AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling
arxiv.org原文 ↗
AgentJudgeBench 用 3,808 个 DAG 工作流实例、六种拓扑和三档难度,系统比较五个生成器与六个 judge 在有无 ground truth 时的对齐。困难且无真值的样本中,所有 judge 都挤在 77 - 82% 的窄区间,显示规模无法越过由任务结构造成的上限;结构化 rubric 最多带来 6.5 点改善,而 chain-of-thought 和温度调节几乎不起作用。
–浏览
评论 · Comments