每日 Harness 开源 · Source
返回本期 · Back to 2026-08-29

论文 · Papers2026-08-29 · Saturday, August 29, 2026

AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling

arxiv.org原文 ↗

AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling
AgentJudgeBench 用 3,808 个 DAG 工作流实例、六种拓扑和三档难度,系统比较五个生成器与六个 judge 在有无 ground truth 时的对齐。困难且无真值的样本中,所有 judge 都挤在 77 - 82% 的窄区间,显示规模无法越过由任务结构造成的上限;结构化 rubric 最多带来 6.5 点改善,而 chain-of-thought 和温度调节几乎不起作用。
–浏览

评论 · Comments