每日 Harness 开源 · Source
返回本期 · Back to 2026-07-21

论文 · Papers2026-07-21 · Tuesday, July 21, 2026

Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning

arxiv.org原文 ↗

Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning
这项实验把“reviewer 找错准不准”和“系统是否采纳 critique”分开测量,在 4,181 个 verifier-grounded Omni-MATH 问题上比较 PER pipeline 与 broadcast peer discussion。PER reviewer precision 为 0.861,高于 broadcast 的 0.644,但经 evaluator 验证的有用 critique 更少改变下一轮答案。结论刺中 reviewer-centric agent 评测的盲点:能指出错误的角色不自动带来更高最终解题率。
浏览

评论 · Comments