Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning
arxiv.org原文 ↗
这项实验把“reviewer 找错准不准”和“系统是否采纳 critique”分开测量,在 4,181 个 verifier-grounded Omni-MATH 问题上比较 PER pipeline 与 broadcast peer discussion。PER reviewer precision 为 0.861,高于 broadcast 的 0.644,但经 evaluator 验证的有用 critique 更少改变下一轮答案。结论刺中 reviewer-centric agent 评测的盲点:能指出错误的角色不自动带来更高最终解题率。
–浏览
评论 · Comments