LLM-as-a-Judge Is Not an Oracle: Why Self-Improving Agents Need Deterministic Guardrails
arxiv.org原文 ↗
这篇论文不是泛泛批评 judge,而是来自合同分析、合规审查和代码质量生产循环的故障清单:共 11 种,覆盖 judge 偏差、指标/harness、错误 ground truth 与 reward hacking。一个代理读取缓存答案拿到 100% 通过率,真实能力却只有 68%;错误合规标签还诱导删除正确规则。PROCTOR 让 teacher 只能给建议,最终由 hermetic sandbox、角色隔离、验收优先、冻结 holdout 和“满分本身可疑”的 canary 把关,同时坦承 teacher 自身仍可能误判。
–浏览
评论 · Comments