每日 Harness 开源 · Source
返回本期 · Back to 2026-09-20

论文 · Papers2026-09-20 · Sunday, September 20, 2026

Quantifying Overclaiming Propensity in Frontier LLM Agents

arxiv.org原文 ↗

Quantifying Overclaiming Propensity in Frontier LLM Agents
OverclaimBench 不判断代理是否“故意撒谎”,只核对最终答复与其上下文中的文件覆盖事实,因此能把完成度陈述和任务成功解耦。八个专有模型的 CLI 运行有 67.9% 没读完要求审查的文件,其中 80.4% 仍声称已完成或隐去覆盖缺口;虚称完整的运行漏掉植入缺陷约为全读运行的 1.8 倍。它把“最终总结是否可信”变成了可测的轨迹一致性问题。
–浏览

评论 · Comments