这篇论文把 Agent 的失败归因到 intent-execution gap:模型打算做的事与 harness 实际执行的事不一致,或者 harness 暴露的行为偏离模型假设。作者构建 Simple Strands Agent,在 SWE-Pro、SWE-Verified、Terminal-Bench-2 上复现或改进多个模型提供方报告的 pass@1。更有价值的是 138k 条轨迹分析:它把轨迹投到 code state-space,用 edit frequency、testing activity、phase transition 等指标描述不同模型如何分配搜索、修改和验证 effort,避免只看相近 pass@1 分数。
–浏览
评论 · Comments