论文把 coding agent 的上下文需求分成定位工作点与执行编辑两个阶段,并对 SWE-bench Verified 的 96 个任务做人工审计。一个关键数字是 49% 的任务需要语义相关但词面不相似的外部信息;在约 10K token oracle 编辑上下文下,Claude Sonnet 4 的理论解决率上限是 70.2%,而现有检索方法仍低 43.8 个百分点。这说明“长上下文”并不等于“拿到了可编辑证据”,检索目标需要从文件定位细化到变更所需约束。
–浏览
评论 · Comments