An empirical study of harness design for coding agents
arxiv.org原文 ↗
论文将 harness 视为可拆解的执行系统,在四个模型、SWE-Bench Verified 和 Terminal-Bench 2.1 上控制变量比较规划、动作空间与上下文策略。176 组设置显示,预算越紧,上下文管理越能避免 overflow;先做规则式省略再调用 LLM 摘要的效率最好,而可恢复省略没有带来准确率收益。规划对弱模型更像准确率支架,对强模型则主要节省成本;bash 能力强的模型用 bash-only 界面也能以更低成本完成命令行任务。
–浏览
评论 · Comments