每日 Harness 开源 · Source
返回本期 · Back to 2026-09-21

论文 · Papers2026-09-21 · Monday, September 21, 2026

An empirical study of harness design for coding agents

arxiv.org原文 ↗

An empirical study of harness design for coding agents
论文将 harness 视为可拆解的执行系统,在四个模型、SWE-Bench Verified 和 Terminal-Bench 2.1 上控制变量比较规划、动作空间与上下文策略。176 组设置显示,预算越紧,上下文管理越能避免 overflow;先做规则式省略再调用 LLM 摘要的效率最好,而可恢复省略没有带来准确率收益。规划对弱模型更像准确率支架,对强模型则主要节省成本;bash 能力强的模型用 bash-only 界面也能以更低成本完成命令行任务。
–浏览

评论 · Comments