每日 Harness 开源 · Source
返回本期 · Back to 2026-06-12

论文 · Papers2026-06-12 · Friday, June 12, 2026

Claw-SWE-Bench: A Benchmark for Evaluating OpenClaw-style Agent Harnesses on Coding Tasks

arxiv.org原文 ↗

Claw-SWE-Bench: A Benchmark for Evaluating OpenClaw-style Agent Harnesses on Coding Tasks
Claw-SWE-Bench 解决一个评测接口问题:通用 agent harness 不天然满足 SWE-bench 的 Docker workspace、patch 和 prediction contract。作者提供 adapter protocol,把 fixed prompt、runtime budget、workspace contract、patch extraction、evaluator 和 cost accounting 固定下来;完整集有 350 个 GitHub issue-resolution 实例,覆盖 8 种语言、43 个仓库,并提供 80 题 Lite。相同 GLM 5.1 backbone 下,OpenClaw minimal direct-diff adapter Pass@1 只有 19.1%,完整 adapter 达 73.4%。这条结果说明 coding agent 成绩不能只归因于模型,harness/adapter 设计本身就是可测变量。
浏览

评论 · Comments