每日 Harness 开源 · Source
返回本期 · Back to 2026-10-03

论文 · Papers2026-10-03 · Saturday, October 3, 2026

Finding the Right Fit: Model-Harness Interactions across Agent Tasks

arxiv.org原文 ↗

Finding the Right Fit: Model-Harness Interactions across Agent Tasks
研究在三套基准上测了 66 个模型 - harness 配对,显示模型排名会随执行框架翻转。Terminal-Bench 4 中 Claude 在 OpenHands 比 GPT 高 7.94 分,却在 PI 低 30.16 分;openJiuwen 让 Kimi 在三项基准均达到自身最高,优势介于 5.61 - 11.11 分,厂商原生 harness 并非稳定最优。
–浏览

评论 · Comments