每日 Harness 开源 · Source
返回本期 · Back to 2026-09-08

论文 · Papers2026-09-08 · Tuesday, September 8, 2026

Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation

arxiv.org原文 ↗

Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation
适配器先通过代码审查和 parity experiment 把 80 多个 benchmark 统一进 Harbor,再用 54 个 benchmark、8 个模型分析能力与失败模式,最后过滤成 29 个 benchmark 的 82 个高质量任务。所有模型-harness 配置通过率低于 30%,最强 GPT-5.5+Codex 为 28.0%;这种刻意保持的难度为跨项目比较留下余量,也暴露出当前代理离稳健完成仍远。
–浏览

评论 · Comments