Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation
arxiv.org原文 ↗
适配器先通过代码审查和 parity experiment 把 80 多个 benchmark 统一进 Harbor,再用 54 个 benchmark、8 个模型分析能力与失败模式,最后过滤成 29 个 benchmark 的 82 个高质量任务。所有模型-harness 配置通过率低于 30%,最强 GPT-5.5+Codex 为 28.0%;这种刻意保持的难度为跨项目比较留下余量,也暴露出当前代理离稳健完成仍远。
–浏览
评论 · Comments