每日 Harness 开源 · Source
返回本期 · Back to 2026-09-12

论文 · Papers2026-09-12 · Saturday, September 12, 2026

DAREBench: Deployment-Aware and Reliable Evaluation of Models as Agents

arxiv.org原文 ↗

DAREBench: Deployment-Aware and Reliable Evaluation of Models as Agents
DAREBench 将 22 个基准的 233 个任务放入统一 OpenClaw 环境,以模态×执行形式组成 2×3 工作矩阵,并用合约和证据分数审计交付物。评测覆盖 23 个商业 API、12 个本地模型和 7,587 次模型任务运行;没有模型在所有维度占优,准确率、模态和成本之间的取舍会随部署条件改变。
–浏览

评论 · Comments