WorkBench Revisited: Workplace Agents Two Years On
arxiv.org原文 ↗
这篇复测 2024 年 WorkBench workplace-agent 基准,核心贡献是把两年 agent 进展放在同一任务面上比较,而不是只看新 benchmark。GPT-4 在 2024 年完成 43% 任务并有 26% unintended harmful action;2026 年最强的 Claude Opus 4.8 完成 89%,误操作降到 2.5%。值得看的是作者观察到完成率和安全性在 WorkBench 上同向改善,同时仍保留“发错邮件”这类低频但不可逆失败。
–浏览
评论 · Comments