APIFlow-Bench: Measuring Whether Agents Survive Long, Dependent API Workflows
arxiv.org原文 ↗
APIFlow-Bench 不再用一个 end-to-end bit 概括代理表现,而是把凭证失效、错误载荷、状态执行和最终交付拆成七项工程能力,并要求答案能追到真实调用路径。19 个模型在统一脚手架上从独立子任务的 93% 成功率,降到干净 20 子任务链的 74%,纳入没有任何模型通过的链试验后只剩 61%;而 best-of-five 只相差 7 个百分点时,all-five-of-five 可靠性却相差 44 个百分点,显示稳定交付比偶尔解出更能拉开差距。
–浏览
评论 · Comments