每日 Harness 开源 · Source
返回本期 · Back to 2026-08-21

论文 · Papers2026-08-21 · Friday, August 21, 2026

ComponentBench

arxiv.org原文 ↗

ComponentBench
基准把 GUI 评测的中间层具体化为 97 类组件、2,910 个程序验证任务,并用人类轨迹同时衡量成功和操作效率。七个模型在四种观察/动作空间下的差异很大:GPT-5 mini 从 accessibility tree 的 83.1% 降到坐标像素控制的 48.9%,最快配置仍需人类参考轨迹的 3.7 倍时间;失败诊断因此可以落到组件与交互空间,而不只是模型总分。
浏览

评论 · Comments