ComponentBench
arxiv.org原文 ↗
基准把 GUI 评测的中间层具体化为 97 类组件、2,910 个程序验证任务,并用人类轨迹同时衡量成功和操作效率。七个模型在四种观察/动作空间下的差异很大:GPT-5 mini 从 accessibility tree 的 83.1% 降到坐标像素控制的 48.9%,最快配置仍需人类参考轨迹的 3.7 倍时间;失败诊断因此可以落到组件与交互空间,而不只是模型总分。
–浏览
arxiv.org原文 ↗
评论 · Comments