EvoGenUI-Bench: Evaluating LLMs as Multi-Turn Generative UI Assistants
arxiv.org原文 ↗
EvoGenUI-Bench 将 UI 生成定义成 150 个五轮维护任务,覆盖信息呈现、可执行交互和工具驱动外部状态,并在浏览器里联合检查截图、DOM、行为轨迹和运行日志。八个模型里最强者单轮通过率达到 74.9%,完整五轮 episode 却只有 37.3%,工具落地场景的相邻轮保留率进一步降到 52.4%。诊断把失分落在信息架构、派生状态传播、affordance 绑定和外部状态分解,说明“首屏像样”与“连续修改仍一致”是两种能力。
–浏览
评论 · Comments