PreAct 把 computer-use Agent 的一次成功执行编译成小型 state-machine program:状态负责检查屏幕是否符合预期,transition 负责执行点击或输入,后续同类任务直接 replay 而不是逐步调用模型。论文报告 replay 比重新让 Agent 观察和推理快 8.5 到 13 倍,且每一步不再消耗语言模型调用;一旦屏幕状态不匹配,控制权会交回 Agent。它还要求新程序只有在干净环境中被独立 evaluator 确认完成任务后才能入库,这个 store-time check 在 mobile、desktop、web 三类 benchmark 上分别带来 1.75 到 2.6 个任务的增益。
–浏览
评论 · Comments