Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents
arxiv.org原文 ↗
这篇论文把失败轨迹从“丢弃的训练副产物”变成 inference-time agent 改进材料。流程让 LLM 诊断失败模式、提出推理时解决方案,并生成经轻量人工核验的代码补丁来升级 agent,而不走额外 fine-tuning。作者用 OpenCUA-72B 在 OSWorld 上验证,成功率从 42.3% 提升到 48.9%,增加 6.6 个百分点;这个结果适合与 success-only synthetic data loop 对照阅读,因为它把 agent 系统本身当作可补丁化软件。
–浏览
评论 · Comments