每日 Harness 开源 · Source
返回本期 · Back to 2026-07-02

论文 · Papers2026-07-02 · Thursday, July 2, 2026

Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents

arxiv.org原文 ↗

Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents
这篇论文把失败轨迹从“丢弃的训练副产物”变成 inference-time agent 改进材料。流程让 LLM 诊断失败模式、提出推理时解决方案,并生成经轻量人工核验的代码补丁来升级 agent,而不走额外 fine-tuning。作者用 OpenCUA-72B 在 OSWorld 上验证,成功率从 42.3% 提升到 48.9%,增加 6.6 个百分点;这个结果适合与 success-only synthetic data loop 对照阅读,因为它把 agent 系统本身当作可补丁化软件。
浏览

评论 · Comments