每日 Harness 开源 · Source
返回本期 · Back to 2026-08-27

论文 · Papers2026-08-27 · Thursday, August 27, 2026

CAFE: Self-Improving Search Agents Need Co-Evolving Feedback

arxiv.org原文 ↗

CAFE: Self-Improving Search Agents Need Co-Evolving Feedback
CAFE 让同一模型交替做搜索 agent 与 critic,在线用“请求反馈/跳过反馈”的成功差塑造回报,离线从成败配对轨迹学习反馈。七个 agentic search 基准上,它平均超过被测 RL 搜索 agent,并在六个 OOD 基准保持收益、降低答案幻觉。单独提升 agent 或 critic 都会停滞,交替更新仍继续提升,说明反馈策略需要随被指导的 policy 一起变化。
–浏览

评论 · Comments