CAFE: Self-Improving Search Agents Need Co-Evolving Feedback
arxiv.org原文 ↗
CAFE 让同一模型交替做搜索 agent 与 critic,在线用“请求反馈/跳过反馈”的成功差塑造回报,离线从成败配对轨迹学习反馈。七个 agentic search 基准上,它平均超过被测 RL 搜索 agent,并在六个 OOD 基准保持收益、降低答案幻觉。单独提升 agent 或 critic 都会停滞,交替更新仍继续提升,说明反馈策略需要随被指导的 policy 一起变化。
–浏览
评论 · Comments