Don't Solve, Just Compare: Tiny Advisors for Runtime Intervention in LLM Agents
arxiv.org原文 ↗
COTA 训练一个只比较同前缀反事实分支的轻量 advisor,让主 actor 根据非约束建议重规划,避免再部署一个能独立解题的 critic。它在 WebShop、ALFWorld、tau³-Retail 的三个 actor、九个设置中全部提升,论证“干预方向”可以由远弱于执行器的模型提供。
–浏览
评论 · Comments