QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents
arxiv.org原文 ↗
QVal 的切入点是:dense supervision 信号不该每次都靠完整训练 pipeline 的下游表现来评估,因为那会混入工程配置和训练成本。它用 training-free testbed 直接衡量 state-action score 是否 Q-aligned,也就是能否按强 reference policy 的 Q-values 排列动作。QVal-v1.0 比较 21 种 dense supervision 方法、4 个环境、7 类方法和 6 个开源 backbone,超过 1.2K evaluation experiments;一个逆直觉结果是简单 prompting baseline 常常胜过近期 dense supervision 文献方法。
–浏览
评论 · Comments