Do Agents Know When They Succeed? Calibrating Agent Confidence from Internal Representations
arxiv.org原文 ↗
论文用 residual stream 的轨迹变化构造 Latent Trajectory Dynamics,并在动作节点训练 Action Representation Probe,直接估计多轮任务最终是否成功。Bash、SQL、Python 三个交互基准上,Qwen14B、Qwen7B、DeepSeek6.7B 三个模型族均超过表面输出和序列校准基线;监控不需要改 prompt、重复采样或额外推理回合。
–浏览
评论 · Comments