Doomed from the Start: Early Abort of LLM Agent Episodes via a Recall-Controlled Probe Cascade
arxiv.org原文 ↗
这篇论文把 agent episode 的早停问题转化为隐藏表示上的失败预测:每轮用轻量 probe 读取 hidden activations,甚至第一轮就能预判后续失败,而只看可观察行为的 scorer 还接近随机。作者设计了 per-round calibrated gate cascade,通过联合搜索 recall budgets 保证最终会成功的 episode 以用户指定全局比例存活。TextCraft 上两个 agent model 在 90%-97% recall target 都达标;90% target 下,Qwen-2.5-7B 节省 47.1% ± 10.3% 推理 compute,Llama-3.2-3B 节省 37.2% ± 8.8%,约为最佳 single-gate policy 的 1.6-1.7x。
–浏览
评论 · Comments