Never Stop Thinking: Continuous-Time Language Agents
arxiv.org原文 ↗
连续时间 agent 允许模型在聆听和发言期间被打断、恢复并持续思考;ReactiveBench 用 120 个实时场景测量端到端行为。整体延迟下降 19%,目标工作区间约贡献一半收益;加入 on-policy 类型化奖励后,流式完成率从 48% 提升到 73%±5%。这表明实时交互的瓶颈不只是生成速度,还在于把思考状态做成可调度对象,同时要警惕 LLM judge 对中断行为的评估偏差。
–浏览
评论 · Comments