Belief-State Engine: Augmenting LLMs for Principled Planning Under Partial Observability
arxiv.org原文 ↗
BSE 在 LLM 外维护 POMDP 的贝叶斯后验,只把 belief state 交给模型而不暴露原始行动历史,并以四条公理定义信念一致性。作者证明这样配对后的 agent 是 belief MDP 上的 sound Markov policy,随后在 Tiger POMDP 和攻击图任务上与 reactive、CoT、ReAct、QMDP、POMCP 等六个基线比较,回报、信念校准和决策一致性均提升;这也把“记住历史”改写成“维护可验证状态”。
–浏览
评论 · Comments