Grounded Iterative Language Planning
arxiv.org原文 ↗
论文区分两类 language-agent world model:调用 LLM API 的 agent-based model,以及训练出的参数化 transition predictor。前者能灵活用语言推理,但错误会表现为难以用普通 regression loss 评分的状态幻觉;后者的错误可量化,因此能更稳定地参与迭代规划。该工作切中的问题是 agent 规划中最危险的失败模式之一:早期错误状态被后续步骤当作事实继续传播。
–浏览
评论 · Comments