Belief-Calibrated Optimization: An Explicit World Model for Agentic Optimization
arxiv.org原文 ↗
BCO 把编码代理每轮编辑时对“环境会如何响应”的隐含判断写入持续修订的 in-context 世界模型,再接回普通的分数 - 编辑循环。跨记忆问答、工具问答、代码动作和终端代理的五个基准中,BCO 在所有留出 split 都领先匹配控制组;换 backbone 后仍占优,只有上下文溢出会让 scaffold 未完成。离线预测器在真实文档上比空文档和伪造文档更能预测环境反应,支持收益来自内容而非模板。
–浏览
评论 · Comments