AdaPlanBench: Evaluating Adaptive Planning in Large Language Model Agents under World and User Constraints
arxiv.org原文 ↗
AdaPlanBench 关注约束逐步显露时 agent 能否重新规划,而不是一次性给出完整世界状态的静态 planning。它把 world constraints 和 user constraints 同时纳入动态交互设置,测试模型在反馈中修正计划的能力。检索到的摘要给出一个明确基线:十个领先 LLM 中最佳模型也只有 67.75% accuracy,说明 dual-constrained re-planning 仍是 agent 评测里的硬缺口。
–浏览
评论 · Comments