AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments
arxiv.org原文 ↗
AgentGym2 将 LLM agent benchmark 推向“去理想化”环境,把真实部署里的噪声、部分可观测、工具不稳定和交互约束纳入评测。它不是再造一个干净任务集,而是考 agent 在环境不完美时能否验证、恢复并持续推进。这个方向适合检验 agent 工程成熟度,因为真实系统失败往往来自边界条件而非核心能力题。
–浏览
评论 · Comments