每日 Harness 开源 · Source
返回本期 · Back to 2026-07-08

论文 · Papers2026-07-08 · Wednesday, July 8, 2026

AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments

arxiv.org原文 ↗

AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments
AgentGym2 将 LLM agent benchmark 推向“去理想化”环境,把真实部署里的噪声、部分可观测、工具不稳定和交互约束纳入评测。它不是再造一个干净任务集,而是考 agent 在环境不完美时能否验证、恢复并持续推进。这个方向适合检验 agent 工程成熟度,因为真实系统失败往往来自边界条件而非核心能力题。
浏览

评论 · Comments