返回本期 · Back to 2026-06-19 论文 · Papers2026-06-19 · Friday, June 19, 2026 CEO-Bench: Can Agents Play the Long Game? arxiv.org原文 ↗ 基准推理与规划工具使用其他垂直 这篇论文构造了一个 500 天创业公司经营环境,代理通过 Python 接口管理定价、营销、预算等决策,并从噪声业务数据库里推断策略。关键结果很克制:只有 Claude Opus 4.8 和 GPT-5.5 最终高于 100 万美元起始余额,但二者也不能稳定盈利。它把 agent benchmark 从“会不会调用工具”推进到长期资源配置、信息获取和策略调整。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments