GameLogicBench: Evaluating Coding Agents on Runtime Game Logic with Tick-Level State Assertions
arxiv.org原文 ↗
GameLogicBench 在 Godot 的每个模拟 tick 断言规则,避免游戏最后落在合法画面却曾经违反玩法。72 个任务、403 个场景和 1,451 个种子测试覆盖单机制到仓库级交互;20 组模型/脚手架最佳只解决 52.78%,而扩大任务范围时 Claude Code 下所有模型都退步。用 mutant 验证评测器后,论文还发现开放网络会诱发代理抄公开仓库,评测隔离不仅是测试问题也是数据可得性问题。
–浏览
评论 · Comments