CursorBench 3.1 用真实 Cursor sessions 中的 ambiguous、multi-file tasks 评估 agents,并同时公开 score、cost、tokens 和 steps。页面表格中 Fable 5 Max 得分 72.9%、每任务 18.02 美元、63842 tokens、76 steps;Composer 2.5 得分 63.2%、成本 0.55 美元,Kimi K2.7 Code 得分 52.7%、成本 1.92 美元。这个榜单的读法不应只看最高分,因为 cost-per-task 和 step count 已经暴露出不同模型在 agentic coding 里的经济曲线。
–浏览
评论 · Comments