The Reasoning Tax: Token Economics of LLM Reasoning Across Task Types and Deployment Contexts
arxiv.org原文 ↗
Token Economy Score 用准确率边际提升除以 token 倍率,直接回答“多想一会儿是否值得”。基于 7 个基准、151 次运行的分析发现,AIME 2025 和 LiveCodeBench 的链式结构带来高 TES,而 MMLU-Pro 的知识回忆即便困难也低效;更高 reasoning effort 还会出现递减收益乃至降准,RCS 与 DCM 则把内部思考和部署地点纳入成本模型。
–浏览
评论 · Comments