返回本期 · Back to 2026-08-15 论文 · Papers2026-08-15 · Saturday, August 15, 2026 TsuGO arxiv.org原文 ↗ 评测方法推理与规划测试时计算其他垂直 TsuGO 把围棋死活题用作答案封闭可验的搜索实验室,将 chain-of-thought 解析成树,并分别计算搜索效率与 token 效率。强模型往往较早提出正确候选,也更常沿有效分支推进,但总体轨迹仍接近无引导搜索而不是 KataGo 式规划。更长推理未必提高单位 token 产出,这让评测能区分“最终碰到答案”和“把计算预算分配到有希望的分支”。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments