2026 年 8 月6
-
Disagree to Explore, Agree to Converge: Adaptive MoE Routing for Test-Time Agentic Coding
Risa 读取 MoE 的原生路由轨迹:专家意见分散时继续探索,路由趋同时收束,并用同一信号挑选补丁,不另接裁判或把测试结果当选择器。SWE-bench Verified 上,gpt-oss 的宏观解决率从 44.9% 增至 48.2%,策略还能迁移到 Qwen3.6 的完整 500 题。它将本来只是稀疏计算调度的内部信号,转化为自适应测试时预算,前提是模型暴露足够细的路由信息。
原文 ↗– -
Second Thought: Reasoning in Parallel as LLM Agents Act and Observe
Second Thought 在代理每次结束一段 Thought 后分叉四条辅助支路,让它们在主线工具调用等待期间继续解码,再随新观察合并。
原文 ↗– -
Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things
Simon Willison 的本地测试认为 Qwen 3.8 27B 已有很强的代码与 agent 能力,但默认推理预算会在中等任务上膨胀,抵消本地部署的延迟优势。社区案例出现约 3 万生成 token 才完成一道适中工程题,通过限制思考长度或关闭 thinking 才改善可用性。文章把“答案能不能做对”与“要花多少 token、功耗和等待时间”放进同一评价函数,这是本地模型选型常被忽略的一半。
原文 ↗– -
Test-Time Augmentation for LLMs
作者把 test-time compute 从“重复采样输出”分一部分给“改写输入”,比较语义改述、词法扰动和视觉变换,覆盖六个知识、数学、多语、多模态与情感任务。语义改述在六项中的五项超过 self-consistency,每美元带来的准确率增益约高 1.8 倍,并形成更好的成本效果 Pareto 前沿。收益集中在中档模型且依赖变换保持题意,论文因此提供的是输入多样性预算的有力证据,不是所有任务…
原文 ↗– -
Test-Time Scaling in Reasoning LLMs
这篇综述把推理模型的测试时扩展归纳为单轨迹延长、叶节点终态规约和前缀搜索三类,并区分精确复现与分布式结果复现。作者同时发布约 20 亿 token 的完整推理轨迹,试图让采样、验证与搜索策略可以在统一材料上比较。它的价值主要是清理术语和复现实验边界;作为综述,并没有提出一个能跨任务取胜的新缩放算法。
原文 ↗– -
Fail-Fast, Restart-Smart
该工作用 0.6B 参数前缀监视器配合一次同策略新 rollout,在软件工程代理尚未耗尽预算前判断轨迹是否值得终止。SWE-bench Verified 跨多种策略可节省 14.6%–20.4% token,同时把误杀率控制在 5%;即使容许 25% 误杀,重启策略仍将解决率从 66.6% 提到 71.8%,冷重启仅为 66.8%。这表明测试时扩展不应只讨论“跑更多”,还应把预算从低前景轨迹动态…
原文 ↗–
2026 年 7 月5
-
Effort Router: Intelligent /effort selection per Claude turn
effort-router 用 Claude Code skill frontmatter 的 effort override,把每个用户请求分到 low、medium、high、xhigh、max 五档。SessionStart hook 注入“每轮都分类”的 standing instruction,UserPromptSubmit 每次用约 20 tokens 重新锚定,Stop hook…
原文 ↗– -
Controlling Reasoning Effort in LLMs
Sebastian Raschka 解释 reasoning effort 参数如何影响 LLM 推理成本、延迟和输出行为。文章把 effort 放进 inference scaling 框架,与 self-consistency、self-refinement 等技术相邻讨论,说明“多想”既可以是模型内部预算,也可以是外部采样和反复修正。它的实用点在于把用户可见旋钮和底层推理时计算联系起来,而不…
原文 ↗– -
Doomed from the Start: Early Abort of LLM Agent Episodes via a Recall-Controlled Probe Cascade
这篇论文把 agent episode 的早停问题转化为隐藏表示上的失败预测:每轮用轻量 probe 读取 hidden activations,甚至第一轮就能预判后续失败,而只看可观察行为的 scorer 还接近随机。作者设计了 per-round calibrated gate cascade,通过联合搜索 recall budgets 保证最终会成功的 episode 以用户指定全局比例存活…
原文 ↗– -
SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference
SPORK 观察到 agent 循环中工具调用等待会让模型推理链路空转,于是提出 self-speculative forking。模型在等待真实工具结果时先 fork 出多个可能后续分支,等结果返回后再保留可用路径。这个方法抓住的是 agentic inference 的端到端延迟,而不是单次 token 解码速度。
原文 ↗– -
Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling
论文研究 LLM 置信度校准,并把置信信号用于决定测试时是否增加采样、验证或推理计算。关键设定是 adaptive test-time scaling:预算不是固定平均分配,而是向低置信问题倾斜。它值得跟进,因为测试时扩展如果没有可靠置信度,很容易把计算浪费在模型本来已经能解的问题上。
原文 ↗–
2026 年 6 月5
-
Multi-Turn Reflective Masking Elicits Reasoning in Mask Diffusion Models
论文提出 Reflective Masking,让 mask diffusion models 多轮回看和局部修订既有输出,以支持类似反思的推理过程。方法不改架构,只做轻量 post-training,并加入无参数 History Reference 利用中间 denoising states;任务覆盖文本生成、Sudoku 和图像编辑,结果优于标准 masking baseline。它把测试时扩…
原文 ↗– -
How Inference Compute Shapes Frontier LLM Evaluation
这篇论文把 benchmark score 视为模型能力与测试时计算协议的共同产物,而不是模型的单点属性。作者在最多 12 个 frontier language model 和 7 个覆盖软件工程、数学、医学、网络安全的 benchmark 上,组合更大 token budget、context compaction、repeated submission attempts,以及模型自导或 mi…
原文 ↗– -
Beyond Parallel Sampling: Diverse Query Initialization for Agentic Search
这篇论文指出 agentic search 的并行 rollout 很早就会塌缩:如果第一轮 query 相似,后续线程会围绕同一批检索证据继续推理,breadth scaling 的收益迅速递减。DivInit 不训练模型,而是在一次调用中生成 n 个候选首轮 query,从中挑出 k 个彼此差异更大的 seed 再并行展开。作者在 5 个 open-weight 模型和 8 个 benchma…
原文 ↗– -
Agentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning
ACTS 不是再给模型加一句“思考更短”的提示,而是在推理过程中插入一个控制器,让冻结的 reasoner 按预算、轨迹状态和任务难度动态改变思考策略。摘要称它把 steering 写成 MDP,并在多个 benchmark 上达到接近 full-thinking 的表现,同时减少推理 token;这使它更像 inference-time scheduler,而不是 prompt engineer…
原文 ↗– -
FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search
论文把 agentic search 的答案验证拆成细粒度 claim 检查,用于更稳健地利用 test-time compute。
原文 ↗–
2026 年 5 月1
-
The Sequence Opinion #868: Recursion Is the New Scaling Law
TheSequence 讨论递归式模型调用和系统组合是否正在成为 AI 扩展的新路径。
原文 ↗–