2026 年 7 月5
-
Effort Router: Intelligent /effort selection per Claude turn
effort-router 用 Claude Code skill frontmatter 的 effort override,把每个用户请求分到 low、medium、high、xhigh、max 五档。SessionStart hook 注入“每轮都分类”的 standing instruction,UserPromptSubmit 每次用约 20 tokens 重新锚定,Stop hook…
原文 ↗– -
Controlling Reasoning Effort in LLMs
Sebastian Raschka 解释 reasoning effort 参数如何影响 LLM 推理成本、延迟和输出行为。文章把 effort 放进 inference scaling 框架,与 self-consistency、self-refinement 等技术相邻讨论,说明“多想”既可以是模型内部预算,也可以是外部采样和反复修正。它的实用点在于把用户可见旋钮和底层推理时计算联系起来,而不…
原文 ↗– -
Doomed from the Start: Early Abort of LLM Agent Episodes via a Recall-Controlled Probe Cascade
这篇论文把 agent episode 的早停问题转化为隐藏表示上的失败预测:每轮用轻量 probe 读取 hidden activations,甚至第一轮就能预判后续失败,而只看可观察行为的 scorer 还接近随机。作者设计了 per-round calibrated gate cascade,通过联合搜索 recall budgets 保证最终会成功的 episode 以用户指定全局比例存活…
原文 ↗– -
SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference
SPORK 观察到 agent 循环中工具调用等待会让模型推理链路空转,于是提出 self-speculative forking。模型在等待真实工具结果时先 fork 出多个可能后续分支,等结果返回后再保留可用路径。这个方法抓住的是 agentic inference 的端到端延迟,而不是单次 token 解码速度。
原文 ↗– -
Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling
论文研究 LLM 置信度校准,并把置信信号用于决定测试时是否增加采样、验证或推理计算。关键设定是 adaptive test-time scaling:预算不是固定平均分配,而是向低置信问题倾斜。它值得跟进,因为测试时扩展如果没有可靠置信度,很容易把计算浪费在模型本来已经能解的问题上。
原文 ↗–
2026 年 6 月5
-
Multi-Turn Reflective Masking Elicits Reasoning in Mask Diffusion Models
论文提出 Reflective Masking,让 mask diffusion models 多轮回看和局部修订既有输出,以支持类似反思的推理过程。方法不改架构,只做轻量 post-training,并加入无参数 History Reference 利用中间 denoising states;任务覆盖文本生成、Sudoku 和图像编辑,结果优于标准 masking baseline。它把测试时扩…
原文 ↗– -
How Inference Compute Shapes Frontier LLM Evaluation
这篇论文把 benchmark score 视为模型能力与测试时计算协议的共同产物,而不是模型的单点属性。作者在最多 12 个 frontier language model 和 7 个覆盖软件工程、数学、医学、网络安全的 benchmark 上,组合更大 token budget、context compaction、repeated submission attempts,以及模型自导或 mi…
原文 ↗– -
Beyond Parallel Sampling: Diverse Query Initialization for Agentic Search
这篇论文指出 agentic search 的并行 rollout 很早就会塌缩:如果第一轮 query 相似,后续线程会围绕同一批检索证据继续推理,breadth scaling 的收益迅速递减。DivInit 不训练模型,而是在一次调用中生成 n 个候选首轮 query,从中挑出 k 个彼此差异更大的 seed 再并行展开。作者在 5 个 open-weight 模型和 8 个 benchma…
原文 ↗– -
Agentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning
ACTS 不是再给模型加一句“思考更短”的提示,而是在推理过程中插入一个控制器,让冻结的 reasoner 按预算、轨迹状态和任务难度动态改变思考策略。摘要称它把 steering 写成 MDP,并在多个 benchmark 上达到接近 full-thinking 的表现,同时减少推理 token;这使它更像 inference-time scheduler,而不是 prompt engineer…
原文 ↗– -
FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search
论文把 agentic search 的答案验证拆成细粒度 claim 检查,用于更稳健地利用 test-time compute。
原文 ↗–
2026 年 5 月1
-
The Sequence Opinion #868: Recursion Is the New Scaling Law
TheSequence 讨论递归式模型调用和系统组合是否正在成为 AI 扩展的新路径。
原文 ↗–