每日 Harness 开源 · Source
主题 · All topics

认知与推理Reasoning

本主题共 33 条 · 最早 2026-05-29 · 最新 2026-08-26

视图 · View

2026 年 8 月10

  • XWM

    XWM 用 JAX 实现动作条件潜在世界模型,把观察编码到潜变量后直接预测下一状态,不训练像素解码器。JEPA、TD-MPC2、MuZero 复用同一组件,可接 CEM、MPPI、梯度与 MCTS 规划器,并允许只观察一部分 token;示例从 CPU 合成任务延伸到 Franka 机械臂。统一接口便于比较表示与规划组合,不过仓库尚早,行为测试不能替代真实控制基准。

    Project2026-08-26github.com原文 ↗
    –
  • Disagree to Explore, Agree to Converge: Adaptive MoE Routing for Test-Time Agentic Coding

    Risa 读取 MoE 的原生路由轨迹:专家意见分散时继续探索,路由趋同时收束,并用同一信号挑选补丁,不另接裁判或把测试结果当选择器。SWE-bench Verified 上,gpt-oss 的宏观解决率从 44.9% 增至 48.2%,策略还能迁移到 Qwen3.6 的完整 500 题。它将本来只是稀疏计算调度的内部信号,转化为自适应测试时预算,前提是模型暴露足够细的路由信息。

    Paper2026-08-26arxiv.org原文 ↗
    –
  • Active Inference as Context Acquisition for AI Agents

    论文把澄清、检索、工具调用、提示试验、直接执行和停止都视作有成本的上下文获取动作,由内层更新潜在任务状态,外层最小化期望自由能。

    Paper2026-08-22arxiv.org原文 ↗
    –
  • Second Thought: Reasoning in Parallel as LLM Agents Act and Observe

    Second Thought 在代理每次结束一段 Thought 后分叉四条辅助支路,让它们在主线工具调用等待期间继续解码,再随新观察合并。

    Paper2026-08-18arxiv.org原文 ↗
    –
  • Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things

    Simon Willison 的本地测试认为 Qwen 3.8 27B 已有很强的代码与 agent 能力,但默认推理预算会在中等任务上膨胀,抵消本地部署的延迟优势。社区案例出现约 3 万生成 token 才完成一道适中工程题,通过限制思考长度或关闭 thinking 才改善可用性。文章把“答案能不能做对”与“要花多少 token、功耗和等待时间”放进同一评价函数,这是本地模型选型常被忽略的一半。

    Blog2026-08-17simonwillison.net原文 ↗
    –
  • Test-Time Augmentation for LLMs

    作者把 test-time compute 从“重复采样输出”分一部分给“改写输入”,比较语义改述、词法扰动和视觉变换,覆盖六个知识、数学、多语、多模态与情感任务。语义改述在六项中的五项超过 self-consistency,每美元带来的准确率增益约高 1.8 倍,并形成更好的成本效果 Pareto 前沿。收益集中在中档模型且依赖变换保持题意,论文因此提供的是输入多样性预算的有力证据,不是所有任务…

    Paper2026-08-12arxiv.org原文 ↗
    –
  • The Optimizer Is the Agent

    ReASearch 让单一工具调用 agent 自己选择评估、诊断、编辑、验证或重启,持久记忆负责跨长轨迹分配搜索预算。14 项任务中相对专用优化器提升 2%–40%,部分解超过人工已知最好结果。论文把外层控制器的职责放回推理循环,代价是搜索行为和预算决策也更依赖 agent 自身稳定性。

    Paper2026-08-11arxiv.org原文 ↗
    –
  • Learning more about Claude’s mathematical capabilities

    Anthropic 记录 Claude 参与黎曼 ζ 函数问题研究的实验,关注模型如何探索、提出中间猜想并用计算核验。digest 未提供可复现实验规模或最终数学成果,因而本文不把“参与研究”夸成独立证明。它更适合作为观察 agent 化数学工作流的案例:答案质量取决于中间步骤是否可检查。

    Blog2026-08-11anthropic.com原文 ↗
    –
  • Test-Time Scaling in Reasoning LLMs

    这篇综述把推理模型的测试时扩展归纳为单轨迹延长、叶节点终态规约和前缀搜索三类,并区分精确复现与分布式结果复现。作者同时发布约 20 亿 token 的完整推理轨迹,试图让采样、验证与搜索策略可以在统一材料上比较。它的价值主要是清理术语和复现实验边界;作为综述,并没有提出一个能跨任务取胜的新缩放算法。

    Paper2026-08-06arxiv.org原文 ↗
    –
  • Fail-Fast, Restart-Smart

    该工作用 0.6B 参数前缀监视器配合一次同策略新 rollout,在软件工程代理尚未耗尽预算前判断轨迹是否值得终止。SWE-bench Verified 跨多种策略可节省 14.6%–20.4% token,同时把误杀率控制在 5%;即使容许 25% 误杀,重启策略仍将解决率从 66.6% 提到 71.8%,冷重启仅为 66.8%。这表明测试时扩展不应只讨论“跑更多”,还应把预算从低前景轨迹动态…

    Paper2026-08-06arxiv.org原文 ↗
    –

2026 年 7 月11

  • PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents

    PhoenixRepair 不把软件修复限制为“在第一次猜中的文件附近继续改”,而是显式探索编辑位置、修复策略和验证反馈组成的搜索空间。系统保留多条候选分支,并依据测试结果重排而非过早承诺单一路线;其贡献是把编码 agent 的失败归因于搜索覆盖不足,为预算如何分配到定位与修改提供了可操作框架。

    Paper2026-07-24arxiv.org原文 ↗
    –
  • Effort Router: Intelligent /effort selection per Claude turn

    effort-router 用 Claude Code skill frontmatter 的 effort override,把每个用户请求分到 low、medium、high、xhigh、max 五档。SessionStart hook 注入“每轮都分类”的 standing instruction,UserPromptSubmit 每次用约 20 tokens 重新锚定,Stop hook…

    Project2026-07-21github.com原文 ↗
    –
  • Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?

    论文用 textual baseline、flexible executable world model、带 scheduled simplification 的 executable model、以及 fixed-interface replay verification 四个 Codex-based agent 做消融。主实验覆盖 gpt-5.4 与 gpt-5.5 的 high/xhigh…

    Paper2026-07-21arxiv.org原文 ↗
    –
  • Controlling Reasoning Effort in LLMs

    Sebastian Raschka 解释 reasoning effort 参数如何影响 LLM 推理成本、延迟和输出行为。文章把 effort 放进 inference scaling 框架,与 self-consistency、self-refinement 等技术相邻讨论,说明“多想”既可以是模型内部预算,也可以是外部采样和反复修正。它的实用点在于把用户可见旋钮和底层推理时计算联系起来,而不…

    Blog2026-07-21magazine.sebastianraschka.com原文 ↗
    –
  • Can We Understand How Large Language Models Reason?

    CACM 文章梳理 LLM 推理可解释性、chain-of-thought 和机制理解之间的张力。它明确区分“模型写出一段推理文本”和“研究者知道模型内部为何得到答案”这两件事。围绕因果干预、机制解释和可审计推理的讨论,会继续影响模型评测和安全研究的设计。

    News2026-07-13cacm.acm.org原文 ↗
    –
  • FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents

    FirstResearch 把科学发现 agent 的第一个研究问题拆成可审计的 Research Question Certificate,要求记录 primitive definitions、assumptions、mechanism model、tension/contradiction、falsifiable hypothesis、minimal decisive test 和 failu…

    Paper2026-07-09arxiv.org原文 ↗
    –
  • Doomed from the Start: Early Abort of LLM Agent Episodes via a Recall-Controlled Probe Cascade

    这篇论文把 agent episode 的早停问题转化为隐藏表示上的失败预测:每轮用轻量 probe 读取 hidden activations,甚至第一轮就能预判后续失败,而只看可观察行为的 scorer 还接近随机。作者设计了 per-round calibrated gate cascade,通过联合搜索 recall budgets 保证最终会成功的 episode 以用户指定全局比例存活…

    Paper2026-07-09arxiv.org原文 ↗
    –
  • SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference

    SPORK 观察到 agent 循环中工具调用等待会让模型推理链路空转,于是提出 self-speculative forking。模型在等待真实工具结果时先 fork 出多个可能后续分支,等结果返回后再保留可用路径。这个方法抓住的是 agentic inference 的端到端延迟,而不是单次 token 解码速度。

    Paper2026-07-08arxiv.org原文 ↗
    –
  • Understanding is the new bottleneck

    Geoffrey Litt 讨论 AI 降低生成代码成本后,理解系统状态、业务约束、历史决策和副作用正在成为新的瓶颈。文章把开发效率问题从打字速度转向认知负荷,指出“能写更多代码”不等于“能安全改变系统”。它适合放在 agent 编程讨论里看,因为模型越能产出补丁,理解和验证就越成为稀缺环节。

    Blog2026-07-04geoffreylitt.com原文 ↗
    –
  • Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling

    论文研究 LLM 置信度校准,并把置信信号用于决定测试时是否增加采样、验证或推理计算。关键设定是 adaptive test-time scaling:预算不是固定平均分配,而是向低置信问题倾斜。它值得跟进,因为测试时扩展如果没有可靠置信度,很容易把计算浪费在模型本来已经能解的问题上。

    Paper2026-07-04arxiv.org原文 ↗
    –
  • BaRA: BFS-and-Reflection Web Data Collection Agent

    BaRA 面向 live websites 上的站点级采集问题,解决 agent 容易漏页、遗漏多模态输出、返回不可下载媒体 URL 的问题。方法把 bounded BFS traversal 和 history-based self-reflection 组合在固定交互预算内运行。作者在 50 个带 ground-truth reference sets 的 synthetic websites…

    Paper2026-07-03arxiv.org原文 ↗
    –

2026 年 6 月10

  • The Sequence Opinion #884: Self-Driving Labs: The Laboratory That Chooses Its Next Experiment

    TheSequence 介绍 self-driving lab:系统自动选择、执行并根据结果更新下一步实验。关键是实验室从执行工具变成闭环决策系统。它与 agent planning 的关系很直接:科学实验中的 action space、反馈延迟和成本约束比网页 agent 更硬,因而更能检验自主决策系统。

    Blog2026-06-27thesequence.substack.com原文 ↗
    –
  • A Verifiable Search Is Not a Learnable Chain-of-Thought

    这篇论文反驳“短程序可解就能教成可泛化 CoT”的直觉,研究对象是可验证搜索过程,而不是开放式问答。实验包含九个由确定性生成器产生的推理任务,public 与 hidden splits 共享生成器,因此隐藏集主要检查同一程序性分布下的泛化。它提示一个硬边界:可验证性和可学习推理轨迹不是同一件事。

    Paper2026-06-24arxiv.org原文 ↗
    –
  • Multi-Turn Reflective Masking Elicits Reasoning in Mask Diffusion Models

    论文提出 Reflective Masking,让 mask diffusion models 多轮回看和局部修订既有输出,以支持类似反思的推理过程。方法不改架构,只做轻量 post-training,并加入无参数 History Reference 利用中间 denoising states;任务覆盖文本生成、Sudoku 和图像编辑,结果优于标准 masking baseline。它把测试时扩…

    Paper2026-06-23arxiv.org原文 ↗
    –
  • Uncertainty Decomposition for Clarification Seeking in LLM Agents

    这篇研究代理何时应该向用户澄清,而不是凭猜测继续执行。摘要指出 classical aleatoric/epistemic uncertainty 框架不足以覆盖交互式 LLM agents,需要 underspecification-aware、decomposed、communicable 的不确定性表示。它的意义在于,澄清提问不再只是“模型没把握”的笼统反应,而可以服务于 shared me…

    Paper2026-06-20arxiv.org原文 ↗
    –
  • How Inference Compute Shapes Frontier LLM Evaluation

    这篇论文把 benchmark score 视为模型能力与测试时计算协议的共同产物,而不是模型的单点属性。作者在最多 12 个 frontier language model 和 7 个覆盖软件工程、数学、医学、网络安全的 benchmark 上,组合更大 token budget、context compaction、repeated submission attempts,以及模型自导或 mi…

    Paper2026-06-18arxiv.org原文 ↗
    –
  • GLM-5.2: Built for Long-Horizon Tasks

    Z.ai 的 Hugging Face 文章把 GLM-5.2 放在 long-horizon tasks 语境里介绍,与榜单新闻形成一条“技术叙述 + 外部评测”的组合。模型发布方把能力重心放在 autonomous coding、complex engineering 和持续多步任务。它值得与 Agent 评测论文放在一起看:长程任务能力越来越不是单轮推理,而是上下文管理、工具调用、反馈循环和…

    News2026-06-18huggingface.co原文 ↗
    –
  • Beyond Parallel Sampling: Diverse Query Initialization for Agentic Search

    这篇论文指出 agentic search 的并行 rollout 很早就会塌缩:如果第一轮 query 相似,后续线程会围绕同一批检索证据继续推理,breadth scaling 的收益迅速递减。DivInit 不训练模型,而是在一次调用中生成 n 个候选首轮 query,从中挑出 k 个彼此差异更大的 seed 再并行展开。作者在 5 个 open-weight 模型和 8 个 benchma…

    Paper2026-06-18arxiv.org原文 ↗
    –
  • Agentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning

    ACTS 不是再给模型加一句“思考更短”的提示,而是在推理过程中插入一个控制器,让冻结的 reasoner 按预算、轨迹状态和任务难度动态改变思考策略。摘要称它把 steering 写成 MDP,并在多个 benchmark 上达到接近 full-thinking 的表现,同时减少推理 token;这使它更像 inference-time scheduler,而不是 prompt engineer…

    Paper2026-06-05arxiv.org原文 ↗
    –
  • Rethinking Search as Code Generation

    Perplexity Research 把搜索重新表述为代码生成:模型不只生成查询词,而是生成可执行检索程序,组合搜索、过滤、解析和聚合步骤。这个视角把复杂信息需求拆成控制流、数据流和验证逻辑,适合多跳事实查找和结构化答案生成。值得看的是,它让 search agent 的推理过程更容易调试、复现和审计。

    Blog2026-06-03research.perplexity.ai原文 ↗
    –
  • FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search

    论文把 agentic search 的答案验证拆成细粒度 claim 检查,用于更稳健地利用 test-time compute。

    Paper2026-06-03arxiv.org原文 ↗
    –

2026 年 5 月2

  • Biohub/esm

    Biohub/esm 发布 ESMC、ESMFold2 和 ESM Atlas 相关代码与模型入口。README 称 ESM Atlas 覆盖 68 亿蛋白,ESMFold2 的 folding throughput 支撑了超过 10 亿结构预测;SAE 层把 ESMC 内部表示拆成约 1.6 万个可解释 feature,并用 agentic pipeline 映射到已知生物学。值得看的是蛋白模型…

    Trending2026-05-31github.com原文 ↗
    –
  • The Sequence Opinion #868: Recursion Is the New Scaling Law

    TheSequence 讨论递归式模型调用和系统组合是否正在成为 AI 扩展的新路径。

    Blog2026-05-29thesequence.substack.com原文 ↗
    –