每日 Harness 开源 · Source
主题 · All topics

1.1 推理与规划Reasoning & Planning

本主题共 16 条 · 最早 2026-05-31 · 最新 2026-08-26

视图 · View

2026 年 8 月4

  • XWM

    XWM 用 JAX 实现动作条件潜在世界模型,把观察编码到潜变量后直接预测下一状态,不训练像素解码器。JEPA、TD-MPC2、MuZero 复用同一组件,可接 CEM、MPPI、梯度与 MCTS 规划器,并允许只观察一部分 token;示例从 CPU 合成任务延伸到 Franka 机械臂。统一接口便于比较表示与规划组合,不过仓库尚早,行为测试不能替代真实控制基准。

    Project2026-08-26github.com原文 ↗
    –
  • Active Inference as Context Acquisition for AI Agents

    论文把澄清、检索、工具调用、提示试验、直接执行和停止都视作有成本的上下文获取动作,由内层更新潜在任务状态,外层最小化期望自由能。

    Paper2026-08-22arxiv.org原文 ↗
    –
  • The Optimizer Is the Agent

    ReASearch 让单一工具调用 agent 自己选择评估、诊断、编辑、验证或重启,持久记忆负责跨长轨迹分配搜索预算。14 项任务中相对专用优化器提升 2%–40%,部分解超过人工已知最好结果。论文把外层控制器的职责放回推理循环,代价是搜索行为和预算决策也更依赖 agent 自身稳定性。

    Paper2026-08-11arxiv.org原文 ↗
    –
  • Learning more about Claude’s mathematical capabilities

    Anthropic 记录 Claude 参与黎曼 ζ 函数问题研究的实验,关注模型如何探索、提出中间猜想并用计算核验。digest 未提供可复现实验规模或最终数学成果,因而本文不把“参与研究”夸成独立证明。它更适合作为观察 agent 化数学工作流的案例:答案质量取决于中间步骤是否可检查。

    Blog2026-08-11anthropic.com原文 ↗
    –

2026 年 7 月6

  • PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents

    PhoenixRepair 不把软件修复限制为“在第一次猜中的文件附近继续改”,而是显式探索编辑位置、修复策略和验证反馈组成的搜索空间。系统保留多条候选分支,并依据测试结果重排而非过早承诺单一路线;其贡献是把编码 agent 的失败归因于搜索覆盖不足,为预算如何分配到定位与修改提供了可操作框架。

    Paper2026-07-24arxiv.org原文 ↗
    –
  • Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?

    论文用 textual baseline、flexible executable world model、带 scheduled simplification 的 executable model、以及 fixed-interface replay verification 四个 Codex-based agent 做消融。主实验覆盖 gpt-5.4 与 gpt-5.5 的 high/xhigh…

    Paper2026-07-21arxiv.org原文 ↗
    –
  • Can We Understand How Large Language Models Reason?

    CACM 文章梳理 LLM 推理可解释性、chain-of-thought 和机制理解之间的张力。它明确区分“模型写出一段推理文本”和“研究者知道模型内部为何得到答案”这两件事。围绕因果干预、机制解释和可审计推理的讨论,会继续影响模型评测和安全研究的设计。

    News2026-07-13cacm.acm.org原文 ↗
    –
  • FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents

    FirstResearch 把科学发现 agent 的第一个研究问题拆成可审计的 Research Question Certificate,要求记录 primitive definitions、assumptions、mechanism model、tension/contradiction、falsifiable hypothesis、minimal decisive test 和 failu…

    Paper2026-07-09arxiv.org原文 ↗
    –
  • Understanding is the new bottleneck

    Geoffrey Litt 讨论 AI 降低生成代码成本后,理解系统状态、业务约束、历史决策和副作用正在成为新的瓶颈。文章把开发效率问题从打字速度转向认知负荷,指出“能写更多代码”不等于“能安全改变系统”。它适合放在 agent 编程讨论里看,因为模型越能产出补丁,理解和验证就越成为稀缺环节。

    Blog2026-07-04geoffreylitt.com原文 ↗
    –
  • BaRA: BFS-and-Reflection Web Data Collection Agent

    BaRA 面向 live websites 上的站点级采集问题,解决 agent 容易漏页、遗漏多模态输出、返回不可下载媒体 URL 的问题。方法把 bounded BFS traversal 和 history-based self-reflection 组合在固定交互预算内运行。作者在 50 个带 ground-truth reference sets 的 synthetic websites…

    Paper2026-07-03arxiv.org原文 ↗
    –

2026 年 6 月5

  • The Sequence Opinion #884: Self-Driving Labs: The Laboratory That Chooses Its Next Experiment

    TheSequence 介绍 self-driving lab:系统自动选择、执行并根据结果更新下一步实验。关键是实验室从执行工具变成闭环决策系统。它与 agent planning 的关系很直接:科学实验中的 action space、反馈延迟和成本约束比网页 agent 更硬,因而更能检验自主决策系统。

    Blog2026-06-27thesequence.substack.com原文 ↗
    –
  • A Verifiable Search Is Not a Learnable Chain-of-Thought

    这篇论文反驳“短程序可解就能教成可泛化 CoT”的直觉,研究对象是可验证搜索过程,而不是开放式问答。实验包含九个由确定性生成器产生的推理任务,public 与 hidden splits 共享生成器,因此隐藏集主要检查同一程序性分布下的泛化。它提示一个硬边界:可验证性和可学习推理轨迹不是同一件事。

    Paper2026-06-24arxiv.org原文 ↗
    –
  • Uncertainty Decomposition for Clarification Seeking in LLM Agents

    这篇研究代理何时应该向用户澄清,而不是凭猜测继续执行。摘要指出 classical aleatoric/epistemic uncertainty 框架不足以覆盖交互式 LLM agents,需要 underspecification-aware、decomposed、communicable 的不确定性表示。它的意义在于,澄清提问不再只是“模型没把握”的笼统反应,而可以服务于 shared me…

    Paper2026-06-20arxiv.org原文 ↗
    –
  • GLM-5.2: Built for Long-Horizon Tasks

    Z.ai 的 Hugging Face 文章把 GLM-5.2 放在 long-horizon tasks 语境里介绍,与榜单新闻形成一条“技术叙述 + 外部评测”的组合。模型发布方把能力重心放在 autonomous coding、complex engineering 和持续多步任务。它值得与 Agent 评测论文放在一起看:长程任务能力越来越不是单轮推理,而是上下文管理、工具调用、反馈循环和…

    News2026-06-18huggingface.co原文 ↗
    –
  • Rethinking Search as Code Generation

    Perplexity Research 把搜索重新表述为代码生成:模型不只生成查询词,而是生成可执行检索程序,组合搜索、过滤、解析和聚合步骤。这个视角把复杂信息需求拆成控制流、数据流和验证逻辑,适合多跳事实查找和结构化答案生成。值得看的是,它让 search agent 的推理过程更容易调试、复现和审计。

    Blog2026-06-03research.perplexity.ai原文 ↗
    –

2026 年 5 月1

  • Biohub/esm

    Biohub/esm 发布 ESMC、ESMFold2 和 ESM Atlas 相关代码与模型入口。README 称 ESM Atlas 覆盖 68 亿蛋白,ESMFold2 的 folding throughput 支撑了超过 10 亿结构预测;SAE 层把 ESMC 内部表示拆成约 1.6 万个可解释 feature,并用 agentic pipeline 映射到已知生物学。值得看的是蛋白模型…

    Trending2026-05-31github.com原文 ↗
    –