每日 Harness 开源 · Source
主题 · All topics

1.1 推理与规划Reasoning & Planning

本主题共 12 条 · 最早 2026-05-31 · 最新 2026-07-24

视图 · View

2026 年 7 月6

  • PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents

    PhoenixRepair 不把软件修复限制为“在第一次猜中的文件附近继续改”,而是显式探索编辑位置、修复策略和验证反馈组成的搜索空间。系统保留多条候选分支,并依据测试结果重排而非过早承诺单一路线;其贡献是把编码 agent 的失败归因于搜索覆盖不足,为预算如何分配到定位与修改提供了可操作框架。

    Paper2026-07-24arxiv.org原文 ↗
  • Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?

    论文用 textual baseline、flexible executable world model、带 scheduled simplification 的 executable model、以及 fixed-interface replay verification 四个 Codex-based agent 做消融。主实验覆盖 gpt-5.4 与 gpt-5.5 的 high/xhigh…

    Paper2026-07-21arxiv.org原文 ↗
  • Can We Understand How Large Language Models Reason?

    CACM 文章梳理 LLM 推理可解释性、chain-of-thought 和机制理解之间的张力。它明确区分“模型写出一段推理文本”和“研究者知道模型内部为何得到答案”这两件事。围绕因果干预、机制解释和可审计推理的讨论,会继续影响模型评测和安全研究的设计。

    News2026-07-13cacm.acm.org原文 ↗
  • FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents

    FirstResearch 把科学发现 agent 的第一个研究问题拆成可审计的 Research Question Certificate,要求记录 primitive definitions、assumptions、mechanism model、tension/contradiction、falsifiable hypothesis、minimal decisive test 和 failu…

    Paper2026-07-09arxiv.org原文 ↗
  • Understanding is the new bottleneck

    Geoffrey Litt 讨论 AI 降低生成代码成本后,理解系统状态、业务约束、历史决策和副作用正在成为新的瓶颈。文章把开发效率问题从打字速度转向认知负荷,指出“能写更多代码”不等于“能安全改变系统”。它适合放在 agent 编程讨论里看,因为模型越能产出补丁,理解和验证就越成为稀缺环节。

    Blog2026-07-04geoffreylitt.com原文 ↗
  • BaRA: BFS-and-Reflection Web Data Collection Agent

    BaRA 面向 live websites 上的站点级采集问题,解决 agent 容易漏页、遗漏多模态输出、返回不可下载媒体 URL 的问题。方法把 bounded BFS traversal 和 history-based self-reflection 组合在固定交互预算内运行。作者在 50 个带 ground-truth reference sets 的 synthetic websites…

    Paper2026-07-03arxiv.org原文 ↗

2026 年 6 月5

  • The Sequence Opinion #884: Self-Driving Labs: The Laboratory That Chooses Its Next Experiment

    TheSequence 介绍 self-driving lab:系统自动选择、执行并根据结果更新下一步实验。关键是实验室从执行工具变成闭环决策系统。它与 agent planning 的关系很直接:科学实验中的 action space、反馈延迟和成本约束比网页 agent 更硬,因而更能检验自主决策系统。

    Blog2026-06-27thesequence.substack.com原文 ↗
  • A Verifiable Search Is Not a Learnable Chain-of-Thought

    这篇论文反驳“短程序可解就能教成可泛化 CoT”的直觉,研究对象是可验证搜索过程,而不是开放式问答。实验包含九个由确定性生成器产生的推理任务,public 与 hidden splits 共享生成器,因此隐藏集主要检查同一程序性分布下的泛化。它提示一个硬边界:可验证性和可学习推理轨迹不是同一件事。

    Paper2026-06-24arxiv.org原文 ↗
  • Uncertainty Decomposition for Clarification Seeking in LLM Agents

    这篇研究代理何时应该向用户澄清,而不是凭猜测继续执行。摘要指出 classical aleatoric/epistemic uncertainty 框架不足以覆盖交互式 LLM agents,需要 underspecification-aware、decomposed、communicable 的不确定性表示。它的意义在于,澄清提问不再只是“模型没把握”的笼统反应,而可以服务于 shared me…

    Paper2026-06-20arxiv.org原文 ↗
  • GLM-5.2: Built for Long-Horizon Tasks

    Z.ai 的 Hugging Face 文章把 GLM-5.2 放在 long-horizon tasks 语境里介绍,与榜单新闻形成一条“技术叙述 + 外部评测”的组合。模型发布方把能力重心放在 autonomous coding、complex engineering 和持续多步任务。它值得与 Agent 评测论文放在一起看:长程任务能力越来越不是单轮推理,而是上下文管理、工具调用、反馈循环和…

    News2026-06-18huggingface.co原文 ↗
  • Rethinking Search as Code Generation

    Perplexity Research 把搜索重新表述为代码生成:模型不只生成查询词,而是生成可执行检索程序,组合搜索、过滤、解析和聚合步骤。这个视角把复杂信息需求拆成控制流、数据流和验证逻辑,适合多跳事实查找和结构化答案生成。值得看的是,它让 search agent 的推理过程更容易调试、复现和审计。

    Blog2026-06-03research.perplexity.ai原文 ↗

2026 年 5 月1

  • Biohub/esm

    Biohub/esm 发布 ESMC、ESMFold2 和 ESM Atlas 相关代码与模型入口。README 称 ESM Atlas 覆盖 68 亿蛋白,ESMFold2 的 folding throughput 支撑了超过 10 亿结构预测;SAE 层把 ESMC 内部表示拆成约 1.6 万个可解释 feature,并用 agentic pipeline 映射到已知生物学。值得看的是蛋白模型…

    Trending2026-05-31github.com原文 ↗