2026 年 7 月6
-
PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents
PhoenixRepair 不把软件修复限制为“在第一次猜中的文件附近继续改”,而是显式探索编辑位置、修复策略和验证反馈组成的搜索空间。系统保留多条候选分支,并依据测试结果重排而非过早承诺单一路线;其贡献是把编码 agent 的失败归因于搜索覆盖不足,为预算如何分配到定位与修改提供了可操作框架。
原文 ↗– -
Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?
论文用 textual baseline、flexible executable world model、带 scheduled simplification 的 executable model、以及 fixed-interface replay verification 四个 Codex-based agent 做消融。主实验覆盖 gpt-5.4 与 gpt-5.5 的 high/xhigh…
原文 ↗– -
Can We Understand How Large Language Models Reason?
CACM 文章梳理 LLM 推理可解释性、chain-of-thought 和机制理解之间的张力。它明确区分“模型写出一段推理文本”和“研究者知道模型内部为何得到答案”这两件事。围绕因果干预、机制解释和可审计推理的讨论,会继续影响模型评测和安全研究的设计。
原文 ↗– -
FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents
FirstResearch 把科学发现 agent 的第一个研究问题拆成可审计的 Research Question Certificate,要求记录 primitive definitions、assumptions、mechanism model、tension/contradiction、falsifiable hypothesis、minimal decisive test 和 failu…
原文 ↗– -
Understanding is the new bottleneck
Geoffrey Litt 讨论 AI 降低生成代码成本后,理解系统状态、业务约束、历史决策和副作用正在成为新的瓶颈。文章把开发效率问题从打字速度转向认知负荷,指出“能写更多代码”不等于“能安全改变系统”。它适合放在 agent 编程讨论里看,因为模型越能产出补丁,理解和验证就越成为稀缺环节。
原文 ↗– -
BaRA: BFS-and-Reflection Web Data Collection Agent
BaRA 面向 live websites 上的站点级采集问题,解决 agent 容易漏页、遗漏多模态输出、返回不可下载媒体 URL 的问题。方法把 bounded BFS traversal 和 history-based self-reflection 组合在固定交互预算内运行。作者在 50 个带 ground-truth reference sets 的 synthetic websites…
原文 ↗–
2026 年 6 月5
-
The Sequence Opinion #884: Self-Driving Labs: The Laboratory That Chooses Its Next Experiment
TheSequence 介绍 self-driving lab:系统自动选择、执行并根据结果更新下一步实验。关键是实验室从执行工具变成闭环决策系统。它与 agent planning 的关系很直接:科学实验中的 action space、反馈延迟和成本约束比网页 agent 更硬,因而更能检验自主决策系统。
原文 ↗– -
A Verifiable Search Is Not a Learnable Chain-of-Thought
这篇论文反驳“短程序可解就能教成可泛化 CoT”的直觉,研究对象是可验证搜索过程,而不是开放式问答。实验包含九个由确定性生成器产生的推理任务,public 与 hidden splits 共享生成器,因此隐藏集主要检查同一程序性分布下的泛化。它提示一个硬边界:可验证性和可学习推理轨迹不是同一件事。
原文 ↗– -
Uncertainty Decomposition for Clarification Seeking in LLM Agents
这篇研究代理何时应该向用户澄清,而不是凭猜测继续执行。摘要指出 classical aleatoric/epistemic uncertainty 框架不足以覆盖交互式 LLM agents,需要 underspecification-aware、decomposed、communicable 的不确定性表示。它的意义在于,澄清提问不再只是“模型没把握”的笼统反应,而可以服务于 shared me…
原文 ↗– -
GLM-5.2: Built for Long-Horizon Tasks
Z.ai 的 Hugging Face 文章把 GLM-5.2 放在 long-horizon tasks 语境里介绍,与榜单新闻形成一条“技术叙述 + 外部评测”的组合。模型发布方把能力重心放在 autonomous coding、complex engineering 和持续多步任务。它值得与 Agent 评测论文放在一起看:长程任务能力越来越不是单轮推理,而是上下文管理、工具调用、反馈循环和…
原文 ↗– -
Rethinking Search as Code Generation
Perplexity Research 把搜索重新表述为代码生成:模型不只生成查询词,而是生成可执行检索程序,组合搜索、过滤、解析和聚合步骤。这个视角把复杂信息需求拆成控制流、数据流和验证逻辑,适合多跳事实查找和结构化答案生成。值得看的是,它让 search agent 的推理过程更容易调试、复现和审计。
原文 ↗–
2026 年 5 月1
-
Biohub/esm
Biohub/esm 发布 ESMC、ESMFold2 和 ESM Atlas 相关代码与模型入口。README 称 ESM Atlas 覆盖 68 亿蛋白,ESMFold2 的 folding throughput 支撑了超过 10 亿结构预测;SAE 层把 ESMC 内部表示拆成约 1.6 万个可解释 feature,并用 agentic pipeline 映射到已知生物学。值得看的是蛋白模型…
原文 ↗–