每日 Harness 开源 · Source
主题 · All topics

认知与推理Reasoning

本主题共 23 条 · 最早 2026-05-29 · 最新 2026-07-24

视图 · View

2026 年 7 月11

  • PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents

    PhoenixRepair 不把软件修复限制为“在第一次猜中的文件附近继续改”,而是显式探索编辑位置、修复策略和验证反馈组成的搜索空间。系统保留多条候选分支,并依据测试结果重排而非过早承诺单一路线;其贡献是把编码 agent 的失败归因于搜索覆盖不足,为预算如何分配到定位与修改提供了可操作框架。

    Paper2026-07-24arxiv.org原文 ↗
  • Effort Router: Intelligent /effort selection per Claude turn

    effort-router 用 Claude Code skill frontmatter 的 effort override,把每个用户请求分到 low、medium、high、xhigh、max 五档。SessionStart hook 注入“每轮都分类”的 standing instruction,UserPromptSubmit 每次用约 20 tokens 重新锚定,Stop hook…

    Project2026-07-21github.com原文 ↗
  • Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?

    论文用 textual baseline、flexible executable world model、带 scheduled simplification 的 executable model、以及 fixed-interface replay verification 四个 Codex-based agent 做消融。主实验覆盖 gpt-5.4 与 gpt-5.5 的 high/xhigh…

    Paper2026-07-21arxiv.org原文 ↗
  • Controlling Reasoning Effort in LLMs

    Sebastian Raschka 解释 reasoning effort 参数如何影响 LLM 推理成本、延迟和输出行为。文章把 effort 放进 inference scaling 框架,与 self-consistency、self-refinement 等技术相邻讨论,说明“多想”既可以是模型内部预算,也可以是外部采样和反复修正。它的实用点在于把用户可见旋钮和底层推理时计算联系起来,而不…

    Blog2026-07-21magazine.sebastianraschka.com原文 ↗
  • Can We Understand How Large Language Models Reason?

    CACM 文章梳理 LLM 推理可解释性、chain-of-thought 和机制理解之间的张力。它明确区分“模型写出一段推理文本”和“研究者知道模型内部为何得到答案”这两件事。围绕因果干预、机制解释和可审计推理的讨论,会继续影响模型评测和安全研究的设计。

    News2026-07-13cacm.acm.org原文 ↗
  • FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents

    FirstResearch 把科学发现 agent 的第一个研究问题拆成可审计的 Research Question Certificate,要求记录 primitive definitions、assumptions、mechanism model、tension/contradiction、falsifiable hypothesis、minimal decisive test 和 failu…

    Paper2026-07-09arxiv.org原文 ↗
  • Doomed from the Start: Early Abort of LLM Agent Episodes via a Recall-Controlled Probe Cascade

    这篇论文把 agent episode 的早停问题转化为隐藏表示上的失败预测:每轮用轻量 probe 读取 hidden activations,甚至第一轮就能预判后续失败,而只看可观察行为的 scorer 还接近随机。作者设计了 per-round calibrated gate cascade,通过联合搜索 recall budgets 保证最终会成功的 episode 以用户指定全局比例存活…

    Paper2026-07-09arxiv.org原文 ↗
  • SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference

    SPORK 观察到 agent 循环中工具调用等待会让模型推理链路空转,于是提出 self-speculative forking。模型在等待真实工具结果时先 fork 出多个可能后续分支,等结果返回后再保留可用路径。这个方法抓住的是 agentic inference 的端到端延迟,而不是单次 token 解码速度。

    Paper2026-07-08arxiv.org原文 ↗
  • Understanding is the new bottleneck

    Geoffrey Litt 讨论 AI 降低生成代码成本后,理解系统状态、业务约束、历史决策和副作用正在成为新的瓶颈。文章把开发效率问题从打字速度转向认知负荷,指出“能写更多代码”不等于“能安全改变系统”。它适合放在 agent 编程讨论里看,因为模型越能产出补丁,理解和验证就越成为稀缺环节。

    Blog2026-07-04geoffreylitt.com原文 ↗
  • Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling

    论文研究 LLM 置信度校准,并把置信信号用于决定测试时是否增加采样、验证或推理计算。关键设定是 adaptive test-time scaling:预算不是固定平均分配,而是向低置信问题倾斜。它值得跟进,因为测试时扩展如果没有可靠置信度,很容易把计算浪费在模型本来已经能解的问题上。

    Paper2026-07-04arxiv.org原文 ↗
  • BaRA: BFS-and-Reflection Web Data Collection Agent

    BaRA 面向 live websites 上的站点级采集问题,解决 agent 容易漏页、遗漏多模态输出、返回不可下载媒体 URL 的问题。方法把 bounded BFS traversal 和 history-based self-reflection 组合在固定交互预算内运行。作者在 50 个带 ground-truth reference sets 的 synthetic websites…

    Paper2026-07-03arxiv.org原文 ↗

2026 年 6 月10

  • The Sequence Opinion #884: Self-Driving Labs: The Laboratory That Chooses Its Next Experiment

    TheSequence 介绍 self-driving lab:系统自动选择、执行并根据结果更新下一步实验。关键是实验室从执行工具变成闭环决策系统。它与 agent planning 的关系很直接:科学实验中的 action space、反馈延迟和成本约束比网页 agent 更硬,因而更能检验自主决策系统。

    Blog2026-06-27thesequence.substack.com原文 ↗
  • A Verifiable Search Is Not a Learnable Chain-of-Thought

    这篇论文反驳“短程序可解就能教成可泛化 CoT”的直觉,研究对象是可验证搜索过程,而不是开放式问答。实验包含九个由确定性生成器产生的推理任务,public 与 hidden splits 共享生成器,因此隐藏集主要检查同一程序性分布下的泛化。它提示一个硬边界:可验证性和可学习推理轨迹不是同一件事。

    Paper2026-06-24arxiv.org原文 ↗
  • Multi-Turn Reflective Masking Elicits Reasoning in Mask Diffusion Models

    论文提出 Reflective Masking,让 mask diffusion models 多轮回看和局部修订既有输出,以支持类似反思的推理过程。方法不改架构,只做轻量 post-training,并加入无参数 History Reference 利用中间 denoising states;任务覆盖文本生成、Sudoku 和图像编辑,结果优于标准 masking baseline。它把测试时扩…

    Paper2026-06-23arxiv.org原文 ↗
  • Uncertainty Decomposition for Clarification Seeking in LLM Agents

    这篇研究代理何时应该向用户澄清,而不是凭猜测继续执行。摘要指出 classical aleatoric/epistemic uncertainty 框架不足以覆盖交互式 LLM agents,需要 underspecification-aware、decomposed、communicable 的不确定性表示。它的意义在于,澄清提问不再只是“模型没把握”的笼统反应,而可以服务于 shared me…

    Paper2026-06-20arxiv.org原文 ↗
  • How Inference Compute Shapes Frontier LLM Evaluation

    这篇论文把 benchmark score 视为模型能力与测试时计算协议的共同产物,而不是模型的单点属性。作者在最多 12 个 frontier language model 和 7 个覆盖软件工程、数学、医学、网络安全的 benchmark 上,组合更大 token budget、context compaction、repeated submission attempts,以及模型自导或 mi…

    Paper2026-06-18arxiv.org原文 ↗
  • GLM-5.2: Built for Long-Horizon Tasks

    Z.ai 的 Hugging Face 文章把 GLM-5.2 放在 long-horizon tasks 语境里介绍,与榜单新闻形成一条“技术叙述 + 外部评测”的组合。模型发布方把能力重心放在 autonomous coding、complex engineering 和持续多步任务。它值得与 Agent 评测论文放在一起看:长程任务能力越来越不是单轮推理,而是上下文管理、工具调用、反馈循环和…

    News2026-06-18huggingface.co原文 ↗
  • Beyond Parallel Sampling: Diverse Query Initialization for Agentic Search

    这篇论文指出 agentic search 的并行 rollout 很早就会塌缩:如果第一轮 query 相似,后续线程会围绕同一批检索证据继续推理,breadth scaling 的收益迅速递减。DivInit 不训练模型,而是在一次调用中生成 n 个候选首轮 query,从中挑出 k 个彼此差异更大的 seed 再并行展开。作者在 5 个 open-weight 模型和 8 个 benchma…

    Paper2026-06-18arxiv.org原文 ↗
  • Agentic Chain-of-Thought Steering for Efficient and Controllable LLM Reasoning

    ACTS 不是再给模型加一句“思考更短”的提示,而是在推理过程中插入一个控制器,让冻结的 reasoner 按预算、轨迹状态和任务难度动态改变思考策略。摘要称它把 steering 写成 MDP,并在多个 benchmark 上达到接近 full-thinking 的表现,同时减少推理 token;这使它更像 inference-time scheduler,而不是 prompt engineer…

    Paper2026-06-05arxiv.org原文 ↗
  • Rethinking Search as Code Generation

    Perplexity Research 把搜索重新表述为代码生成:模型不只生成查询词,而是生成可执行检索程序,组合搜索、过滤、解析和聚合步骤。这个视角把复杂信息需求拆成控制流、数据流和验证逻辑,适合多跳事实查找和结构化答案生成。值得看的是,它让 search agent 的推理过程更容易调试、复现和审计。

    Blog2026-06-03research.perplexity.ai原文 ↗
  • FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search

    论文把 agentic search 的答案验证拆成细粒度 claim 检查,用于更稳健地利用 test-time compute。

    Paper2026-06-03arxiv.org原文 ↗

2026 年 5 月2

  • Biohub/esm

    Biohub/esm 发布 ESMC、ESMFold2 和 ESM Atlas 相关代码与模型入口。README 称 ESM Atlas 覆盖 68 亿蛋白,ESMFold2 的 folding throughput 支撑了超过 10 亿结构预测;SAE 层把 ESMC 内部表示拆成约 1.6 万个可解释 feature,并用 agentic pipeline 映射到已知生物学。值得看的是蛋白模型…

    Trending2026-05-31github.com原文 ↗
  • The Sequence Opinion #868: Recursion Is the New Scaling Law

    TheSequence 讨论递归式模型调用和系统组合是否正在成为 AI 扩展的新路径。

    Blog2026-05-29thesequence.substack.com原文 ↗