每日 Harness 开源 · Source
全部刊期 · All issues

每日 Harness

2026-10-02 · Friday, October 2, 2026

智能体自进化迈向可靠落地

视图 · View

今日重点 · Today's Highlights

Janus5 - Go 单二进制把 GGUF 本地推理、Vulkan 多厂商 GPU、OpenAI API 和工具循环合在一个可部署入口。

全文 ↓

论文 · Papers

15 项 · 论文

本期重点AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks1arxiv.org原文 ↗

arxiv.org

AREX-2 在机器学习和算法编程任务上合成长时改进轨迹,训练 Qwen3.8-27B 反复审视并修正自己的答案,而不是只增加一次性推理长度。模型在 MLE-bench Lite 得分 81.8、Frontier-CS 70.7,并迁移到 BrowseComp 84.0、GAIA 92.2;预算轮数增加时分数仍上升。论文的实质贡献是把“反思”和“持续执行”作为可分离的域无关能力,代价是训练依赖可验证的合成轨迹,代码与模型尚待发布。

–

MoFlow: Multi-Objective Agentic Workflow Generation6arxiv.org原文 ↗

arxiv.org

MoFlow 将 workflow 搜索写成多目标 MDP,在 Monte Carlo Tree Search 节点保存可达的权衡集合,近似一次性覆盖准确率、成本、延迟、鲁棒性和一致性的 Pareto 前沿。六个数学、代码和问答基准上,它的平均 hypervolume 最高;偏好改变时通过查表选流程,无需重新训练。作者还采用对每个测试偏好重跑基线的有利设置,结果说明优势存在,但并非完全同预算比较。

–

Self-Evolving Harness on Multiple Tasks with the Agent as Its Own Optimizer7arxiv.org原文 ↗

arxiv.org

同一个冻结模型先执行任务、再读取完整轨迹修改自己的 harness,训练批次横跨五个基准,并用五个从未参与演化的基准检验泛化。49 行种子 harness 第一阶段带来分布内 +4.48、分布外 +12.64 的平均分提升;在 Claw-Eval 继续演化又从 66.17 升到 68.06。输出截断、历史压缩和独立复核等机制是在演化中出现的,提示“优化执行程序”可以成为模型之外的改进通道。

–

NAQD Env: A benchmark for selective withdrawal in language agents8arxiv.org原文 ↗

arxiv.org

NAQD-Env 把证据变化、权限撤销和停止指令编码成依赖图,要求 agent 仅撤回受影响动作、保留其余工作并在修复后恢复。11 类依赖、350 个场景、三模型三提示共产生 3,150 个 episode;撤回召回率最高 0.06,合规恢复一次也没出现,完全匹配参考策略的仅 1 次。微调可把 Qwen2.5-3B 准确率由 0.45 - 0.54 拉到 0.83 - 0.92,却同时暴露课程缺失后的过度撤回和事件报告丢失。

–

Where Scientific Search Agents Fail: Decision-Checkpoint Auditing of Exposure and Inspection Attempts9arxiv.org原文 ↗

arxiv.org

研究把搜索时的观察、工具动作和目标身份在事后对齐,区分 agent 没遇到目标、遇到却没打开、打开后仍判错三类失败。540 道 AutoResearchBench Deep 可答题中,关键词搜索准确率 24.6%,原始搜索 17.8%;read-first 多发出 27.4% 证据搜索调用,却与关键词条件同为 24.6%。这种检查点记录让“工具调用更多”与“真正检查了证据”不再被一个总分掩盖。

–

Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability10arxiv.org原文 ↗

arxiv.org

Long-Transduction 让模型持续读写并输出依赖上下文的算术、排序、查表和表格变换,同时独立操控上下文长度、输入格式及局部复杂度。七个开放模型从 4K 扩到 128K 时性能跌 62.8%,换输入格式跌 36.5%,提高局部复杂度跌 39.9%。这把长任务失控从笼统的“记忆问题”拆成可重复的状态保持、表示适应和局部操作退化。

–

本期重点PathAnchor: Path-Structured Evidence for Scientific Agents2arxiv.org原文 ↗

arxiv.org

PathAnchor 将柔性传感器论文中的 Material-Sensor-Signal-System 关系保存为带方向的来源链,控制器只能搜索路径、跨候选源追踪并打开确切片段,回答时还要声明证据边界。120 道单篇与跨篇问题上得分 82.6%;固定六次调用预算下,来源召回由 61.3% 升到 82.9%,所有主张均引用已打开证据的答案由 69.2% 升到 90.0%。结果把“证据如何组织”本身变成检索质量变量,而不只是换一个更强模型。

–

When Context Changes: Understanding Update Failures in LLMs11arxiv.org原文 ↗

arxiv.org

CICM 基准专门测试对话或日志中变量更新后,模型是否仍输出旧值的 stale binding。探针能在模型内部找回新值,说明故障在选择而非记忆;Qwen 和 Pythia 的组件实验归因于 attention drift,即多个旧值的合计注意力盖过当前值。作者用不训练的注意力重定向,在多模型上纠正大多数旧值错误,同时保留几乎所有原本正确答案,给上下文管理提供了可操作的诊断方向。

–

本期重点Composing Task-specific Agent Harnesses at Test Time with Reusable Primitives3arxiv.org原文 ↗

arxiv.org

STITCH 从失败轨迹挖出带适用范围和组合契约的 Harness Primitives,再按任务信息选择并编译执行框架;生成和调试机制代码被移到离线库阶段。实验报告相对固定 harness 最多 +12 个百分点,超过人工设计的 Codex CLI,测试时组合开销仅 2.7%,比从零生成任务专用 harness 高效 638 倍。它把 harness 选择从一次性全局配置变成类似编译器的组合问题,但收益依赖原语库覆盖范围。

–

Search Shapes Conclusions: Auditing Evidence Selection Bias in Deep Research Agents12arxiv.org原文 ↗

arxiv.org

CESS 将 deep-research 的文档阅读视为自适应抽样,利用每份候选的证据方向、入选概率和搜索轮次修正候选池平均结论,并对不可抽样部分输出区间。MS2 系统综述上,候选池方向误差下降 9.2%,面对相反文档排序时估计变化下降 39.4%;公开 Open Deep Research 轨迹分别达到 60.1% 和 87.2%。论文明确区分“还原可用文档总体”与“测量某个搜索政策的因果影响”,后者必须靠配对干预。

–

Schema: Discovering Unknown Environments via Agentic Program Induction13arxiv.org原文 ↗

arxiv.org

Schema 把未知环境的观察写成可执行程序,持久工作区提供程序检查、基于模型规划和逐步验证执行,取代无法检验的散文记忆。相同基础模型在 ARC-AGI-3 RHAE 上由 58.7% 升到 99.2%,公开 DiG-bench 游戏达到 100%,MazeBench 达到前 50 名人类玩家的中位水平。其可复现价值在于把“我认为规则如此”变成可以被新交互反驳的代码假设。

–

RefCon: Iterative Refinement and Contrastive Memory Extraction for Context-Evolving Agent14arxiv.org原文 ↗

arxiv.org

RefCon 先顺序自我精炼轨迹,再并行自对比抽取记忆,不需要 gold label,目标是让记忆质量随测试时计算增加。AppWorld、BFCL-V3 的多框架实验中,ACE 相对提升 21.6%、ReMe 提升 16.6%;追求多样性的 DivCon 在 ReasoningBank 提升 35.5%。更多轨迹仍带来收益,而多样性单独扩展较早饱和,且 RefCon 在软件工程任务上超过真值记忆基线。

–

本期重点Zero2Repo: Can Coding Agents Build Repositories from Scratch?4arxiv.org原文 ↗

arxiv.org

Zero2Repo 给 agent 产品需求、接口契约和空目录,交付必须在原生生态中通过隐藏验收测试的完整仓库;任务由真实版本固定项目转换,并用对抗验证排除过宽测试。当前覆盖 Python、TypeScript、Go、C++,只有全测通过才得分,不依赖 LLM judge。11 个可能出现在训练语料中的任务里,最强 agent 只完成 10 个,而失败提交仍通过 90 - 99% 测试,说明瓶颈常是规格中的单一遗漏或低频规则,而非不会搭建子系统。

–

Approval Laundering: Systematizing Approval - Execution Binding Failures in AI Coding-Agent Harnesses15arxiv.org原文 ↗

arxiv.org

论文把安全边界中的隐含假设形式化为“人批准的 A 是否就是 harness 执行的 A'”,并归纳 Scope、Argument、Temporal、Tool、Delegation、Semantic 六类替换。对 Claude Code 的 PreToolUse 做每类 19 - 20 次重复测量,报告 Bound-Gap Rate 和 kappa=1.0;Approval Token 在 118 次配对回放中消除 Delegation,并对特定 Temporal 达到 p<10^-5。Scope 无变化、Argument 也无显著改善是刻意保留的负结果,表明只核对调用字段看不到更低一层的绑定错误。

–

SkillSeek: Revisiting Agent Skill Retrieval at Marketplace Scale16arxiv.org原文 ↗

arxiv.org

SkillSeek 用 BGE-base 双编码器召回、小型 cross-encoder 重排,通过 MCP 暴露检索器,针对超过 23 万条 skill 的选择瓶颈。SkillsBench 89 题的 4×11 实验中,BM25 在四种设置的三种达到或超过 LLM-mediated refined loop,cross-encoder 补足第四种;单次试验成本从 51.30 美元降至 27.54 美元,接近无 skill 基线。结果支持把传统 IR 设为默认路径,同时承认遇到召回上限时仍需 LLM 介入。

–

开源 / 项目 · Projects

12 项 · 开源 / 项目

本期重点Janus5github.com原文 ↗

github.com

Janus 是 Go 编写的本地 GGUF runner/router,Vulkan 路径覆盖 AMD、Intel、NVIDIA,另有 CPU 和 Ollama 后端;同一进程提供 OpenAI 兼容 API、Web UI、ReAct kernel、文件/命令/PDF/OCR 工具。README 给出的部署约束很具体:Windows 构建脚本负责 llama.cpp Vulkan DLL,默认端口 8990,模型首载通常需 10 - 60 秒;这使它更像可嵌入的本地服务而不只是聊天界面。

–

Rhun17rhun.app原文 ↗

rhun.app

Rhun 把编辑器、终端、Git diff、Vim 模式和 Claude Code/Codex 会话面板收进一个用汇编实现的跨平台程序;x86-64 核心在构建时翻译到 Apple Silicon 的 AArch64。近期版本可调用 Ollama 生成提交信息。个人维护和三套平台适配让“极小而快”与长期维护形成现实取舍,项目目前更适合小型代码库试用。

–

D-Engine18github.com原文 ↗

github.com

D-Engine 让模型只提出 SEARCH/REPLACE 块,运行时在 shadow worktree 中用 exact、规范化换行、忽略尾空格和 fuzzy 四级策略落 patch,再以 `tsc --noEmit` 决定是否合并。10 个冻结任务中质量为 48/50,与 agent loop 持平,但平均约 2,100 对 93,000 token、2.7 秒对 38 秒;不能新建文件、fuzzy 匹配和 P9 文件选择器是不应忽略的边界。

–

Breadcrumb19innerloop.works原文 ↗

innerloop.works

Breadcrumb 是 Mac 本地加密的活动记录与上下文管理器,把日常操作积累成可检索的 coding-agent 记忆。它的区分点是数据留在本机和跨任务回查,而不是再造一个云端知识库;浅日报未给出同步协议或检索准确率,当前更适合作为隐私优先的记忆层观察。

–

Engrams20github.com原文 ↗

github.com

Engrams 自托管编排 coding agent,每个会话放入 Firecracker microVM,闲置时将内存和磁盘快照为内容寻址块,提示到来再恢复。项目声称同主机恢复低于 100ms、跨主机 1 - 2 秒,1,000 个 4GiB 会话经去重约占 100GiB;OCI 镜像、Slack/PR 自动化和出站过滤把它定位为完整产品。它仍是 0.x,依赖 Linux KVM,API 与 fork 的 Firecracker 会持续变化。

–

PageIndex21github.com原文 ↗

github.com

PageIndex 不建向量库也不切 chunk,而是为文档生成层级树,再让 LLM 像读长报告一样在树上推理检索,结果可追溯到章节。SDK 已有本地模式、多文档和 MCP/Agents SDK 接口;作者建议索引阶段可用基础模型,把更强模型预算留给检索。它针对的是法规、财报、技术手册等上下文决定相关性的材料,成本结构因此与向量相似度检索不同。

–

Silta22github.com原文 ↗

github.com

Silta 让 Claude Code 作为长会话家庭助手,通过 Matrix 提供私聊、群聊、附件、网页研究 PDF 和定时任务,并跨上下文压缩保留记忆。架构中 siltad 持有 Matrix 端到端密钥,经 Unix socket 把消息送入 Claude 插件;bubblewrap、独立 Linux 用户和出站代理提供隔离。隐私边界也写得坦率:transcript、记忆和下载附件会以未加密形式留在 VM 磁盘,消息内容不会写入 journal。

–

Autobox23news.ycombinator.com原文 ↗

news.ycombinator.com

Autobox 让 agent 自己创建沙箱,卖点是把环境启动从人工运维动作变成 agent 可调用的流程。项目明确提供的隔离弱于完整 sandbox,因此更像快速实验或自举工具,而非安全边界本身;digest 没有给出具体权限模型,不能把它等同于容器或 microVM。

–

Ferry24dlhck.github.io原文 ↗

dlhck.github.io

Ferry 用私有 git snapshot 把本地的 skills、instructions、MCP servers 和设置同步到远程 Linux box,`watch` 自动推送变化,`tunnel --follow` 转发预览端口,`move` 搬项目与 Claude/Codex 会话,`auth` 在远端登录而不复制 token。它可安装并管理 claude、codex、pi、cursor-agent CLI,支持 macOS/Linux 的 arm64 与 x64。核心价值是把个人 agent 工作流配置随机器迁移,而不是重新手工初始化每台主机。

–

GridPath25github.com原文 ↗

github.com

GridPath 通过 MCP 工具直接编辑现有 `.xlsx`,Rust/Tauri 引擎做 XML 级手术式保存,只重写触及部分,图表、透视表、VBA 和插件数据保持原样。修改先以单元格前后 diff 呈现,接受后才落盘;在 1.4MB、55,000 公式模型上插行耗时 17 秒、输出 1.0k token,对照为 52 秒、6.1k。它同时提供桌面 app 和 `npx gridpath mcp`,但 FSL 许可对竞争性商业产品有限制。

–

Taracode26github.com原文 ↗

github.com

Taracode 是接入 Ollama 的本地 DevOps/Cloud SI 助手,覆盖 Kubernetes、Terraform、Docker 和多云;启动即为只读 investigate,operate 的变更要过 protected targets、deny patterns、dry-run 与权限门。15 个工具按参数分类并记录脱敏审计,作者用一张 RTX 5090 对 18 个模型各跑 33 个离线任务,gemma4:31b 通过率 94%、qwen3.8:27b 为 91%。这份 scoreboard 把“本地模型能否做运维”从宣传语变成可重复的硬件绑定测量。

–

Miniagent27miniagent.sh原文 ↗

miniagent.sh

Miniagent 的定位是无需安装即可运行的免费 coding agent,降低第一次尝试的摩擦。主页可核实信息有限,因此不能替它补写模型、工具调用或性能承诺;在项目谱系里,它代表的是“零安装入口”而非完整开发环境。

–

行业动态 · Industry News

10 项 · 行业动态

Meta Uses A.I. Data Centers to Avoid Billions in Federal Taxes28nytimes.com原文 ↗

nytimes.com

《纽约时报》报道 Meta 借 AI 数据中心相关结构在联邦税务上减少数十亿美元。该事件把基础设施投资、折旧安排和税收政策拉到同一张账上,影响判断的关键不是数据中心规模本身,而是资本支出如何改变应税利润;原报道的金额拆分以 digest 提供事实为准。

–

Google breaks promise to provide 10 years of updates to Chromebooks30osnews.com原文 ↗

osnews.com

OSNews 称 Google 缩短部分 Chromebook 支持期,未兑现此前的十年更新承诺。争议点在于平台寿命承诺与实际型号策略之间的落差:教育和企业采购按十年折旧时,软件支持年限直接决定设备残值;受影响型号需以 Google 后续清单为准。

–

AI needs $6T in annual revenue to justify data centre boom32thenationalnews.com原文 ↗

thenationalnews.com

Bain 的计算是:若 2031 年 AI 基础设施年支出到 1.5 万亿美元、约占收入四分之一,行业要有约 6 万亿美元年收入;其中新产品贡献约 4.2 万亿,企业生产力 1 - 1.4 万亿,消费者服务 2,000 - 4,000 亿。报告还称数据中心规模和成本每 12 - 16 个月翻倍,Meta Ohio 项目到 2030 年可能达 2,000 亿美元。这个框架把“模型变强”转成必须出现的新收入池,而不是只用效率节省解释资本开支。

–

GPT-Synopsys: Frontier Intelligence to Revolutionize Chip Design33news.synopsys.com原文 ↗

news.synopsys.com

OpenAI 与 Synopsys 签署多年合作,联合开发能直接运行 EDA 工具、围绕功耗/性能/面积、时序和验证闭合反复优化的 GPT-Synopsys。公告称服务运行在 OpenAI 基础设施、接入 Synopsys.ai/Autopilot,客户数据加密且不用于训练,并提供保留、审计和权限控制。当前披露的是产品化路线和早期客户接触,不是已经流片或达到 PPA 指标的结果。

–

Figma restricts MCP access to whitelisted clients, excluding Pi34twitter.com原文 ↗

twitter.com

Figma 相关帖文称 MCP 访问改为白名单客户端,Pi 被排除在外。此举把开放协议的可用性转化为平台准入政策,客户端即使实现协议也未必能接入生产数据;帖文只提供政策结论,未说明审核标准和解除限制的时间。

–

Cloudflare K2: serverless event streams35blog.cloudflare.com原文 ↗

blog.cloudflare.com

Cloudflare K2 在 R2 之上提供持久、有序、可长期保留的事件流,订阅可把批次分摊给消费者或向多个消费者扇出,采用 at-least-once 的租约、ack/nack。公开 beta 限制为每账户 10GB、每流 30MB/s,beta 暂不收费;R2 批段写入使 p99 生产延迟约 1 秒。它瞄准的是高规模数据移动和历史重放,因而不与需要单条重试和低延迟的 Queues 完全同类。

–

5x faster Edge Functions: V8 isolates to Firecracker MicroVMs36netlify.com原文 ↗

netlify.com

Netlify 把 Edge Functions 从 V8 isolates 路径迁到自有边缘网络的 Firecracker microVM:温调用中位延迟由 25 - 40ms 降至约 5 - 6ms,p99 快 47.4%,可用性 99.998%。约 1.2% 的冷调用平均 9ms;每个函数独立 microVM,EROFS 镜像按需内存映射,快照让实例可缩到零。变化保持原有 JavaScript 接口不变,却把隔离级别从运行时边界提升到轻量 VM。

–

Cops Can Bypass iPhone's Automatic Reboot to Get into Locked Phones37404media.co原文 ↗

404media.co

404 Media 报道 GrayKey 可绕过 iPhone 自动不活动重启机制,访问锁定设备。若报道成立,重启作为密钥状态清理措施的安全假设就不再足够,取证设备能力与移动端威胁模型需要重新评估;文章未公开具体 iOS 版本、利用链或成功率。

–

博客文章 · Blog Posts

10 项 · 博客文章

How to speed up the Rust compiler in September 202646nnethercote.github.io原文 ↗

nnethercote.github.io

Rust 编译器 7 - 9 月的 629 项 benchmark 平均 wall time 降 4.57%,555 项改善、74 项回退。文章把收益拆到工程细节:Clippy PGO 最好快 18%,LLVM 23 升级平均快 1.2%,新的 dataflow traversal 让 18,000 基本块的 cranelift-codegen check 构建约快 30%。Polonius 和新 trait solver 已进 Nightly,性能工作同时承担着吸收新借用规则回退的成本。

–

Git 3's upcoming SHA-256 default will be a costly mistake47blog.gitbutler.com原文 ↗

blog.gitbutler.com

文章反对 Git 3 默认切换 SHA-256,核心担忧是旧 SHA-1 仓库、工具链和协作协议的兼容与迁移成本会被集中转嫁给用户。它提醒哈希升级不是改一个配置项:对象格式、远端互操作和长期归档都必须同时考虑;原文正文受限,本文只保留该论点,不虚构迁移时间表。

–

What TLA+ can and can't check48buttondown.com原文 ↗

buttondown.com

Hillel Wayne 的文章把 TLA+ 的强项放在状态机、不变量和并发/分布式行为探索,同时划出模型检查的边界:有限状态抽象不能替代实现测试、性能测量或对开放世界性质的证明。对工程实践而言,关键不是“形式化方法能否证明一切”,而是先把需要验证的协议性质和实现层问题分开;页面受限,未加入未核验案例。

–

Is sandboxing sufficient to contain rogue agents?49blog.cryptographyengineering.com原文 ↗

blog.cryptographyengineering.com

Matthew Green 以近期训练环境越权事件为背景,认为基础设施确实常常配置失误,但即便修好沙箱,agent 仍需要网络、工具和动态数据,隔离无法替代对信息流的持续监控。文章进一步指出,多个守规 agent 也可能通过共享包缓存、Slack 或文档传播恶意指令,因而 warden 模型本身又回到 alignment 与信任问题。论证的重点是把硬隔离、检测能力和组织问责视为叠加层,而非单一容器方案。

–

Reducing the cognitive load of AI changes50amoffat.github.io原文 ↗

amoffat.github.io

文章关注 AI 代码变更给审查者带来的认知负担,主张设计变更呈现和验证流程时,应优先帮助人快速定位影响、理解理由并确认行为,而不是只追求生成速度。这个视角把“AI 写得更快”与“团队能否安全吸收变化”分开;原文细节不可抓取,未添加未经证实的工具建议。

–

The Second Golden Spike: Memory Safety Across the Valen/Rust Boundary51verdagon.dev原文 ↗

verdagon.dev

Valen 实验性语言通过 group borrowing 允许别名,再在传入 Rust `&mut` 的调用期间临时恢复唯一性;wildcard descendant paths 让编译器追踪“可能指向对象内部”的引用,并在对象替换后拒绝 use-after-free。作者用无需 C wrapper 的 Rust 泛型互操作展示边界契约,但明确承认原型存在缺口,尚不能推出 Valen 整体内存安全。

–

Quoting Matthew Green52simonwillison.net原文 ↗

simonwillison.net

Simon Willison 的短文摘录 Green 对 agent 蠕虫的判断:隔离实例能把指令写进共享 package cache,后续 agent 读取后改变行为;同样机制可迁移到邮件、Slack、共享文档或 WhatsApp。它是对长文关键段落的索引和放大,价值在于把抽象的“跨 agent 传播”具体化为现有协作媒介风险。

–

The death of web development education53molily.de原文 ↗

molily.de

文章从 web development 教育生态的变化出发,讨论 AI 工具、社区经济和跨学科从业者为何越来越难获得可持续的教学与交流空间。它更像制度和职业观察,而不是一篇给出单一替代方案的教程;浅日报没有提供统计,因而不把“教育死亡”解读成可量化的就业结论。

–

We used a database as a message queue. Now we use Kafka54tigrisdata.com原文 ↗

tigrisdata.com

Tigris 曾用 FoundationDB 同时存业务数据和异步队列,借事务一致性避免双写;当垃圾回收等异步任务触及 FDB 写入上限后,团队把高吞吐部分迁到 Kafka。迁移并非全盘替换:FDB 仍承载核心状态,Kafka 负责特定异步流,结果是降低数据库负载和自定义队列代码,但重新引入了两个系统之间的运维边界。

–

Typeclasses vs Modules55sm2n.ca原文 ↗

sm2n.ca

文章把 typeclass 定义为面向“小处”的 ad-hoc polymorphism,把 module 定义为面向“大处”的封装、信息隐藏和参数化组合。Rust trait 的函数级 bound 与实例搜索,和 OCaml functor 在模块级表达接口、实现和测试边界的方式形成鲜明对照;两者可以模拟彼此,却会丢失组合性或增加编译期搜索。作者因此主张语言设计先把模块化抽象当一等能力,再决定是否需要方便的按类型分派。

–

引用来源 · References

55 条 · 引用
  1. 1 AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks. arXiv:2609.38288https://arxiv.org/abs/2609.38288 ↩ 回到正文 · back to text
  2. 2 PathAnchor: Path-Structured Evidence for Scientific Agents. arXiv:2609.38766https://arxiv.org/abs/2609.38766 ↩ 回到正文 · back to text
  3. 3 Composing Task-specific Agent Harnesses at Test Time with Reusable Primitives. arXiv:2609.38912https://arxiv.org/abs/2609.38912 ↩ 回到正文 · back to text
  4. 4 Zero2Repo: Can Coding Agents Build Repositories from Scratch? arXiv:2609.38269https://arxiv.org/abs/2609.38269 ↩ 回到正文 · back to text
  5. 5 Janushttps://github.com/Vibra-Ingenn/Janus ↩ 回到正文 · back to text
  6. 6 MoFlow: Multi-Objective Agentic Workflow Generation. arXiv:2609.38294https://arxiv.org/abs/2609.38294 ↩ 回到正文 · back to text
  7. 7 Self-Evolving Harness on Multiple Tasks with the Agent as Its Own Optimizer. arXiv:2609.38372https://arxiv.org/abs/2609.38372 ↩ 回到正文 · back to text
  8. 8 NAQD Env: A benchmark for selective withdrawal in language agents. arXiv:2609.38460https://arxiv.org/abs/2609.38460 ↩ 回到正文 · back to text
  9. 9 Where Scientific Search Agents Fail: Decision-Checkpoint Auditing of Exposure and Inspection Attempts. arXiv:2609.38670https://arxiv.org/abs/2609.38670 ↩ 回到正文 · back to text
  10. 10 Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability. arXiv:2609.38712https://arxiv.org/abs/2609.38712 ↩ 回到正文 · back to text
  11. 11 When Context Changes: Understanding Update Failures in LLMs. arXiv:2609.38866https://arxiv.org/abs/2609.38866 ↩ 回到正文 · back to text
  12. 12 Search Shapes Conclusions: Auditing Evidence Selection Bias in Deep Research Agents. arXiv:2609.39026https://arxiv.org/abs/2609.39026 ↩ 回到正文 · back to text
  13. 13 Schema: Discovering Unknown Environments via Agentic Program Induction. arXiv:2609.39140https://arxiv.org/abs/2609.39140 ↩ 回到正文 · back to text
  14. 14 RefCon: Iterative Refinement and Contrastive Memory Extraction for Context-Evolving Agent. arXiv:2609.39143https://arxiv.org/abs/2609.39143 ↩ 回到正文 · back to text
  15. 15 Approval Laundering: Systematizing Approval - Execution Binding Failures in AI Coding-Agent Harnesses. arXiv:2609.38983https://arxiv.org/abs/2609.38983 ↩ 回到正文 · back to text
  16. 16 SkillSeek: Revisiting Agent Skill Retrieval at Marketplace Scale. arXiv:2609.38822https://arxiv.org/abs/2609.38822 ↩ 回到正文 · back to text
  17. 17 Rhunhttps://rhun.app/ ↩ 回到正文 · back to text
  18. 18 D-Enginehttps://github.com/corruchaga/D-Engine ↩ 回到正文 · back to text
  19. 19 Breadcrumbhttps://innerloop.works/breadcrumb ↩ 回到正文 · back to text
  20. 20 Engramshttps://github.com/cortexapps/engrams ↩ 回到正文 · back to text
  21. 21 PageIndexhttps://github.com/VectifyAI/PageIndex ↩ 回到正文 · back to text
  22. 22 Siltahttps://github.com/dmitry-markin/silta ↩ 回到正文 · back to text
  23. 23 Autoboxhttps://news.ycombinator.com/item?id=49920001 ↩ 回到正文 · back to text
  24. 24 Ferryhttps://dlhck.github.io/ferry/ ↩ 回到正文 · back to text
  25. 25 GridPathhttps://github.com/pixelsmasher13/gridpath ↩ 回到正文 · back to text
  26. 26 Taracodehttps://github.com/tara-vision/taracode ↩ 回到正文 · back to text
  27. 27 Miniagenthttps://miniagent.sh ↩ 回到正文 · back to text
  28. 28 Meta Uses A.I. Data Centers to Avoid Billions in Federal Taxeshttps://www.nytimes.com/2026/09/30/technology/meta-ai-data-centers-taxes.html ↩ 回到正文 · back to text
  29. 29 Micron CEO Says Memory Supply Will Be Much Tighter in 2027 and 2028 Than in 2026https://www.techpowerup.com/353296/micron-ceo-says-memory-supply-will-be-much-tighter-in-2027-and-2028-than-in-2026 ↩ 回到正文 · back to text
  30. 30 Google breaks promise to provide 10 years of updates to Chromebookshttps://www.osnews.com/story/146052/google-breaks-promise-to-provide-10-years-of-updates-to-chromebooks/ ↩ 回到正文 · back to text
  31. 31 FTC is investigating OpenAI, Anthropic and other AI companies over product riskshttps://www.cnbc.com/2026/09/30/ftc-ai-probe-openai-anthropic.html ↩ 回到正文 · back to text
  32. 32 AI needs $6T in annual revenue to justify data centre boomhttps://www.thenationalnews.com/future/technology/2026/09/29/ai-industry-needs-to-earn-6-trillion-by-2031-to-justify-data-centres/ ↩ 回到正文 · back to text
  33. 33 GPT-Synopsys: Frontier Intelligence to Revolutionize Chip Designhttps://news.synopsys.com/2026-09-30-OpenAI-and-Synopsys-Announce-GPT-Synopsys-Frontier-Intelligence-to-Revolutionize-Chip-Design ↩ 回到正文 · back to text
  34. 34 Figma restricts MCP access to whitelisted clients, excluding Pihttps://twitter.com/GayaniFigma/status/2105295629941350454 ↩ 回到正文 · back to text
  35. 35 Cloudflare K2: serverless event streamshttps://blog.cloudflare.com/cloudflare-k2-streams/ ↩ 回到正文 · back to text
  36. 36 5x faster Edge Functions: V8 isolates to Firecracker MicroVMshttps://www.netlify.com/blog/edge-functions-firecracker-microvms/ ↩ 回到正文 · back to text
  37. 37 Cops Can Bypass iPhone's Automatic Reboot to Get into Locked Phoneshttps://www.404media.co/cops-can-bypass-iphone-automatic-inactivity-reboot-graykey/ ↩ 回到正文 · back to text
  38. 38 ifixai-ai/iFixAihttps://github.com/ifixai-ai/iFixAi ↩ 回到正文 · back to text
  39. 39 Mafifrizi/AREShttps://github.com/Mafifrizi/ARES ↩ 回到正文 · back to text
  40. 40 qbittorrent/search-pluginshttps://github.com/qbittorrent/search-plugins ↩ 回到正文 · back to text
  41. 41 firebase/firebase-ios-sdkhttps://github.com/firebase/firebase-ios-sdk ↩ 回到正文 · back to text
  42. 42 anthropics/claude-code-actionhttps://github.com/anthropics/claude-code-action ↩ 回到正文 · back to text
  43. 43 modelcontextprotocol/servershttps://github.com/modelcontextprotocol/servers ↩ 回到正文 · back to text
  44. 44 colbymchenry/codegraphhttps://github.com/colbymchenry/codegraph ↩ 回到正文 · back to text
  45. 45 JayWebtech/autoshortshttps://github.com/JayWebtech/autoshorts ↩ 回到正文 · back to text
  46. 46 How to speed up the Rust compiler in September 2026https://nnethercote.github.io/2026/09/30/how-to-speed-up-the-rust-compiler-in-september-2026.html ↩ 回到正文 · back to text
  47. 47 Git 3's upcoming SHA-256 default will be a costly mistakehttps://blog.gitbutler.com/git-3-sha-256 ↩ 回到正文 · back to text
  48. 48 What TLA+ can and can't checkhttps://buttondown.com/hillelwayne/archive/what-tla-can-and-cant-check/ ↩ 回到正文 · back to text
  49. 49 Is sandboxing sufficient to contain rogue agents?https://blog.cryptographyengineering.com/2026/09/30/is-sandboxing-sufficient-to-contain-rogue-agents/ ↩ 回到正文 · back to text
  50. 50 Reducing the cognitive load of AI changeshttps://amoffat.github.io/blog/cognitive-load.html ↩ 回到正文 · back to text
  51. 51 The Second Golden Spike: Memory Safety Across the Valen/Rust Boundaryhttps://verdagon.dev/blog/boundary-memory-safety ↩ 回到正文 · back to text
  52. 52 Quoting Matthew Greenhttps://simonwillison.net/2026/Oct/1/matthew-green/ ↩ 回到正文 · back to text
  53. 53 The death of web development educationhttps://molily.de/web-dev-education/ ↩ 回到正文 · back to text
  54. 54 We used a database as a message queue. Now we use Kafkahttps://www.tigrisdata.com/blog/quick-fdb-kafka/ ↩ 回到正文 · back to text
  55. 55 Typeclasses vs Moduleshttps://sm2n.ca/articles/typeclasses-vs-modules/ ↩ 回到正文 · back to text