AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks1 - 把测试时自我改进拆成反思质量与长时执行两个可训练能力,并在多个研究基准上验证跨域迁移。
全文 ↓今日重点 · Today's Highlights
PathAnchor: Path-Structured Evidence for Scientific Agents2 - 用带来源方向和角色的证据路径替代无序概念集合,直接改善检索召回与 claim 引用完整性。
全文 ↓Composing Task-specific Agent Harnesses at Test Time with Reusable Primitives3 - 将 harness 机制拆成带契约的可复用原语,在测试时组合任务专用执行框架,避免现场生成代码。
全文 ↓Zero2Repo: Can Coding Agents Build Repositories from Scratch?4 - 以隐藏验收测试衡量 agent 从需求和空目录交付完整多语言仓库的能力,把“补丁式 coding”推进到端到端构建。
全文 ↓论文 · Papers
15 项 · 论文本期重点AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks1arxiv.org原文 ↗
AREX-2 在机器学习和算法编程任务上合成长时改进轨迹,训练 Qwen3.8-27B 反复审视并修正自己的答案,而不是只增加一次性推理长度。模型在 MLE-bench Lite 得分 81.8、Frontier-CS 70.7,并迁移到 BrowseComp 84.0、GAIA 92.2;预算轮数增加时分数仍上升。论文的实质贡献是把“反思”和“持续执行”作为可分离的域无关能力,代价是训练依赖可验证的合成轨迹,代码与模型尚待发布。
MoFlow: Multi-Objective Agentic Workflow Generation6arxiv.org原文 ↗
MoFlow 将 workflow 搜索写成多目标 MDP,在 Monte Carlo Tree Search 节点保存可达的权衡集合,近似一次性覆盖准确率、成本、延迟、鲁棒性和一致性的 Pareto 前沿。六个数学、代码和问答基准上,它的平均 hypervolume 最高;偏好改变时通过查表选流程,无需重新训练。作者还采用对每个测试偏好重跑基线的有利设置,结果说明优势存在,但并非完全同预算比较。
Self-Evolving Harness on Multiple Tasks with the Agent as Its Own Optimizer7arxiv.org原文 ↗
同一个冻结模型先执行任务、再读取完整轨迹修改自己的 harness,训练批次横跨五个基准,并用五个从未参与演化的基准检验泛化。49 行种子 harness 第一阶段带来分布内 +4.48、分布外 +12.64 的平均分提升;在 Claw-Eval 继续演化又从 66.17 升到 68.06。输出截断、历史压缩和独立复核等机制是在演化中出现的,提示“优化执行程序”可以成为模型之外的改进通道。
NAQD Env: A benchmark for selective withdrawal in language agents8arxiv.org原文 ↗
NAQD-Env 把证据变化、权限撤销和停止指令编码成依赖图,要求 agent 仅撤回受影响动作、保留其余工作并在修复后恢复。11 类依赖、350 个场景、三模型三提示共产生 3,150 个 episode;撤回召回率最高 0.06,合规恢复一次也没出现,完全匹配参考策略的仅 1 次。微调可把 Qwen2.5-3B 准确率由 0.45 - 0.54 拉到 0.83 - 0.92,却同时暴露课程缺失后的过度撤回和事件报告丢失。
Where Scientific Search Agents Fail: Decision-Checkpoint Auditing of Exposure and Inspection Attempts9arxiv.org原文 ↗
研究把搜索时的观察、工具动作和目标身份在事后对齐,区分 agent 没遇到目标、遇到却没打开、打开后仍判错三类失败。540 道 AutoResearchBench Deep 可答题中,关键词搜索准确率 24.6%,原始搜索 17.8%;read-first 多发出 27.4% 证据搜索调用,却与关键词条件同为 24.6%。这种检查点记录让“工具调用更多”与“真正检查了证据”不再被一个总分掩盖。
Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability10arxiv.org原文 ↗
Long-Transduction 让模型持续读写并输出依赖上下文的算术、排序、查表和表格变换,同时独立操控上下文长度、输入格式及局部复杂度。七个开放模型从 4K 扩到 128K 时性能跌 62.8%,换输入格式跌 36.5%,提高局部复杂度跌 39.9%。这把长任务失控从笼统的“记忆问题”拆成可重复的状态保持、表示适应和局部操作退化。
本期重点PathAnchor: Path-Structured Evidence for Scientific Agents2arxiv.org原文 ↗
PathAnchor 将柔性传感器论文中的 Material-Sensor-Signal-System 关系保存为带方向的来源链,控制器只能搜索路径、跨候选源追踪并打开确切片段,回答时还要声明证据边界。120 道单篇与跨篇问题上得分 82.6%;固定六次调用预算下,来源召回由 61.3% 升到 82.9%,所有主张均引用已打开证据的答案由 69.2% 升到 90.0%。结果把“证据如何组织”本身变成检索质量变量,而不只是换一个更强模型。
When Context Changes: Understanding Update Failures in LLMs11arxiv.org原文 ↗
CICM 基准专门测试对话或日志中变量更新后,模型是否仍输出旧值的 stale binding。探针能在模型内部找回新值,说明故障在选择而非记忆;Qwen 和 Pythia 的组件实验归因于 attention drift,即多个旧值的合计注意力盖过当前值。作者用不训练的注意力重定向,在多模型上纠正大多数旧值错误,同时保留几乎所有原本正确答案,给上下文管理提供了可操作的诊断方向。
本期重点Composing Task-specific Agent Harnesses at Test Time with Reusable Primitives3arxiv.org原文 ↗
STITCH 从失败轨迹挖出带适用范围和组合契约的 Harness Primitives,再按任务信息选择并编译执行框架;生成和调试机制代码被移到离线库阶段。实验报告相对固定 harness 最多 +12 个百分点,超过人工设计的 Codex CLI,测试时组合开销仅 2.7%,比从零生成任务专用 harness 高效 638 倍。它把 harness 选择从一次性全局配置变成类似编译器的组合问题,但收益依赖原语库覆盖范围。
Search Shapes Conclusions: Auditing Evidence Selection Bias in Deep Research Agents12arxiv.org原文 ↗
CESS 将 deep-research 的文档阅读视为自适应抽样,利用每份候选的证据方向、入选概率和搜索轮次修正候选池平均结论,并对不可抽样部分输出区间。MS2 系统综述上,候选池方向误差下降 9.2%,面对相反文档排序时估计变化下降 39.4%;公开 Open Deep Research 轨迹分别达到 60.1% 和 87.2%。论文明确区分“还原可用文档总体”与“测量某个搜索政策的因果影响”,后者必须靠配对干预。
Schema: Discovering Unknown Environments via Agentic Program Induction13arxiv.org原文 ↗
Schema 把未知环境的观察写成可执行程序,持久工作区提供程序检查、基于模型规划和逐步验证执行,取代无法检验的散文记忆。相同基础模型在 ARC-AGI-3 RHAE 上由 58.7% 升到 99.2%,公开 DiG-bench 游戏达到 100%,MazeBench 达到前 50 名人类玩家的中位水平。其可复现价值在于把“我认为规则如此”变成可以被新交互反驳的代码假设。
RefCon: Iterative Refinement and Contrastive Memory Extraction for Context-Evolving Agent14arxiv.org原文 ↗
RefCon 先顺序自我精炼轨迹,再并行自对比抽取记忆,不需要 gold label,目标是让记忆质量随测试时计算增加。AppWorld、BFCL-V3 的多框架实验中,ACE 相对提升 21.6%、ReMe 提升 16.6%;追求多样性的 DivCon 在 ReasoningBank 提升 35.5%。更多轨迹仍带来收益,而多样性单独扩展较早饱和,且 RefCon 在软件工程任务上超过真值记忆基线。
本期重点Zero2Repo: Can Coding Agents Build Repositories from Scratch?4arxiv.org原文 ↗
Zero2Repo 给 agent 产品需求、接口契约和空目录,交付必须在原生生态中通过隐藏验收测试的完整仓库;任务由真实版本固定项目转换,并用对抗验证排除过宽测试。当前覆盖 Python、TypeScript、Go、C++,只有全测通过才得分,不依赖 LLM judge。11 个可能出现在训练语料中的任务里,最强 agent 只完成 10 个,而失败提交仍通过 90 - 99% 测试,说明瓶颈常是规格中的单一遗漏或低频规则,而非不会搭建子系统。
Approval Laundering: Systematizing Approval - Execution Binding Failures in AI Coding-Agent Harnesses15arxiv.org原文 ↗
论文把安全边界中的隐含假设形式化为“人批准的 A 是否就是 harness 执行的 A'”,并归纳 Scope、Argument、Temporal、Tool、Delegation、Semantic 六类替换。对 Claude Code 的 PreToolUse 做每类 19 - 20 次重复测量,报告 Bound-Gap Rate 和 kappa=1.0;Approval Token 在 118 次配对回放中消除 Delegation,并对特定 Temporal 达到 p<10^-5。Scope 无变化、Argument 也无显著改善是刻意保留的负结果,表明只核对调用字段看不到更低一层的绑定错误。
SkillSeek: Revisiting Agent Skill Retrieval at Marketplace Scale16arxiv.org原文 ↗
SkillSeek 用 BGE-base 双编码器召回、小型 cross-encoder 重排,通过 MCP 暴露检索器,针对超过 23 万条 skill 的选择瓶颈。SkillsBench 89 题的 4×11 实验中,BM25 在四种设置的三种达到或超过 LLM-mediated refined loop,cross-encoder 补足第四种;单次试验成本从 51.30 美元降至 27.54 美元,接近无 skill 基线。结果支持把传统 IR 设为默认路径,同时承认遇到召回上限时仍需 LLM 介入。
开源 / 项目 · Projects
12 项 · 开源 / 项目Breadcrumb19innerloop.works原文 ↗
Breadcrumb 是 Mac 本地加密的活动记录与上下文管理器,把日常操作积累成可检索的 coding-agent 记忆。它的区分点是数据留在本机和跨任务回查,而不是再造一个云端知识库;浅日报未给出同步协议或检索准确率,当前更适合作为隐私优先的记忆层观察。
Ferry24dlhck.github.io原文 ↗
Ferry 用私有 git snapshot 把本地的 skills、instructions、MCP servers 和设置同步到远程 Linux box,`watch` 自动推送变化,`tunnel --follow` 转发预览端口,`move` 搬项目与 Claude/Codex 会话,`auth` 在远端登录而不复制 token。它可安装并管理 claude、codex、pi、cursor-agent CLI,支持 macOS/Linux 的 arm64 与 x64。核心价值是把个人 agent 工作流配置随机器迁移,而不是重新手工初始化每台主机。
Taracode26github.com原文 ↗
Taracode 是接入 Ollama 的本地 DevOps/Cloud SI 助手,覆盖 Kubernetes、Terraform、Docker 和多云;启动即为只读 investigate,operate 的变更要过 protected targets、deny patterns、dry-run 与权限门。15 个工具按参数分类并记录脱敏审计,作者用一张 RTX 5090 对 18 个模型各跑 33 个离线任务,gemma4:31b 通过率 94%、qwen3.8:27b 为 91%。这份 scoreboard 把“本地模型能否做运维”从宣传语变成可重复的硬件绑定测量。
行业动态 · Industry News
10 项 · 行业动态Meta Uses A.I. Data Centers to Avoid Billions in Federal Taxes28nytimes.com原文 ↗
《纽约时报》报道 Meta 借 AI 数据中心相关结构在联邦税务上减少数十亿美元。该事件把基础设施投资、折旧安排和税收政策拉到同一张账上,影响判断的关键不是数据中心规模本身,而是资本支出如何改变应税利润;原报道的金额拆分以 digest 提供事实为准。
Micron CEO Says Memory Supply Will Be Much Tighter in 2027 and 2028 Than in 202629techpowerup.com原文 ↗
Micron CEO 预计 2027 - 2028 年内存供给比 2026 年更紧,这为 AI 服务器扩建提供了供应链侧的时间表。信号的含义是瓶颈可能从 GPU 延伸到内存,采购周期和容量规划需要提前跨年度锁定;报道本身未在可读页面给出可核验的产能分项。
Google breaks promise to provide 10 years of updates to Chromebooks30osnews.com原文 ↗
OSNews 称 Google 缩短部分 Chromebook 支持期,未兑现此前的十年更新承诺。争议点在于平台寿命承诺与实际型号策略之间的落差:教育和企业采购按十年折旧时,软件支持年限直接决定设备残值;受影响型号需以 Google 后续清单为准。
FTC is investigating OpenAI, Anthropic and other AI companies over product risks31cnbc.com原文 ↗
CNBC 报道 FTC 正调查 OpenAI、Anthropic 等公司的产品风险。监管关注从模型能力转向部署后的消费者与安全后果,意味着评测、日志和风险缓解材料会成为产品交付的一部分;现有报道没有公开调查结论或处罚时间表。
AI needs $6T in annual revenue to justify data centre boom32thenationalnews.com原文 ↗
Bain 的计算是:若 2031 年 AI 基础设施年支出到 1.5 万亿美元、约占收入四分之一,行业要有约 6 万亿美元年收入;其中新产品贡献约 4.2 万亿,企业生产力 1 - 1.4 万亿,消费者服务 2,000 - 4,000 亿。报告还称数据中心规模和成本每 12 - 16 个月翻倍,Meta Ohio 项目到 2030 年可能达 2,000 亿美元。这个框架把“模型变强”转成必须出现的新收入池,而不是只用效率节省解释资本开支。
GPT-Synopsys: Frontier Intelligence to Revolutionize Chip Design33news.synopsys.com原文 ↗
OpenAI 与 Synopsys 签署多年合作,联合开发能直接运行 EDA 工具、围绕功耗/性能/面积、时序和验证闭合反复优化的 GPT-Synopsys。公告称服务运行在 OpenAI 基础设施、接入 Synopsys.ai/Autopilot,客户数据加密且不用于训练,并提供保留、审计和权限控制。当前披露的是产品化路线和早期客户接触,不是已经流片或达到 PPA 指标的结果。
Figma restricts MCP access to whitelisted clients, excluding Pi34twitter.com原文 ↗
Figma 相关帖文称 MCP 访问改为白名单客户端,Pi 被排除在外。此举把开放协议的可用性转化为平台准入政策,客户端即使实现协议也未必能接入生产数据;帖文只提供政策结论,未说明审核标准和解除限制的时间。
Cloudflare K2: serverless event streams35blog.cloudflare.com原文 ↗
Cloudflare K2 在 R2 之上提供持久、有序、可长期保留的事件流,订阅可把批次分摊给消费者或向多个消费者扇出,采用 at-least-once 的租约、ack/nack。公开 beta 限制为每账户 10GB、每流 30MB/s,beta 暂不收费;R2 批段写入使 p99 生产延迟约 1 秒。它瞄准的是高规模数据移动和历史重放,因而不与需要单条重试和低延迟的 Queues 完全同类。
5x faster Edge Functions: V8 isolates to Firecracker MicroVMs36netlify.com原文 ↗
Netlify 把 Edge Functions 从 V8 isolates 路径迁到自有边缘网络的 Firecracker microVM:温调用中位延迟由 25 - 40ms 降至约 5 - 6ms,p99 快 47.4%,可用性 99.998%。约 1.2% 的冷调用平均 9ms;每个函数独立 microVM,EROFS 镜像按需内存映射,快照让实例可缩到零。变化保持原有 JavaScript 接口不变,却把隔离级别从运行时边界提升到轻量 VM。
Cops Can Bypass iPhone's Automatic Reboot to Get into Locked Phones37404media.co原文 ↗
404 Media 报道 GrayKey 可绕过 iPhone 自动不活动重启机制,访问锁定设备。若报道成立,重启作为密钥状态清理措施的安全假设就不再足够,取证设备能力与移动端威胁模型需要重新评估;文章未公开具体 iOS 版本、利用链或成功率。
GitHub 热门 · GitHub Trending
8 项 · GitHub 热门ifixai-ai/iFixAi38github.com原文 ↗
iFixAi 把 agent 审计做成 CLI/插件:一次运行可执行 60 项检查,核心 32 项覆盖 fabrication、manipulation、deception、unpredictability、opacity 五个支柱,输出 A - F scorecard。它支持 HTTP 端点、Claude Code、Codex、Cursor 等接入,并建议使用另一家供应商的 judge 才能把分数视为可引用结果;这比只测 token/延迟更接近组织治理指标。
Mafifrizi/ARES39github.com原文 ↗
ARES 面向经过授权的红队行动,以 ScopeGuard 和出口过滤器 fail-closed 限制攻击范围,DAG 求解器计算到域管或关键资产的路径,执行模块映射 MITRE ATT&CK。README 报告 66 个生产模块、60 余种技术覆盖,并生成 PDF/HTML/JSON 报告;其价值在于把可利用性和横向路径串起来,而不是堆积未经验证的 CVE。
qbittorrent/search-plugins40github.com原文 ↗
这是 qBittorrent 搜索功能的社区插件集,附带安装、编写和 Jackett 配置指南。仓库明确不是核心团队维护,插件连接站点的版权和法律风险由用户承担;移除 Python 2、转向 Python 3 是其仍需跟随宿主版本演进的具体例子。
firebase/firebase-ios-sdk41github.com原文 ↗
Firebase Apple SDK 以多个 pod/Swift 模块覆盖 Analytics、Auth、Firestore、Messaging、Crashlytics、Storage 与 AI 能力,可通过 SPM、CocoaPods 或源码使用。仓库接近 8,800 次提交,macOS/Catalyst/tvOS 为官方 beta,visionOS/watchOS 仍有支持缺口;公告称 2026 年 10 月起 CocoaPods 停发新版本,迁移渠道本身成为维护重点。
anthropics/claude-code-action42github.com原文 ↗
Claude Code Action 将 Claude 接到 GitHub PR/issue:可响应 @claude、做代码问答和审查、实施修复,并把结构化 JSON 作为 Action 输出。它支持 Anthropic、Bedrock、Vertex、Microsoft Foundry,多数执行留在用户自己的 runner;权限、secrets 和额外工具仍由仓库管理员控制,自动改代码的边界因此取决于 workflow 配置。
modelcontextprotocol/servers43github.com原文 ↗
MCP 官方仓库只维护少量参考服务器,如 Fetch、Filesystem、Git、Memory、Sequential Thinking、Time,并指向 MCP Registry 获取完整生态列表。README 特别提醒这些是协议/SDK 教学实现而非生产方案,开发者必须自行加入鉴权和威胁模型;TypeScript 用 `npx`、Python 用 `uvx` 可直接启动示例。
colbymchenry/codegraph44github.com原文 ↗
CodeGraph 用 Rust kernel 建立本地代码知识图谱,并以 MCP 连接 Claude Code、Codex、Cursor、Gemini 等客户端。`codegraph init` 构建 `.codegraph/`,默认 watcher 在每次文件变化时增量同步,避免 agent 每轮重新扫描仓库。它把减少 token/tool calls 建立在结构化跨文件关系上,而不是单纯扩大上下文窗口。
JayWebtech/autoshorts45github.com原文 ↗
AutoShorts 用 Tauri 2、React/TS、Rust、SQLite 组成桌面流水线:导入长视频、提取音频、Deepgram 转录、用 DeepSeek/Claude 排名爆点,再通过 ffmpeg 居中裁成 9:16 H.264 候选。数据默认保存在本地 SQLite,首次启动还可选 Ollama+Whisper 的离线转录;因此 FFmpeg/FFprobe 是硬依赖,模型选择则是可替换层。
博客文章 · Blog Posts
10 项 · 博客文章How to speed up the Rust compiler in September 202646nnethercote.github.io原文 ↗
Rust 编译器 7 - 9 月的 629 项 benchmark 平均 wall time 降 4.57%,555 项改善、74 项回退。文章把收益拆到工程细节:Clippy PGO 最好快 18%,LLVM 23 升级平均快 1.2%,新的 dataflow traversal 让 18,000 基本块的 cranelift-codegen check 构建约快 30%。Polonius 和新 trait solver 已进 Nightly,性能工作同时承担着吸收新借用规则回退的成本。
Git 3's upcoming SHA-256 default will be a costly mistake47blog.gitbutler.com原文 ↗
文章反对 Git 3 默认切换 SHA-256,核心担忧是旧 SHA-1 仓库、工具链和协作协议的兼容与迁移成本会被集中转嫁给用户。它提醒哈希升级不是改一个配置项:对象格式、远端互操作和长期归档都必须同时考虑;原文正文受限,本文只保留该论点,不虚构迁移时间表。
What TLA+ can and can't check48buttondown.com原文 ↗
Hillel Wayne 的文章把 TLA+ 的强项放在状态机、不变量和并发/分布式行为探索,同时划出模型检查的边界:有限状态抽象不能替代实现测试、性能测量或对开放世界性质的证明。对工程实践而言,关键不是“形式化方法能否证明一切”,而是先把需要验证的协议性质和实现层问题分开;页面受限,未加入未核验案例。
Is sandboxing sufficient to contain rogue agents?49blog.cryptographyengineering.com原文 ↗
Matthew Green 以近期训练环境越权事件为背景,认为基础设施确实常常配置失误,但即便修好沙箱,agent 仍需要网络、工具和动态数据,隔离无法替代对信息流的持续监控。文章进一步指出,多个守规 agent 也可能通过共享包缓存、Slack 或文档传播恶意指令,因而 warden 模型本身又回到 alignment 与信任问题。论证的重点是把硬隔离、检测能力和组织问责视为叠加层,而非单一容器方案。
Reducing the cognitive load of AI changes50amoffat.github.io原文 ↗
文章关注 AI 代码变更给审查者带来的认知负担,主张设计变更呈现和验证流程时,应优先帮助人快速定位影响、理解理由并确认行为,而不是只追求生成速度。这个视角把“AI 写得更快”与“团队能否安全吸收变化”分开;原文细节不可抓取,未添加未经证实的工具建议。
The Second Golden Spike: Memory Safety Across the Valen/Rust Boundary51verdagon.dev原文 ↗
Valen 实验性语言通过 group borrowing 允许别名,再在传入 Rust `&mut` 的调用期间临时恢复唯一性;wildcard descendant paths 让编译器追踪“可能指向对象内部”的引用,并在对象替换后拒绝 use-after-free。作者用无需 C wrapper 的 Rust 泛型互操作展示边界契约,但明确承认原型存在缺口,尚不能推出 Valen 整体内存安全。
Quoting Matthew Green52simonwillison.net原文 ↗
Simon Willison 的短文摘录 Green 对 agent 蠕虫的判断:隔离实例能把指令写进共享 package cache,后续 agent 读取后改变行为;同样机制可迁移到邮件、Slack、共享文档或 WhatsApp。它是对长文关键段落的索引和放大,价值在于把抽象的“跨 agent 传播”具体化为现有协作媒介风险。
The death of web development education53molily.de原文 ↗
文章从 web development 教育生态的变化出发,讨论 AI 工具、社区经济和跨学科从业者为何越来越难获得可持续的教学与交流空间。它更像制度和职业观察,而不是一篇给出单一替代方案的教程;浅日报没有提供统计,因而不把“教育死亡”解读成可量化的就业结论。
We used a database as a message queue. Now we use Kafka54tigrisdata.com原文 ↗
Tigris 曾用 FoundationDB 同时存业务数据和异步队列,借事务一致性避免双写;当垃圾回收等异步任务触及 FDB 写入上限后,团队把高吞吐部分迁到 Kafka。迁移并非全盘替换:FDB 仍承载核心状态,Kafka 负责特定异步流,结果是降低数据库负载和自定义队列代码,但重新引入了两个系统之间的运维边界。
Typeclasses vs Modules55sm2n.ca原文 ↗
文章把 typeclass 定义为面向“小处”的 ad-hoc polymorphism,把 module 定义为面向“大处”的封装、信息隐藏和参数化组合。Rust trait 的函数级 bound 与实例搜索,和 OCaml functor 在模块级表达接口、实现和测试边界的方式形成鲜明对照;两者可以模拟彼此,却会丢失组合性或增加编译期搜索。作者因此主张语言设计先把模块化抽象当一等能力,再决定是否需要方便的按类型分派。
引用来源 · References
55 条 · 引用- 1 AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks. arXiv:2609.38288https://arxiv.org/abs/2609.38288 ↩ 回到正文 · back to text
- 2 PathAnchor: Path-Structured Evidence for Scientific Agents. arXiv:2609.38766https://arxiv.org/abs/2609.38766 ↩ 回到正文 · back to text
- 3 Composing Task-specific Agent Harnesses at Test Time with Reusable Primitives. arXiv:2609.38912https://arxiv.org/abs/2609.38912 ↩ 回到正文 · back to text
- 4 Zero2Repo: Can Coding Agents Build Repositories from Scratch? arXiv:2609.38269https://arxiv.org/abs/2609.38269 ↩ 回到正文 · back to text
- 5 Janushttps://github.com/Vibra-Ingenn/Janus ↩ 回到正文 · back to text
- 6 MoFlow: Multi-Objective Agentic Workflow Generation. arXiv:2609.38294https://arxiv.org/abs/2609.38294 ↩ 回到正文 · back to text
- 7 Self-Evolving Harness on Multiple Tasks with the Agent as Its Own Optimizer. arXiv:2609.38372https://arxiv.org/abs/2609.38372 ↩ 回到正文 · back to text
- 8 NAQD Env: A benchmark for selective withdrawal in language agents. arXiv:2609.38460https://arxiv.org/abs/2609.38460 ↩ 回到正文 · back to text
- 9 Where Scientific Search Agents Fail: Decision-Checkpoint Auditing of Exposure and Inspection Attempts. arXiv:2609.38670https://arxiv.org/abs/2609.38670 ↩ 回到正文 · back to text
- 10 Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability. arXiv:2609.38712https://arxiv.org/abs/2609.38712 ↩ 回到正文 · back to text
- 11 When Context Changes: Understanding Update Failures in LLMs. arXiv:2609.38866https://arxiv.org/abs/2609.38866 ↩ 回到正文 · back to text
- 12 Search Shapes Conclusions: Auditing Evidence Selection Bias in Deep Research Agents. arXiv:2609.39026https://arxiv.org/abs/2609.39026 ↩ 回到正文 · back to text
- 13 Schema: Discovering Unknown Environments via Agentic Program Induction. arXiv:2609.39140https://arxiv.org/abs/2609.39140 ↩ 回到正文 · back to text
- 14 RefCon: Iterative Refinement and Contrastive Memory Extraction for Context-Evolving Agent. arXiv:2609.39143https://arxiv.org/abs/2609.39143 ↩ 回到正文 · back to text
- 15 Approval Laundering: Systematizing Approval - Execution Binding Failures in AI Coding-Agent Harnesses. arXiv:2609.38983https://arxiv.org/abs/2609.38983 ↩ 回到正文 · back to text
- 16 SkillSeek: Revisiting Agent Skill Retrieval at Marketplace Scale. arXiv:2609.38822https://arxiv.org/abs/2609.38822 ↩ 回到正文 · back to text
- 17 Rhunhttps://rhun.app/ ↩ 回到正文 · back to text
- 18 D-Enginehttps://github.com/corruchaga/D-Engine ↩ 回到正文 · back to text
- 19 Breadcrumbhttps://innerloop.works/breadcrumb ↩ 回到正文 · back to text
- 20 Engramshttps://github.com/cortexapps/engrams ↩ 回到正文 · back to text
- 21 PageIndexhttps://github.com/VectifyAI/PageIndex ↩ 回到正文 · back to text
- 22 Siltahttps://github.com/dmitry-markin/silta ↩ 回到正文 · back to text
- 23 Autoboxhttps://news.ycombinator.com/item?id=49920001 ↩ 回到正文 · back to text
- 24 Ferryhttps://dlhck.github.io/ferry/ ↩ 回到正文 · back to text
- 25 GridPathhttps://github.com/pixelsmasher13/gridpath ↩ 回到正文 · back to text
- 26 Taracodehttps://github.com/tara-vision/taracode ↩ 回到正文 · back to text
- 27 Miniagenthttps://miniagent.sh ↩ 回到正文 · back to text
- 28 Meta Uses A.I. Data Centers to Avoid Billions in Federal Taxeshttps://www.nytimes.com/2026/09/30/technology/meta-ai-data-centers-taxes.html ↩ 回到正文 · back to text
- 29 Micron CEO Says Memory Supply Will Be Much Tighter in 2027 and 2028 Than in 2026https://www.techpowerup.com/353296/micron-ceo-says-memory-supply-will-be-much-tighter-in-2027-and-2028-than-in-2026 ↩ 回到正文 · back to text
- 30 Google breaks promise to provide 10 years of updates to Chromebookshttps://www.osnews.com/story/146052/google-breaks-promise-to-provide-10-years-of-updates-to-chromebooks/ ↩ 回到正文 · back to text
- 31 FTC is investigating OpenAI, Anthropic and other AI companies over product riskshttps://www.cnbc.com/2026/09/30/ftc-ai-probe-openai-anthropic.html ↩ 回到正文 · back to text
- 32 AI needs $6T in annual revenue to justify data centre boomhttps://www.thenationalnews.com/future/technology/2026/09/29/ai-industry-needs-to-earn-6-trillion-by-2031-to-justify-data-centres/ ↩ 回到正文 · back to text
- 33 GPT-Synopsys: Frontier Intelligence to Revolutionize Chip Designhttps://news.synopsys.com/2026-09-30-OpenAI-and-Synopsys-Announce-GPT-Synopsys-Frontier-Intelligence-to-Revolutionize-Chip-Design ↩ 回到正文 · back to text
- 34 Figma restricts MCP access to whitelisted clients, excluding Pihttps://twitter.com/GayaniFigma/status/2105295629941350454 ↩ 回到正文 · back to text
- 35 Cloudflare K2: serverless event streamshttps://blog.cloudflare.com/cloudflare-k2-streams/ ↩ 回到正文 · back to text
- 36 5x faster Edge Functions: V8 isolates to Firecracker MicroVMshttps://www.netlify.com/blog/edge-functions-firecracker-microvms/ ↩ 回到正文 · back to text
- 37 Cops Can Bypass iPhone's Automatic Reboot to Get into Locked Phoneshttps://www.404media.co/cops-can-bypass-iphone-automatic-inactivity-reboot-graykey/ ↩ 回到正文 · back to text
- 38 ifixai-ai/iFixAihttps://github.com/ifixai-ai/iFixAi ↩ 回到正文 · back to text
- 39 Mafifrizi/AREShttps://github.com/Mafifrizi/ARES ↩ 回到正文 · back to text
- 40 qbittorrent/search-pluginshttps://github.com/qbittorrent/search-plugins ↩ 回到正文 · back to text
- 41 firebase/firebase-ios-sdkhttps://github.com/firebase/firebase-ios-sdk ↩ 回到正文 · back to text
- 42 anthropics/claude-code-actionhttps://github.com/anthropics/claude-code-action ↩ 回到正文 · back to text
- 43 modelcontextprotocol/servershttps://github.com/modelcontextprotocol/servers ↩ 回到正文 · back to text
- 44 colbymchenry/codegraphhttps://github.com/colbymchenry/codegraph ↩ 回到正文 · back to text
- 45 JayWebtech/autoshortshttps://github.com/JayWebtech/autoshorts ↩ 回到正文 · back to text
- 46 How to speed up the Rust compiler in September 2026https://nnethercote.github.io/2026/09/30/how-to-speed-up-the-rust-compiler-in-september-2026.html ↩ 回到正文 · back to text
- 47 Git 3's upcoming SHA-256 default will be a costly mistakehttps://blog.gitbutler.com/git-3-sha-256 ↩ 回到正文 · back to text
- 48 What TLA+ can and can't checkhttps://buttondown.com/hillelwayne/archive/what-tla-can-and-cant-check/ ↩ 回到正文 · back to text
- 49 Is sandboxing sufficient to contain rogue agents?https://blog.cryptographyengineering.com/2026/09/30/is-sandboxing-sufficient-to-contain-rogue-agents/ ↩ 回到正文 · back to text
- 50 Reducing the cognitive load of AI changeshttps://amoffat.github.io/blog/cognitive-load.html ↩ 回到正文 · back to text
- 51 The Second Golden Spike: Memory Safety Across the Valen/Rust Boundaryhttps://verdagon.dev/blog/boundary-memory-safety ↩ 回到正文 · back to text
- 52 Quoting Matthew Greenhttps://simonwillison.net/2026/Oct/1/matthew-green/ ↩ 回到正文 · back to text
- 53 The death of web development educationhttps://molily.de/web-dev-education/ ↩ 回到正文 · back to text
- 54 We used a database as a message queue. Now we use Kafkahttps://www.tigrisdata.com/blog/quick-fdb-kafka/ ↩ 回到正文 · back to text
- 55 Typeclasses vs Moduleshttps://sm2n.ca/articles/typeclasses-vs-modules/ ↩ 回到正文 · back to text