每日 Harness 开源 · Source
全部刊期 · All issues

每日 Harness

2026-09-02 · Wednesday, September 2, 2026

智能体工程化迈向可靠交付

视图 · View

今日重点 · Today's Highlights

slotstream4 - 通过 SSD 专家流式加载和弹性缓存,把 104GB 的 4-bit Qwen MoE 模型压进 48GB Mac 的可用内存预算。

全文 ↓

论文 · Papers

15 项 · 论文

本期重点DS-Lighting: Making Agent Harnesses Explicit for Data-Science Automation1arxiv.org原文 ↗

arxiv.org

论文把数据科学 agent 的 harness 明确拆为 data、workflow、execution、evaluation 四个可复用层,并将不同 agent 写成既能跑预定义管线又能自适应搜索的可执行 operator program。作者把多个开源数据科学基准改成共享任务接口、沙箱和指标协议,实验观察到显式设计提升复现、比较和可靠性,同时减少端到端的系统级故障。

–

本期重点CrossAudit: A Git-Native, Cross-Vendor Audit Loop for Agentic Science2arxiv.org原文 ↗

arxiv.org

CrossAudit 要求每个工作增量由不同厂商模型按人工版本化规则审计,脚本确定性检查先行,模型只能引用规则阻断而不能替规则豁免。参考实现是 GitHub Actions 加数百行 Python;30 个增量、43 个注入缺陷的试验显示两个厂商会对同一 rulebook 产生不同解释,论文还把自家仓库被交叉审计后取消盲审的过程写进结果,因而把“可复盘的监督记录”置于单一准确率之前。

–

Selective Forgetting: A Graph-Based Memory Framework for Long-Term LLM Agents6arxiv.org原文 ↗

arxiv.org

该工作把每个对话轮次抽成类型节点和属性边,从两跳子图检索答案,再按新近性、访问频率、度中心性和年龄剪枝。LongMemEval 的匹配预算下,图方案 token F1 只有 0.417,对比平面向量基线的 0.468;需要复述某个历史 assistant 回答时,正确率更从 0.911 掉到 0.607。相反,遗忘本身在 27,021 节点图上删掉 9.8% 节点和 9.5% 字节,F1 变化仅 +0.001,说明结构化记忆的“会忘”比“会找”更接近可用状态。

–

本期重点APIFlow-Bench: Measuring Whether Agents Survive Long, Dependent API Workflows3arxiv.org原文 ↗

arxiv.org

APIFlow-Bench 不再用一个 end-to-end bit 概括代理表现,而是把凭证失效、错误载荷、状态执行和最终交付拆成七项工程能力,并要求答案能追到真实调用路径。19 个模型在统一脚手架上从独立子任务的 93% 成功率,降到干净 20 子任务链的 74%,纳入没有任何模型通过的链试验后只剩 61%;而 best-of-five 只相差 7 个百分点时,all-five-of-five 可靠性却相差 44 个百分点,显示稳定交付比偶尔解出更能拉开差距。

–

EvoGenUI-Bench: Evaluating LLMs as Multi-Turn Generative UI Assistants7arxiv.org原文 ↗

arxiv.org

EvoGenUI-Bench 将 UI 生成定义成 150 个五轮维护任务,覆盖信息呈现、可执行交互和工具驱动外部状态,并在浏览器里联合检查截图、DOM、行为轨迹和运行日志。八个模型里最强者单轮通过率达到 74.9%,完整五轮 episode 却只有 37.3%,工具落地场景的相邻轮保留率进一步降到 52.4%。诊断把失分落在信息架构、派生状态传播、affordance 绑定和外部状态分解,说明“首屏像样”与“连续修改仍一致”是两种能力。

–

Towards a Systems Foundation for Agentic Skills: Architecture, Lifecycle, and Security8arxiv.org原文 ↗

arxiv.org

论文把 skill 视作连接高层规划与确定性执行的外置程序性知识,给出覆盖发现、编写、存储、检索路由、编排、执行修复、持续适应、评估和安全治理的九阶段生命周期。作者还把技能注册表、市场机制、运行时验证和对抗威胁放进同一参考架构,并按软件工程、OS 导航、机器人和科学发现整理实现。它更像系统边界的地图而非新算法,价值在于指出持续学习与真实基准仍缺少可操作的共同接口。

–

TRACER: Per-Tool Context Retention for LLM Agents via Consequence-Attributed Reinforcement Learning9arxiv.org原文 ↗

arxiv.org

TRACER 用轻量 REINFORCE 策略逐个工具决定上下文保留比例,奖励函数同时惩罚 token、任务失败和压缩后重调用,并用 outcome model 与“完整保留”的反事实比较来分配 credit。三种压缩后端的留出生产查询中,token 消耗较全量保留低 29 - 46%,成功率相当或更高;相比静态的工具类型策略又省 15 - 18%。这把压缩从一次性的长度预算变成会考虑后续调用成本的序贯控制问题。

–

Measure Before You Manage: Evaluating Agent Working Memory in Coding Agents10arxiv.org原文 ↗

arxiv.org

研究将 coding agent 的工作记忆按指令、工件、工具输出和内部状态分类,回放 55 条历史轨迹后发现不同语义对象的保留曲线和压缩代价并不相同。object-aware 压缩和 retrieval 策略在校准集上的收益无法稳定迁移到留出任务,相同 token 上限也不保证同样的 delivered context。作者因此把评测分成 stored state、delivered context、management work 和最终任务结果四层,并在真实服务回放中验证名义预算会掩盖运行时瓶颈。

–

Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data11arxiv.org原文 ↗

arxiv.org

agentic data cracking 让 agent 在打开网页、报告或 PDF 回答当前问题时,分叉一个 cracking 子 agent,从已加载上下文提取有依据且可能服务未来问题的结构;查询决定何时结构化,抽取还会有意超前。FanOutQA 上,理想结构化存储的推理成本可比反复开文档低 28 倍,而“一次性把所有文档结构化”又不可行;加入每题一个相关后续问题后,cracking 在不牺牲准确率的情况下再降 53% 成本,收益来自跨查询摊销。

–

Facts Without Rules: Boundary Metadata Collapse in Multi-Agent LLM Handoffs12arxiv.org原文 ↗

arxiv.org

这项研究把 handoff 摘要视为隐私边界的结构性薄弱点:操作事实容易留下,规定事实如何使用的 boundary marker 却在压缩时消失。受控测试中,自由文本的边界存活率 σb 约 0.80,25 词预算降到约 0.57,事实保留仍近乎满分;模糊语言使 GPT 73%、DeepSeek 50% 的下游案例发生泄漏,而显式约束把三种模型的泄漏压到 15% 以下。结论不是“少摘要”,而是把权限语义当成摘要字段而非隐含上下文。

–

Localizing Emergent Failures in Agentic AI: Recovering Minimal Repair Families via Counterfactual Replay13arxiv.org原文 ↗

arxiv.org

MRFR 要找的是所有能修复一次失败的包含关系最小事件集合,因此能捕捉必须联动修改的事件,而非只找一个“最可疑”点。GCJR 先在执行依赖图切出相关事件,再构造单点和成对候选,以干净副本重放验证;在 120-DAG 基准的 90 个适用案例上,family exact match 为 1.000,平均重放由 56.3 次减至 25.3 次(55.1%),四 agent 的 24 个 LLM pilot 也从 21.0 降到 10.0 次模型调用。

–

Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents14arxiv.org原文 ↗

arxiv.org

作者把专业任务拆成公开指令和含私有约定、参考表、utility operator 的小型 artifact,并以 provenance、字节一致指令、泄漏审计和 executable witness 证明任务确实被知识门控。15 个校准任务里,一种 frontier 配置拿到 artifact 的通过率为 68.0%,拿不到时为 0%;给出貌似合理但错误的 artifact,在一个任务的五次试验也全错。这个协议能区分“没见过规则”和“不会执行”,但论文明确没有把校准结果外推成后训练收益。

–

Will the User Ever Know? Covert Indirect Prompt Injection on Tool-Using LLM Agents15arxiv.org原文 ↗

arxiv.org

论文把成功的间接提示注入分为用户能从最终回答察觉的 overt 和无痕的 covert,提出 CSR/OSR 取代只报 ASR 的粗粒度指标。轨迹显示,隐蔽路径会先执行恶意动作,再把控制交回用户任务;这利用了 ReAct 最终回答倾向总结最近一步的格式。基于此设计的 ICoA 在 AgentDojo 四个模型上让 CSR 比最强基线提高 3.79 - 12.01 个百分点,说明“是否被用户看见”本身应进入攻击评测。

–

AgentLogs: A Dataset for Opening the Black Box of GitHub's Cloud Agent16arxiv.org原文 ↗

arxiv.org

AgentLogs 不只收集 Copilot cloud agent 最终提交的 PR,还记录它探索仓库、编辑文件、运行命令、操作 GitHub 和消耗 token 的每一步。数据扫描 1,812,362 个热门公开仓库,其中 35,810 个仓库贡献 307,416 个任务、549,239 个 session 和 64,255,174 条日志项。这样的规模让研究可以把任务表述、成本、失败模式、人类接管和最终代码质量放在同一条因果链上观察,而不是从 commit 反推过程。

–

Handoff Debt: The Rediscovery Cost When Coding Agents Take Over Interrupted Tasks17arxiv.org原文 ↗

arxiv.org

Handoff Debt 在 75 个源任务设置确定性交接点,比较后继 agent 只看仓库、原始 trace、摘要笔记或结构化笔记时的接管成本,共形成 181 个 takeover task、每个后继模型 724 次运行。三种模型中,带上下文的交接让中位事件数下降 20 - 59%,累计 prompt token 下降 42 - 63%,但解题率变化较小且依模型而异。论文把编码评测从“单 agent 是否修好”扩展到“下一位 agent 为重新建立状态付出了多少工作”。

–

开源 / 项目 · Projects

13 项 · 开源 / 项目

Newton's Orchard18newtonsorchard.app原文 ↗

newtonsorchard.app

这是一个浏览器中的二维空间与引力实验 playground,用户通过逐步探索场景调节物体和参数,直接观察轨道、碰撞等现象。页面信息更像可操作实验台而非静态教材,适合把抽象物理概念与即时反馈连起来;公开介绍没有给出数值模拟器或性能承诺。

–

Mcptunnels19terragohan.github.io原文 ↗

terragohan.github.io

Mcptunnels 为 MCP 服务提供临时公网隧道,并附带基础 OAuth 支持,把本地工具短时暴露给远端 agent 或协作者。它解决的是可达性和最小认证的接入摩擦;由于项目介绍未列出持久化、审计或零信任保证,部署时仍需自行限定暴露时长和权限。

–

本期重点slotstream4github.com原文 ↗

github.com

项目用 Swift/MLX 将 Qwen3.8-Flash-Next 的 512 个 routed experts 从 SSD 读入共享 cache,dense trunk 常驻内存,并提供 Ollama/OpenAI 兼容的 chat/generate 端点。README 在 48GB M5 Pro 上实测 32GB 峰值、约 12 tok/s warm decode、约 3 秒首 token;权重需下载 103.8GB,长 prompt 仍是首 token 的主要延迟来源,且 16GB 档位只是曲线估算。

–

Wasmer SDK20wasmer.io原文 ↗

wasmer.io

Wasmer 的 SDK 文章把本地沙箱定位成 agent 的执行边界:生成或调用的代码在隔离环境运行,宿主可以控制文件、网络和资源权限。它把“模型能写代码”与“代码能安全落地”分成两层,适合嵌入需要本地执行的 agent 产品;digest 未提供具体启动时间或隔离强度数字。

–

Semantic Overlays21semantic-overlays.vercel.app原文 ↗

semantic-overlays.vercel.app

Semantic Overlays 用训练 adapter 改变模型对上下文的表示,把提示注入防护从输入字符串过滤推进到表示层实验。项目更像研究型 demo:核心可观察量是上下文被编码和分离的方式,而不是一个宣称通用防护的网关;公开页面没有给出攻击成功率或跨模型泛化数据。

–

Openheim22openheim.io原文 ↗

openheim.io

Openheim 是 Rust 编写的多供应商 LLM agent runtime,提供把不同模型后端接入同一执行层的项目骨架。它把供应商切换和运行时抽象放在中心,适合需要避免单一 API 锁定的实验;目前公开描述未展开工具协议、状态管理或调度基准,不能据名称推断这些能力已经完备。

–

Shaide23github.com原文 ↗

github.com

shaide 把推理、注册表、网关、存储、观测和应用层作为一套 Pulumi 基础设施部署到自有 Kubernetes,支持多模型多副本和按请求路由,范围还覆盖 air-gapped 集群。README 将其定位为企业自托管平台而非新模型,并明确标注 early access:模块布局和 stack 配置可能变化,实际采用应固定 release。

–

Shed24github.com原文 ↗

github.com

Shed 用 Go 管理 coding agent 的 Git 资源:`~/.shed/repos` 下的上游 checkout 只读且在 session 开始、创建工作区前同步,写入操作则从共享 mirror 秒级 hardlink 出独立 workspace。它支持 Claude Code、Cursor CLI 和 opencode 并行运行,`prune` 会拒绝删除脏或未推送内容;无 daemon、无 telemetry 的设计把新鲜代码和隔离分支交给 agent 自己维护。

–

extensible-mcp25github.com原文 ↗

github.com

这是位于 LLM 与 MCP server 之间的策略代理,按需加载服务器、检索工具,并把每个动作送入由 Rego 编写的确定性过滤管线。工具定义和敏感凭证不必长期留在 prompt,模型也不能读取或说服策略引擎放行;签名的人类批准绑定到精确动作,形成“提议”和“提交”的硬边界。

–

codex-remote-control26github.com原文 ↗

github.com

该仓库以 Claude Code skill 的形式借用 Claude Remote Control,让手机上的 Claude 会话查看和引导本机 Codex CLI。安装是 marketplace 插件或复制一个 skill 目录,README 展示它能回传当前目录、最近消息、命令和退出状态,用户无需直接敲终端命令。桥接层增加的是远程可见性和交互入口,并不替 Codex 重新定义权限。

–

VPIPE27github.com原文 ↗

github.com

VPIPE 用自定义 Metal kernel 连接视频、音频、图像、文本和工具动作,配合权重流式加载与 4-bit 准备让 16GB Apple Silicon 也能跑图像/视频生成。仓库自带图像编辑、MiniMax H3、Qwen chat、实时 VQA、ASR/TTS 和本地 tool calling,Composer 会把布局、提示、参数和模型配置一起保存。macOS app、Web UI 和手机浏览器入口使它更接近完整工作台,而非一组孤立 kernel。

–

agents-workbook28github.com原文 ↗

github.com

agents-workbook 在 Claude Code/Codex 请求前加本地代理,让模型通过普通工具调用写出决策、被放弃的替代方案和代价,并把流实时显示在 `127.0.0.1:8080`。它特别声明不是 reasoning trace 数据采集器,也不允许挖掘或训练捕获内容;Docker Compose 借助 Maven wrapper 构建,因此主机无需预装 Maven。项目的工程问题是让计划与实际执行可对照,而不是追求更长的隐藏思维链。

–

Selfship.ai29selfship.ai原文 ↗

selfship.ai

Selfship 观察真实流量中的失败,生成带 eval 依据的 GitHub 修复 PR;合并后继续验证,若同一问题复现则在重试上限内再次开 PR,并把状态标成需关注。产品坚持人工审查和合并,不直接触碰代码,分析在临时沙箱执行且轨迹不用于训练;基础档为每月 20 美元、6,000 sessions 和 120 天留存,卖点是把监控闭环延伸到上线后的证明。

–

行业动态 · Industry News

10 项 · 行业动态

Path to Astra: critical capabilities and frontier safeguards30openai.com原文 ↗

openai.com

OpenAI 表示 Astra 已达到 Preparedness Framework 的 Critical 网络安全门槛,理由包括 ExploitBench 100% 得分、内部 20 个高危漏洞测试中发现并使用两枚 zero-day,以及在加固浏览器和系统上构造逃逸、提权链。发布策略是限制高级网络安全访问、增加拒答和系统级监控;在无生产防护的 jailbreak 测试中,Astra 拒答率 91.5%,GPT-5.6 Sol 为 59%。文章也承认更强的监控会暂停合法任务,且部分评估结果只代表 Daybreak Blue 条件。

–

Claude Fable 5.1 and Claude Mythos 5.131anthropic.com原文 ↗

anthropic.com

Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1,并同步模型更新与系统卡。当前摘要中没有可核验的上下文长度、价格或基准表,因此这条新闻的确定事实是版本发布与安全文档配套,而不是可量化的能力排名。

–

Play Store blocks AuroraStore, hurting GrapheneOS users32gitlab.com原文 ↗

gitlab.com

AuroraStore 的 issue 记录了匿名安装链路的“Server busy”故障:在 Fairphone 5、Android 16、CalyxOS 7.2.4.20 和 4.8.4 nightly 上,搜索后点击 Install 的应用全部失败。用户尝试 VPN、清缓存、刷新匿名账户、强制关闭和重启仍无效;这份记录能确认影响面和复现路径,但没有把根因归结为单一 Play Store 策略。

–

Google Has Removed MV2 Extensions from the Chrome Web Store, Including UBO33webiterate.dev原文 ↗

webiterate.dev

报道称 Chrome Web Store 已移除部分 Manifest V2 扩展,包括 uBlock Origin。直接后果是依赖旧扩展模型的隐私和广告拦截工具可发现性、安装和更新路径被平台控制;文章与 digest 没给出完整下架清单或迁移期限,因而不把这条报道延伸成所有 MV2 扩展同时失效。

–

Apple caught off guard by AI demand for Mac Mini and Mac Studio34macrumors.com原文 ↗

macrumors.com

MacRumors 援引 The Information 称,企业购买 Mac mini/Mac Studio 跑 AI 的需求促使苹果提前发布新机,并重点宣传多台 Mac Studio 联机运行大模型。报道同时指出苹果缺少企业工程与开发者关系团队,高配机在内存短缺中数月缺货,部分客户转买 Nvidia DGX Spark;这把桌面 Mac 的需求变化与供应链、企业销售准备度放到同一张图里。

–

Healthcare organizations can now connect EHR and additional industry data to ChatGPT35openai.com原文 ↗

openai.com

OpenAI 为 ChatGPT for Healthcare 增加 Epic EHR 集成和连接 9 个官方公共数据源的插件,医生可在授权范围内汇总病历、药物、试验和覆盖政策并回指来源。官方评估中,27 个临床用例的 4,363 次医生评分有 99.1% 判为安全,五个数据源的准确性均超过 93%;这些是厂商与合作医生的响应评估,尚不能等同于临床结局或独立审计。

–

How AI-native companies turn workflows into operating capability36openai.com原文 ↗

openai.com

OpenAI 用三个工作流案例说明 agent 的落地梯度:Basis 把入职从 2 小时缩到 30 分钟,Clay 的持久 account subagent 每晚刷新资料、约省 1 小时 triage,Exa 则让 Codex 监测机会、开 PR、跑测试并准备周报。文章引用 Enterprise Signals:前 10% AI 使用企业的每活跃用户输出 token 是典型企业的 8.3 倍,1 月为 2.6 倍;它把差距解释为上下文、工具、证据和 review 被纳入可重复流程,而非单纯多发请求。

–

OpenAI supports California's bill to advance youth AI safety37openai.com原文 ↗

openai.com

OpenAI 支持加州 SB 1119,赞成对 13 - 17 岁用户默认进行年龄识别、上线前风险评估、独立审计、家长控制、危机资源和定向广告限制,同时保留学习功能。文章称近九成每周使用 ChatGPT 的青少年把它用于学习、信息、技能或生产力,并列出 ChatGPT for Teens 的 Quizzes、Learning Visualizations、Study mode 与记忆保护。政策重点从可选开关转为默认行为,但年龄预测和实施细则仍是执行风险。

–

Polimill builds Japan's next-generation public AI infrastructure38openai.com原文 ↗

openai.com

Polimill 将日本各地议会记录、福利与法律资料标准化并加元数据,放入 QommonsAI 的统一检索层,再用 OpenAI 模型服务地方政府日常工作。官方案例称平台覆盖约 1,050 个自治体和约 55 万名公务员,Codex 参与需求、代码检查、实现和测试后让开发速度提高 3 - 5 倍。可复制的部分是先建设跨组织知识底座、再接模型和审计控制,而非把通用聊天直接推给公务员。

–

GrapheneOS may skip Pixel 11 over missing hardware security feature39cyberinsider.com原文 ↗

cyberinsider.com

报道称 GrapheneOS 团队正在讨论因 Pixel 11 缺少某项硬件安全特性而跳过支持。当前公开信息只支持“可能不支持”的项目立场,尚未形成最终决定或完整硬件清单;这场争议的实质是移动系统安全基线是否能由软件项目单方面补齐。

–

博客文章 · Blog Posts

10 项 · 博客文章

Codex bundles LibreOffice40simonwillison.net原文 ↗

simonwillison.net

Simon Willison 从 Codex 桌面应用缓存中看到 Python、Node.js、Poppler、Git 和 LibreOffice,推断本地 agent 正把代码、PDF 和办公文档处理依赖一起带到客户端。这个观察更适合当作软件供应链线索:缓存目录证明组件存在,却不能单独证明每次任务都会调用它们,仍需区分实际依赖与打包残留。

–

Python 3.15.0 candidate 2 is here!41simonwillison.net原文 ↗

simonwillison.net

Python 3.15.0 的第二个候选版本把关注点移到发布冻结和兼容性验证:RC 阶段主要接收阻塞性修复,最终版前不宜继续引入大范围行为变化。对依赖库维护者而言,最有信息量的动作是用自己的完整 CI 和构建矩阵跑 RC,而不是只看新特性列表。

–

Introducing wrapture42simonwillison.net原文 ↗

simonwillison.net

wrapture 在 wrapt 的函数包装基础上加入调用追踪与测试替换,使不改业务函数也能观察调用、注入替身或控制测试行为。它针对的是可观测性和可测试性之间的胶水代码;文章属于项目介绍,未给出性能基准,因此不宜把便利 API 读成零开销保证。

–

How accurate have Ed Zitron's AI skeptic predictions been?43danluu.com原文 ↗

danluu.com

Dan Luu 把 Ed Zitron 过去的预测按原文、时间点和现实进展逐项复核,重点是把“预测命中”拆成可验证命题,并处理定义变化与选择性引用。文章提供的是审计评论的方法,而非一个脱离语境的总命中率;它提醒读者先固定预测的时间窗口和可观测指标,再讨论观点是否准确。

–

I trained a small transformer in 1.5hrs and it beats many LLMs44mvakde.github.io原文 ↗

mvakde.github.io

Mithil Vakde 报告一个从零训练约 1.5 小时、成本约 0.67 美元的 Transformer,在 ARC-AGI-1 得分 44%、ARC-2 得分 7%。关键增益来自每任务 embedding、3D RoPE、SwiGLU、RMSNorm、NorMuon 与更精简的增强;去掉 3D RoPE 或任务 embedding 后约降至 25%,改用 1D RoPE 或移除任务 embedding 约 24%。作者还过滤掉 ARC-2 中重复的 773 个 ARC-1 题,明确处理了训练泄漏争议。

–

Agent memory as a file format45calpaterson.com原文 ↗

calpaterson.com

Memoryfields 把 agent memory 设计成可读、可编辑、可版本控制的 zip:多页 Markdown,可选 YAML frontmatter,再配 SQLite 向量索引。作者给单页约 8KB、约 2,000 tokens 的软上限,以便做 embedding,并批评图数据库和“蒸馏事实”在追求结构时丢掉语境。它的反直觉点是把记忆当 data format,让文件本身成为调试和迁移接口,而不是再建一个决定“记什么”的复杂服务。

–

The pattern language of software architecture46metapatterns.io原文 ↗

metapatterns.io

Metapatterns 以模式语言整理软件架构中的重复结构,把分散的设计经验表达成可互相组合、可比较的模式集合。页面更像知识索引而非运行时或框架,未给出性能数字;阅读价值在于用结构关系帮助设计者描述取舍,而不是提供一条必须照搬的技术栈。

–

Wasmi 2.0 - Engineering of the Fastest Wasm Interpreters47wasmi-labs.github.io原文 ↗

wasmi-labs.github.io

Wasmi 2.0 的工程文章围绕 WebAssembly 解释器的实现与性能设计,讨论 dispatch、内存访问和宿主交互等解释执行中的主要成本。它关注如何在保留解释器灵活性的同时降低运行时开销,属于实现剖析而非 Wasm 入门;digest 未给出具体 benchmark,因此不虚构跨引擎的速度排名。

–

A Self-Improving RLM Harness Just Dropped48mail.bycloud.ai原文 ↗

mail.bycloud.ai

AI Timeline 以一个新出现的自我改进 RLM harness 为切口,汇总近期模型、agent benchmark 和开源模型动态。文章的主要产物是时间线和线索集合,而不是完整实验报告;digest 没列出该 harness 的代码、任务集或指标,故正文只保留其新闻索引属性。

–

not much happened today49news.smol.ai原文 ↗

news.smol.ai

smol.ai 这期整理 8 月 29 - 31 日的 AI 新闻与社区讨论,把模型、agent 和工具生态的短线变化压缩成多条摘要。它适合用来发现后续阅读入口,却不构成单一论点或统一数据集;具体事实应回到各条原始公告,而不能把 roundup 的语气当作独立验证。

–

引用来源 · References

57 条 · 引用
  1. 1 DS-Lighting: Making Agent Harnesses Explicit for Data-Science Automation. arXiv:2608.28590https://arxiv.org/abs/2608.28590 ↩ 回到正文 · back to text
  2. 2 CrossAudit: A Git-Native, Cross-Vendor Audit Loop for Agentic Science. arXiv:2608.28631https://arxiv.org/abs/2608.28631 ↩ 回到正文 · back to text
  3. 3 APIFlow-Bench: Measuring Whether Agents Survive Long, Dependent API Workflows. arXiv:2608.29128https://arxiv.org/abs/2608.29128 ↩ 回到正文 · back to text
  4. 4 slotstreamhttps://github.com/carloslfu/slotstream ↩ 回到正文 · back to text
  5. 5 SkillZip Pro: Execution-Aware Dynamic Compression of Progressively Loaded Skills for Self-Evolving Agents. arXiv:2608.30785https://arxiv.org/abs/2608.30785 ↩ 回到正文 · back to text
  6. 6 Selective Forgetting: A Graph-Based Memory Framework for Long-Term LLM Agents. arXiv:2608.28978https://arxiv.org/abs/2608.28978 ↩ 回到正文 · back to text
  7. 7 EvoGenUI-Bench: Evaluating LLMs as Multi-Turn Generative UI Assistants. arXiv:2608.29387https://arxiv.org/abs/2608.29387 ↩ 回到正文 · back to text
  8. 8 Towards a Systems Foundation for Agentic Skills: Architecture, Lifecycle, and Security. arXiv:2608.29596https://arxiv.org/abs/2608.29596 ↩ 回到正文 · back to text
  9. 9 TRACER: Per-Tool Context Retention for LLM Agents via Consequence-Attributed Reinforcement Learning. arXiv:2608.29363https://arxiv.org/abs/2608.29363 ↩ 回到正文 · back to text
  10. 10 Measure Before You Manage: Evaluating Agent Working Memory in Coding Agents. arXiv:2608.31057https://arxiv.org/abs/2608.31057 ↩ 回到正文 · back to text
  11. 11 Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data. arXiv:2608.31082https://arxiv.org/abs/2608.31082 ↩ 回到正文 · back to text
  12. 12 Facts Without Rules: Boundary Metadata Collapse in Multi-Agent LLM Handoffs. arXiv:2608.29028https://arxiv.org/abs/2608.29028 ↩ 回到正文 · back to text
  13. 13 Localizing Emergent Failures in Agentic AI: Recovering Minimal Repair Families via Counterfactual Replay. arXiv:2608.29228https://arxiv.org/abs/2608.29228 ↩ 回到正文 · back to text
  14. 14 Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents. arXiv:2608.30322https://arxiv.org/abs/2608.30322 ↩ 回到正文 · back to text
  15. 15 Will the User Ever Know? Covert Indirect Prompt Injection on Tool-Using LLM Agents. arXiv:2608.30362https://arxiv.org/abs/2608.30362 ↩ 回到正文 · back to text
  16. 16 AgentLogs: A Dataset for Opening the Black Box of GitHub's Cloud Agent. arXiv:2608.29204https://arxiv.org/abs/2608.29204 ↩ 回到正文 · back to text
  17. 17 Handoff Debt: The Rediscovery Cost When Coding Agents Take Over Interrupted Tasks. arXiv:2606.02875https://arxiv.org/abs/2606.02875 ↩ 回到正文 · back to text
  18. 18 Newton's Orchardhttps://newtonsorchard.app ↩ 回到正文 · back to text
  19. 19 Mcptunnelshttps://terragohan.github.io/mcptunnels/ ↩ 回到正文 · back to text
  20. 20 Wasmer SDKhttps://wasmer.io/posts/wasmer-local-sandboxes-for-ai-agents ↩ 回到正文 · back to text
  21. 21 Semantic Overlayshttps://semantic-overlays.vercel.app/ ↩ 回到正文 · back to text
  22. 22 Openheimhttps://openheim.io/ ↩ 回到正文 · back to text
  23. 23 Shaidehttps://github.com/axem-solutions/shaide ↩ 回到正文 · back to text
  24. 24 Shedhttps://github.com/AndrewHannigan/shed ↩ 回到正文 · back to text
  25. 25 extensible-mcphttps://github.com/SenteLabsAI/extensible-mcp ↩ 回到正文 · back to text
  26. 26 codex-remote-controlhttps://github.com/sahrizvi/codex-remote-control ↩ 回到正文 · back to text
  27. 27 Vpipehttps://github.com/tgo-app-dev/vpipe ↩ 回到正文 · back to text
  28. 28 agents-workbookhttps://github.com/softcane/agents-workbook ↩ 回到正文 · back to text
  29. 29 Selfship.aihttps://selfship.ai/ ↩ 回到正文 · back to text
  30. 30 Path to Astra: critical capabilities and frontier safeguardshttps://openai.com/index/path-to-astra ↩ 回到正文 · back to text
  31. 31 Claude Fable 5.1 and Claude Mythos 5.1https://www.anthropic.com/claude-fable-and-mythos-5-1 ↩ 回到正文 · back to text
  32. 32 Play Store blocks AuroraStore, hurting GrapheneOS usershttps://gitlab.com/AuroraOSS/AuroraStore/-/work_items/1566 ↩ 回到正文 · back to text
  33. 33 Google Has Removed MV2 Extensions from the Chrome Web Store, Including UBOhttps://webiterate.dev/google-removed-extensions-ublock-origin-108/ ↩ 回到正文 · back to text
  34. 34 Apple caught off guard by AI demand for Mac Mini and Mac Studiohttps://www.macrumors.com/2026/08/30/apple-unexpected-mac-mini-and-studio-demand/ ↩ 回到正文 · back to text
  35. 35 Healthcare organizations can now connect EHR and additional industry data to ChatGPThttps://openai.com/index/chatgpt-connects-health-records-and-healthcare-sources ↩ 回到正文 · back to text
  36. 36 How AI-native companies turn workflows into operating capabilityhttps://openai.com/index/ai-native-company-workflows ↩ 回到正文 · back to text
  37. 37 OpenAI supports California's bill to advance youth AI safetyhttps://openai.com/index/supporting-california-bill-advance-ai-youth-safety ↩ 回到正文 · back to text
  38. 38 Polimill builds Japan's next-generation public AI infrastructurehttps://openai.com/index/polimill ↩ 回到正文 · back to text
  39. 39 GrapheneOS may skip Pixel 11 over missing hardware security featurehttps://cyberinsider.com/grapheneos-may-skip-pixel-11-over-missing-hardware-security-feature/ ↩ 回到正文 · back to text
  40. 40 Codex bundles LibreOfficehttps://simonwillison.net/2026/Sep/1/codex-libreoffice/ ↩ 回到正文 · back to text
  41. 41 Python 3.15.0 candidate 2 is here!https://simonwillison.net/2026/Sep/1/python-315-rc-2/ ↩ 回到正文 · back to text
  42. 42 Introducing wrapturehttps://simonwillison.net/2026/Aug/31/introducing-wrapture/ ↩ 回到正文 · back to text
  43. 43 How accurate have Ed Zitron's AI skeptic predictions been?https://danluu.com/zitron/ ↩ 回到正文 · back to text
  44. 44 I trained a small transformer in 1.5hrs and it beats many LLMshttps://mvakde.github.io/blog/44-on-arc-1/ ↩ 回到正文 · back to text
  45. 45 Agent memory as a file formathttps://calpaterson.com/memoryfields.html ↩ 回到正文 · back to text
  46. 46 The pattern language of software architecturehttps://metapatterns.io/ ↩ 回到正文 · back to text
  47. 47 Wasmi 2.0 - Engineering of the Fastest Wasm Interpretershttps://wasmi-labs.github.io/blog/posts/wasmi-v2.0/ ↩ 回到正文 · back to text
  48. 48 A Self-Improving RLM Harness Just Droppedhttps://mail.bycloud.ai/p/a-self-improving-rlm-harness-just-dropped ↩ 回到正文 · back to text
  49. 49 not much happened todayhttps://news.smol.ai/issues/26-08-31-not-much/ ↩ 回到正文 · back to text
  50. 50 securo-finance/securohttps://github.com/securo-finance/securo ↩ 回到正文 · back to text
  51. 51 mukul975/cve-mcp-serverhttps://github.com/mukul975/cve-mcp-server ↩ 回到正文 · back to text
  52. 52 asciimoo/histerhttps://github.com/asciimoo/hister ↩ 回到正文 · back to text
  53. 53 jingyaogong/minimindhttps://github.com/jingyaogong/minimind ↩ 回到正文 · back to text
  54. 54 PurpleDoubleD/locally-uncensoredhttps://github.com/PurpleDoubleD/locally-uncensored ↩ 回到正文 · back to text
  55. 55 hieunc229/mailflarehttps://github.com/hieunc229/mailflare ↩ 回到正文 · back to text
  56. 56 ionic-team/capacitorhttps://github.com/ionic-team/capacitor ↩ 回到正文 · back to text
  57. 57 alphaXiv/openresearch-clihttps://github.com/alphaXiv/openresearch-cli ↩ 回到正文 · back to text