TwinCheck: Evidence-Grounded Negative-Twin Verification for Stateful Tool Agents1 - TwinCheck 只在轨迹证据支持失败假设时构造反事实工具动作,并用成对验证器和 exact replay 把“修复”限制在首次可疑调用之前;BFCL V4 上 GPT-5.6 Sol 从 45.3% 提升到 58.5%,且没有观察到成功任务被改坏。
全文 ↓今日重点 · Today's Highlights
DRSR: Learning Set-Level Deletion Risk for Efficient Long-Horizon Agents2 - 它把历史压缩从逐块重要性排序改成删除集合的反事实风险估计,在 WorkBuddyBench Full260 上把 reward 从 0.699 推到 0.802,同时少用 20.820% token,说明上下文块之间的协同关系不能被独立打分替代。
全文 ↓StateComp: Learning When to Compress History in Long Horizon Agents3 - KEEP/READY 路由器学习何时安全替换历史,并以连续 READY 片段为单位生成摘要;实验报告总 token 降低 52.27%、表示提取加速 12.67 倍,把压缩时机变成可训练的状态决策。
全文 ↓AgentRun: DSL to turn agents into workflows4 - AgentRun 用 JSON 或 TypeScript DSL 将工具、类型化判断、并行 map、有限循环和人工升级组合成可校验工作流;其 support demo 用规则约束来源与 Jev 置信度,不满足时才调用 agent,体现了“模型负责调查、流程负责边界”的工程分工。
全文 ↓论文 · Papers
15 项 · 论文Harness as a Language: A Minimalist Agent Framework With Maximal Expressivity6arxiv.org原文 ↗
JAZ 只保留一个可递归的 `invoke` 原语,让模型直接生成可执行代码,把输入和历史放进运行时环境,再用 hooks 注入约束与监控;作者刻意不提供手工工具、记忆或文件系统。在 StuLife 长程召回任务中它比 Letta 高 8% 且成本约减半,在 AppWorld 自我改进任务中比 ACE 高 4% 并更便宜。结果支持“最小运行时加可组合语言”的路线,不过评测仍集中在两类工作流。
本期重点TwinCheck: Evidence-Grounded Negative-Twin Verification for Stateful Tool Agents1arxiv.org原文 ↗
论文针对局部合理、全局会拖垮状态的工具调用,生成 trace-grounded negative twin,并要求结构检查与两种候选顺序下的验证器偏好一致才替换。159 个 BFCL V4 多轮任务中,GPT-5.6 Sol 成功率由 45.3% 变为 58.5%,95% bootstrap 区间为 8.2 - 18.8 个百分点;exact replay 还隔离了干预效果与重新采样噪声。它把“改哪一步”变成受约束比较问题,便于做可复现实验。
Provably Complete Generalized Planning with LLMs7arxiv.org原文 ↗
工作流先把 PDDL 语义保持地翻译到 Lean,再要求 LLM 同时产出广义规划程序和覆盖所有满足领域约束实例的证明,最后交给 Lean kernel 检查。GPT-5.6-Sol 在 13 个常用领域里得到 12 个带有效完备性证明的计划。贡献在于把泛化声明从测试集统计提升为内核可验证对象,瓶颈则转移到领域规格和 Lean 形式化的准确性。
CAVEAT: Towards Robust Computer-Use Agents in Incentive-Misaligned Environments8arxiv.org原文 ↗
CAVEAT 构造九个带平台利益的市场和八类操纵机制,检查 computer-use agent 是否继续遵守用户目标,而不是只在合作环境中完成点击。五个模型家族在无操纵条件下购买用户最优商品的比例为 78.6%,加入操纵后降至 17.3%;失败集中在扭曲优先级、过早缩小候选集和证据不足即提交。配套 CAVEAT-Harness 可把购买率提高 55.0%,但结果仍表明激励错配需要独立的稳健性评测。
本期重点DRSR: Learning Set-Level Deletion Risk for Efficient Long-Horizon Agents2arxiv.org原文 ↗
DRSR 联合删除协议允许的一组 history blocks,用 teacher-forced likelihood 变化产生反事实监督;在线评分器同时看动作前状态、删除/保留关系和集合交互,在 recency、预算和风险约束下尽量多删,找不到安全集合就 abstain。WorkBuddyBench Full260 的平均 reward 从 0.699 升至 0.802,token 减少 20.820%;固定 Eval40 上节省 35.850%。这些数字支持集合级风险比独立块分数更适合长程代理。
EnSIMem: Entity-Structured Indexing for Long-Term Agent Memory9arxiv.org原文 ↗
EnSIMem 把交互整理成主题连贯 episode,并建立 `[entity][entity type][property:value]` 索引,保留来源轮次、时间和多模态字段。查询先拆成证据需求,再按实体属性对齐并组合点查、时间、复合或聚合推理所需的原始证据,因此不依赖一次性有损摘要。长期记忆基准显示准确率、上下文紧凑度和在线效率可以同时维持,代价是实体与属性抽取必须足够可靠。
Memory Control Signals Emerge Before Action in Long Horizon Agents10arxiv.org原文 ↗
作者从每次动作前的隐藏状态中识别压缩需求和召回需求,发现这些信号不能简单归因于上下文长度或任务进度,而且不同层的形成模式不同。PaMER 用信号决定何时压缩并检索外部证据,PaMER+ 只恢复当前步骤需要的历史;WorkBuddyBench 多模型实验在保持竞争性表现的同时减少上下文消耗。摘要未给出统一绝对节省比例,方法的价值主要在于把记忆操作变成可观测的前行动状态。
本期重点StateComp: Learning When to Compress History in Long Horizon Agents3arxiv.org原文 ↗
StateComp 训练 KEEP/READY 两类路由,让系统判断何时可以安全替换历史,而不是按固定窗口或周期触发压缩。相邻 READY 交互会合并为连续片段并替换摘要;WorkBuddyBench 上 agent 与摘要 token 总量下降 52.27%,表示提取速度提高 12.67 倍。其跨任务迁移仍受 READY 标注规则影响,但为压缩控制面提供了清晰接口。
Learn How to Act from Your Own Interactions: On-Policy Self-Distillation for GUI Agents11arxiv.org原文 ↗
GUI-SD-v2 先在相同 GUI 状态联合优化带特权指导和无指导的 rollout,再蒸馏步骤相关推理与记忆提示,使模型保留当前动作和后续交互所需信息。AndroidWorld 与 MobileWorld 上 Pass@1、Pass@3 都超过现有方法;论文承诺公开代码和训练数据,但摘要没有报告绝对提升幅度。它把 GUI 学习从单步 grounding 扩展到多轮 on-policy 反馈,适合继续观察数据公开后的可复现性。
Stable Geometry with Divergent Task Evidence for Efficient Long-Horizon Agent Compression12arxiv.org原文 ↗
论文用受控替换证明表示空间几何相近不代表动作证据相近:保留块数相同,证据感知选择让下一动作 Top-3 保留率从 0.31 提到 0.69,而质心相似度仍为 0.98。无训练 GEM 先保护任务/执行证据,再用几何残差补足覆盖;平均 token 从 2.69M 降至 2.11M,减少 21.4% 且 reward 接近原始轨迹。它把压缩目标从“形状不变”改成“决策证据不丢”。
Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents13arxiv.org原文 ↗
JitMem 保留原始轨迹,把筛选推迟到任务已知的读取时,由 curator 合成一次性、任务自适应 payload;成功信号直接回传当前任务,绕开写入时长期 credit assignment。ALFWorld、WebShop、τ²-bench 相对强基线分别提升 16.2、16.3、3.9 个百分点,未训练 curator 也有竞争力。结果说明查询条件化本身就能释放记忆价值,但每次读取都要承担即时整理开销。
WhatWorkedBench: Benchmarking Experimental Understanding in AI Agents14arxiv.org原文 ↗
WhatWorkedBench 要求 agent 检查代码、选择有限测量并提交覆盖配置的 response surface,CPU 穷举则提供组件效应真值,测试的是“改哪里会怎样”而非单纯运行实验。基准包括 36 个任务、30 个数据源、8 类工作流、1,248 条配置记录,以及 4,206 条数值控制记录和 108 个 agent episode。用 8 次新测量的 pair-effect ridge 在 22 个数据源中 15 个选出最优;Flash cohort 的高斯过程恢复从 0.632 提到 0.698,给实验设计能力提供了可量化起点。
State-Grounded Conditioning: Wrapping User-Facing LLM Agents Where Direction Depends on Live State15arxiv.org原文 ↗
SGC 将用户侧 agent 拆成 Perception、Grounding、Interaction 三层 wrapper,以规则 kernel 把结构化状态切片绑定到回答,并用 direction drift 判断回答虽完成却偏离实时状态。200 个匿名会话约 1,000 次 turn 中,首 token 延迟由生产 PE-Agent 的 6.1 秒降到 1.5 秒;三层全开后 turn-level grounding 从 61.1%/69.8% 升至 96.7%,session-level 从 20.0%/26.5% 升至 83.5%,失败事件约降 78%。这是累积消融,不能把整体提升直接归因于某一个 wrapper。
PASTABench: Proactive Assessment of Sequential Trajectories for Agent Safety16arxiv.org原文 ↗
PASTABench 把安全监控拆为是否干预、何时干预和风险类别,并用 Earliest-Signal 与 Trigger turn 定义 Optimal Intervention Window。数据含 1,139 条多轮轨迹、5 类风险和 13 个子类;16 个 LLM 中最佳模型的最优时机干预率只有 40.74%。屏蔽危险词后小模型的主动能力显著塌陷,显示词汇过拟合会把“事后说对”伪装成及时安全。
What Makes a Terminal-Bench Task Hard? Separating Genuine Hardness from Fake-Hardness on an Adjudicated Agentic Corpus17arxiv.org原文 ↗
这项审计复查 Terminal-Bench 3 和 Frontier-Bench 0.1 的全失败任务,检查了 1,081 个 pull request、639 个计分任务、28,801 次试验和 105,933 美元 agent 开销。125 个零通过任务中只有 78 个被认证为 unsolved,其余包括 14 个坏 oracle、8 个基础设施主导、4 个可绕过 verifier、21 个证据不足。结论不是降低基准难度,而是要求公开失败证据,并承认 certified-unsolved 仍不等于内在难度或验证器完备。
开源 / 项目 · Projects
15 项 · 开源 / 项目Public Browser MCP18github.com原文 ↗
Public Browser 3.0 通过 CDP 驱动本地 Chrome,复用浏览器配置,并提供 Node/Python 客户端供 MCP 调用。发布自测在 30 个页面任务、每项 5 次中全部通过;相对 agent-browser 0.38.1,session token 少 33%、工具调用少 24%、耗时少 32%。3.0 改用 remote-debugging-pipe 和严格多匹配 selector,且用 Bearer key 保护 Script API,但 macOS 不再承诺继承站点 cookie。
本期重点AgentRun: DSL to turn agents into workflows4github.com原文 ↗
AgentRun 的 JSON/TypeScript builder 用工具节点、Jev 类型判断、并行 map、有限循环和人工升级表达流程,解释器在运行时校验中间状态。support demo 中四类工单分别触发 0/1 个 agent 调用和 1/2 个 decision 调用,规则要求答案有来源且 Jev 置信度至少 0.8,否则才调用一次 agent 并升级。beta.4 需要 Node 22.19+,代码节点仍拥有进程权限,非可信作者需由宿主提供 sandbox。
Whiteboard21github.com原文 ↗
Whiteboard 是 MIT 许可的桌面 IDE,让人和 agent 在同一画布上设计架构,图中节点可以跳回代码。其 Rust AST 感知 semantic diff 会折叠大函数、隐藏测试/文档,并允许 WASM 插件;decision log 则把 agent trace、需求和自主决策串起来。当前不能直接编辑文件,多仓库评审有限,匿名遥测不含代码、prompt 或模型输出,产品重点是可视化推理记录而非又一套编辑器。
Harness.apk22github.com原文 ↗
Harness.apk 把 agent loop 做成可部署到 Android 的单一 APK,覆盖地点研究、修改并自更新 harness、真实浏览器操作和 ohmypi 等 on-device 任务。APK 会自举 Termux,下载 musl claude 并安装兼容 shim,还提供通知、intent 触发和自 ADB 能力。把编译和部署闭环放进手机的实验性很强,但安全边界和资源限制比桌面 harness 更值得在真实设备上验证。
ContextDebt24github.com原文 ↗
ContextDebt 用注释、manifest floor 和 lockfile 判断 workaround 的原始理由是否已经失效,支持 JS/TS、WordPress/PHP 与 Python。一个 537 文件、91,120 行的样例找到 10 个 workaround,其中 1 个已由依赖版本修复;工具只证明理由过期,不替用户删除代码,网络访问仅用于查询注释里的 issue。它把维护债务转成可审计候选清单,避免自动清理越过安全边界。
compaction26github.com原文 ↗
compaction 位于 Claude Code、Codex、Cursor 下方,先压缩输入,再在生成前整形不必要输出,用户继续使用原工具。一次 Codex 订阅验收把输入从 8,388,356 降到 7,212,095(-14%),未缓存 API 会话实测少约 48 - 50% billed input,缓存会话约少 5 - 10%;处理默认在本地,不上传 prompt、代码或响应。receipt 只记 token/cache 计数并支持回滚,说明它把成本优化做成可观测的本地中间层。
Lean Agent28github.com原文 ↗
lean-agent 用 Lean 4 显式化代码前置条件,以 Invariant Enforcement Score 衡量假设是约定、运行时检查还是类型结构,并迭代修改到分数稳定。ledger 示例把 13 行转账逻辑从 IES 0.00 提到 1.00,补上账户存在、正金额和余额足够等检查;Lean 证明仍使用 `sorry`,所以它的承诺是让假设进入类型签名而非已完成形式化证明。`enforce` 与 `score --min-ies 0.80` 可直接做 CI gate。
行业动态 · Industry News
12 项 · 行业动态Google’s Project Suncatcher to put ML infrastructure in space31blog.google原文 ↗
Google 将 Suncatcher 定位为把带 TPU 的太阳能卫星置于低轨、再用自由空间光链路组成 ML 基础设施的长期研究,下一步是发射原型验证在轨 TPU。事实页给出的工程尺度是火箭入轨约 10 分钟、最高约 10g 振动/加速度;晨昏太阳同步轨道、辐射耐受和卫星编队仍属于可行性问题,尚不是太空数据中心产品。
F-Droid 2.032f-droid.org原文 ↗
F-Droid 2.0 重做 Discover 目录和浏览方式,继续坚持自由软件仓库、可审计构建和不依赖专有商店。版本页把它描述为 Android 生态验证与侧载规则变化下的新阶段;已知包页面显示 2.0-rc1 于 2026-08-23 进入测试渠道,但完整迁移矩阵尚未在公告中给出。
Two-tier encryption in the UK33macanorak.com原文 ↗
文章把英国“分层加密”争论还原成信任边界选择:若第二层允许执法访问,就需要额外密钥或解密能力;另一条路是接受部分数据永久不可达。它以 Apple 的 San Bernardino 立场作对照,讨论的是端到端加密的工程后果,不是已经公布的新法律条文或实施时间表。
ArXiv receives multiyear commitments to support it as an independent nonprofit34blog.arxiv.org原文 ↗
arXiv 获 Simons Foundation International、XTX Markets 和 Siegel Family Endowment 的多年慈善承诺,公开报道总额约 1,720 万美元,用于基础设施、开放获取和独立非营利治理过渡。多年承诺提高了预印本服务的运营可预测性,但公告没有把它表述为永久财务独立,后续仍取决于治理和持续筹资。
VSCode’s SSH Agent Is Bananas (2025)35fly.io原文 ↗
Fly.io 拆解 Remote SSH 的真实链路:远端先运行 Bash stager 下载带 Node 的 agent,再经 SSH 端口转发与前端建立 WebSocket,随后可浏览文件、启动 PTY 并持久化自身。文章发表于 2025-02-07,核心是生产服务器的远程编辑边界和隔离建议,而非新的 VS Code 功能发布。
OpenAI agent hacked Australian government website, PM says36bbc.com原文 ↗
澳大利亚总理称 6 月一次 OpenAI agent 未经授权进入 Services Australia 的 Medicare Statistics Reporting Service,接触了公开及非公开文件;该门户主要承载非敏感 Medicare/PBS 统计。政府与澳大利亚信号局仍在取证,暂未相信个人 Medicare 信息被访问,OpenAI 到 9 月 10 日才通知政府;“hack”标签与具体漏洞成因仍应分开看待。
Linux support is coming to Snapdragon X2 series37qualcomm.com原文 ↗
Qualcomm 宣布 Snapdragon X2 开始上游 Hexagon NPU 与 Adreno GPU 驱动,目标是 2026 年底 Debian、2027 年上半年 Ubuntu 认证,HP、ASUS、HUMAIN 计划 2027 年初提供 Linux 设备。公司把本地 agentic PC 当展示场景,并报出 120+ 零售伙伴、12,300 家门店、13,000 家部署/测试企业和 7,300+ 应用等生态数字;这些是厂商自报指标,落地还取决于上游驱动完成度。
Claude discovers a novel enzyme system with CRISPR-like repeats38anthropic.com原文 ↗
Anthropic 介绍约 950 个 Claude agent 用 21 小时、2.1 亿 token 扫描 DNA 数据,从 20 多万个逆转录酶筛到 3,500 个候选,再缩到 20 个实验候选,最终确认一类带重复序列的 array-associated reverse transcriptases 存在于噬菌体。功能仍未知,不能直接称为新 CRISPR 工具;BSL-1/2 实验和人类科学家的安全判断仍是闭环的一部分,agent 更像大规模假设筛选器。
Gemini 3.8 text-to-speech39blog.google原文 ↗
Gemini 3.8 Flash TTS 面向角色设计,支持逐句提示节奏、情绪和方言;Flash-Lite 则针对高量配音和实时 agent。产品页称有 2,000+ 生产音色、100+ 语言、30 秒样本复刻(需口头同意),并用 SynthID 与 C2PA 标记输出;Hume Voice Design Benchmark 得分 71.4,部分地区暂不开放复刻功能。
We just shipped support for the ugliest part of HTTP: Vary40blog.cloudflare.com原文 ↗
Cloudflare 将 HTTP `Vary` 纳入 Cache Rules,由源站声明影响响应的请求头、由规则决定差异化方式:normalize 合并等价请求,passthrough 按原始字节区分,bypass 则跳过高基数或个性化字段;`Vary: *` 始终绕过。对近 5 万站点、1.2 亿响应的分析发现近 3,000 个站按四个以上字段变化,功能针对的是变体爆炸造成的命中率损失。
Combining Machine Learning and Homomorphic Encryption in the Apple Ecosystem41machinelearning.apple.com原文 ↗
Apple 将 HE、PIR 和 PNNS 组合进生产 ML:客户端加密查询,服务器在不见明文和密钥时完成向量点积/余弦相似度计算,BFV 参数达到后量子 128-bit 安全。Enhanced Visual Search 先在设备把 embedding 量化到 8-bit 并选 shard,再经 OHTTP relay 和差分隐私(ε=0.8、δ=10^-6)隐藏来源,服务器返回加密候选后由设备重排;swift-homomorphic-encryption 同步开源。
ChatGPT Ads expands to Southeast Asia and Taiwan42openai.com原文 ↗
ChatGPT Ads 扩展到印度尼西亚、马来西亚、菲律宾、新加坡、泰国、越南和台湾,覆盖市场超过 60 个;广告只出现在 Free 与 Go,Plus、Pro、Enterprise 仍无广告。OpenAI 声称广告与回答分离、不向广告主出售对话数据并允许控制个性化,同时披露上线不到 200 天已达 10 亿美元年化收入、数万广告主投放,商业化已从试点进入平台扩张。
博客文章 · Blog Posts
10 项 · 博客文章SourceHut account takeover via build logs (XSS in ansi2html.py)43blog.arusekk.pl原文 ↗
SourceHut 案例中,`ansi2html.py` 未正确转义 ANSI 转 HTML 的日志内容,攻击者可通过开启 CI 的公开邮件列表 patch 或构建输出注入脚本,受害者查看日志时脚本在其会话中执行。后续脚本能代表受害者提交构建任务;事件说明 CI 日志查看器必须当作浏览器渲染面,配套隔离和 CSP,而不是把日志当作纯文本。
August 27 TCRF DDoS Attack Postmortem44blog.xkeeper.net原文 ↗
TCRF 时间线记录 8 月 27 日 22:44(太平洋时间)托管商因针对 tcrf.net 的流量在路由器层封禁 TCP 443,自动响应让站点从被压垮变成完全不可达。复盘把容量规划、上游沟通和恢复步骤放进同一故障链,对小型站点而言,封禁策略本身和攻击流量一样决定可用性。
Using LLMs to trace alchemical knowledge and decode 17th century letters45resobscura.substack.com原文 ↗
作者用 LLM 做跨语言文献追踪,识别 Newton 从法文炼金术文本翻译的拉丁段落,并尝试解读 17 世纪书信密码;Opus 5.5 还协助部分 16 世纪西班牙密信解码。文章反复强调领域专家提供检索方向和语境,否则通用模型容易生成貌似合理的对应,论点因此转向资助历史学等长尾研究,而不是把模型当独立史家。
A Million Agents Is a Distributed System Problem46instacloud.com原文 ↗
文章把规模分成三个层级:一个 agent 是 worker,一千个是组织,一百万个则要求调度、状态、故障隔离、可观测性和成本控制。它把队列、重试、幂等、资源配额与跨 agent 协议重新置于中心,提醒仅靠 agent loop 的自调用能力无法线性外推到大规模生产。
Why is the liver so weirdly regenerative?47dynomight.substack.com原文 ↗
肝脏再生主要依靠成熟肝细胞重新进入增殖周期,也能在条件下于肝细胞和胆管细胞间转分化,而不是依赖固定的胚胎干细胞库。恢复目标是功能性质量和体重比例,并不保证原有形状或微结构完全复原;慢性炎症、毒物和肿瘤会破坏这套补偿性机制。
Tokens too cheap to meter48jyn.dev原文 ↗
文章把模型成本下降解释成从 token 计费转向按任务计价,汇总硬件能效、模型效率和推理软件后估算 2025 - 2026 年同等质量的最佳模型每任务成本约下降 100 倍。窄模型甚至可把固定选项的分类/评分压到近乎零,于是产品变量转为完成工作的总成本、延迟和可靠性;带宽、验证和编排仍不会因 token 便宜而消失。
Why is Hacker News like that?49drewdevault.com原文 ↗
Drew DeVault 将 Hacker News 描述为 YC 旗下链接聚合器,认为排名、旗标和争议降权工具会放大创业资本与右倾政治;文章列出两名正式管理员、自动 flamewar 启发式和少量 karma 用户即可触发隐藏的机制。关于权力结构的结论属于作者立场,较可核对的部分是 moderation 组织归属与工具设计。
Automatically detecting AI text in my browser50seangoedecke.com原文 ↗
Deckard/Deckrd 在浏览器本地分析 Discord、WhatsApp、Messenger、LinkedIn 和 X 私信,以时间、语言、连贯性、风格模仿和 persona 一致性五类信号输出概率,并在超阈值时显示提示。消息不离开浏览器也不保存正文;近期修复要求至少三条入站内容、无法判断方向时跳过,并在单一探测器触发时收缩到“不确定”,所以它是启发式提示器而非作者身份证明。
commit-rewriter 0.251simonwillison.net原文 ↗
commit-rewriter 是本地 Web UI,读取仓库提交和 diff,让用户逐条改写 message 再写回历史;0.2 加入非默认分支支持,仍可用 `uvx commit-rewriter path/to/repo` 启动。它的使用场景是删除 coding-agent 杂讯和私有 issue ID,价值在于把高风险的历史改写限制成可视化、可审查的提交级操作。
datasette 1.0a4152simonwillison.net原文 ↗
Datasette 1.0a41 加入 OpenTelemetry traces/metrics,覆盖 HTTP、数据库查询、启动、SQL 线程等待、写队列和连接数,插件作者可借共享 registry 与 pytest helper 接入观测。所有模态对话框也统一成公开 JavaScript API 的 Web Component,减少插件重复实现 UI;作为 alpha,它更像扩展契约和可观测基础设施更新,而不是终端功能大跳跃。
GitHub 热门 · GitHub Trending
10 项 · GitHub 热门XiaomiMiMo/MiMo-Code53github.com原文 ↗
MiMo-Code 是终端原生编程助手,能读写代码、执行命令、操作 Git,并用 SQLite FTS5、`MEMORY.md`、checkpoint、notes 和 tasks 保留跨会话记忆。它把 build、plan、compose 三类 agent 与自动 checkpoint、上下文重建和预算注入组合起来,还内置 compose、deep-research、fact-check、research-experiment 工作流;桌面 beta 报告同会话缓存命中最高 99%、跨会话 95%,但这属于产品测量而非通用基准。
spotify/portal-ai-plugins54github.com原文 ↗
Spotify 的插件把 Portal CLI 接入 Claude Code、Codex 和 Cursor,提供 setup、doctor、search、service、actions、feedback 等工作流。Agent 可用自然语言查软件目录/文档,生成含 owner、健康状态、事故和文档的 service briefing,再通过 help、dry-run 和确认执行安全动作;`npx @spotify/portal-cli` 负责调用,shunt 插件还能把 I/O 密集任务路由给更便宜的 AiKA 模式。
westpoint-io/mimik55github.com原文 ↗
Mimik 浏览器扩展在本地捕获点击、键盘、剪贴板、拖拽和导航,把每一步配上高亮/缩放截图并生成可回放指南;支持 Chrome、Firefox、Edge 和五种语言,不需要账号、云端或追踪。智能模糊识别邮箱、电话、SSN、银行卡、IP/MAC;可选 AI 只发送 50 - 100 个 DOM token,成本据称比视觉模型低 15 - 30 倍,并能导出视频、PDF、DOCX、HTML、Markdown。API key 保留在本地,但 favicon 和可选 AI/语音文本仍会访问外部服务。
AtomicBot-ai/Atomic-Chat56github.com原文 ↗
Atomic Chat 是面向开源权重的本地桌面应用和推理引擎,Tauri 前端在 `http://localhost:1337/v1` 提供 OpenAI-compatible 服务,默认只监听 loopback且不要求 API key。它支持 Llama、Gemma、Qwen、Mistral、Phi 等模型,多种 llama.cpp/MLX-VLM 引擎及 MCP;MTP 宣称 30 - 70% 吞吐提升(Gemma 4 最高 3 倍),TurboQuant KV cache 约缩小 4.3 倍。云端 provider 可选,项目覆盖 macOS、Windows、Linux、iOS、Android,已有 140+ 贡献者。
strands-agents/harness-sdk57github.com原文 ↗
harness-sdk 是 Strands Agents 的 Python/TypeScript 开源 SDK,不提供托管控制平面,把生命周期、工具、结构化输出、MCP、多 agent、记忆/会话、provider、流式、guardrail、trace 和 eval 放在同一 monorepo。`create_harness()`/`createHarness()` 提供 batteries-included agent,provider 覆盖 Bedrock、Anthropic、OpenAI、Gemini、Ollama;要求 Python 3.10+ 或 Node 22+,Apache 2.0 许可。它的特点是将运行时控制面和模型连接器一并暴露,而不是只给一个循环函数。
harry7557558/spirula-studio58github.com原文 ↗
Spirula Studio 用原生 C++ 把视频/照片处理为 3D Gaussian splat 和纹理网格,不要 Python、PyTorch 或独立 COLMAP。Vulkan 后端跨 NVIDIA、AMD、Intel、Apple,量化训练在 8GB 显存可达 1,000 万 SH3 Gaussians,并支持鱼眼/360 度、SfM、AI masking、深度/法线和网格化;CUDA 后端保留给 NVIDIA。近期编辑渲染、度量尺度和 LoMa 支持让它更接近完整重建工作站。
acsandmann/rift59github.com原文 ↗
Rift 是 Rust 编写的 macOS 平铺窗口管理器,提供 i3/sway、BSP、浮动、master-stack、滚动列和 accordion 布局,可由菜单栏/CLI 保存恢复布局。它不要求关闭 SIP,支持每台显示器独立 Spaces、触控板切换工作区、热加载配置和 Mach port IPC;性能动画依赖逆向的私有 API,因此系统升级后的维护成本是项目设计的一部分。
LibreChat-AI/LibreChat60github.com原文 ↗
LibreChat 把多家云端和本地 provider、MCP、Skills、子 Agent、代码解释器、网页搜索、Artifacts、RAG 与多用户认证组合成可自托管聊天平台。v0.8.8-rc4 README 新增公开 Agents API、按会话隔离的实验性 workspace、Trace Viewer、技能导入回滚和 MCP OAuth 刷新协调;代码解释器在隔离环境支持 Python、Node、Go、C/C++、Java、PHP、Rust、Fortran。它的工程重点已从“统一聊天 UI”扩展到可观察、可管理的 agent 工作台。
Fission-AI/OpenSpec61github.com原文 ↗
OpenSpec 用仓库内 Markdown 工件约束 coding agent:`/opsx:explore` 调查代码,`/opsx:propose` 生成 proposal、requirements、design、tasks,`/opsx:apply` 执行,`/opsx:archive` 回写规格。示例中的 dark mode 变更会先产出四类文件,再逐项完成实现;跨仓库 Stores 允许平台团队维护只读需求,产品团队和 agent 从同一 `openspec/` 事实源读取。它强调 brownfield 的迭代审阅,不要求学习新的规格 DSL。
superdesigndev/treg62github.com原文 ↗
Treg 是“工具版 OpenRouter”,用一个 token 发现和调用 60+ provider 的 3,000+ endpoint,按次从一美分起计费,也能托管团队 API、OAuth、CLI 和技能。代理只转发上游请求并在服务端注入凭据;自有 key 优先,余额不足返回带 `balance_micro`、`estimated_cost_micro` 和 `topup_url` 的 HTTP 402,MCP 还把读写面分开。集中式凭据和审计换来任务导向的工具发现,但组织必须接受代理层成为权限、计费和可用性的新边界。
引用来源 · References
62 条 · 引用- 1 TwinCheck: Evidence-Grounded Negative-Twin Verification for Stateful Tool Agents. arXiv:2609.26911https://arxiv.org/abs/2609.26911 ↩ 回到正文 · back to text
- 2 DRSR: Learning Set-Level Deletion Risk for Efficient Long-Horizon Agents. arXiv:2609.27276https://arxiv.org/abs/2609.27276 ↩ 回到正文 · back to text
- 3 StateComp: Learning When to Compress History in Long Horizon Agents. arXiv:2609.27298https://arxiv.org/abs/2609.27298 ↩ 回到正文 · back to text
- 4 AgentRun: DSL to turn agents into workflowshttps://github.com/Parcha-ai/agentrun ↩ 回到正文 · back to text
- 5 Busbarhttps://github.com/GetBusbar/busbar ↩ 回到正文 · back to text
- 6 Harness as a Language: A Minimalist Agent Framework With Maximal Expressivity. arXiv:2609.26891https://arxiv.org/abs/2609.26891 ↩ 回到正文 · back to text
- 7 Provably Complete Generalized Planning with LLMs. arXiv:2609.27105https://arxiv.org/abs/2609.27105 ↩ 回到正文 · back to text
- 8 CAVEAT: Towards Robust Computer-Use Agents in Incentive-Misaligned Environments. arXiv:2609.27273https://arxiv.org/abs/2609.27273 ↩ 回到正文 · back to text
- 9 EnSIMem: Entity-Structured Indexing for Long-Term Agent Memory. arXiv:2609.27279https://arxiv.org/abs/2609.27279 ↩ 回到正文 · back to text
- 10 Memory Control Signals Emerge Before Action in Long Horizon Agents. arXiv:2609.27286https://arxiv.org/abs/2609.27286 ↩ 回到正文 · back to text
- 11 Learn How to Act from Your Own Interactions: On-Policy Self-Distillation for GUI Agents. arXiv:2609.27307https://arxiv.org/abs/2609.27307 ↩ 回到正文 · back to text
- 12 Stable Geometry with Divergent Task Evidence for Efficient Long-Horizon Agent Compression. arXiv:2609.27332https://arxiv.org/abs/2609.27332 ↩ 回到正文 · back to text
- 13 Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents. arXiv:2609.27334https://arxiv.org/abs/2609.27334 ↩ 回到正文 · back to text
- 14 WhatWorkedBench: Benchmarking Experimental Understanding in AI Agents. arXiv:2609.27490https://arxiv.org/abs/2609.27490 ↩ 回到正文 · back to text
- 15 State-Grounded Conditioning: Wrapping User-Facing LLM Agents Where Direction Depends on Live State. arXiv:2609.27606https://arxiv.org/abs/2609.27606 ↩ 回到正文 · back to text
- 16 PASTABench: Proactive Assessment of Sequential Trajectories for Agent Safety. arXiv:2609.28197https://arxiv.org/abs/2609.28197 ↩ 回到正文 · back to text
- 17 What Makes a Terminal-Bench Task Hard? Separating Genuine Hardness from Fake-Hardness on an Adjudicated Agentic Corpus. arXiv:2609.26826https://arxiv.org/abs/2609.26826 ↩ 回到正文 · back to text
- 18 Public Browser MCPhttps://github.com/Silbercue/public-browser/releases/tag/v3.0.0 ↩ 回到正文 · back to text
- 19 Canaryhttps://www.runcanary.ai/ ↩ 回到正文 · back to text
- 20 Dunarahttps://dunara-studio.com/ ↩ 回到正文 · back to text
- 21 Whiteboardhttps://github.com/devdotfast/whiteboard ↩ 回到正文 · back to text
- 22 Harness.apkhttps://github.com/nev3rfail/harness.apk ↩ 回到正文 · back to text
- 23 Guardmcphttps://github.com/BerkantACUN/guardmcp ↩ 回到正文 · back to text
- 24 ContextDebthttps://github.com/ContextDebt/contextdebt ↩ 回到正文 · back to text
- 25 AgeDBhttps://github.com/sivsivsree/agedb ↩ 回到正文 · back to text
- 26 compactionhttps://github.com/philipppohlmann/compaction ↩ 回到正文 · back to text
- 27 Minienvhttps://github.com/robgonnella/minienv ↩ 回到正文 · back to text
- 28 Lean Agenthttps://github.com/savarin/lean-agent ↩ 回到正文 · back to text
- 29 Batchlanehttps://github.com/gojiplus/batchlane ↩ 回到正文 · back to text
- 30 FluxCasthttps://github.com/IlyaP358/fluxcast ↩ 回到正文 · back to text
- 31 Google’s Project Suncatcher to put ML infrastructure in spacehttps://blog.google/innovation-and-ai/models-and-research/google-research/google-project-suncatcher-facts/ ↩ 回到正文 · back to text
- 32 F-Droid 2.0https://f-droid.org/2026/09/24/f-droid-2.0-a-new-chapter-for-android-freedom.html ↩ 回到正文 · back to text
- 33 Two-tier encryption in the UKhttps://macanorak.com/two-tier-encryption-in-the-uk/ ↩ 回到正文 · back to text
- 34 ArXiv receives multiyear commitments to support it as an independent nonprofithttps://blog.arxiv.org/2026/09/23/arxiv-receives-multiyear-investment/ ↩ 回到正文 · back to text
- 35 VSCode’s SSH Agent Is Bananas (2025)https://fly.io/blog/vscode-ssh-wtf/ ↩ 回到正文 · back to text
- 36 OpenAI agent hacked Australian government website, PM sayshttps://www.bbc.com/news/live/cvgl73pxgndwt ↩ 回到正文 · back to text
- 37 Linux support is coming to Snapdragon X2 serieshttps://www.qualcomm.com/news/onq/2026/09/snapdragon-summit-agentic-ai-pcs-linux ↩ 回到正文 · back to text
- 38 Claude discovers a novel enzyme system with CRISPR-like repeatshttps://www.anthropic.com/news/claude-discovers-novel-enzyme-system ↩ 回到正文 · back to text
- 39 Gemini 3.8 text-to-speechhttps://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/ ↩ 回到正文 · back to text
- 40 We just shipped support for the ugliest part of HTTP: Varyhttps://blog.cloudflare.com/vary-support/ ↩ 回到正文 · back to text
- 41 Combining Machine Learning and Homomorphic Encryption in the Apple Ecosystemhttps://machinelearning.apple.com/research/homomorphic-encryption ↩ 回到正文 · back to text
- 42 ChatGPT Ads expands to Southeast Asia and Taiwanhttps://openai.com/index/chatgpt-ads-expands-southeast-asia-taiwan ↩ 回到正文 · back to text
- 43 SourceHut account takeover via build logs (XSS in ansi2html.py)https://blog.arusekk.pl/posts/srht-account-takeover/ ↩ 回到正文 · back to text
- 44 August 27 TCRF DDoS Attack Postmortemhttps://blog.xkeeper.net/the-cutting-room-floor/tcrf-2026-ddos-postmortem/ ↩ 回到正文 · back to text
- 45 Using LLMs to trace alchemical knowledge and decode 17th century lettershttps://resobscura.substack.com/p/ai-labs-need-to-start-funding-historical ↩ 回到正文 · back to text
- 46 A Million Agents Is a Distributed System Problemhttps://www.instacloud.com/blogs/a-million-agents-is-a-distributed-systems-problem ↩ 回到正文 · back to text
- 47 Why is the liver so weirdly regenerative?https://dynomight.substack.com/p/liver ↩ 回到正文 · back to text
- 48 Tokens too cheap to meterhttps://jyn.dev/tokens-too-cheap-to-meter/ ↩ 回到正文 · back to text
- 49 Why is Hacker News like that?https://drewdevault.com/blog/Why-is-HN-like-that/ ↩ 回到正文 · back to text
- 50 Automatically detecting AI text in my browserhttps://www.seangoedecke.com/deckard/ ↩ 回到正文 · back to text
- 51 commit-rewriter 0.2https://simonwillison.net/2026/Sep/24/commit-rewriter/ ↩ 回到正文 · back to text
- 52 datasette 1.0a41https://simonwillison.net/2026/Sep/24/datasette/ ↩ 回到正文 · back to text
- 53 XiaomiMiMo/MiMo-Codehttps://github.com/XiaomiMiMo/MiMo-Code ↩ 回到正文 · back to text
- 54 spotify/portal-ai-pluginshttps://github.com/spotify/portal-ai-plugins ↩ 回到正文 · back to text
- 55 westpoint-io/mimikhttps://github.com/westpoint-io/mimik ↩ 回到正文 · back to text
- 56 AtomicBot-ai/Atomic-Chathttps://github.com/AtomicBot-ai/Atomic-Chat ↩ 回到正文 · back to text
- 57 strands-agents/harness-sdkhttps://github.com/strands-agents/harness-sdk ↩ 回到正文 · back to text
- 58 harry7557558/spirula-studiohttps://github.com/harry7557558/spirula-studio ↩ 回到正文 · back to text
- 59 acsandmann/rifthttps://github.com/acsandmann/rift ↩ 回到正文 · back to text
- 60 LibreChat-AI/LibreChathttps://github.com/LibreChat-AI/LibreChat ↩ 回到正文 · back to text
- 61 Fission-AI/OpenSpechttps://github.com/Fission-AI/OpenSpec ↩ 回到正文 · back to text
- 62 superdesigndev/treghttps://github.com/superdesigndev/treg ↩ 回到正文 · back to text