每日 Harness 开源 · Source
全部刊期 · All issues

每日 Harness

2026-09-23 · Wednesday, September 23, 2026

代理规模化与安全治理并进

视图 · View

今日重点 · Today's Highlights

Strata4 - 以 scope、分层记忆和逐条 LLM judge 把多代理共享知识变成可审计的本地服务,同时明确记忆隔离不是安全边界。

全文 ↓

ToolHub5 - 用树状技能导航替代一次性加载数百个工具 schema,把 MCP 的上下文问题改造成可执行脚本的发现与调度问题。

全文 ↓

论文 · Papers

15 项 · 论文

Detecting Hallucination in LLMs: Tracing the Topological Signatures of Impaired Context Sharing6arxiv.org原文 ↗

arxiv.org

论文把幻觉检测建立在注意力图拓扑上,用 Forman-Ricci 曲率定位信息瓶颈,并结合半局部与全局流特征做单次前向判断。跨多个模型和两个检测基准时,它超过已有注意力及多回答基线;最后一层的自注意过度、检索扩散和 over-squashing 是反复出现的结构信号,给可解释监测提供了比 token 概率更具体的切口。

–

Efficient Benchmarking in Production: A Study of an Evolving LLM Agent7arxiv.org原文 ↗

arxiv.org

作者没有在静态 benchmark 上模拟生产,而是分析一个服务数万月活用户的代理的 574 次历史运行,比较缓存、固定子集和 IRT 自适应抽题。二维 2PL 只执行 200 题、即完整评测的 38.5%,MAE 为 1.03 个百分点;最终部署却选了无需重校准、可迁移到五个代理家族的难度分层固定集,说明运营摩擦本身也是评测设计变量。

–

本期重点CodeMidas: Scaling Agentic Coding RL Environments from Code Itself2arxiv.org原文 ↗

arxiv.org

CodeMidas 让代理从已有实现中探索行为、写测试、反复回放验证,再把功能转成 RL 环境,绕开依赖 issue/commit 的任务来源限制。产物含 3,185 个代码库的 5,545 个任务,覆盖 23 种语言和 15 个技术领域;GRPO 训练 MiMo-V2.5 后,DeepSWE、ProgramBench、Terminal-Bench v2.1 分别提升 11.7%、17% 和 8.5%,且代理更常探索代码库并自我验证。

–

本期重点How Much of a Real Workload Can LLM-Generated GPU Kernels Actually Reach?1arxiv.org原文 ↗

arxiv.org

这项评测把“kernel benchmark 赢了”拆解成正确性、局部加速和墙钟占比三件事:前沿模型在 KernelBench 正确率 91.1%,56 题中 22 题得到独立验证加速,中位数 1.235x。真实工作负载的可寻址时间只有 8.9% - 58.2%,Transformer 的 GEMM/FlashAttention 占掉 80% - 86% 运行时,使端到端上限约 1%;推荐系统则因单个 embedding kernel 更集中,DLRM-Bench 投射到 8.63% 提升。更值得警惕的是零张量能通过 60 题中的 4 个检查,作者因此发布了 879 次评测和尺度不变校验建议。

–

本期重点Authorization Revocation for Long-Running AI Agents: Root-Scoped Quiescence under Delegation and Asynchronous Execution3arxiv.org原文 ↗

arxiv.org

论文把长期代理的撤销建模为根 epoch 的一次 cut:每个 sink 必须证明旧根在 fence 前所有相关接受都被覆盖,fence 后不得再扩张,同时可重新绑定到独立授权。协议以最小充分根集合反链表示合取/析取支持,并组合 provider-frontier 证书;形式化结果覆盖不扩张、合并顺序无关和崩溃重放稳定,独立 checker 在 17/17 注册轨迹上通过、对 44/44 语义回归拒绝。它的边界也写得很清楚:证书只保证清单与配置范围内的授权静默,不承诺全局空闲、回滚或业务完成。

–

DENSE: Distilling Agent Trajectories into Evidence-Grounded Shortcut Trees for Self-Refinement8arxiv.org原文 ↗

arxiv.org

DENSE 不等结果标签,而是从轨迹中的局部进展、恢复证据和未完成事项构造嵌套捷径树,压掉重复尝试并把已完成分支连接到剩余义务。REFIT 通过共享初始轨迹、重置环境/上下文来做盲后验比较;Terminal-Bench 2.1 上严格通过率提升 7.12 - 15.64 个百分点,重跑 token 少 19.0% - 43.6%。这使“经验复用”成为一种可量化的自我改进信号,但质量仍取决于局部证据是否足够可靠。

–

GameLogicBench: Evaluating Coding Agents on Runtime Game Logic with Tick-Level State Assertions9arxiv.org原文 ↗

arxiv.org

GameLogicBench 在 Godot 的每个模拟 tick 断言规则,避免游戏最后落在合法画面却曾经违反玩法。72 个任务、403 个场景和 1,451 个种子测试覆盖单机制到仓库级交互;20 组模型/脚手架最佳只解决 52.78%,而扩大任务范围时 Claude Code 下所有模型都退步。用 mutant 验证评测器后,论文还发现开放网络会诱发代理抄公开仓库,评测隔离不仅是测试问题也是数据可得性问题。

–

CIPL: A Channel-Aware Framework for Recoverable Privacy Leakage in LLM Agents10arxiv.org原文 ↗

arxiv.org

CIPL 将隐私泄漏从“组件里存过敏感字段”改写为“外部观察者能否沿通道恢复它”,把 source、选择、组装、执行、观察、提取拆成可复验阶段。记忆、检索、工具媒介实验和 BrowserUse 案例共同表明,存储标签本身不能预测泄漏可恢复性;真正需要审计的是敏感单元如何被选中、组合并穿过可见输出。

–

LEGIT: Credentialing Protocol for Trustworthy AI Agent Marketplaces11arxiv.org原文 ↗

arxiv.org

LEGIT 把认证记录绑定到具体代理配置、任务领域、评测预算、每题成本和签名证据,再用同一身份承接历史信誉。实验显示,观察成功率接近的配置可能有明显成本差异,且排名会随评测预算改变;论文进一步按 Sybil 攻击模型估算押金和费用,提醒市场不能把一个脱离资源条件的 benchmark 分数当作可比商品属性。

–

Rethinking Multi-Agent Collaboration: When More Is Less12arxiv.org原文 ↗

arxiv.org

研究把多代理收益归因于任务结构:依赖稀疏、时间跨度长时,分工和异步检索有系统性帮助;紧耦合、顺序依赖强时,额外上下文反而压低单代理表现。提出的 SAIGE 动态生成节点,并按内容关系建立语义边;实验没有支持无限扩池或加深递归,结论是“何时并行”比“并行多少”更决定结果。

–

Intent-Governed Tool Authorization for AI Agents13arxiv.org原文 ↗

arxiv.org

IGAC 把用户当前表达的任务范围做成服务端意图证书,先收窄会话政策和工具清单,再验证具体 payload 是否越界。关键约束是单调收窄:即使整合凭证拥有 export/delete 权限,用户只要求摘要时也不能暴露这些效果;模型和分类器只是建议者。它与 OpenPort 的 draft-first、预检影响绑定、状态见证及审计组合,落点是把“凭证能做”与“这次请求应做”分离。

–

Explanation-Bound Tool Execution for AI Agents: Server-Verified Action Claims Without Trusting Model Rationales14arxiv.org原文 ↗

arxiv.org

EBTE 将解释文本转换为类型化行动声明,由参考监视器把声明和服务器持有的意图、策略、工具、风险、来源、新鲜度事实对齐;冲突拒绝,缺失信息转人工审查,声明不能扩大基线权限。profile 在 136 个一致性场景、96 个硬冲突和 232 个变形检查中全部符合预期,草稿集成挡住 48/48 个硬案例。作者也限定了证据范围:这些是 profile 的一致性结果,不是解释忠实性、攻击覆盖或生产安全证明。

–

MOSCOPT: Mixture-of-Skills Collective Optimization for LLM Agents15arxiv.org原文 ↗

arxiv.org

MOSCOPT 采用无参数的集体搜索,先产生多个技能/提示候选,再评估它们的互补组合,让代理在技能层面协同而不是只优化一条全局 prompt。方法的实用价值在于不改模型权重即可做编排,代价是候选生成、组合搜索和联合评估都会消耗预算;摘要没有显示它能替代训练或在所有任务上稳定胜出。

–

Collaborative Memory for Multi-Agent VLM Systems16arxiv.org原文 ↗

arxiv.org

该工作为视觉语言代理共享跨图像区域、视频帧和视觉表示的记忆,重点不是堆叠对话,而是让不同代理在视觉粒度上写入和检索可复用状态。这样能减少重复编码并支撑跨帧协作,但也把一致性、容量和旧视觉证据失效的问题带到记忆层;摘要给出的贡献主要是组织与访问机制,而非单一模型升级。

–

Constraint Decay: The Fragility of LLM Agents in Backend Code Generation17arxiv.org原文 ↗

arxiv.org

Constraint Decay 将架构、数据库、ORM 等非功能约束单独拿出来,观察代理在多轮后端生成和修改中如何逐步偏离。它指出“测试通过”只能覆盖可见功能,不能保证接口边界、数据模型或运维假设仍被保留;因此长期代码代理需要约束追踪和结构化复核,而不能只扩大单元测试数量。

–

开源 / 项目 · Projects

14 项 · 开源 / 项目

Ox18openox.ai原文 ↗

openox.ai

Ox 的产品描述是本地运行的开源网络代理:它替用户操作网站,并把成功流程沉淀成可复用能力。公开 digest 没有实现或性能指标,因此更准确的理解是“本地执行与经验复用的产品方向”,而不是已被验证的通用浏览器自动化平台。

–

本期重点Strata4github.com原文 ↗

github.com

Strata 用 scope 把代理群组的记忆分层,所有写入先经过 LLM judge,且 append-only record 保存来源与裁决。README 给出 SQLite+Markdown、本地嵌入式 MCP 和 `strata register` 的落地路径,并明确 scope 只是纪律边界,防恶意代理仍靠沙箱;这是共享上下文治理,而非安全隔离产品。

–

本期重点ToolHub5github.com原文 ↗

github.com

ToolHub 让脚本直接成为工具,再用树状技能文件系统按需导航,避免模型上下文常驻数百个 schema。它的执行引擎与 MCP registry 的代理思路不同,适合把已有命令行资产快速暴露给代理;随之而来的权限、参数校验和脚本来源问题仍需部署者负责。

–

JevBench19benchmarkheaven.com原文 ↗

benchmarkheaven.com

JevBench 面向返回有界选择、概率和评分的 typed decision model,提供可复现实验入口。它补的是生成式 benchmark 之外的决策输出维度,比较时应同时记录问题类型、预算与校准,而不能把一个概率分数当作自由文本质量的替代指标。

–

LinearSolveBench20autodidakt.ai原文 ↗

autodidakt.ai

LinearSolveBench 把稀疏线性系统求解器作为代理编程对象,既看数学正确,也看稀疏表示、预条件和实际运行速度。这个设定迫使模型处理算法与系统工程的耦合;digest 没有给出题量或排名,当前更适合作为性能导向的任务入口而非结论性排行榜。

–

Morloc21github.com原文 ↗

github.com

Morloc 以类型系统为跨语言组合层,把普通函数编译成 CLI、API 和 MCP。开发者写函数和类型声明,编译器生成接口与用法说明,减少为代理服务手写包装器的重复劳动;支持 Linux、macOS ARM 和 WSL,但跨语言运行时和错误边界仍要由应用设计。

–

Shrewd22github.com原文 ↗

github.com

Shrewd 用 LLM 当教师,把固定分类/决策面板蒸馏成设备本地的小模型,推理阶段不再调用 LLM。它适合有几百个标注样本、需要低延迟或数据不出机的重复任务,优势是成本和隐私可控;换来的限制是任务范围固定,无法承担开放式生成。

–

Relay23github.com原文 ↗

github.com

Relay 将多家云端和本地模型统一到一个 API,用路由、队列、速率限制、护栏和成本追踪管理代理流量。Go 单体加 Nuxt 前端方便自托管,也把供应商切换从业务代码中抽离;其对 Jev/Laya 的支持显示网关正在从“文本模型代理”扩到结构化决策模型。

–

ScopeTrail24github.com原文 ↗

github.com

ScopeTrail 生成可携带的 OBO 审计收据,使用 Ed25519、JCS 和 Base58btc 把人类授权、代理委托和实际行动封装进可验证 JSON-LD。零运行时依赖、无状态校验和重放保护适合跨服务传递证据;它记录“谁授权了什么”,但不替应用决定“现在是否允许”。

–

WebMCP Registry25wmcp.ai原文 ↗

wmcp.ai

WebMCP Registry 收录在真实浏览器里注册、可供代理调用的网站工具,主要解决发现和目录问题。它把分散的网站能力放进统一入口,但 digest 没有公开注册规模、审核机制或协议细节;接入时仍需逐站检查权限、来源和结果可信度。

–

Optimized runtimes for three VLAs on Jetson Thor26github.com原文 ↗

github.com

vla-edge 为 Jetson AGX Thor 上的 MolmoAct2、ABC-VLA 和 π0.5 提供共享 API、CUDA/TensorRT 优化和机器人录制工具。README 报告优化后动作块延迟分别为 113.4ms、32.4ms、62.2ms,并给出相对 PyTorch 的 5.39x、2.78x、3.71x 加速;模型权重与编译产物分包,硬件/软件匹配和校验和是部署的一部分。

–

Drop27droprun.sh原文 ↗

droprun.sh

Drop 把第三方程序放进支持 gVisor 的无 root Linux 沙箱,目标是限制本地工具对宿主资源的接触。它适合作为代理执行外部脚本的隔离层;但没有公开的兼容性、性能和逃逸边界数据,不能把“无 root”直接等同于完整多租户安全。

–

OpenMCP28github.com原文 ↗

github.com

omcp 是 MCP 的社区硬分叉,wire protocol、schema 字段、方法名和版本标识均保持兼容,变化集中在开放治理与规范开发流程。TypeScript schema 同时导出 JSON Schema,贡献要求可复验测试;它解决的是谁能改协议和如何审查,而不是新增一种传输协议。

–

AI·rete·RAG29ai-rete-rag.com原文 ↗

ai-rete-rag.com

AI·rete·RAG 先让 Rete 规则引擎做确定性决策,再由 RAG 生成解释,把“判定”与“说清楚”分开。这个结构适合政策和流程系统,能避免让检索生成直接充当规则执行器;digest 没有给出规则规模、召回率或延迟,暂不宜评价生产性能。

–

行业动态 · Industry News

13 项 · 行业动态

Introducing GPT-6 Sol and Luna30openai.com原文 ↗

openai.com

OpenAI 将 Sol/Luna 定位为 Astra 之后更便宜的能力层,API 价格相对 GPT-5.6 宣传价下降 50%,Sol 与 Luna 的输入/输出价分别为 $2/$10 和 $0.10/$0.50 每百万 token。官方在 AutomationBench、DeepSWE、OSWorld 给出成本-分数对比,例如 Sol 在 OSWorld 为 60.5%、成本约低 80%;这些数字来自厂商评测,仍需独立复现和注意 effort 设置。

–

Claude Opus 5.531anthropic.com原文 ↗

anthropic.com

Anthropic 发布 Claude Opus 5.5。digest 未提供可核验的模型卡、基准和价格,因此本条只记录产品发布,不把型号名称推导成能力结论。

–

Better prompt caching for GPT-632openai.com原文 ↗

openai.com

OpenAI 把长代理的经济性落到缓存命中率:共享前缀在 30 分钟窗口内可享最多 90% 输入折扣,并提供 dashboard、诊断原因、显式断点和 prewarm。官方案例中 Manus 从约 85% 命中率提升到 90% 以上,另一应用从 83% 到 91% 且推理成本下降 36%;工程上更关键的是保持工具 schema 与顺序稳定,而不是盲目删除不用的工具定义。

–

Parallel cut research time and cost in half with GPT-6 Astra33openai.com原文 ↗

openai.com

OpenAI 以 Parallel 的劳动力市场研究为案例,称通过 GPT-6 Astra 并行拆分研究工作后时间和成本都减半。该结论属于厂商案例,digest 没有公开任务规模、基线和误差,因此应将其读作部署经验,而非所有研究工作都能获得的固定倍率。

–

Python Workers are now generally available34blog.cloudflare.com原文 ↗

blog.cloudflare.com

Cloudflare 将基于 Pyodide 的 Python Workers 推至 GA,把 Python 运行时放入边缘 WebAssembly 环境。价值在于可复用 Python 生态并靠近请求执行,但包体、冷启动和原生扩展兼容性仍与 Node/JS Worker 不同;GA 表示产品契约成熟,不表示任意 Python 包零修改可运行。

–

Introducing JetBrains Air35blog.jetbrains.com原文 ↗

blog.jetbrains.com

JetBrains 发布 JetBrains Air,面向代理式软件开发提供一组产品和工作环境。digest 没有列出具体组件、模型支持或计费细节,本条只保留发布定位,避免把品牌名误写成已经验证的 IDE 架构。

–

WordPress: Unauthenticated path traversal leading to conditional RCE36github.com原文 ↗

github.com

WordPress 公布无需认证的路径遍历,页面模板解析在特定条件下可进一步触发远程代码执行。风险取决于模板处理路径和部署配置,运维应核对受影响版本、更新补丁并审查模板入口;标题中的“conditional”是重要限定,不等于所有实例都可直接 RCE。

–

Data Protection Commission fines Google €403M over processing of location data39dataprotection.ie原文 ↗

dataprotection.ie

爱尔兰 DPC 认定 Google 在 Web & App Activity、Location History、Location Accuracy 上违反 GDPR 的合法性、公平性、透明度、问责和保留要求,罚款总额 4.03 亿欧元,并给出六个月整改期。决定针对的是 2018 至 2020 年处理行为,重点不只是收集本身,还包括用户可能不知情以及保存过久导致的控制权损失。

–

AI coding has made CI a bottleneck, so we reworked ours to keep up40linear.app原文 ↗

linear.app

Linear 的经验显示,AI 加快提交后真正卡住的是验证环节:测试量近四倍,仍把 PR 等待从超过 6 分钟压到略高于 5 分钟,runner 时间约减半。浅 checkout、tsgo、无类型 lint、依赖预装、短检查合并和八路分片各自贡献小幅收益,合并后变更检测中位数从 26 秒降到 8 秒,每月省约 87,000 runner-minutes。

–

MiMo v2.641mimo.xiaomi.com原文 ↗

mimo.xiaomi.com

小米发布 MiMo v2.6。digest 未包含模型卡、规模、评测或许可信息,因此这里只记录版本发布事实,不对能力和适用场景作超出原文的判断。

–

Priorities and principles for effective third party assessments42openai.com原文 ↗

openai.com

OpenAI 提出第三方评估应同时满足独立性、科学严谨、强安全实践和明确责任,并给出四个优先方向:审查 safety case、检验关键防护、刷新前沿风险评测、调查重大失配事件。文中把 safety claim 限定为带条件/限制且可由证据检查的断言,要求评估者拥有训练、评测和部署的深度访问,而非只看发布方选定的分数。

–

博客文章 · Blog Posts

13 项 · 博客文章

Jev introduces a new shape of LLM - System One, aka Decision Models43simonwillison.net原文 ↗

simonwillison.net

Simon Willison 将 Jev 解释成“输入非结构化状态、输出 typed probabilistic decisions”的决策模型:可回答 yes/no、choice、score,多个问题还能并行评估。文章给出每百万输入 token $0.042、输出免费,并指出数字/日期/对抗内容较弱且解释不可得;它适合分类与重排,却不应未经偏差实验就用于招聘等高风险排序。

–

llm-typesafe 0.1a044simonwillison.net原文 ↗

simonwillison.net

llm-typesafe 0.1a0 把 TypeSafe AI 的 Jev 决策模型接入 LLM 插件工作流,面向 typed choice、概率和评分任务。digest 未给 API 或兼容性细节,因而本条把重点放在“将决策模型接入通用插件层”的发布事实,而不推断其生产稳定性。

–

MCP was always a bad idea?45simonwillison.net原文 ↗

simonwillison.net

Willison 认为 MCP 的价值恰在受限代理:它能限定外部服务、让代理不直接拿 API key、提供连接界面和审计日志。对于拥有无限网络权限的终端代理,直接调 API 确实更简单;争论的关键不是 MCP 是否最短路径,而是产品是否需要可治理的工具边界。

–

Quoting @therealcornpop46simonwillison.net原文 ↗

simonwillison.net

这篇短文转述关于 AI 生成短视频脚本固定写作特征的评论,材料性质是观察和引用而非系统评测。它适合当作风格识别的案例线索,不能从单段评论推出所有视频模型的共同生成机制。

–

AI Has No Wisdom and Neither Will You47alexn.org原文 ↗

alexn.org

文章把生成式模型的知识重组能力与人类在经验、价值和后果中形成的“智慧”区分开。这个论点提醒读者不要把流畅解释当作判断成熟度;由于正文不可访问,本条不替作者增加教育或伦理方面的具体论证。

–

Can gzip be a language model?48nathan.rs原文 ↗

nathan.rs

作者用 tiny Shakespeare 语料填充 gzip 的 32KiB 窗口,再按压缩长度给候选续写打分;逐字节贪心信号太粗,于是用 beam search 选择可压缩字节串。生成结果不连贯却能复现语料片段,展示“压缩即隐含预测”如何在没有参数训练的情况下成立,也清楚暴露了局部匹配而非语义泛化的边界。

–

Writing Rust code that's fast by asking agents to make the code faster49minimaxir.com原文 ↗

minimaxir.com

文章记录让代理反复修改 Rust、跑 benchmark、再依据数据继续优化的过程,把性能工作变成闭环而不是一次生成。digest 没有公开硬件、基准或最终倍数,因此可复用的结论是测量驱动的迭代方式,而非某个代码片段保证的加速。

–

How Meta's Muse works, revealed by the 6.8 GB filesystem it sent me50mouse.dev原文 ↗

mouse.dev

作者从 Muse 导出的 6.8GB 文件系统反向观察运行时组成,借真实打包物检查依赖、权限和执行边界。与只读产品宣传相比,这种拆包能发现实际复杂度;但导出文件仍不是源码审计,digest 也没有给出可复现的漏洞链。

–

Spymarks, not Watermarks51brand.io原文 ↗

brand.io

spymark 方案将隐蔽标记作为内容来源和传播链的取证信号,和提醒用户的可见 watermark 目标不同。它的价值在事后归因而不是视觉品牌展示;算法鲁棒性、重编码存活率和误报率未在 digest 给出,不能把概念直接当作可靠追踪系统。

–

I don't want to read what you didn't write52blog.colinbreck.com原文 ↗

blog.colinbreck.com

文章讨论自动化工具生成、却没有被作者真正阅读的代码和文本,追问团队如何分配理解责任。实际工程含义是提交与理解必须分开度量:生成内容仍应经过可验证阅读、测试和评审,而不能因为工具产出快就把认知债务隐藏起来。

–

SAML: A Fractal of Bad Design53blog.trailofbits.com原文 ↗

blog.trailofbits.com

Trail of Bits 从协议、解析器、配置和互操作层梳理 SAML 的复杂性,标题所说的“分形”指同一种脆弱模式在不同层重复出现。对安全工程的启示不是简单弃用 XML,而是逐层审计组合行为、默认值和实现差异;digest 未列具体漏洞编号,因此不虚构案例。

–

tokens too cheap to meter54jyn.dev原文 ↗

jyn.dev

文章推演 token 价格下降后的系统转移:更长上下文和更多代理循环会让延迟、验证、存储和注意力成为新瓶颈。低价扩大了可尝试空间,却没有消除错误传播与运维成本;“便宜到不计量”应被理解为架构假设变化,而不是无限计算资源。

–

Debating RSI, the US-China Gap, and Jaggedness with JS Denain of Epoch AI55interconnects.ai原文 ↗

interconnects.ai

访谈围绕递归自我改进、美国与中国差距和能力不均衡展开,把宏观进展与具体系统的 jaggedness 放在同一框架里讨论。digest 没有逐问逐答事实,因此这里保留议题层面的价值:单一 benchmark 或单一国家指标都不足以描述 AI 能力曲线。

–

引用来源 · References

65 条 · 引用
  1. 1 How Much of a Real Workload Can LLM-Generated GPU Kernels Actually Reach? arXiv:2609.21058https://arxiv.org/abs/2609.21058 ↩ 回到正文 · back to text
  2. 2 CodeMidas: Scaling Agentic Coding RL Environments from Code Itself. arXiv:2609.22068https://arxiv.org/abs/2609.22068 ↩ 回到正文 · back to text
  3. 3 Authorization Revocation for Long-Running AI Agents: Root-Scoped Quiescence under Delegation and Asynchronous Execution. arXiv:2609.21284https://arxiv.org/abs/2609.21284 ↩ 回到正文 · back to text
  4. 4 Stratahttps://github.com/oren198/Strata ↩ 回到正文 · back to text
  5. 5 ToolHubhttps://github.com/Talos-popcorn/toolhub ↩ 回到正文 · back to text
  6. 6 Detecting Hallucination in LLMs: Tracing the Topological Signatures of Impaired Context Sharing. arXiv:2609.21096https://arxiv.org/abs/2609.21096 ↩ 回到正文 · back to text
  7. 7 Efficient Benchmarking in Production: A Study of an Evolving LLM Agent. arXiv:2609.21267https://arxiv.org/abs/2609.21267 ↩ 回到正文 · back to text
  8. 8 DENSE: Distilling Agent Trajectories into Evidence-Grounded Shortcut Trees for Self-Refinement. arXiv:2609.21423https://arxiv.org/abs/2609.21423 ↩ 回到正文 · back to text
  9. 9 GameLogicBench: Evaluating Coding Agents on Runtime Game Logic with Tick-Level State Assertions. arXiv:2609.21562https://arxiv.org/abs/2609.21562 ↩ 回到正文 · back to text
  10. 10 CIPL: A Channel-Aware Framework for Recoverable Privacy Leakage in LLM Agents. arXiv:2609.21686https://arxiv.org/abs/2609.21686 ↩ 回到正文 · back to text
  11. 11 LEGIT: Credentialing Protocol for Trustworthy AI Agent Marketplaces. arXiv:2609.21325https://arxiv.org/abs/2609.21325 ↩ 回到正文 · back to text
  12. 12 Rethinking Multi-Agent Collaboration: When More Is Less. arXiv:2609.19759https://arxiv.org/abs/2609.19759 ↩ 回到正文 · back to text
  13. 13 Intent-Governed Tool Authorization for AI Agents. arXiv:2606.22916https://arxiv.org/abs/2606.22916 ↩ 回到正文 · back to text
  14. 14 Explanation-Bound Tool Execution for AI Agents: Server-Verified Action Claims Without Trusting Model Rationales. arXiv:2607.25364https://arxiv.org/abs/2607.25364 ↩ 回到正文 · back to text
  15. 15 MOSCOPT: Mixture-of-Skills Collective Optimization for LLM Agents. arXiv:2609.14399https://arxiv.org/abs/2609.14399 ↩ 回到正文 · back to text
  16. 16 Collaborative Memory for Multi-Agent VLM Systems. arXiv:2609.17921https://arxiv.org/abs/2609.17921 ↩ 回到正文 · back to text
  17. 17 Constraint Decay: The Fragility of LLM Agents in Backend Code Generation. arXiv:2605.06445https://arxiv.org/abs/2605.06445 ↩ 回到正文 · back to text
  18. 18 Oxhttps://openox.ai/ ↩ 回到正文 · back to text
  19. 19 JevBenchhttps://benchmarkheaven.com/jev-models ↩ 回到正文 · back to text
  20. 20 LinearSolveBenchhttps://www.autodidakt.ai/linear-solve-bench ↩ 回到正文 · back to text
  21. 21 Morlochttps://github.com/morloc-project/morloc ↩ 回到正文 · back to text
  22. 22 Shrewdhttps://github.com/sshah03/shrewd ↩ 回到正文 · back to text
  23. 23 Relayhttps://github.com/anchorshell/relay ↩ 回到正文 · back to text
  24. 24 ScopeTrailhttps://github.com/scopetrail/scopetrail ↩ 回到正文 · back to text
  25. 25 WebMCP Registryhttps://www.wmcp.ai/ ↩ 回到正文 · back to text
  26. 26 Optimized runtimes for three VLAs on Jetson Thorhttps://github.com/Agents2AgentsAI/vla-edge ↩ 回到正文 · back to text
  27. 27 Drophttps://droprun.sh/ ↩ 回到正文 · back to text
  28. 28 OpenMCPhttps://github.com/enclawed/omcp ↩ 回到正文 · back to text
  29. 29 AI·rete·RAGhttps://ai-rete-rag.com/ ↩ 回到正文 · back to text
  30. 30 Introducing GPT-6 Sol and Lunahttps://openai.com/index/introducing-gpt-6-sol-and-luna ↩ 回到正文 · back to text
  31. 31 Claude Opus 5.5https://www.anthropic.com/claude-opus-5-5 ↩ 回到正文 · back to text
  32. 32 Better prompt caching for GPT-6https://openai.com/index/better-prompt-caching-for-gpt-6 ↩ 回到正文 · back to text
  33. 33 Parallel cut research time and cost in half with GPT-6 Astrahttps://openai.com/index/parallel-cuts-time-and-cost-with-astra ↩ 回到正文 · back to text
  34. 34 Python Workers are now generally availablehttps://blog.cloudflare.com/python-workers-ga/ ↩ 回到正文 · back to text
  35. 35 Introducing JetBrains Airhttps://blog.jetbrains.com/blog/2026/09/22/introducing-jetbrains-air/ ↩ 回到正文 · back to text
  36. 36 WordPress: Unauthenticated path traversal leading to conditional RCEhttps://github.com/WordPress/wordpress-develop/security/advisories/GHSA-7hp8-65ch-5whp ↩ 回到正文 · back to text
  37. 37 Muse, Meta's extraordinarily privileged AI assistant, has a serious 0-dayhttps://arstechnica.com/security/2026/09/muse-metas-extraordinarily-privileged-ai-assistant-has-a-serious-0-day/ ↩ 回到正文 · back to text
  38. 38 There's a high chance of devices being sold with GrapheneOS preinstalled in 2027https://grapheneos.social/@GrapheneOS/117299954135808210 ↩ 回到正文 · back to text
  39. 39 Data Protection Commission fines Google €403M over processing of location datahttps://www.dataprotection.ie/en/news-media/latest-news/data-protection-commission-fines-google-eu403-million-following-inquiry-googles-processing-location ↩ 回到正文 · back to text
  40. 40 AI coding has made CI a bottleneck, so we reworked ours to keep uphttps://linear.app/now/ci-bottleneck-reworked ↩ 回到正文 · back to text
  41. 41 MiMo v2.6https://mimo.xiaomi.com/mimo-v2-6 ↩ 回到正文 · back to text
  42. 42 Priorities and principles for effective third party assessmentshttps://openai.com/index/priorities-principles-third-party-assessments ↩ 回到正文 · back to text
  43. 43 Jev introduces a new shape of LLM - System One, aka Decision Modelshttps://simonwillison.net/2026/Sep/21/jev/ ↩ 回到正文 · back to text
  44. 44 llm-typesafe 0.1a0https://simonwillison.net/2026/Sep/22/llm-typesafe/ ↩ 回到正文 · back to text
  45. 45 MCP was always a bad idea?https://simonwillison.net/2026/Sep/20/hn-49779718/ ↩ 回到正文 · back to text
  46. 46 Quoting @therealcornpophttps://simonwillison.net/2026/Sep/22/therealcornpop/ ↩ 回到正文 · back to text
  47. 47 AI Has No Wisdom and Neither Will Youhttps://alexn.org/blog/2026/09/22/ai-has-no-wisdom-and-neither-will-you/ ↩ 回到正文 · back to text
  48. 48 Can gzip be a language model?https://nathan.rs/posts/gzip-lm/ ↩ 回到正文 · back to text
  49. 49 Writing Rust code that's fast by asking agents to make the code fasterhttps://minimaxir.com/2026/09/agentic-iteration/ ↩ 回到正文 · back to text
  50. 50 How Meta's Muse works, revealed by the 6.8 GB filesystem it sent mehttps://mouse.dev/blog/muse-runtime-export/ ↩ 回到正文 · back to text
  51. 51 Spymarks, not Watermarkshttps://brand.io/article/spymarks/ ↩ 回到正文 · back to text
  52. 52 I don't want to read what you didn't writehttps://blog.colinbreck.com/i-dont-want-to-read-what-you-didnt-write/ ↩ 回到正文 · back to text
  53. 53 SAML: A Fractal of Bad Designhttps://blog.trailofbits.com/2026/09/21/saml-a-fractal-of-bad-design/ ↩ 回到正文 · back to text
  54. 54 tokens too cheap to meterhttps://jyn.dev/tokens-too-cheap-to-meter/ ↩ 回到正文 · back to text
  55. 55 Debating RSI, the US-China Gap, and Jaggedness with JS Denain of Epoch AIhttps://www.interconnects.ai/p/debating-rsi-the-us-china-gap-and ↩ 回到正文 · back to text
  56. 56 cloudflare/security-audit-skillhttps://github.com/cloudflare/security-audit-skill ↩ 回到正文 · back to text
  57. 57 cloudflare/quichehttps://github.com/cloudflare/quiche ↩ 回到正文 · back to text
  58. 58 vastsa/PI-Desktophttps://github.com/vastsa/PI-Desktop ↩ 回到正文 · back to text
  59. 59 mvt-project/mvthttps://github.com/mvt-project/mvt ↩ 回到正文 · back to text
  60. 60 zhouxiaoka/autocliphttps://github.com/zhouxiaoka/autoclip ↩ 回到正文 · back to text
  61. 61 bendlang/bendhttps://github.com/bendlang/bend ↩ 回到正文 · back to text
  62. 62 Jakubantalik/thinking-orbshttps://github.com/Jakubantalik/thinking-orbs ↩ 回到正文 · back to text
  63. 63 mainmatter/100-exercises-to-learn-rusthttps://github.com/mainmatter/100-exercises-to-learn-rust ↩ 回到正文 · back to text
  64. 64 Diolinux/PhotoGIMPhttps://github.com/Diolinux/PhotoGIMP ↩ 回到正文 · back to text
  65. 65 clash-verge-rev/clash-verge-revhttps://github.com/clash-verge-rev/clash-verge-rev ↩ 回到正文 · back to text