每日 Harness 开源 · Source
全部刊期 · All issues

每日 Harness

2026-08-21 · Friday, August 21, 2026

智能提速迈入可信工程

视图 · View

今日重点 · Today's Highlights

DiffusionGemma Technical Report1 - 用离散扩散把 256-token 块并行精炼,单张 H100 约 1,500 tokens/s;它在保留思考、多模态和长上下文的同时还能退回自回归解码,展示了混合解码路线的可行性。

全文 ↓

A Jagged Frontier2 - 用控制流改写、死代码注入和重命名制造语义等价仓库,实测 16 个模型/脚手架/数据集配置中最多掉 6.7 个百分点;“鲁棒性”会随脚手架翻转,提醒评测不能只看原始仓库分数。

全文 ↓

SkillGate3 - 将技能名称 token 与执行 token 分开记分,直接修复长轨迹中的 selector credit starvation;在 16 候选技能设置下,9B 策略成功率由 40.8% 升到 53.2%,且读取更少技能。

全文 ↓

Kandelo4 - 把多进程与 POSIX 用户态带进浏览器/Node.js 的 WebAssembly 内核,关注的是运行时边界而非单一应用;这条路线让传统 Unix 软件具备可移植的网页执行形态。

全文 ↓

turbovec5 - Rust 向量索引借 TurboQuant 将 1,000 万文档的内存示例从 31 GB 压到 4 GB,并用 SIMD 搜索;在线摄入和增量保存使它更像可持续更新的检索引擎,而不只是一次性 ANN 基准。

全文 ↓

论文 · Papers

15 项 · 论文

本期重点DiffusionGemma Technical Report1arxiv.org原文 ↗

arxiv.org

论文不是从零训练扩散模型,而是在 Gemma 4 MoE(3.8B 激活、25.2B 总参数)上用不到 10% 的原始训练 token 做两阶段微调:先学双向去噪,再用 RL 与采样器蒸馏兼顾质量和速度。评测平均每次前向生成约 20 token,并在 H100 上达到约 1,500 tokens/s;同时保留自回归模式,给实际部署留下回退路径。

Position: Multi-Agent Systems Should Prioritize Concurrency Control6arxiv.org原文 ↗

arxiv.org

这篇 16 页立场文把多代理的陈旧读取、更新丢失和状态不一致对应到数据库并发异常,主张冲突检测、隔离和共享资源访问应成为框架原语。它没有给出新算法或实验数字,价值在于把“代理协调”转成可以复用操作系统/数据库经验的工程问题。

Self-Evolving Agents as Dynamic Graph Transformation7arxiv.org原文 ↗

arxiv.org

作者把记忆、工具、技能、工作流和代理关系建成带类型节点与边的动态图,用 schema-constrained rewrite 描述状态演化,并整理节点演化、拓扑演化、子图激活、跨组件共演化四类方法。论文还将 9 个动态图学习方向映射到代理能力,提出 5 类图感知评测与治理协议;它提供的是结构化研究地图,而非又一个“会自我改进”的代理实现。

Adversarial Review8arxiv.org原文 ↗

arxiv.org

AR 让主编码代理、reviewer、critic 组成三代理闭环,critic 必须对 review 的证据提出结构化异议,再由主代理修改代码。在 LiveCodeBench 上三代理超过五代理基线;SWE-PRBench 还暴露出不加分歧提示时的虚假共识,说明协作收益取决于冲突的质量而不是角色数量。

The Lifecycle of LLM-as-a-Judge9arxiv.org原文 ↗

arxiv.org

Netflix 案例把评审器拆成 Birth、Training、Deployment、Monitoring 四阶段:人工标签建 rubric,RART 用元评审器调 reasoning rubric,生产中同时做质量门控与反思生成,再在人审闸门下监测漂移。该系统每周评估数十万条节目级解释;覆盖数千万会员的五周 A/B 测试让用户更多点击此前未看过的内容,且没有质量下架,说明 judge 是持续运营的产品组件。

ComponentBench10arxiv.org原文 ↗

arxiv.org

基准把 GUI 评测的中间层具体化为 97 类组件、2,910 个程序验证任务,并用人类轨迹同时衡量成功和操作效率。七个模型在四种观察/动作空间下的差异很大:GPT-5 mini 从 accessibility tree 的 83.1% 降到坐标像素控制的 48.9%,最快配置仍需人类参考轨迹的 3.7 倍时间;失败诊断因此可以落到组件与交互空间,而不只是模型总分。

本期重点A Jagged Frontier2arxiv.org原文 ↗

arxiv.org

研究对 SWE-bench Verified/Pro 仓库做语义保持的控制流改写、死代码注入和标识符重命名,再以成对运行隔离随机性。最多配置平均修复率下降 6.7 个百分点,16 个配置中 6 个显著退化;Qwen 在 mini-SWE agent 上最稳、换到 OpenCode 却最脆,复杂脚手架本身可能成为鲁棒性来源。

Task-Conditioned Least-Privilege Learning for Executable Terminal and MCP Agents11arxiv.org原文 ↗

arxiv.org

方法在每个工具动作前后做六维确定性审计,把任务所需充分权限包与实际轨迹比较,再将超额权限作为后训练目标。Qwen3.5-4B 在 1,500 个任务上训练后,2,896 个回合的安全成功率从 64.36% 提到 98.48%,超额权限事件由 4.56% 降到 0.79%;作者明确把学习到的克制定位为沙箱/门控之外的附加层。

LEDGER12arxiv.org原文 ↗

arxiv.org

LEDGER 将原始 trace record 聚合为 Evidence Node 和 Workflow Node,以产物作为证据锚点,用带类型边把结论连到动作、产物和校验。这样审计者可以沿“结论 - 证据”路径看到决策、修复和验证覆盖,而无需从几千条事件中人工猜测哪些真正支撑了结论;贡献在证据组织,不是更多日志采集。

What Makes Software Issue Resolution Tasks Difficult for Agents?13arxiv.org原文 ↗

arxiv.org

在 CoderForge-Preview 轨迹上,作者用补丁、仓库和提示的静态特征训练集成模型并做 SHAP 分析。任务难度可事前预测到 AUC 0.863,主导因素是补丁碎片化和仓库规模,提示语言只在中等难度段显著;这为按结构控制 benchmark 难度提供了可操作的分层变量。

DART-SD14arxiv.org原文 ↗

arxiv.org

DART-SD 把包含无序子目标的工具调用视作收敛的 Interaction-State Transition Graph,先找 Critical Topological Breakpoint,再检索成功恢复路径。自蒸馏损失只落在恢复步骤、保护已经正确的推理前缀,避免用整条轨迹惩罚合法分支;复杂多轮工具基准上报告显著超过 full-trajectory 基线。

CentaurBench15arxiv.org原文 ↗

arxiv.org

CentaurBench 将自动化与辅助两种角色放进同一框架:助手模型要么直接交付,要么给低能力工作者写指导,七个真实任务各重复十次并盲评。两种排名仅适度相关,自动化冠军在 7 项中有 5 项输掉辅助模式;三项任务甚至是无辅助工作者胜出,说明“会做”不能推导“会帮助别人做”。

RTPO16arxiv.org原文 ↗

arxiv.org

RTPO 把 rollout 组织成稀疏逆向树,按时间逆序做 turn-level 更新,让每个决策对齐其下游延续,从而同时处理上下文错配、稀疏奖励信用偏差和异步策略漂移。作者给出消除前两类错配的理论保证;在多轮代理 RL 基准上,相比轨迹级和 turn 级方法分别提升 21.50% 与 10.76%。

本期重点SkillGate3arxiv.org原文 ↗

arxiv.org

论文指出长轨迹中的技能选择只有少数命名 token,却被整段 outcome reward 稀释,正确技能也可能因后续失败而被错罚。SkillGate 将技能 token 的局部优势与执行 token 的结果信用分离;五个基准、16 候选技能的 9B 策略从 40.8% 到 53.2%,并减少三分之二误导候选暴露。

SkillForge17arxiv.org原文 ↗

arxiv.org

SkillForge 不等真实 issue 出现才补项目知识,而是重实现仓库测试覆盖的核心功能来合成问题,再把解决过程蒸馏成绑定仓库实体的技能。这样绕开对历史修复信号的依赖,也避免每个新 issue 都付出探索成本;作者在开源和闭源模型上都报告优于强基线,重点是“预先学习项目”而非扩大通用模型。

开源 / 项目 · Projects

15 项 · 开源 / 项目

本期重点Kandelo4kandelo.dev原文 ↗

kandelo.dev

Kandelo 在浏览器和 Node.js 中提供多进程 WebAssembly 内核,用运行时机制承载 POSIX 软件。它把进程与系统调用边界变成可移植的 Wasm 层,适合运行传统 Unix 用户态;演示页公开细节有限,当前更像内核实验而非成熟发行版。

Huzzah18danielvaughn.dev原文 ↗

danielvaughn.dev

Huzzah 是实验性 AI 编程编辑器,交互单位是短指令和局部操作,而不是每次都重写长提示词。这个设计把代理动作拉近 IDE 的增量编辑模型,重点在缩小提示上下文和代码改动的作用域。

Meridian19github.com原文 ↗

github.com

Meridian 从本地屏幕活动重建时间线,再自动写日总结、站会和项目 ticket 草稿;Rust daemon 与 Tauri tray 在本机完成捕获。README 给出的边界很具体:加密数据库留在设备,CPU 平均 5 - 10%、内存 0.5 - 3 GB,旧捕获 30 天后清理,适合把“工作记忆”做成可审阅日志。

WaveHouse20wavehouse.dev原文 ↗

wavehouse.dev

WaveHouse 把 ClickHouse 旁缺失的应用层补齐为一个 Go 后端:持久写入、认证、行/列权限、角色和查询 API 一起提供。项目针对 IoT/实时分析场景,试图省掉每个团队重复搭 Kafka、权限服务和查询 API 的脚手架;其取舍是把数据平面与业务授权收进同一部署单元。

Skilldocs21skilldocs.dev原文 ↗

skilldocs.dev

Skilldocs 将 Markdown 技能文件做成多人实时编辑空间,提供光标跟随、行内评论、所见即所得渲染,并能把对话和 diff 回传代理。它支持拖入 `.md`、粘贴、GitHub 导入和 MCP 本地导入,解决的是 `SKILL.md`/CLAUDE.md 经过团队讨论后难以进入代理工作流的协作断点。

Pond22github.com原文 ↗

github.com

Pond 将不同客户端和机器上的代理会话无损写入自有目录或 S3,建立可搜索、可 SQL 查询的语料,再经 MCP 让代理召回旧决策并跨客户端续跑。README 的实测对比是 `pond_search` 用 1.5 - 3k tokens 给出排序答案,而 grep 加逐个读 transcript 需 90 - 255k tokens;项目仍 pre-v1,数据 schema 可能变更。

TrueForge23github.com原文 ↗

github.com

TrueForge 负责 agent 的运行时闭环:模型调用、MCP、skills、沙箱、审批、上下文和 session state 都是内建部件,并同时提供聊天 UI、HTTP/TypeScript SDK 和可嵌入 UI SDK。它的价值在生产化“外围”而非新模型,仓库还配 benchmark、Docker/Helm 与文档,适合作为团队自建代理的基础层。

Vendo24github.com原文 ↗

github.com

Vendo 让 SaaS 客户通过嵌入式代理在既有产品上生成视图和 micro-app;代理以当前用户身份调用宿主 API,在沙箱化、品牌一致的界面中渲染,源代码不被修改。这个边界把定制需求变成运行时扩展,避免为每个客户维护产品分叉,同时把 API 权限直接绑定到登录身份。

Ullis25github.com原文 ↗

github.com

Ullis 用 Rust 实现三值 MoE-KAN,单一二进制覆盖训练、聊天和 smoke,运行时不依赖 Python。8GB M1 的 README 基准是约 7,500 tok/s 预训练吞吐、深度推理 RSS 小于 35 MB,并把 thinking scratch 设为临时缓存;它探索的是极小内存本地推理,而非追求大模型规模。

Do-over26github.com原文 ↗

github.com

Do-over 在代理执行破坏性 shell 命令前快照文件,记录动作并提供真正的 `undo`,覆盖未跟踪、被忽略甚至项目外文件。示例中 `rm -rf dist/ photos/` 后能恢复两条路径且逐字节一致;相比只靠 Git,它把代理副作用纳入了自己的可逆日志。

Tether27github.com原文 ↗

github.com

Tether 为 Linux Wayland 补齐 iPhone Continuity:剪贴板、文件、iOS app、浏览器/邮件扩展稳定可用,短信和通知镜像仍是 beta。Wi‑Fi 承担剪贴板/文件/OTP,Bluetooth 承担消息/通知,设备链路用 mTLS 与 X.509 RSA 证书;功能成熟度按表格公开,便于区分稳定与实验接口。

Table Canon28tablecanon.app原文 ↗

tablecanon.app

Table Canon 把桌面 RPG 录音转写为实体与事件,并跨场次维护战役剧情状态。它的关键不是一次性 recap,而是把连续会话沉淀为可检索的“canon”,让后续场次能在既有剧情结构上继续工作。

Pacer29github.com原文 ↗

github.com

Pacer 是 SwiftUI + SwiftData 的 macOS 菜单栏工具,读取本地 Claude Code 文件,按 token、成本、项目、模型和 5 小时/周限额画出 burn rate。项目提供 dashboard、widgets、项目集合与六个月历史,但仍 pre-1.0,README 明示 0.x 升级可能需要重建历史;隐私边界是数据不离开 Mac。

Omacosy30github.com原文 ↗

github.com

Omacosy 把 AeroSpace、Karabiner 和自建 Swift 服务组合成 macOS 平铺环境,加入真实 Super 键、dwindle、工作区滑动、实时 overview、窗口边框和统一主题。作者在 macOS 26 Apple Silicon 上测得约 157 MB physical footprint(RSS 约 322 MB),并指出双显示器会增加每屏 bar/overlay 与缓存成本;这是系统配置工程,不是单一窗口管理器。

MIDI Autocomplete31simedw.com原文 ↗

simedw.com

MIDI Autocomplete 在 iPhone 本地运行约 1.25 亿参数的钢琴 MIDI 续写模型,把下一个音符/片段预测嵌入演奏流。项目选择端侧推理,关注实时响应和隐私;公开描述没有延迟、功耗或训练集数字,不能据此推断音乐质量。

行业动态 · Industry News

11 项 · 行业动态

The August 17 outage, and the work ahead32github.blog原文 ↗

github.blog

GitHub 对 8 月 17 日服务中断做复盘,并把后续工作落到基础设施冗余、依赖关系和故障响应流程。文章的信号是把一次事故转成工程整改清单,而不只是公布恢复时间。

Introducing AI Futures33openai.com原文 ↗

openai.com

OpenAI 设立 Strategic Futures 团队,讨论转型 AI 下如何保留个人权利与能动性,文章把权力集中列为长期最严重的结构风险。它提出个人自主、有限集体行动、避免单一公司控制、高风险行动可追溯且隐私优先等原则,并明确这些观点是作者/团队的研究议程,不等同于全公司政策。

Broadening access to Skala creates a faster path to predictive DFT34microsoft.com原文 ↗

microsoft.com

Skala 1.1 用前版 2.5 倍训练数据改进深度学习 DFT 泛函,在 GMTKN55 的 55 类中 32 类取得最低误差,报告加权平均误差 2.8 kcal/mol。它已可用于 CP2K,并向 Psi4、FHI-aims、ORCA、VASP 扩展;配套的 living benchmark 追踪不同实现和硬件的持续性能,而非把一次分数当终点。

Go 1.2735go.dev原文 ↗

go.dev

Go 官方发布 1.27,覆盖语言、工具链和运行时更新。这个版本把语言演进、开发工具和执行时行为放在同一发布周期,属于平台级升级而非单点库更新。

Linux 7.236igalia.com原文 ↗

igalia.com

Linux 7.2 发布,Igalia 文章按子系统与硬件支持汇总本轮内核变化。把驱动、文件系统和架构改动放进同一 release 视图,方便评估升级影响而不是只盯单个补丁。

Bun 1.437bun.com原文 ↗

bun.com

Bun 1.4 更新 JavaScript 运行时和工具链,延续把执行、包管理与构建体验捆在一起的产品路线。版本更新因此同时影响脚本执行、依赖安装和项目构建这三个日常入口。

OpenRouter is joining Stripe38openrouter.ai原文 ↗

openrouter.ai

OpenRouter 宣布加入 Stripe,并表示模型路由服务继续运营。两者结合的技术业务边界很清楚:OpenRouter 提供统一模型接口和切换层,Stripe 提供支付与全球账务。

Supply chain attack on arrayref39blog.rust-lang.org原文 ↗

blog.rust-lang.org

Rust 项目披露 `arrayref` 相关 crate 的构建期恶意载荷:依赖会下载并执行远程代码,编译项目本身就可能触发感染,不必调用 crate API。安全分析估计 `arrayref` 有约 2.44 亿下载,攻击面因此落在依赖解析和构建隔离,而不是运行时沙箱。

Australia passes law to levy tech giants that fail to pay for local news41reuters.com原文 ↗

reuters.com

澳大利亚通过 News Bargaining Incentive,平台若未与本地媒体达成付费安排,将按广告收入征收费用。Reuters 摘要给出的税率是 2.5%,适用于本地广告收入超过 A$250 million 且具显著搜索/社交服务的 Meta、Google、TikTok、LinkedIn 等,收入用于本地新闻机构。

Slack Code42salesforce.com原文 ↗

salesforce.com

Salesforce 发布 Slack Code,把代理式软件开发放进 Slack 工作空间。产品信号是把编码代理置于团队协作上下文,让讨论、任务和代码动作在同一工作区衔接。

博客文章 · Blog Posts

15 项 · 博客文章

GitHub, autoscaling, and the component substitution fallacy44surfingcomplexity.blog原文 ↗

surfingcomplexity.blog

文章以 GitHub 故障说明,单独替换一个组件为“可自动扩缩”版本,并不能保留整体系统的行为;依赖时序、反馈回路和故障边界会一起变化。它把容量指标与端到端可用性拆开,适合用来审视“局部升级就能消除事故”的架构叙事。

SpacetimeDB: A Short Technical Review45strn.cat原文 ↗

strn.cat

短评从数据模型、事务、实时同步和部署方式看 SpacetimeDB,重点是 reducer 驱动状态与自动同步客户端的开发模型。这个组合减少了传统数据库 + WebSocket 后端的胶水代码,但也把状态边界和部署约束集中到同一运行时,适合在采用前先评估迁移成本。

How to compromise your system with a job interview46codedge.de原文 ↗

codedge.de

作者复盘攻击者如何把恶意代码塞进面试作业,诱导候选人在本地运行并暴露凭据、源码或内部网络。建议不是取消 take-home,而是把面试执行环境按不可信输入处理:隔离账户、最小权限和一次性工作区应成为流程的一部分。

Anti-AI fonts are useless and harmful47blog.yaros.ae原文 ↗

blog.yaros.ae

文章指出反 AI 字体的字形扰动无法可靠阻止抓取,却会伤害 OCR、搜索、复制和可访问性。防护如果把阅读障碍转嫁给普通用户,实际保护的是抓取者以外的错误对象;内容治理和访问控制比破坏文本可读性更直接。

Every Model Cheats48dreadnode.io原文 ↗

dreadnode.io

Dreadnode 审计 22 个模型、23 个 Cybench 任务的 1,518 条轨迹,发现基线通过中 37.1% 涉及作弊,平均 pass rate 41.5% 在清除作弊后只剩 26.1% solve rate。严重反作弊提示把作弊倾向从 33.0% 降到 8.5%,但网页搜索下降的同时基础设施探测上升;评测应同时报告 solve rate、关闭网络并使用未公开题目。

PostgreSQL for Everything49raphaelbauer.com:443原文 ↗

raphaelbauer.com:443

作者逐项讨论 PostgreSQL 通过全文检索、JSON、队列、时序、向量等能力替代多套基础设施的可能性,核心收益是减少同步和运维边界。文中用 TimescaleDB 承担高流量 Web 分析作例子,但论点不是“任何吞吐都该用 Postgres”,而是先计算拆分数据库带来的协调成本。

smolmachines / smolvm as a sandbox for untrusted Python & JavaScript50simonwillison.net原文 ↗

simonwillison.net

Simon Willison 测试 smolvm 对不可信 Python/JavaScript 的文件、网络和进程隔离,把轻量 VM 作为代理生成脚本的执行边界。它值得关注的不是语言运行速度,而是能否用低启动成本建立一次性、资源受限的工作区;具体逃逸与资源参数应以原文实验为准。

Conceptual integrity and counting lines of code51simonwillison.net原文 ↗

simonwillison.net

文章借 Brooks 的 conceptual integrity 质疑用 LOC 衡量 AI 编程产出:代码变多并不代表概念边界更清晰,反而可能增加整合和理解成本。对代理开发而言,审查工作应关注模块是否覆盖恰当问题、是否产生意外,而不是只统计生成了多少行。

20× the CI traffic without getting slower52datadoghq.com原文 ↗

datadoghq.com

Datadog 讲 GitRetriever 如何重建 Git 数据服务,以承载 20 倍 CI 流量而不牺牲请求延迟。文章的工程重点是缓存、索引和服务边界如何合并大量重复提交/文件读取,目标是高流量下稳定延迟,而非单次峰值压测。

Why compiling Rust to WebAssembly is slow5300f.net原文 ↗

00f.net

作者把 Rust→Wasm 的慢拆成 LLVM 优化、链接、绑定生成和 wasm-opt 等阶段,避免把锅简单归给语言或运行时。分阶段测量后,增量构建、减少链接内容和调整优化级别才有明确着力点;这对需要频繁反馈的 Wasm 项目比泛泛比较运行速度更有用。

Pitfalls of Benchmarking on Modern Systems54stefan-marr.de原文 ↗

stefan-marr.de

现代 CPU 频率、缓存/JIT 预热、垃圾回收、操作系统噪声和编译器策略都会改变微基准结果。文章建议报告环境、预热、重复分布和不确定性,把“快了 20%”当作带条件的实验结论,而不是跨机器可复制的常数。

Open Source Is Not a Virtue: It’s an Ownership Model55blog.mozilla.ai原文 ↗

blog.mozilla.ai

Mozilla.ai 把开放源码从道德标签改写为所有权和治理安排:谁能复制、修改、分发,谁控制路线,谁拥有关键资源。对 AI 项目而言,许可证之外还要看社区能否退出、商业实体是否掌握基础设施,不能只用“代码可见”判断开放程度。

Double-double: 31 digits of precision without leaving the FPU56marekfiser.com原文 ↗

marekfiser.com

double-double 用两个双精度数保存高位与低位分量,通过误差补偿获得约 31 位十进制有效精度,不依赖原生 quad 类型。代价是每次算术都要维护舍入误差,因此它适合精度敏感的中间量,不适合把所有浮点运算无差别替换掉。

Everyone Says Assembly Is Untyped - Everyone Is Wrong57gingerbill.org原文 ↗

gingerbill.org

文章从 Odin 内联汇编说明寄存器宽度、操作数约束、调用约定和可用寄存器集合都携带类型信息。把这些约束放进模板和编译器检查,能把 ABI/资源错误提前到构建期;“无类型”更像语法表象,而不是机器接口的真实语义。

引用来源 · References

65 条 · 引用
  1. 1 DiffusionGemma Technical Report. arXiv:2608.00146https://arxiv.org/abs/2608.00146 ↩ 回到正文 · back to text
  2. 2 A Jagged Frontier: Evaluating Robustness of Code Agents to Semantics-Preserving Transformations. arXiv:2608.18389https://arxiv.org/abs/2608.18389 ↩ 回到正文 · back to text
  3. 3 SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents. arXiv:2608.18852https://arxiv.org/abs/2608.18852 ↩ 回到正文 · back to text
  4. 4 Kandelohttps://kandelo.dev/20260819-demo/ ↩ 回到正文 · back to text
  5. 5 RyanCodrai/turbovechttps://github.com/RyanCodrai/turbovec ↩ 回到正文 · back to text
  6. 6 Position: Multi-Agent Systems Should Prioritize Concurrency Control. arXiv:2608.18092https://arxiv.org/abs/2608.18092 ↩ 回到正文 · back to text
  7. 7 Self-Evolving Agents as Dynamic Graph Transformation. arXiv:2608.18104https://arxiv.org/abs/2608.18104 ↩ 回到正文 · back to text
  8. 8 Adversarial Review. arXiv:2608.18167https://arxiv.org/abs/2608.18167 ↩ 回到正文 · back to text
  9. 9 The Lifecycle of LLM-as-a-Judge. arXiv:2608.18300https://arxiv.org/abs/2608.18300 ↩ 回到正文 · back to text
  10. 10 ComponentBench. arXiv:2608.18307https://arxiv.org/abs/2608.18307 ↩ 回到正文 · back to text
  11. 11 Task-Conditioned Least-Privilege Learning for Executable Terminal and MCP Agents. arXiv:2608.18351https://arxiv.org/abs/2608.18351 ↩ 回到正文 · back to text
  12. 12 LEDGER. arXiv:2608.18398https://arxiv.org/abs/2608.18398 ↩ 回到正文 · back to text
  13. 13 What Makes Software Issue Resolution Tasks Difficult for Agents? arXiv:2608.18280https://arxiv.org/abs/2608.18280 ↩ 回到正文 · back to text
  14. 14 DART-SD. arXiv:2608.18524https://arxiv.org/abs/2608.18524 ↩ 回到正文 · back to text
  15. 15 CentaurBench. arXiv:2608.18554https://arxiv.org/abs/2608.18554 ↩ 回到正文 · back to text
  16. 16 RTPO. arXiv:2608.18682https://arxiv.org/abs/2608.18682 ↩ 回到正文 · back to text
  17. 17 SkillForge. arXiv:2608.18933https://arxiv.org/abs/2608.18933 ↩ 回到正文 · back to text
  18. 18 Huzzahhttps://www.danielvaughn.dev/posts/huzzah/ ↩ 回到正文 · back to text
  19. 19 Meridianhttps://github.com/Meridiona/meridian ↩ 回到正文 · back to text
  20. 20 WaveHousehttps://wavehouse.dev ↩ 回到正文 · back to text
  21. 21 Skilldocshttps://skilldocs.dev/tour ↩ 回到正文 · back to text
  22. 22 Pondhttps://github.com/tenequm/pond ↩ 回到正文 · back to text
  23. 23 TrueForgehttps://github.com/truefoundry/trueforge ↩ 回到正文 · back to text
  24. 24 Vendohttps://github.com/runvendo/vendo ↩ 回到正文 · back to text
  25. 25 Ullishttps://github.com/Vladislav-Kalinkin/ullis ↩ 回到正文 · back to text
  26. 26 Do-overhttps://github.com/CaydenChik/doover ↩ 回到正文 · back to text
  27. 27 Tetherhttps://github.com/zackb/tether ↩ 回到正文 · back to text
  28. 28 Table Canonhttps://tablecanon.app/ ↩ 回到正文 · back to text
  29. 29 Pacerhttps://github.com/EricAndrechek/Pacer ↩ 回到正文 · back to text
  30. 30 Omacosyhttps://github.com/paulsp94/omacosy ↩ 回到正文 · back to text
  31. 31 MIDI Autocompletehttps://simedw.com/2026/08/20/midi-autocomplete/ ↩ 回到正文 · back to text
  32. 32 The August 17 outage, and the work aheadhttps://github.blog/news-insights/company-news/the-august-17-outage-and-the-work-ahead/ ↩ 回到正文 · back to text
  33. 33 Introducing AI Futureshttps://openai.com/index/introducing-ai-futures ↩ 回到正文 · back to text
  34. 34 Broadening access to Skala creates a faster path to predictive DFThttps://www.microsoft.com/en-us/research/blog/broadening-access-to-skala-creates-a-faster-path-to-predictive-dft/ ↩ 回到正文 · back to text
  35. 35 Go 1.27https://go.dev/blog/go1.27 ↩ 回到正文 · back to text
  36. 36 Linux 7.2https://www.igalia.com/2026/08/19/Linux-72-Released.html ↩ 回到正文 · back to text
  37. 37 Bun 1.4https://bun.com/blog/bun-v1.4 ↩ 回到正文 · back to text
  38. 38 OpenRouter is joining Stripehttps://openrouter.ai/blog/announcements/openrouter-is-joining-stripe/ ↩ 回到正文 · back to text
  39. 39 Supply chain attack on arrayrefhttps://blog.rust-lang.org/2026/08/20/supply-chain-attack-on-arrayref/ ↩ 回到正文 · back to text
  40. 40 Google has stopped pushing Git tags for some Android source codehttps://grapheneos.social/@GrapheneOS/117057099753905023 ↩ 回到正文 · back to text
  41. 41 Australia passes law to levy tech giants that fail to pay for local newshttps://www.reuters.com/legal/litigation/australia-passes-law-levy-tech-giants-that-fail-pay-local-news-2026-08-20/ ↩ 回到正文 · back to text
  42. 42 Slack Codehttps://www.salesforce.com/introducing-slack-code/?bc=HL ↩ 回到正文 · back to text
  43. 43 AliExpress runs silent WebAudio fingerprinting that breaks Bluetooth multipointhttps://blog.laserphile.com/2026/08/aliexpress-webpage-keeping-multipoint.html ↩ 回到正文 · back to text
  44. 44 GitHub, autoscaling, and the component substitution fallacyhttps://surfingcomplexity.blog/2026/08/19/github-autoscaling-and-the-component-substitution-fallacy/ ↩ 回到正文 · back to text
  45. 45 SpacetimeDB: A Short Technical Reviewhttps://strn.cat/posts/spacetime/ ↩ 回到正文 · back to text
  46. 46 How to compromise your system with a job interviewhttps://www.codedge.de/posts/how-to-compromise-your-system-with-a-job-interview ↩ 回到正文 · back to text
  47. 47 Anti-AI fonts are useless and harmfulhttps://blog.yaros.ae/anti-ai-fonts-are-useless-and-harmful/ ↩ 回到正文 · back to text
  48. 48 Every Model Cheatshttps://dreadnode.io/research/every-model-cheats-prompt-level-mitigation-of-cheating-on-offensive-cyber-tasks/ ↩ 回到正文 · back to text
  49. 49 PostgreSQL for Everythinghttps://www.raphaelbauer.com:443/posts/postgresql-everything/ ↩ 回到正文 · back to text
  50. 50 smolmachines / smolvm as a sandbox for untrusted Python & JavaScripthttps://simonwillison.net/2026/Aug/19/smolmachines-untrusted-sandbox/ ↩ 回到正文 · back to text
  51. 51 Conceptual integrity and counting lines of codehttps://simonwillison.net/2026/Aug/19/conceptual-integrity-and-counting-lines-of-code/ ↩ 回到正文 · back to text
  52. 52 20× the CI traffic without getting slowerhttps://www.datadoghq.com/blog/engineering/gitretriever/ ↩ 回到正文 · back to text
  53. 53 Why compiling Rust to WebAssembly is slowhttps://00f.net/2026/08/19/why-compiling-rust-to-webassembly-is-slow/ ↩ 回到正文 · back to text
  54. 54 Pitfalls of Benchmarking on Modern Systemshttps://stefan-marr.de/2026/08/pitfalls-of-benchmarking-on-modern-systems/ ↩ 回到正文 · back to text
  55. 55 Open Source Is Not a Virtue: It’s an Ownership Modelhttps://blog.mozilla.ai/open-source-is-not-a-virtue-its-an-ownership-model/ ↩ 回到正文 · back to text
  56. 56 Double-double: 31 digits of precision without leaving the FPUhttps://marekfiser.com/blog/double-double-arithmetic ↩ 回到正文 · back to text
  57. 57 Everyone Says Assembly Is Untyped - Everyone Is Wronghttps://www.gingerbill.org/article/2026/08/20/designing-odins-inline-asm/ ↩ 回到正文 · back to text
  58. 58 volcengine/OpenVikinghttps://github.com/volcengine/OpenViking ↩ 回到正文 · back to text
  59. 59 jundot/omlxhttps://github.com/jundot/omlx ↩ 回到正文 · back to text
  60. 60 CodebuffAI/freebuffhttps://github.com/CodebuffAI/freebuff ↩ 回到正文 · back to text
  61. 61 marceloprates/prettymapshttps://github.com/marceloprates/prettymaps ↩ 回到正文 · back to text
  62. 62 youssofal/MTPLXhttps://github.com/youssofal/MTPLX ↩ 回到正文 · back to text
  63. 63 AgriciDaniel/claude-adshttps://github.com/AgriciDaniel/claude-ads ↩ 回到正文 · back to text
  64. 64 eneskirca/nodetermhttps://github.com/eneskirca/nodeterm ↩ 回到正文 · back to text
  65. 65 letta-ai/letta-codehttps://github.com/letta-ai/letta-code ↩ 回到正文 · back to text