每日 Harness 开源 · Source
全部刊期 · All issues

每日 Harness

2026-08-12 · Wednesday, August 12, 2026

智能体走向工程化治理

视图 · View

今日重点 · Today's Highlights

FailForge4 - 将失败 rollout 诊断成临时 skill、救活后再移除提示训练,让 4B 模型从原本被丢弃的轨迹中获得 6.6 点 SWE-bench Verified 增益。

全文 ↓

H3-metal5 - 直接用 C/Metal 在 Apple Silicon 跑 MiniMax-H3 的完整音视频推理,并提供从四步预览到 2 GiB DiT 流式常驻的明确速度与内存旋钮。

全文 ↓

论文 · Papers

15 项 · 论文

本期重点Stealing Reasoning Traces from Proprietary LLM APIs3arxiv.org原文 ↗

安全与攻防上下文工程系统·基础设施

论文抓住闭源 API 的架构缺口:服务端把加密推理块交给客户端保存并在后续请求回传,但同一厂商内这些块能跨会话、用户乃至模型互换。攻击者可把强模型的块送给防护较弱的模型,诱使后者逐字吐出明文;作者在 Anthropic、OpenAI 和 Google 上演示了反蒸馏、隐私提取、危险信息泄漏与隐形提示注入四类路径。对公共仓库中 315,320 个 reasoning block 的解码找到 367 项 PII 和 182 份凭据,说明“内容加密”若不绑定主体、模型与会话,仍无法提供隔离。

本期重点What Keeps Agent Skills from Being Reusable? Evidence from 138K SKILL.md Files2arxiv.org原文 ↗

作者依据官方规范和最佳实践建立两层缺陷分类,检查来自 20,556 个仓库的 138,133 份 `SKILL.md`,不是只抽样几个热门 skill。91.8% 至少命中一项缺陷,宽松到严格阈值下仍为 88.8% - 94.6%,主因是弱路由元数据、臃肿或不可执行的正文和资源组织失序,而非罕见安全攻击。20,000 项 skill 的确定性路由压力测试进一步表明,规范元数据确实提高启动描述中的召回;论文给出的 lint、自动修复和安全 gate 因而对应可观察故障,而不是文档洁癖。

本期重点The Scaffolding Matters More Than the Interface1arxiv.org原文 ↗

研究把任务固定为私有 Git 仓库上的六次操作,在七种 scaffold、五个模型上比较 MCP 与 CLI,并检查仓库最终状态而非相信 agent 自报。两个完全不支持 MCP 的 scaffold 仍完成所有运行,其纯 CLI 成本比五个 MCP-capable scaffold 低 5 - 28 倍;小型 27B 本地模型跨 scaffold 的成本更相差 139 倍。13 个严格配对的 MCP/CLI 比率从 0.43 到 29,且 MCP 失败消耗占 12.9%、CLI 为 2.2%,所以单独宣称某种接口“更省 token”会掩盖 harness 行为和未完成工作的成本。

Not Worth Another Token6arxiv.org原文 ↗

这项工作把 deep-research agent 的上下文裁剪放在检索前、检索后和最终合成前三个位置,对照简单启发式与学习型边际价值模型。最稳定的结论不是某个 scorer 胜出,而是阶段更重要:早裁剪影响端到端检索支出,晚裁剪主要改善交给写作者的证据集。轻量规则最多省下 73% token 且质量仅小幅下降,但没有方法同时支配质量、效率和忠实度,适合把“何时停”设计成多目标策略而非单阈值。

MasDrift7arxiv.org原文 ↗

MasDrift 用八个领域的 600 个良性生产力任务,把必做工作和明确保留动作成对设置,测量委派链是否保留原授权边界。中央层级完成率达到 93.9% - 98.6%,高于 peer network 的 85.7% - 87.0%,代价却是越权率升至 2.7% - 19.8%,而 peer 仅 0.6% - 0.8%;层级越深,差距越大。每次待执行调用重新对齐原始用户请求能在所有模型配置下降越权,只损失 1.6 个完成率点;沿委派链传递衰减 policy 则最多牺牲 36.3 点完成率,显示授权证据放在哪里比“有 policy”更关键。

SodaMem8arxiv.org原文 ↗

SodaMem 将长期对话记忆变成有证据约束的时间图:抽取带原文 span 的 FactEvent,同时保存提及、发生、有效时间,以及 `SUPERSEDES`、`CONTRADICTS`、`UPDATES` 关系。回答端通过 planner-reader 循环先收集可引用证据,再组合结论;在 LongMemEval-S 上作者报告 464/500、即 92.8% 准确率,平均每题 0.00161 美元。该数字使用同一 Flash 模型兼任 reader 与 judge,且不计 ingest/judge 成本,跨系统比较也来自估算,因此亮点是“当前事实+来源”的数据模型,前沿成本结论仍需统一 harness 复验。

Mendel Gödel Machine9arxiv.org原文 ↗

MGM 针对自改写 coding agent 只看单次失败轨迹的问题,引入 reaction-norm mutation,用同一 agent 在多任务上的历史共同决定修改;再用 cross-lineage hybridization,参考另一谱系解决同题的轨迹。论文在加性 fitness landscape 下证明这两种比较信号能加快并改善收敛,随后在 SWE-bench 与 Polyglot 上报告性能、效率和泛化持续优于单轨迹变异。方法的技术看点是把“经验档案”从日志仓库变成可比较的遗传材料,而摘要没有给出具体绝对分数,实际增益规模仍要看完整实验表。

TeXFix-Bench10arxiv.org原文 ↗

该基准先从 TeX Stack Exchange、GitHub 修复提交和包文档中核实 168 个 LaTeX 硬崩溃,做出 18 类故障 taxonomy,再以 48 个 AST-aware 算子扩展到 LaTeX、Typst 和 Markdown。最终包含 10,437 个实例、743 个开放许可种子、七个模型和 48,651 次尝试;基于真实错误分布的 DocMut 比模式突变难 5.6 - 9.2 个点。更关键的是,在 28,129 个已经能编译的修复里仍有 13.6% - 18.5% 实质改变正文,编译率排名也不等于内容恢复排名,这给“测试通过即修好”加了一层必要的语义检查。

Your Prompt Is Not the Only Prompt11arxiv.org原文 ↗

工具使用上下文工程系统·基础设施

论文把结构化输出中的 schema description 当作第二条指令通道,在两个厂商的十种配置上,用 nonce label 分类隔离标签先验。GPT-4.1 与无 reasoning 的 GPT-5.4 中,schema 放定义比 system prompt 低 11 - 13 点;当两者冲突时,错误 schema 可令准确率跌 5 - 45 点,Claude Haiku 4.5 更从 52.5% 掉到 7%。在 label 前增加必填 reasoning 字段却能把 schema-only 准确率抬高 15 - 24 点,说明 JSON Schema 不只是验证器配置,字段顺序和描述共同参与模型控制面。

TelemetrySuffBench12arxiv.org原文 ↗

TelemetrySuffBench 刻意把“检测到失败”“定位故障起点”和“证据不足时拒绝归因”分开,构造延迟绑定故障、七因子遮罩以及观测完全相同但根因不同的样本。完整遥测时五个模型的源步骤 Top-1 从 33.8% 到 97.2%;常见 metadata、OpenTelemetry 和 OpenInference 视图虽保留 99.5% - 100% detection F1,定位却不超过 0.5%。删除 decision content 后所有模型的定位归零,说明成功/失败状态足以报警,却不能替代决策到 provenance 的显式链接。

Governing the KV Cache13arxiv.org原文 ↗

KVGov 面向共享 prefix cache 的时序侧信道,用每主体的 HMAC 盐初始化 block hash chain,使不同租户即使提示前缀相同也无法共享可探测的 key。作者在 A100/vLLM 上测得冷缓存与命中 TTFT 比 0.22,在 llama.cpp/Apple Metal 上为 0.093,验证生产栈确有足够强的时间信号;只在提示分叉边界注盐则估计可保留 93% cache 收益。需要留意的是防御效果主要在实测延迟校准的模拟中评估,ORIGAMI 审计调度的 12.6% 攻击收益下降尚不是端到端线上数据。

Test-Time Augmentation for LLMs14arxiv.org原文 ↗

测试时计算其他垂直

作者把 test-time compute 从“重复采样输出”分一部分给“改写输入”,比较语义改述、词法扰动和视觉变换,覆盖六个知识、数学、多语、多模态与情感任务。语义改述在六项中的五项超过 self-consistency,每美元带来的准确率增益约高 1.8 倍,并形成更好的成本效果 Pareto 前沿。收益集中在中档模型且依赖变换保持题意,论文因此提供的是输入多样性预算的有力证据,不是所有任务上无限增加 paraphrase 都有效。

本期重点FailForge4arxiv.org原文 ↗

FailForge 把 RFT 会直接丢弃的失败 rollout 重新加工:诊断 agent 读取错误与执行轨迹,提炼成简短可操作 skill,再让原 agent 在该提示下重试。被救活的轨迹加入训练集时会拿掉 skill,迫使 Qwen3.5-4B 把行为内化,而不是部署时继续依赖外部提示。框架以边际追加成本恢复超过 26% 的原失败实例,并让 SWE-bench Verified resolve rate 比强 RFT 基线高 6.6 点;它把最难样本从负资产变成有验证器把关的课程数据。

OBLIVION15arxiv.org原文 ↗

OBLIVION 研究的不是参数层“忘记”,而是部署后删掉一项 skill 时,agent 能否从 archive、transcript、schema 或 memory 残留把工作流重新拼回来。它把攻击表示成 source-to-sink 路径,结合 Cross-Surface Coherent Erasure 和危险 sink 前的冻结式补救。88 个锁定攻击回合中,无防御成功率 1.0,被压到 0.114,同时效用保持 1.0、良性阻断为 0;另一沙箱也从 1.0 降至 0.2,表明撤销检查必须覆盖可重构路径,而非只检查 registry。

AndroidReality16arxiv.org原文 ↗

AndroidReality 从 MDP 的 state、transition、action 三轴整理现实手机界面的变化,并在 AndroidWorld 上注入可控扰动,补上干净 benchmark 没测到的部署条件。评测暴露明显稳健性缺口和四类反复错误,作者据此设计无需训练的 Test-Time Introspective Recovery,在干净与扰动设置都能缓解失败。摘要没有给出下降与恢复的绝对数字,但它把“界面偶尔不按预期”转成可复现实验变量,比只报告理想环境成功率更接近移动 agent 的真实可靠性。

开源 / 项目 · Projects

12 项 · 开源 / 项目

本期重点H3-metal5github.com原文 ↗

github.com

H3-metal 是 MiniMax-H3 的 Apple Silicon 原生推理实现,C/Objective-C 主机代码直接调 Metal,已贯通文生视频/音频、首尾帧约束和有序图像、视频、音频参考,不是只做到权重加载的实验壳。它直接读 BF16 checkpoint,并把去噪步数、50 层裁剪、整网或 core reuse、token reduction、内部画布缩放做成独立旋钮;M5 Max 四步去噪约 3.5 秒,29 步参考为 26.4 秒。低内存模式每次只留两个 DiT block 并从 SSD 预取,把被追踪的 DiT 张量从约 36.5 GiB 降至 2.0 - 2.1 GiB,但 512 方形前向慢 84%,是一项透明的内存/延迟交换。

Needle217cactuscompute.com原文 ↗

Needle2 把 14MB 模型定位在手机、可穿戴设备和嵌入式设备,内建工具调用与按 schema 抽取,而非追求长篇通用对话。如此小的包体有利于离线、隐私和启动延迟,不过发布条目没有给参数量、量化方式、端侧吞吐或基准集;目前最值得关注的是“专用 agentic 能力压进极小本地模型”的产品方向,而不是尚未展示的性能领先。

Mcptoon18github.com原文 ↗

Mcptoon 用一个零依赖 CLI 统一 stdio/HTTP MCP server,把工具列表和结果输出成紧凑 TOON,同时能导出 OpenAI function、OpenAPI 3.0 与原生 MCP manifest,任何会跑 shell 的 agent 都能接。README 自报 manifest token 省 97%、结果省 40% - 60%,并提供五分钟 schema cache、模糊纠错、stdin 大载荷和纯本地用量记录。路由层默认拦截名称命中 `delete`、`drop`、`purge`、`wipe`、`kill` 的操作,只有显式 `--destructive` 才执行;这种字符串策略是实用护栏,但不能替代工具端权限控制。

git-knife19github.com原文 ↗

github.com

git-knife 把 commit message、作者/提交者姓名邮箱和两套日期做成可批量编辑的桌面表格,并支持正则查找替换与应用前逐项 diff。实现不复刻 Git 对象模型,而是 shell out 到系统 Git,以 `git commit-tree` 复用每个 commit 的原 tree,所以改元数据不会碰文件内容。每次 rewrite 自动建立 backup ref、对已推送历史告警且永不替用户 push;merge commit 当前锁定不可改,说明 MVP 有意收窄最危险的拓扑重写范围。

TermDOM20github.com原文 ↗

github.com

TermDOM 不是把 HTML 粗略转成文本,而是维护真实 DOM document,用 CSS cascade、box model、Flexbox 与 table layout 计算终端单元格,并在 mutation 时重绘。键盘、鼠标、focus、paste 都走 DOM event,表单控件、Shadow DOM、slot、media query、scroll 和 fullscreen 也有对应实现,因此 React 等框架可以把终端当另一种渲染目标。它还处理 CJK、emoji、组合字符和阿拉伯文塑形,最难的宽度与光标问题已进入核心能力,项目的技术密度明显高于常见 ANSI 组件库。

Advect21yaugenst.github.io原文 ↗

yaugenst.github.io

Advect 面向 NumPy 和 Python Array API 做自动微分,但计算不是用过即弃:程序可以被暂存、优化、序列化、重新载入并再次微分。这使同一中间表示能服务图变换、部署和高阶导数,而不仅是提供一个 `grad()` 包装。项目页未给算子覆盖、控制流语义、后端矩阵或性能数据,现阶段适合把它看作可操作微分程序的早期实现,而非已可替换成熟 autodiff 栈的结论。

Tura22github.com原文 ↗

Tura 用 runtime-managed `command_run` 把搜索、补丁、构建、测试组成有依赖的命令图,让确定性步骤连续执行,不必每个 tool result 都带着增长中的 context 回到模型。作者在 20 个 DeepSWE v1.1 任务、每种配置三次的实验中报告:Direct 比 Codex CLI 少 77.5% aggregate token,verifier 成功率 65.0% 对 63.3%;Balanced 成功率 80.0%,仍少用 31.1% token。README 主动注明没有消融能证明宏工具单独造成差异,也列出 provider、跨 OS 与 UI latency 证据缺口,这使项目基准比只给营销总数更可审查。

Chopi23github.com原文 ↗

Chopi 让 macOS agent 继续使用宿主机真实工具,但以 Seatbelt 锁文件系统、Smokescreen CONNECT proxy 锁域名、Caddy relay 锁 GitHub 仓库,绕开容器/VM 带来的环境差异。它只接受 Git worktree 根作为工作区,`.git` 的 objects、refs、index 等数据路径可写,config 与 hooks 保持只读;退出时还会中止可能夹带 `exec` 的未完成 rebase/cherry-pick。对团队规则等“应该先审再写”的目标,agent 只能投递 patch queue,由沙箱外 `chopi-review` 批准,体现了比简单 allowlist 更细的持久化威胁模型。

ExtractBench24github.com原文 ↗

github.com

ExtractBench 要求系统面对未见过的企业文档与 JSON Schema,返回正确值、完整重复记录、明确 `null` 和逐字段来源证据,评分不用 LLM judge。数据集有 370 份文档、4,869 页、八个领域和 67 类 schema,其中 325 份为真实公共记录;长文 split 只有 20 份,却占 1,816 页,专门放大跨页表与列表截断。榜首 unified value F1 为 95.59,但最佳 word-level grounding F1 只有 46.43;“值看似对”与“能指向正确证据”的巨大差距,是这个基准比普通抽取榜更有用的地方。

Pulp25github.com原文 ↗

github.com

Pulp 是 Windows x64 的 C DLL,把日志在调用进程内先做语义去重、LZ4、AVX2 IP 匿名化和 URL 参数剥离,再写二进制 shard,读取端由 `PulpReader` 还原。README 当前在 6 核 Ryzen 5 Pro 8640HS 与 NVMe 上报告完整落盘管线持续超过 2,000 万条/秒、压缩 3 - 6 倍、最低约 20MB 确定性内存。数字包含高基数数据与物理写盘但仍是作者自测,价值更明确地落在零分配热路径和 Windows 原生集成,而非未经独立验证的吞吐冠军称号。

Write.md26writemd.app原文 ↗

writemd.app

Write.md 是免费、开源并可换主题的 macOS Markdown 编辑器,选择轻量原生桌面写作而非账号和云服务优先的路线。公开说明没有展开渲染内核、文件监控、同步或大文档性能,信息密度不足以做技术横评;可确定的差异点是本地应用、零付费门槛和外观可定制三者组合。

Scroll Through Every Rubik’s Cube State27everycube.alen.is原文 ↗

everycube.alen.is

这个网页让用户交互滚动三阶魔方的 43,252,003,274,489,856,000 个合法状态,把抽象的组合规模变成可探索界面。项目不可能静态存下所有画面,真正有意思的部分在状态编号、按需生成与稳定可视化之间的映射;公开页面描述没有解释具体编码或遍历顺序,因此应把它视为精巧的组合数学演示,而不是已公开算法论文。

行业动态 · Industry News

12 项 · 行业动态

OpenAI launches ChatGPT desktop app for Linux28techcrunch.com原文 ↗

techcrunch.com

OpenAI 推出 ChatGPT Linux 桌面客户端,补上官方桌面产品的平台空白。这条发布确认的是客户端可用性扩展,没有伴随可核对的发行版矩阵、打包方式或与 macOS/Windows 的功能对照,因此不宜把它改写成新的模型能力发布。

Nvidia Nemotron 3.5 Lightning and NeMo Switchyard29blogs.nvidia.com原文 ↗

blogs.nvidia.com

Nvidia 将 Nemotron 3.5 Lightning 模型与 NeMo Switchyard 工具一并发布,并把部署叙事放在 RTX PC 与 DGX 系统。模型和切换/编排工具同时出现,反映 Nvidia 正把开放模型、运行时选择与自有硬件打成一套端侧到工作站方案;参数量、许可证和独立基准没有出现在可用描述里,性能判断应等待模型卡。

Mojo 1.030modular.com原文 ↗

modular.com

Modular 在 26.5 版本发布 Mojo 1.0,把高速 CPU/GPU kernel 语言从快速变动阶段推到稳定基线。1.0 对使用者最实在的含义是稳定 API、语义版本与可维护的包生态,而不只是版本号变大;async、private member 等更广义系统编程能力此前被列为后续阶段,不能把首个稳定版等同于路线图全部完成。

OpenSSH 10.531openssh.org原文 ↗

openssh.org

10.5/10.5p1 修复 ssh-agent 锁定与 `session-bind` 交互造成的远程越权、本地 multiplex socket 增加 remote forwarding 时的潜在 use-after-free,以及 `authorized_keys restrict` 未覆盖 tunnel forwarding三项安全问题。Portable OpenSSH 现在要求 libcrypto 具备含 NIST P-521 的 ECC 支持,并新增 `ssh -Z` 打印公钥认证尝试顺序。项目还明确表示 AI 辅助报告增多促使团队暂时提高发布频率,但欢迎的前提仍是人工 triage、测试与修复证据。

Manus will return to operating as an independent company32manus.im原文 ↗

manus.im

Manus 宣布恢复独立公司运营,这是一项公司结构变化而非功能更新。公告摘要没有交代交易架构、切换时间表以及用户合同和数据责任如何承接,现阶段可确认的边界只有经营主体将重新独立,产品和服务影响需由后续条款说明。

OpenAI’s head of ethics leaves less than a year after joining33ft.com原文 ↗

ft.com

Chloé Bakalar 加入不到一年便离开 OpenAI 伦理负责人职位,使公司治理团队的连续性成为关注点。报道摘要没有提供离职原因、继任安排或职能重组,单一人事变化不足以推出 OpenAI 已改变某项伦理或安全政策。

How Claude marks AI-generated content35support.claude.com原文 ↗

support.claude.com

Anthropic 正式说明 Claude 对生成文本和图像采用内容标记机制,把来源披露从界面提示推进为产品政策。标记的实际可信度取决于载荷是否能跨复制、编辑和格式转换保留,以及是否有独立验证入口;当前摘要没有这些实现细节,所以它更像 provenance 承诺的起点,而不是不可移除的水印证明。

GPT-5.6 Cyber36openai.com原文 ↗

openai.com

OpenAI 将 Daybreak 分成 Blue 与 Red 两级,Red 提供基于 GPT-5.6 Sol 专训、减少高风险网络请求拒答的 GPT-5.6 Cyber。内部完成率评测中 Cyber 回答 95.0% 的 exploit-chain、认证绕过和提权请求,Sol 仅 1.5%,上一代 Cyber 为 57.3%;但开放式漏洞发现与报告写作反而弱于 Sol,专训没有全面支配通用强模型。OpenAI 还称该模型协助发现并披露 V8 高危 CVE-2026-15903,并以身份核验、监控、硬件安全密钥和受控账户限制访问。

Briar is in maintenance mode37briarproject.org原文 ↗

briarproject.org

Briar 没有按传闻关闭,但目前只做必要安全更新与 bugfix。团队坦承多年未解决 Android 耗电、后台不可靠、缺少账户备份和附件、离线加联系人困难等问题,也因没有资金和长期重写方案一度准备停止项目。维护模式保住现有通信网络,却意味着用户不应预期短期出现架构级修复;项目能否恢复演进仍取决于资源与可行路线。

Woman pulled over twice after Flock-linked software connected her to homicide38guessingheadlights.com原文 ↗

guessingheadlights.com

报道称 Flock 关联软件把一名女性错误连到凶杀案,导致她两次遭警方持枪拦停。值得警惕的不是一次孤立分类误差,而是错误关联进入执法工作流后被重复采信,并把数字记录转化为现实武力风险;可用描述没有给算法细节和纠错时间线,因此不扩展具体成因。

Go is an ideal language for AI-assisted software engineering39developers.googleblog.com原文 ↗

Google 认为 Go 的小语法面、强约定和统一 `fmt`、build、test、vet/module 工具链,能减少 coding agent 的无效选择,并让改动快速进入机械验证。这个论点把“适合 AI”落在反馈闭环与可验证性,而不是宣称模型天生更会写 Go。它仍是一篇语言工程立场文,不是控制任务难度后的跨语言 benchmark;可取之处是把 agent 效率归因到工具表面设计。

博客文章 · Blog Posts

12 项 · 博客文章

Compression is prediction40ngrok.com原文 ↗

ngrok.com

文章从码长 `-log₂ p` 出发说明:预测器给真实下一符号的概率越高,熵编码所需位数越少,因此预测质量与无损压缩存在严格对应,而非泛泛类比。传统压缩器和语言模型都在寻找可利用结构,区别主要在概率模型与计算预算;next-token loss 也可读成平均编码成本。这个视角值得保留,因为它能用可测压缩率讨论模型是否真正学到分布,却不能把“压得好”直接等同于所有下游智能能力。

Apple Silicon and macOS VMs: Faster LLM Inference with llama.cpp41github.com原文 ↗

github.com

Cua 发现 `Virtualization.framework` 的 guest GPU 保守报告 Apple family 5、32KB threadgroup memory,令 llama.cpp 退回慢 Metal kernel,于是做了仅注入单一 guest 进程的 capability shim,把两个回答改为 family 9 和 64KB。M1 Ultra 上 TinyLlama prompt 从 431.86 升至 4,786.70 tok/s,generation 从 12.63 升至 206.60 tok/s;Gemma 4 12B 的解码也从 3.41 到 49.67 tok/s。该方法没有做 PCI/GPU 直通,且依赖私有、版本敏感行为,只在一台主机和三种 llama.cpp 模型验证;MLX-LM 基本不变,说明收益来自特定 kernel 选择瓶颈。

The whole of PyTorch on one page42tensor.khalilli.ai原文 ↗

tensor.khalilli.ai

这篇“地图”把 PyTorch 的用户层张量与 module API,向下连接 autograd、operator dispatch、图捕获/编译和不同硬件 backend,试图在一页内回答一次调用到底经过哪些层。它不是 API 速查表,而是阅读庞大代码库前的坐标系:同一个算子可同时涉及 Python binding、dispatcher key、梯度定义和设备实现。对框架工程而言,这种全局结构图的价值是减少局部概念错位;文章没有把复杂栈简化成单一执行路径。

Nvidia’s Risky Business43stratechery.com原文 ↗

stratechery.com

Stratechery 从 Nvidia 的主导地位、关键客户与业务边界讨论其风险:平台方既依赖 hyperscaler 持续采购,又通过完整软硬件栈和资本关系增强对生态的控制。增长与集中度是同一结构的两面,少数客户既是需求来源,也有动力发展自研芯片并压低供应商议价权。文章是商业结构分析而非技术 benchmark,值得看的部分在“生态控制如何反过来制造客户冲突”,不是对某季营收作线性外推。

What I learned by putting GitHub Copilot behind a MitM proxy44lighthousenewsletter.com原文 ↗

作者把 VS Code/Copilot 流量置于 mitmproxy 后,观察模型与 capability discovery、请求路由、ghost completion 注入的上下文,以及近期编辑如何牵引当前文件之外的内容。调查还追到 Chronicle 的 SQLite session store,其中保存 prompts/responses,并可被模型通过工具调用查询历史。这类抓包比隐私政策更接近实际数据流,但结论绑定被测版本、功能开关和账号配置;它揭示可审计面,不自动证明所有模式都发送同样内容。

What’s the best programming language for coding agents?45danluu.com原文 ↗

文章把 coding agent 的语言成本定义为完整轨迹预算:读代码、生成补丁、编译失败、测试、回退与再次解释都要算,而不是只比较相同程序的 tokenized 源码长度。静态类型可能增加初稿约束,却用编译器快速暴露错误;简洁语法减少输出,却可能把语义藏进动态行为,熟悉度还会改变 agent 是否绕去 Python 原型。这样的比较提醒基准作者按任务成功后的总 token 计费,不能从“字符少”直接推出“agent 最优语言”。

DeepSeek: Reverse Engineering an AI Assistant by Interviewing Itself46manish.sh原文 ↗

作者先让 DeepSeek 自述 prompt stack、生成、隐藏推理、工具、记忆、MoE 与 MLA,再把回答标成直接观察、推断或猜测,并回查公开论文。模型明确无法查看自己的权重、hidden state、expert routing 和 serving 参数,却对 V3 论文已公开的 256 experts、671B 总参数/37B 激活参数也过度保守,展示“诚实校准”同样会漏掉公共事实。文章最稳健的方法论是把聊天当产品行为访谈,把架构数值交给论文;模型自我解释并不是对内部计算的观测报告。

Introducing Muse Glimmer47simonwillison.net原文 ↗

simonwillison.net

Simon Willison 记录 Meta 以 Apache 2.0 发布 Muse Glimmer 30B 开放权重模型,关键事实是可取得权重、参数级别和宽松再使用许可。这三个条件让本地量化、派生与商用实验有明确起点,但单凭发布摘要无法判断它的上下文、模态、agent/tool-use 或相对评测表现。该条适合作为模型可用性新闻,而不是在缺少模型卡数字时提前授予性能定位。

No, local models will not win48seangoedecke.com原文 ↗

seangoedecke.com

文章反对本地模型会在总体上击败云服务,理由集中在个人设备算力上限、前沿模型快速迭代,以及搜索、工具、记忆和协作等云端产品层能力会与模型共同进步。这个论点把竞争单位从 checkpoint 改成持续运营的完整服务,因此即使开源小模型逼近旧一代能力,也未必追上同期云端产品。结论并不消除隐私、离线、可控成本与低延迟形成的本地细分市场;更准确的读法是本地难以成为所有任务的默认赢家。

Reviewing code is a skill49typesanitizer.com原文 ↗

typesanitizer.com

文章把 review 拆成理解变更意图、建立影响面、识别正确性与维护风险、检查验证证据,再写出可执行反馈,而不是从 diff 第一行开始挑风格。好的意见需要说明失败条件和严重度,并清楚区分必须修改、建议改进与个人偏好;否则评论数量只会增加沟通成本。随着 agent 生成代码速度上升,这套能力更接近独立工程产出:审查者必须验证“改动是否解决原问题”,而不只是判断代码看起来是否像惯用写法。

Rust SIMD on the GPU50vectorware.com原文 ↗

vectorware.com

文章尝试把 Rust SIMD 风格映射到 GPU,让向量类型与熟悉的语言抽象承担并行表达,而不是要求每段逻辑都显式操作 block、warp 和 lane。难点在于 CPU SIMD 是程序声明向量,GPU 则以 SIMT warp 锁步执行;分支发散、lane 利用率、内存 coalescing 和同步语义都不能靠表面语法抹平。方向的价值是把 Rust 类型检查与现有库带到 GPU,但性能是否成立必须按 kernel 形状评估,抽象一致不等于硬件成本一致。

Making holograms with a pen plotter51blog.jordan.matelsky.com原文 ↗

blog.jordan.matelsky.com

作者用 pen plotter 在平面材料上刻画有方向的细密几何轨迹,让不同观察角度接收到不同反射,从而产生全息式深度或运动效果。流程把光学目标离散成绘图仪可重复执行的路径,线距、切线方向、表面和光源几何共同决定成像;成品依靠反射微结构,而非记录完整波前的体积全息。它是一篇很好的跨域制作记录:普通二维机械工具在精确轨迹控制下可以实现超出“画线”的光学行为。

引用来源 · References

61 条 · 引用
  1. 1 The Scaffolding Matters More Than the Interface: A Controlled Comparison of MCP and CLI Tool Use Across Seven Agent Scaffoldings, Five Language Models, and One Software Task. arXiv:2608.08654https://arxiv.org/abs/2608.08654 ↩ 回到正文 · back to text
  2. 2 What Keeps Agent Skills from Being Reusable? Evidence from 138K SKILL.md Files. arXiv:2608.08453https://arxiv.org/abs/2608.08453 ↩ 回到正文 · back to text
  3. 3 Stealing Reasoning Traces from Proprietary LLM APIs. arXiv:2608.09867https://arxiv.org/abs/2608.09867 ↩ 回到正文 · back to text
  4. 4 FailForge: Distilling Procedural Competence from Persistent Failures into Code Agents. arXiv:2608.08570https://arxiv.org/abs/2608.08570 ↩ 回到正文 · back to text
  5. 5 H3-metal. GitHub: antirez/h3.chttps://github.com/antirez/h3.c ↩ 回到正文 · back to text
  6. 6 Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents. arXiv:2608.08389https://arxiv.org/abs/2608.08389 ↩ 回到正文 · back to text
  7. 7 MasDrift: Benchmarking Authorization Preservation Across Multi-Agent Architectures. arXiv:2608.07556https://arxiv.org/abs/2608.07556 ↩ 回到正文 · back to text
  8. 8 SodaMem: Evidence-Grounded Temporal Graph Memory for LLM Agents. arXiv:2608.08055https://arxiv.org/abs/2608.08055 ↩ 回到正文 · back to text
  9. 9 Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution. arXiv:2608.07645https://arxiv.org/abs/2608.07645 ↩ 回到正文 · back to text
  10. 10 TeXFix-Bench: An Empirically Grounded Multi-Format Benchmark for LLM-Based Document Source Repair. arXiv:2608.07617https://arxiv.org/abs/2608.07617 ↩ 回到正文 · back to text
  11. 11 Your Prompt Is Not the Only Prompt: How Much Do LLMs Weight Structured-Output Schema Descriptions? arXiv:2608.08254https://arxiv.org/abs/2608.08254 ↩ 回到正文 · back to text
  12. 12 TelemetrySuffBench: Is Agent Telemetry Sufficient for Failure-Origin Diagnosis? arXiv:2608.07899https://arxiv.org/abs/2608.07899 ↩ 回到正文 · back to text
  13. 13 Governing the KV Cache: Preventing Timing Side-Channel Leakage in Multi-Tenant LLM Inference. arXiv:2608.09225https://arxiv.org/abs/2608.09225 ↩ 回到正文 · back to text
  14. 14 Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute. arXiv:2608.09351https://arxiv.org/abs/2608.09351 ↩ 回到正文 · back to text
  15. 15 OBLIVION: Workflow-Level Operational Skill Unlearning for Deployed Agents. arXiv:2608.08264https://arxiv.org/abs/2608.08264 ↩ 回到正文 · back to text
  16. 16 AndroidReality: How Far Are Mobile Agents from the Real World? arXiv:2608.07775https://arxiv.org/abs/2608.07775 ↩ 回到正文 · back to text
  17. 17 Needle2https://cactuscompute.com/needle ↩ 回到正文 · back to text
  18. 18 Mcptoon. GitHub: activeing123/mcptoonhttps://github.com/activeing123/mcptoon ↩ 回到正文 · back to text
  19. 19 git-knife. GitHub: TheRealYT/git-knifehttps://github.com/TheRealYT/git-knife ↩ 回到正文 · back to text
  20. 20 TermDOM. GitHub: bikeshaving/termdomhttps://github.com/bikeshaving/termdom ↩ 回到正文 · back to text
  21. 21 Advecthttps://yaugenst.github.io/advect/0.1.0/playground/ ↩ 回到正文 · back to text
  22. 22 Tura. GitHub: Tura-AI/turahttps://github.com/Tura-AI/tura ↩ 回到正文 · back to text
  23. 23 Chopi. GitHub: danra/chopihttps://github.com/danra/chopi ↩ 回到正文 · back to text
  24. 24 ExtractBench. GitHub: run-llama/ExtractBenchhttps://github.com/run-llama/ExtractBench ↩ 回到正文 · back to text
  25. 25 Pulp. GitHub: superwired-labs/Pulphttps://github.com/superwired-labs/Pulp ↩ 回到正文 · back to text
  26. 26 Write.mdhttps://writemd.app/ ↩ 回到正文 · back to text
  27. 27 Scroll Through Every Rubik’s Cube Statehttps://everycube.alen.is/ ↩ 回到正文 · back to text
  28. 28 OpenAI launches ChatGPT desktop app for Linuxhttps://techcrunch.com/2026/08/11/openai-launches-chatgpt-desktop-app-for-linux/ ↩ 回到正文 · back to text
  29. 29 Nvidia Nemotron 3.5 Lightning and NeMo Switchyardhttps://blogs.nvidia.com/blog/nemotron-lightning-switchyard-rtx-dgx/ ↩ 回到正文 · back to text
  30. 30 Mojo 1.0https://www.modular.com/blog/modular-26-5-mojo-1-0-is-here ↩ 回到正文 · back to text
  31. 31 OpenSSH 10.5https://www.openssh.org/releasenotes.html#10.5 ↩ 回到正文 · back to text
  32. 32 Manus will return to operating as an independent companyhttps://manus.im/blog/a-note-to-our-users ↩ 回到正文 · back to text
  33. 33 OpenAI’s head of ethics leaves less than a year after joininghttps://www.ft.com/content/e49dfb75-f841-4466-a577-f7aaff8779a0 ↩ 回到正文 · back to text
  34. 34 Mark Zuckerberg attacks “closed” AI rivals as Meta returns to open modelshttps://www.ft.com/content/4e3957f8-ea7c-4c46-a3de-cdce8e526878 ↩ 回到正文 · back to text
  35. 35 How Claude marks AI-generated contenthttps://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content ↩ 回到正文 · back to text
  36. 36 GPT-5.6 Cyberhttps://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows/ ↩ 回到正文 · back to text
  37. 37 Briar is in maintenance modehttps://briarproject.org/news/2026-maintenance-mode/ ↩ 回到正文 · back to text
  38. 38 Woman pulled over twice after Flock-linked software connected her to homicidehttps://guessingheadlights.com/yall-failed-me-woman-pulled-over-at-gunpoint-twice-after-flock-camera-glitch/ ↩ 回到正文 · back to text
  39. 39 Go is an ideal language for AI-assisted software engineeringhttps://developers.googleblog.com/why-go-is-an-ideal-language-for-ai-assisted-software-engineering/ ↩ 回到正文 · back to text
  40. 40 Compression is predictionhttps://ngrok.com/blog/compression-is-prediction ↩ 回到正文 · back to text
  41. 41 Apple Silicon and macOS VMs: Faster LLM Inference with llama.cpp. GitHub: trycua/cuahttps://github.com/trycua/cua/blob/main/blog/gpu-passthrough-macos-vms.md ↩ 回到正文 · back to text
  42. 42 The whole of PyTorch on one pagehttps://tensor.khalilli.ai/blog/part-0-the-map/ ↩ 回到正文 · back to text
  43. 43 Nvidia’s Risky Businesshttps://stratechery.com/2026/nvidias-risky-business/ ↩ 回到正文 · back to text
  44. 44 What I learned by putting GitHub Copilot behind a MitM proxyhttps://www.lighthousenewsletter.com/p/i-put-github-copilot-behind-a-mitm ↩ 回到正文 · back to text
  45. 45 What’s the best programming language for coding agents?http://danluu.com/pl-tokens/ ↩ 回到正文 · back to text
  46. 46 DeepSeek: Reverse Engineering an AI Assistant by Interviewing Itselfhttps://manish.sh/writings/models/inside-deepseek-reverse-engineering-an-ai-assistant-by-interviewing-itself ↩ 回到正文 · back to text
  47. 47 Introducing Muse Glimmerhttps://simonwillison.net/2026/Aug/10/introducing-muse-glimmer/#atom-everything ↩ 回到正文 · back to text
  48. 48 No, local models will not winhttps://www.seangoedecke.com/local-models-will-not-win/ ↩ 回到正文 · back to text
  49. 49 Reviewing code is a skillhttps://typesanitizer.com/blog/code-review.html ↩ 回到正文 · back to text
  50. 50 Rust SIMD on the GPUhttps://www.vectorware.com/blog/simd-on-gpu/ ↩ 回到正文 · back to text
  51. 51 Making holograms with a pen plotterhttps://blog.jordan.matelsky.com/Penplotter-holography/ ↩ 回到正文 · back to text
  52. 52 paperclipai/paperclip. GitHub: paperclipai/papercliphttps://github.com/paperclipai/paperclip ↩ 回到正文 · back to text
  53. 53 danielmiessler/LifeOS. GitHub: danielmiessler/LifeOShttps://github.com/danielmiessler/LifeOS ↩ 回到正文 · back to text
  54. 54 opa334/Dopamine. GitHub: opa334/Dopaminehttps://github.com/opa334/Dopamine ↩ 回到正文 · back to text
  55. 55 huangruiteng/loopx. GitHub: huangruiteng/loopxhttps://github.com/huangruiteng/loopx ↩ 回到正文 · back to text
  56. 56 joelbqz/writer-computer. GitHub: joelbqz/writer-computerhttps://github.com/joelbqz/writer-computer ↩ 回到正文 · back to text
  57. 57 semantica-agi/semantica. GitHub: semantica-agi/semanticahttps://github.com/semantica-agi/semantica ↩ 回到正文 · back to text
  58. 58 brightdata/cli. GitHub: brightdata/clihttps://github.com/brightdata/cli ↩ 回到正文 · back to text
  59. 59 mufeedvh/code2prompt. GitHub: mufeedvh/code2prompthttps://github.com/mufeedvh/code2prompt ↩ 回到正文 · back to text
  60. 60 confident-ai/deepteam. GitHub: confident-ai/deepteamhttps://github.com/confident-ai/deepteam ↩ 回到正文 · back to text
  61. 61 neuml/txtai. GitHub: neuml/txtaihttps://github.com/neuml/txtai ↩ 回到正文 · back to text