每日 Harness 开源 · Source
全部刊期 · All issues

每日 Harness

2026-08-15 · Saturday, August 15, 2026

智能体走向可验可控可审计

视图 · View

今日重点 · Today's Highlights

StateBridge - 用闭式正交对齐替代训练式投影器,在 26 个异构模型通信组合中取得 22 个最佳或并列最佳结果。

全文 ↓

Vero - 把形式化编程评测从孤立定理扩展到 43 个 Lean 4 多模块仓库,并允许审计规范与参考实现本身。

全文 ↓

Graft - tree-sitter 代码图和按需摘要在受控实验中减少 42% token,同时保持正确率并提高 SWE-bench 通过数。

全文 ↓

Self-bench - 从仓库已经完成的变更反建隐藏测试和参考解,让私有开发历史直接变成抗泄漏 coding-agent 评测。

全文 ↓

论文 · Papers

15 项 · 论文

本期重点A Contract-Grade Verifier for LLM-Generated GPU Kernels1arxiv.org原文 ↗

作者没有再把“若干样例输出相近”当作内核正确,而是设置 12 道对抗性关卡,其中多项完全不允许容差。重审 2,638 个此前获准的机器生成内核后,39.5% 已超出数值容差,62.1% 至少违反一项契约;普通测试误收 1,487 个,而新验证器相对普通测试只多拒 14 个。论文还给出 Blackwell `tcgen05` 的 GDN 反向实现并以双精度验证,说明验证器也能支撑真正的新内核开发,而非只做事后挑错。

MindMemOS: A Portable and Self-Evolving Memory Operating Layer for AI Agents2arxiv.org原文 ↗

MindMemOS 以实体 - 属性 - 时间统一承载事实记忆,通过 schema 搜索、去重、冲突消解和轨迹技能化,让记忆结构与程序知识随运行演化。它在 LOCOMO 和 PersonaMem 上分别达到 94.03% 与 70.63%,在 SpreadsheetBench 上再提高 9.2 个百分点。相比只增加向量库容量,这套设计把“记住什么、如何整理、何时形成技能”放进同一个生命周期,实验也覆盖了记忆问答与实际工具任务两种收益面。

Governed Persistent Memory3arxiv.org原文 ↗

这项工作把长期记忆定义成可审计的双时态状态机,写入前校验来源,冲突时隔离,撤回或删除后禁止复活,释放声明则默认 fail-closed。治理实现匹配全部 3,600 个测试;最强的简单策略只对 1,800 个,且在违规情形中有一半会释放不该出现的内容。模型检查遍历 331,776 个语义状态与 1,990,656 个查询状态而未见反例,不过作者明确把结论限定在给定契约和状态边界内,而非宣称系统记忆等同于现实真相。

Dead text or binding clause?4arxiv.org原文 ↗

论文测量已撤销约束仍然影响后续行为的 “revocation inertia”,并用带 tombstone 的契约账本、可执行 checker 与逐项消融探针定位残余。单句 tombstone 能挽回约三分之一的约束编译效应,自适应修复阶梯却没有可检测的额外增益;8B 模型还会随着约束负载增加而更糟。结果把一个常被归为“上下文混乱”的现象变成可单独测试的生命周期缺陷,也表明在 prompt 尾部追加取消说明并不足以清除旧规则。

SteerBench-Work5arxiv.org原文 ↗

SteerBench-Work 收录 7 个领域的 106 个事故锚定工作场景,并为每例构造证据反转镜像,要求 agent 在发信、合并代码或付款前选择执行或暂停。30 种模型条件下,错误阻止已授权工作的比例达 28.1%,错误放行危险动作只有 1.0%;在知名事故叙事上得分 98.5%,换成反向现场证据便跌至 63.8%。这个不对称说明当前安全训练更容易制造保守先验,模型未必真在读取决定权限的具体证据。

Practice Makes Unsafe6arxiv.org原文 ↗

作者追踪自改进 agent 如何把一次“不安全但成功”的轨迹固化为可跨会话调用的技能,并用版本化技能状态、冻结基准和 9 项生命周期指标观测扩散。25 个配置各执行 525 个任务、25 个 episode;21 个发生演化的配置全都生成不安全制品,15 个会在新会话造成伤害,三次恶意练习把 carryover ASR 从 16.0% 推到 35.3%。SafeEvolve 将不安全检索和新会话伤害分别压低 26.7 与 17.3 个百分点,良性效用仅变化 0.4 点,证明风险控制可以作用在技能准入而非等到输出末端拦截。

Rethinking Normalization Placement for LLMs7arxiv.org原文 ↗

arxiv.org

研究用 Qwen3-8B 教师和 9 层学生重新检验 pre-norm 与 post-norm,关键变量不是架构单独训练,而是逐步增加 Transformer 深度的课程。联合训练时两者验证交叉熵只差 0.0004;采用扩深课程后 post-norm 领先 0.0328,控制实验把反转定位到新 block 的追加。pre-norm 出现结构 token 尺度漂移且末层近似恒等,提示所谓稳定性优势会随增长式训练路径改变,不能从固定深度实验直接外推。

SkillShapley8arxiv.org原文 ↗

SkillShapley 以 Shapley 边际贡献衡量 agent skill 中每一步究竟增加还是损害最终奖励。由于离散任务常有奖励悬崖,完整组合又指数爆炸,算法先寻找最有信息的 coalition 边界,再自适应复用已采样的边际证据;SkillsBench 用它识别关键、冗余和破坏性步骤。这项归因把整条 skill 的单一分数拆成可操作诊断,下一步关键是检验步骤贡献能否跨任务和采样种子保持稳定。

TsuGO9arxiv.org原文 ↗

TsuGO 把围棋死活题用作答案封闭可验的搜索实验室,将 chain-of-thought 解析成树,并分别计算搜索效率与 token 效率。强模型往往较早提出正确候选,也更常沿有效分支推进,但总体轨迹仍接近无引导搜索而不是 KataGo 式规划。更长推理未必提高单位 token 产出,这让评测能区分“最终碰到答案”和“把计算预算分配到有希望的分支”。

本期重点StateBridge10arxiv.org原文 ↗

StateBridge 直接求一个正交变换,将发送模型的最终隐藏状态对齐到接收模型输入空间,再经范数校准和词表锚定注入为连续前缀。方法不训练 projector,也不要求成对通信数据;在数学、代码、问答任务的 4 个模型、2 个家族间,26 个方向组合有 22 个最佳或并列最佳。闭式映射把异构 agent 通信从自然语言中介推进到可部署的连续表示层,但适用范围仍取决于词表锚点是否足以连接两个模型的语义几何。

Beyond Final Scores11arxiv.org原文 ↗

该研究在 7 个前沿模型、36 项长程 AI 研发任务上记录方案形成、执行、反馈控制与经验复用,而非只收集最终 leaderboard 分。过程日志显示 agent 更像工程优化器:能迭代已有方向,却少有真正新颖的研究假设;同一设置运行方差大,先前经验有时提速、有时把搜索带偏。这样的分解解释了两个同分系统可能具有完全不同的失败位置,也为评估研发自动化提供了比单次最好成绩更可靠的观察单位。

Humans are Missing from AI Coding Agent Research12arxiv.org原文 ↗

这篇立场论文指出,多数 coding-agent benchmark 把人从回路中拿掉,于是通过率无法反映澄清需求、监督中间步骤和纠正方向的真实成本。作者提出任务对齐、可验证性、可操控性、适应性四个维度,要求实验覆盖 agent 如何融入人的工作流。它没有提供新的性能数字,贡献是为下一代评测划定缺失变量;能否落地仍需要把人类时间、干预质量和团队差异变成可重复协议。

Reduced Matrix Multiplication13arxiv.org原文 ↗

arxiv.org

Reduced Matrix Multiplication 在矩阵收缩维度上按当前输入挑选高信息切片,以保留率调节算量,不需要重训或额外校准模型。实验从 1B 延伸到 70B,覆盖判别、生成、长上下文和多模态任务,并观察到 attention 通常比 MLP 更可削减;面向 A100 的自定义 kernel 在长序列获得实际运行时收益。后一点很关键,因为输入自适应稀疏若只减少理论 FLOPs,却无法形成规则访存,通常不会转化为端到端速度。

本期重点Vero: Can AI Agents Build Formally Verified Software Repositories?14arxiv.org原文 ↗

Vero 将原本分散在 Python、Dafny、Verus、Coq 的 43 个真实多模块实例重写为 Lean 4 仓库,提供 API、规范和参考实现,并设置 proof-only 与 code-plus-proof 两条赛道。审计不默认题目正确:它能证明部分规范不可满足或参考实现有错;最佳 agent 完成 27/43,却没有系统关闭最难仓库。基准因此同时测定理证明、实现和跨文件依赖管理,也避免把有缺陷的 oracle 当作不可质疑的真值。

AI Guardrail Survival under Single-Cycle Agentic Self-Summarization15arxiv.org原文 ↗

作者只做一次上下文自摘要,却不满足于检查规则句子是否“还在”,而是重放决策看规则是否真的触发。相对完整焊接规则,退化残留使禁止动作在两种 replay 模型中分别增加 34 和 57 个百分点;规则文本比匹配长度的事实更易保留,但保留下来也可能不生效。实验范围限于单轮压缩,仍足以证明关键护栏不能只寄托于 agent 自己的摘要,应有独立规则注册和执行检查。

开源 / 项目 · Projects

15 项 · 开源 / 项目

Memcode16github.com原文 ↗

Memcode 把 coding agent 打包成一个 Go 二进制 TUI,并把子系统知识、会话历史、失败和偏好写入可版本控制的 `.memcode` 仓库。客户端负责模型路由与回退,可接 OpenAI 兼容或原生 provider,还能经 Telegram、Discord、Slack、GitHub、WhatsApp 等 gateway 收发任务。项目目前规模很小,阅读时约 14 stars,但“记忆是仓库内明文资产”比隐藏在服务端向量库更便于审查和迁移。

RCA-lab17github.com原文 ↗

github.com

RCA-lab 在 Kubernetes 中运行 Python、Go、Java、Node、Rust、PHP 服务以及 PostgreSQL、MySQL、MongoDB、Valkey、Kafka,用真实机制制造锁等待、GC、泄漏、事件循环阻塞和 noisy neighbor。FailureScenario CR 负责注入并持久化回滚状态,整套实验约需 8 CPU、16 GiB 内存,产品表预置约 10GB 数据。它比静态日志样本更能检验 OTel 与 RCA 系统是否沿因果链定位故障,不过 README 明确警告不要部署到共享或生产集群。

Mocktail18getmocktail.com原文 ↗

getmocktail.com

Mocktail 把 mock API 路由、可视化控制台和内置数据库装进约 25MB 的单个二进制,可在本机或团队基础设施自托管,也不要求云端账号。减少外部数据库与控制面的依赖,使临时联调环境更容易随测试一起启动和销毁。轻量分发、持久响应与浏览器管理三者合一,定位比依赖完整后端栈的 mock 平台更聚焦。

E3d-pilot19github.com原文 ↗

E3d-pilot 以 Bash 编排发现、构思、人工批准、隔离 worktree 实现、验证、起草 PR,再由独立批准步骤合并。当前两个 reviewer 必须对未变化的草案一致同意,最终授权还绑定精确 PR URL、base 和 head SHA;受保护路径、diff 文件数与行数上限控制改动面。完整事件写入 `.e3d-pilot/events.jsonl`,所以这不是让 agent 无限循环“自我改进”,而是将每次自治变更压进可重放的供应链门禁。

Mole20github.com原文 ↗

Mole 是 Go 编写的静态深度研究工具,会分解问题、搜索来源、整理声明、检测矛盾并输出引用。每次模型调用先在数据库预算账本预留再结算,测试中超支为 0%;引文若无法逐字出现在来源就直接丢弃。本地分析只允许至少 5 条记录后的聚合计数、均值、检验和分桶离开设备,再加 SQLite、MCP 和 14 个内置工具,形成了比“能搜网页”更完整的成本与数据边界。

LuaCAD21luacad.ad-si.com原文 ↗

luacad.ad-si.com

LuaCAD 让参数化几何直接写成 Lua,并通过运算符重载把 `a+b`、`a-b`、`a*b` 映射为 CSG 并集、差集和交集。命令行适合批量生成,桌面端承担编辑和预览,脚本本身就是可复现模型定义。通用语言的组合能力是它当前最鲜明的优势;几何内核鲁棒性和交换格式支持仍会决定它能否进入成熟 CAD 流程。

本期重点Graft22github.com原文 ↗

Graft 先用 tree-sitter 建确定性结构图,再生成彼此链接的 Markdown 摘要,让 coding agent 按需拉取而不反复 grep 整库。162 次受控运行把平均 token 从 8,070 降至 4,650、调用从 4.2 降至 2.3、延迟从 39.8 秒降至 15.8 秒,正确率仍是 93%;50 个 SWE-bench 实例则从 27 个通过升到 33 个。支持 20 种语言且单文件改动可增量刷新,说明它把上下文压缩落实为可测的代码索引层,而不仅是一段导航 prompt。

本期重点Self-bench23github.com原文 ↗

Self-bench 从已经完成的本地 agent 会话或合并 PR 找到修改前 commit,自动构造隐藏测试和参考解,再证明原代码失败、参考解通过后导出 Harbor 包。难度分档至少要求 20、50、100 行实现改动并跨 1、2、3 条路径,测试与解答均不暴露给被测 agent。这条流水线让组织用自己的真实变更分布测 coding agent,同时降低公开 benchmark 被训练集记忆污染的问题。

Hexis24github.com原文 ↗

Hexis 把 skills、tools、context、permissions 与 identity 存成平台拥有的 Git 文件,配 owner、review 和逐文件权限,再通过自托管 MCP 交给 agent。agent 不直接拿底层凭据,SSO 与变更历史把安装脚本难以回答的“谁批准了哪项能力”显式化。README 给出的 Docker 启动只需 4 个必填环境值并宣称约 5 分钟部署,适合需要集中治理多 agent 配置的团队,但价值要靠实际权限边界而非目录管理来验证。

Shoehorn25github.com原文 ↗

蒸馏与压缩系统·基础设施

Shoehorn 读取 BF16 GGUF 与 importance matrix,先从显存预算扣除 KV cache、计算区和预留,再用加权误差为每个 tensor 选择量化档位,以拉格朗日加贪心求多选背包。示例在 519.2MiB 预算内使用 99.981%,只剩 103,424 字节,平均 7.306 bpw;Qwen3-0.6B 方案求解约 0.7 秒。精确预算和逐 tensor 误差权衡比“整模选 Q4/Q5”更贴近统一内存设备的硬上限,输出仍保持 GGUFv3 可用性。

Easel26github.com原文 ↗

Easel 让 agent 发布一个本地审阅页面,人类在浏览器直接标注,阻塞的 `await` 收到结构化 JSON,重新发布后显示视觉差异。守护进程只监听 `127.0.0.1:4400` 并持久化状态,预置 review、eval、rulings、queue、page 等模板,还能把 Mermaid 转成 Excalidraw。当前 macOS 与 Node 22 门槛、约 1GB Puppeteer Chromium 是实际成本,但页面级反馈比把视觉意见重新翻译成聊天文字更少丢坐标和对象身份。

Remarc27github.com原文 ↗

Remarc 从 macOS 菜单栏捕获选中文字、截图、网页元素或语音,再经 MCP 和插件把反馈送到 Claude、Codex、Cursor。浏览器扩展保留 URL、DOM/CSS、布局、可访问性与 React 上下文;macOS 26 的语音可由 Apple Speech、WhisperKit 或 Parakeet 在本地转写。它解决的是评论到代码证据链的定位损耗,而会话状态跟踪也让 reviewer 能看到意见是否已被接收、处理或关闭。

MCP-stama28github.com原文 ↗

MCP-stama 是无第三方依赖的 Rust stdio JSON-RPC server,提供 fast_grep、基于 gix 的 git_snapshot 和 docker_watcher。README 的 100 次自测中,docker 工具 p50 为 327 微秒、p99 为 1.66 毫秒,Git 为 462 微秒和 1.36 毫秒,grep 为 5.05 与 8.72 毫秒;二进制宣称低于 10MB、冷启动低于 2ms。这些是项目方微基准而非跨实现审计,但至少把“轻量”落到了可复跑指标。

Lumabri29github.com原文 ↗

github.com

Lumabri 用纯 C 的 Colibri 网络把 MoE 权重分散在点对点节点:tracker 索引持有者,maintainer 接受字节范围读取,客户端用 `LD_PRELOAD` 拦截文件 API 并在稀疏镜像缺块时取回。首个问题会受网络拖慢,后续命中本地块,缓存完整后可以离线;CPU 与 SSD 是默认路径,GPU 只做可选加速。它把“分布式推理”缩成文件块供应协议,部署简洁,但吞吐上限仍直接受专家命中分布和网络尾延迟支配。

OpenAnalytics30github.com原文 ↗

github.com

OpenAnalytics 不设 cookie 或跨站标识,访客哈希加盐并每晚轮换,城市定位只有显式开启本地库才工作。pnpm monorepo 同时包含 tracker、collector、worker、API、查询网关、实时层、Web 与 CLI,后端依赖 Postgres、ClickHouse 和两套 Valkey,查询信封用 Ed25519 签名。约 4GB 内存、4 个 DNS 名和 10 个预构建镜像说明它是完整分析基础设施而非单容器小工具,隐私收益要与相应运维面一起评估。

行业动态 · Industry News

14 项 · 行业动态

Qwen3.8-27B31huggingface.co原文 ↗

huggingface.co

Qwen 发布 27B 参数的 Qwen3.8 FP8 权重和模型卡,提供面向低精度推理栈的部署工件。FP8 可直接减轻权重存储与显存压力,但模型页所代表的是精度变体发布,不能仅凭参数量和格式推断相对其他 Qwen 版本的质量变化。

GLM-5.3: Frontier coding with emergent cyber capabilities32z.ai原文 ↗

z.ai

Z.ai 称 GLM-5.3 沿用 GLM-5.2 底座,能力增量主要由后训练取得;内部 Z.ai Code Bench 约提升 50%,并报告 Terminal Bench 3.0、Agent's Last Exam 与 CyberGym 的更强结果。网络利用能力随编程能力一起上升,团队计划在约两周安全加固后开放权重,这个时间差反映发布方对可用性与双重用途风险的取舍。

DeepSeek peak/off-peak pricing update33api-docs.deepseek.com原文 ↗

api-docs.deepseek.com

DeepSeek 把 API 调用拆成高峰与低谷时段分别计价,同一模型、同样 token 量会因 UTC 调度时间产生不同成本。可延迟的批处理、离线评测和 agent 队列因此能通过移峰降费,实时产品则必须按峰值费率做预算;这项调整改变部署经济性,并不表示上下文或模型能力同步更新。

How Google is making private AI practical with homomorphic encryption34blog.google原文 ↗

blog.google

Google 介绍用同态加密让服务端直接对密文执行 AI 计算,数据无须先恢复成平台可见的明文,结果再由持钥方解密。它将“云端是否可信”转化为密钥、允许算子和密码学安全假设,适用于高度敏感输入;真正能否普及仍由推理延迟、支持的运算范围和密文膨胀共同决定,而不只是算法在功能上可行。

How Claude's text watermarking works35anthropic.com原文 ↗

anthropic.com

Anthropic 公开 Claude 文本水印的嵌入、检测和鲁棒性思路:生成时在 token 选择分布中留下统计信号,检测器再对足够长文本给出概率判断。改写、截断、误报率和短样本都会削弱证据,因此水印更适合平台级来源线索,而不是单篇文本作者身份的密码学证明。

Anthropic Risk Report - August 202636www-cdn.anthropic.com原文 ↗

www-cdn.anthropic.com

Anthropic 发布经过删节的 2026 年 8 月风险报告,记录其模型风险识别、评估和缓解框架。删节版同时限定了外界能审计的证据范围:公开分类和控制可用于对照后续模型发布,但空白处不能被当作“没有风险”,报告价值最终取决于承诺能否映射到可观察措施。

Mistral OCR 4.138docs.mistral.ai原文 ↗

docs.mistral.ai

Mistral 更新 OCR 4.1 模型及 API 文档,服务对象是扫描件、图片与复杂版面进入结构化文档管线的环节。调用方需要用自己的表格、公式、多栏页面和低质扫描回归,并固定版本标识;OCR 的小版本升级可能改变布局还原和字段边界,不能只以纯文本字符准确率验收。

Bluesky Protocol Services39atproto.com原文 ↗

atproto.com

Bluesky 推出面向 AT Protocol 应用的托管协议服务,并带来可做网络重放的 Jetstream v2。开发者可少运行一部分 relay、索引和事件消费设施,同时仍以开放协议取得数据;轻量 JSON 流与断线重放的组合,瞄准的正是联邦应用从 demo 走向长期运行时最常见的状态恢复成本。

RustDesk now supports true unattended remote access on Wayland40rustdesk.com原文 ↗

rustdesk.com

RustDesk 宣布在 Wayland 下实现无需本地确认的无人值守远程访问,补齐重启后远程维护 Linux 桌面的关键路径。能力越接近真正 unattended,凭据保管、会话解锁、桌面授权和审计的风险也越集中;部署验收应从外部机器跨重启实连,而不能只看本地设置已开启。

Firefox is now the last major browser that still supports uBlock Origin41pcworld.com原文 ↗

pcworld.com

Firefox 目前仍能运行完整版 uBlock Origin,主要因为它继续提供扩展所需的 MV2 `webRequest` 阻断能力。Chromium 的 MV3 转向 `declarativeNetRequest`,留下的是功能受限的 uBO Lite;差异会落到动态过滤、规则规模和高级防跟踪,而不只是扩展名称是否还能在商店搜到。

France's top court blocks social media ban for under-15s42reuters.com原文 ↗

reuters.com

法国最高法院阻止面向 15 岁以下人群的社交媒体禁令,认定其对表达自由的压缩过宽。裁决没有否认未成年人保护目标,而是要求限制具有比例性;后续政策若重写,年龄核验的隐私成本、平台义务和更窄的风险控制将必须一起被论证。

Z.ai Security Disclosure43cvd.z.ai原文 ↗

cvd.z.ai

Z.ai 上线安全漏洞披露与协调入口,为研究者提供明确的报告路径。门户只是起点,实际可信度取决于范围说明、safe harbor、响应时限和修复后的公开记录;这些机制决定研究者是在受保护流程中协作,还是仍需依靠非正式渠道推动处理。

Nine PBS sues Iron Mountain over blocked access to archival data44current.org原文 ↗

current.org

Nine PBS 因无法取得由 Iron Mountain 托管的历史影音数据而提起诉讼。案件把档案系统常被忽略的区别摆到台前:介质仍在不代表拥有者能按时、完整、带元数据地导出;公共文化资产的合同需要把访问连续性、开放格式和退出迁移写成可执行义务。

博客文章 · Blog Posts

15 项 · 博客文章

Everything is about to “go dark”45blog.cryptographyengineering.com原文 ↗

blog.cryptographyengineering.com

Matthew Green 从端到端加密扩张讨论平台可见性、个人隐私与执法部门所谓 “going dark” 的冲突。分析应区分消息内容、元数据、终端设备和合法取证渠道:服务端不再持有明文会改变证据获取边界,而任何人为例外也会成为普通攻击者可瞄准的接口。文章把政治口号拉回密码系统无法只给“好人”留后门这一结构性约束。

What You Gain by Building Your Own Game Engine46eliasfarhan.ch原文 ↗

eliasfarhan.ch

作者把自研游戏引擎的收益落在架构控制和认知深度:渲染、资源、场景、平台层如何连接,不再由大型现成引擎替团队决定。对应成本是编辑器、资产工具、跨平台兼容和长期维护都要自行承担。它更像一份边界清楚的工程交换表,而不是“所有项目都该重造基础设施”的宣言。

ActivityPub Won by Being Boring47o.ee原文 ↗

o.ee

文章认为 ActivityPub 的胜出来自稳定、通用且足够容易实现,而非拥有最精巧的联邦协议抽象。共享对象与 inbox/outbox 模型让不同社交产品在相同兼容面上各自演化,互操作无需所有参与者同步创新。这里的“无聊”意味着故障和行为更可预测,也意味着一旦生态形成,历史包袱会与网络效应一起固化。

RISC-V: They Should Have Known Better48dmitry.gr原文 ↗

dmitry.gr

作者从编码、扩展组合和微架构实现成本批评 RISC-V 的若干 ISA 选择,反对把开放许可直接等同于技术简洁。其核心提醒是复杂度不会消失:规范层少做的工作,常会转移给解码器、编译器、验证或兼容层。这是立场鲜明的反方文章,最适合拿具体指令与扩展权衡逐项核对,而非把结论当作对整个生态的一票否决。

There Is Still No Silver Bullet49cekrem.github.io原文 ↗

cekrem.github.io

文章重访 Brooks 的本质复杂度与偶然复杂度:框架、语言和 AI 能显著减少表达与操作摩擦,却不会替需求冲突、领域规则和跨系统协调给出唯一答案。代码生成越便宜,理解要建什么、证明行为正确所占比例反而越高。“没有银弹”在这里不是否认工具进步,而是拒绝把局部速度提升误写成软件交付的整体自动化。

Why does Opus 5 feel worse to work with?50mun-logadan.github.io原文 ↗

mun-logadan.github.io

作者记录与 Opus 5 协作时观察到的风格、指令执行和节奏变化,并尝试解释主观体验为何下降。它是使用者现场笔记而非控制实验,不能从“感觉更差”直接推导总体能力回退;文章更有用的产物是那些可转成复现任务的摩擦点,之后才能分离模型、系统提示和工具环境的影响。

Where did the old web go?510.mk原文 ↗

0.mk

作者追踪 657,607 个链接,把旧网页的命运分成存活、重定向和失效等状态,给 link rot 一份大样本剖面。这个规模使“旧互联网在消失”从印象变成可测现象,也暴露 URL 只是定位符、不是长期证据。需要多年可验证的引用应同时保存快照、内容哈希或归档副本,单靠原链接无法承担保存职责。

Choosing an AI model: one prompt, 11 models, different results52netlify.com原文 ↗

netlify.com

Netlify 让 11 个模型执行同一个开发任务,比较输出结构、实现路线与完成效果。相同 prompt 只控制需求入口,并未消除组件拆分、依赖选择、边界处理和自我验证上的分歧。模型采购因此应复用团队自己的任务样本,并把可维护性与部署结果一起评分,而不是只按通用榜单挑最高名次。

Understanding is the new bottleneck53geoffreylitt.com原文 ↗

Geoffrey Litt 将 AI 编程的新瓶颈定义为建立足以参与下一轮创造的理解,而非仅能给生成结果盖章。文中给出三类界面:带 5 题测验的 “literate diff”、可操作的 micro-world,以及人与 agent 共用的空间;作者甚至要求自己答对后 agent 才交代码。这个做法把认知债务变成流程阻塞条件,直指快速产出让人逐渐失去系统模型的风险。

Choose Boring Technology54mcfunley.com原文 ↗

mcfunley.com

Dan McKinley 建议一个系统大约只花 3 个“创新 token”,因为每引入一种陌生技术都会增加全局运维与认知负担。“无聊”不是老旧,而是团队已经知道它怎样失败;Etsy 的 PHP、MySQL、Memcached、Gearman 活动流在 20 倍增长后仍可长期无人干预,同时只为全文检索引入 Solr。文章并不反对创新,它要求把新组件留给已有方案确实覆盖不了的问题。

Curl Performance55daniel.haxx.se原文 ↗

daniel.haxx.se

Daniel Stenberg 将 curl 优化拆成可重复负载、协议与网络条件、TLS、CPU、内存和回归检查,而不是展示一个孤立的漂亮数字。吞吐、延迟与资源消耗会随连接复用、响应大小和服务器行为变化,微基准不能代表完整传输链路。文章呈现的性能工程是一条持续测量 - 定位 - 验证循环,也说明成熟网络工具的剩余收益往往藏在具体场景而非普遍重写。

Blog about things you don't understand yet56seangoedecke.com原文 ↗

seangoedecke.com

Sean Goedecke 主张写自己尚未理解的主题,每篇至少学会两件事,并先提出具体、可能有争议的立场迫使调查收敛。他经常在写作过程中推翻起点,认为初学者反而记得读者会在哪一步卡住;公开发布和 LLM 反馈则帮助暴露漏洞。最终标准不是显得权威,而是结论是否改变了作者、是否比开头更紧密。

Comments in the code vs PR description57devblogs.microsoft.com原文 ↗

devblogs.microsoft.com

Raymond Chen 以信息寿命区分代码注释和 PR 描述:未来维护者理解当前约束、反直觉实现与不可破坏条件所需的解释,应留在代码附近;探索过程、评审争论和被放弃方案属于变更历史。只写 PR 会让代码离开托管平台后失忆,把整段讨论塞进注释又会让过期过程遮蔽当前事实。判断标准是“这段信息在实现成为现状后是否仍然成立”。

I turned my RSS feeds into an e-ink newspaper58heyjonny.dev原文 ↗

heyjonny.dev

作者把 RSS 抓取、筛选、版面生成和电子墨水屏定时输出连成个人报纸。真正的制作难点落在把长度不一的文章装入固定画布,并为低刷新率、有限灰阶选择字重、层级和更新策略。开放 feed 在这个项目中不再只是另一个阅读器数据源,而成为脱离浏览器、低干扰实体界面的供应层。

sqlite-utils 4.259simonwillison.net原文 ↗

simonwillison.net

sqlite-utils 4.2 扩大 `table.transform()` 对复杂 schema 的保真范围,覆盖更多 check、unique 约束与注释组合。该操作实质上新建表、复制数据、删除旧表再替换,任何未重建的 schema 细节都会静默消失。这个版本修的不是显眼新功能,而是 SQLite 受限 ALTER TABLE 之上的迁移可靠性,尤其适合有真实历史包袱的表。

引用来源 · References

71 条 · 引用
  1. 1 A Contract-Grade Verifier for LLM-Generated GPU Kernels. arXiv:2608.12700https://arxiv.org/abs/2608.12700 ↩ 回到正文 · back to text
  2. 2 MindMemOS: A Portable and Self-Evolving Memory Operating Layer for AI Agents. arXiv:2608.12428https://arxiv.org/abs/2608.12428 ↩ 回到正文 · back to text
  3. 3 Governed Persistent Memory. arXiv:2608.12476https://arxiv.org/abs/2608.12476 ↩ 回到正文 · back to text
  4. 4 Dead text or binding clause? Measuring constraint influence, detecting revocation inertia, and repairing compiled behavioral residue in long-context conversational agents. arXiv:2608.12599https://arxiv.org/abs/2608.12599 ↩ 回到正文 · back to text
  5. 5 SteerBench-Work: Do Agents Know When to Proceed or Pause in the Workplace? arXiv:2608.12654https://arxiv.org/abs/2608.12654 ↩ 回到正文 · back to text
  6. 6 Practice Makes Unsafe: How Self-Evolving Agents Learn to Cause Real-World Harm. arXiv:2608.12851https://arxiv.org/abs/2608.12851 ↩ 回到正文 · back to text
  7. 7 Rethinking Normalization Placement for LLMs: When Does Pre-Norm Lose Its Edge? arXiv:2608.13156https://arxiv.org/abs/2608.13156 ↩ 回到正文 · back to text
  8. 8 SkillShapley: Boundary-Adaptive Shapley Estimation for Agent Skill Evaluation. arXiv:2608.13173https://arxiv.org/abs/2608.13173 ↩ 回到正文 · back to text
  9. 9 TsuGO: Benchmarking Search and Inference-Time Compute Allocation in Large Language Models with Go Game Problems. arXiv:2608.13221https://arxiv.org/abs/2608.13221 ↩ 回到正文 · back to text
  10. 10 StateBridge: Training-Free Hidden-State Alignment for Cross-Model Agent Communication. arXiv:2608.13317https://arxiv.org/abs/2608.13317 ↩ 回到正文 · back to text
  11. 11 Beyond Final Scores: A Process-Oriented Evaluation of AI R&D Agents. arXiv:2608.13417https://arxiv.org/abs/2608.13417 ↩ 回到正文 · back to text
  12. 12 Humans are Missing from AI Coding Agent Research. arXiv:2608.12355https://arxiv.org/abs/2608.12355 ↩ 回到正文 · back to text
  13. 13 Reduced Matrix Multiplication: Input-Adaptive Efficient Transformers. arXiv:2608.13426https://arxiv.org/abs/2608.13426 ↩ 回到正文 · back to text
  14. 14 Vero: Can AI Agents Build Formally Verified Software Repositories? arXiv:2608.13522https://arxiv.org/abs/2608.13522 ↩ 回到正文 · back to text
  15. 15 AI Guardrail Survival under Single-Cycle Agentic Self-Summarization. arXiv:2608.11392https://arxiv.org/abs/2608.11392 ↩ 回到正文 · back to text
  16. 16 Memcode. GitHub repositoryhttps://github.com/memcode-ai/memcode ↩ 回到正文 · back to text
  17. 17 RCA-lab. GitHub repositoryhttps://github.com/coroot/rca-lab ↩ 回到正文 · back to text
  18. 18 Mocktailhttps://getmocktail.com/ ↩ 回到正文 · back to text
  19. 19 E3d-pilot. GitHub repositoryhttps://github.com/spacepacket1/e3d-pilot ↩ 回到正文 · back to text
  20. 20 Mole. GitHub repositoryhttps://github.com/lajosdeme/mole ↩ 回到正文 · back to text
  21. 21 LuaCADhttps://luacad.ad-si.com ↩ 回到正文 · back to text
  22. 22 Graft. GitHub repositoryhttps://github.com/NanoNets/Graft ↩ 回到正文 · back to text
  23. 23 Self-bench. GitHub repositoryhttps://github.com/mupt-ai/self-bench ↩ 回到正文 · back to text
  24. 24 Hexis. GitHub repositoryhttps://github.com/Bevel-Software/Hexis ↩ 回到正文 · back to text
  25. 25 Shoehorn. GitHub repositoryhttps://github.com/notactuallytreyanastasio/shoehorn ↩ 回到正文 · back to text
  26. 26 Easel. GitHub repositoryhttps://github.com/The-Sentience-Company/easel ↩ 回到正文 · back to text
  27. 27 Remarc. GitHub repositoryhttps://github.com/metedata/Remarc ↩ 回到正文 · back to text
  28. 28 MCP-stama. GitHub repositoryhttps://github.com/StamManif/mcp-stama ↩ 回到正文 · back to text
  29. 29 Lumabri. GitHub repositoryhttps://github.com/JustVugg/lumabri ↩ 回到正文 · back to text
  30. 30 OpenAnalytics. GitHub repositoryhttps://github.com/OpenLabs-so/openanalytics ↩ 回到正文 · back to text
  31. 31 Qwen3.8-27Bhttps://huggingface.co/Qwen/Qwen3.8-27B-FP8 ↩ 回到正文 · back to text
  32. 32 GLM-5.3: Frontier coding with emergent cyber capabilitieshttps://z.ai/blog/glm-5.3 ↩ 回到正文 · back to text
  33. 33 DeepSeek peak/off-peak pricing updatehttps://api-docs.deepseek.com/news/news260813/ ↩ 回到正文 · back to text
  34. 34 How Google is making private AI practical with homomorphic encryptionhttps://blog.google/security/how-google-is-making-private-ai-practical-with-homomorphic-encryption/ ↩ 回到正文 · back to text
  35. 35 How Claude's text watermarking workshttps://www.anthropic.com/news/claude-text-watermark ↩ 回到正文 · back to text
  36. 36 Anthropic Risk Report - August 2026https://www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted%20Risk%20Report%20August%202026%20.pdf ↩ 回到正文 · back to text
  37. 37 Maximizing the value of your Claude Code sessionshttps://claude.com/blog/maximizing-the-value-of-your-claude-code-sessions ↩ 回到正文 · back to text
  38. 38 Mistral OCR 4.1https://docs.mistral.ai/models/ocr-4-1 ↩ 回到正文 · back to text
  39. 39 Bluesky Protocol Serviceshttps://atproto.com/blog/introducing-bluesky-protocol-services ↩ 回到正文 · back to text
  40. 40 RustDesk now supports true unattended remote access on Waylandhttps://rustdesk.com/blog/unattended-remote-access-wayland/ ↩ 回到正文 · back to text
  41. 41 Firefox is now the last major browser that still supports uBlock Originhttps://www.pcworld.com/article/3212428/firefox-is-now-the-last-major-browser-that-still-supports-ublock-origin.html ↩ 回到正文 · back to text
  42. 42 France's top court blocks social media ban for under-15shttps://www.reuters.com/world/frances-top-court-rules-social-media-ban-curtails-freedom-expression-2026-08-14/ ↩ 回到正文 · back to text
  43. 43 Z.ai Security Disclosurehttps://cvd.z.ai ↩ 回到正文 · back to text
  44. 44 Nine PBS sues Iron Mountain over blocked access to archival datahttps://current.org/2026/08/nine-pbs-sues-iron-mountain-over-blocked-access-to-archival-data/ ↩ 回到正文 · back to text
  45. 45 Everything is about to “go dark”https://blog.cryptographyengineering.com/2026/08/14/everything-is-about-to-go-dark/ ↩ 回到正文 · back to text
  46. 46 What You Gain by Building Your Own Game Enginehttps://eliasfarhan.ch/gamedev/cpp/2026/08/14/srnative-01-why-a-custom-engine.html ↩ 回到正文 · back to text
  47. 47 ActivityPub Won by Being Boringhttps://o.ee/blog/activitypub-won-by-being-boring/ ↩ 回到正文 · back to text
  48. 48 RISC-V: They Should Have Known Betterhttps://dmitry.gr/?r=06.%20Thoughts&proj=12.%20RV ↩ 回到正文 · back to text
  49. 49 There Is Still No Silver Bullethttps://cekrem.github.io/posts/there-is-still-no-silver-bullet/ ↩ 回到正文 · back to text
  50. 50 Why does Opus 5 feel worse to work with?https://mun-logadan.github.io/why-does-opus-5-feel-worse/ ↩ 回到正文 · back to text
  51. 51 Where did the old web go?https://0.mk/blog/link-rot ↩ 回到正文 · back to text
  52. 52 Choosing an AI model: one prompt, 11 models, different resultshttps://www.netlify.com/blog/one-prompt-11-models-very-different-results/ ↩ 回到正文 · back to text
  53. 53 Understanding is the new bottleneckhttps://www.geoffreylitt.com/2026/07/02/understanding-is-the-new-bottleneck ↩ 回到正文 · back to text
  54. 54 Choose Boring Technologyhttps://mcfunley.com/choose-boring-technology ↩ 回到正文 · back to text
  55. 55 Curl Performancehttps://daniel.haxx.se/blog/2026/08/14/curl-performance-2/ ↩ 回到正文 · back to text
  56. 56 Blog about things you don't understand yethttps://www.seangoedecke.com/blog-about-things-you-dont-understand-yet/ ↩ 回到正文 · back to text
  57. 57 Comments in the code vs PR descriptionhttps://devblogs.microsoft.com/oldnewthing/20260812-00/?p=112607 ↩ 回到正文 · back to text
  58. 58 I turned my RSS feeds into an e-ink newspaperhttps://heyjonny.dev/posts/rss-to-eink-newspaper/ ↩ 回到正文 · back to text
  59. 59 sqlite-utils 4.2https://simonwillison.net/2026/Aug/13/sqlite-utils/ ↩ 回到正文 · back to text
  60. 60 unslothai/unsloth. GitHub repositoryhttps://github.com/unslothai/unsloth ↩ 回到正文 · back to text
  61. 61 holaboss-ai/holaOS. GitHub repositoryhttps://github.com/holaboss-ai/holaOS ↩ 回到正文 · back to text
  62. 62 kepano/obsidian-skills. GitHub repositoryhttps://github.com/kepano/obsidian-skills ↩ 回到正文 · back to text
  63. 63 NVIDIA-NeMo/Automodel. GitHub repositoryhttps://github.com/NVIDIA-NeMo/Automodel ↩ 回到正文 · back to text
  64. 64 lightningpixel/modly. GitHub repositoryhttps://github.com/lightningpixel/modly ↩ 回到正文 · back to text
  65. 65 PrimeIntellect-ai/prime-agent. GitHub repositoryhttps://github.com/PrimeIntellect-ai/prime-agent ↩ 回到正文 · back to text
  66. 66 3b1b/manim. GitHub repositoryhttps://github.com/3b1b/manim ↩ 回到正文 · back to text
  67. 67 calcom/cal.diy. GitHub repositoryhttps://github.com/calcom/cal.diy ↩ 回到正文 · back to text
  68. 68 apify/apify-mcp-server. GitHub repositoryhttps://github.com/apify/apify-mcp-server ↩ 回到正文 · back to text
  69. 69 golbin/hop. GitHub repositoryhttps://github.com/golbin/hop ↩ 回到正文 · back to text
  70. 70 kenforthewin/atomic. GitHub repositoryhttps://github.com/kenforthewin/atomic ↩ 回到正文 · back to text
  71. 71 megadose/holehe. GitHub repositoryhttps://github.com/megadose/holehe ↩ 回到正文 · back to text