每日 Harness 开源 · Source
全部刊期 · All issues

每日 Harness

2026-07-13 · Monday, July 13, 2026

代理浪潮重估代价

视图 · View

今日重点 · Today's Highlights

pgrust2 - 用 Rust 重写 PostgreSQL,并明确以 Postgres 18.3 与官方回归测试作为行为对齐目标。

全文 ↓

Mindwalk3 - 将 coding-agent 的文件访问和编辑轨迹投射到 3D 代码库地图,给代理会话提供可复盘的空间视图。

全文 ↓

Sqlsure4 - 针对 AI 生成 SQL 的 join、fan-out、可加性和策略语义做确定性检查,补上语法正确之外的质量门。

全文 ↓

mcp-spec-check5 - 对远程 MCP endpoint 做黑盒探测,直接给出面向 2026-07-28 MCP spec 的 readiness verdict。

全文 ↓

论文 · Papers

2 项 · 论文

本期重点Automation Without Understanding1arxiv.org原文 ↗

这篇短论讨论 AI 参与研究级数学后,数学基础设施要怎样从“读懂完整推导”转向“审计机器可检查的关键声明”。它提出把 AI 产出的核心 claim 暴露为可形式化、可验证对象,并强调人类数学家的解释、反例构造和挑战能力仍然是系统的一部分。文章更像研究议程而非实验论文,局限也在这里:它提出的是验证架构和社会技术分工,还不是一个已经跑完的数学自动化系统。

The Energetic Costs of Cellular Computation6arxiv.org原文 ↗

arxiv.org

论文用两组分细胞网络分析细胞估计外部配体浓度时要付出的能量成本,把生物信号转导明确建模成信息处理问题。关键事实是模型把学习精度、响应动力学和能耗放到同一框架内比较,而不是只描述化学反应路径。它值得保留在今天的列表里,因为它把“细胞是否在计算”推进到可量化的物理约束上。

开源 / 项目 · Projects

15 项 · 开源 / 项目

本期重点Mindwalk3github.com原文 ↗

Mindwalk 把 Claude Code、Codex 等 coding-agent 会话日志回放到代码库的 3D 地图上,展示 agent 搜索、读取和编辑过的文件路径。它处理的是代理开发中常见但难观察的问题:模型究竟看了哪些上下文、绕了哪些路、改动集中在哪里。相比线性日志,这种空间化视图更容易发现无效探索、遗漏区域和高风险修改簇。

Shirei7github.com原文 ↗

github.com

Shirei 是 Go 编写的跨平台 GUI 框架,采用 immediate-mode API 和 flexbox 布局模型。它的做法是让界面从当前状态直接绘制,减少 retained-mode widget 层级和长期对象生命周期管理。对于 Go 桌面应用来说,这条路线的看点在于把布局、渲染和交互压到一个更轻的开发模型里。

本期重点mcp-spec-check5github.com原文 ↗

协议与互操作评测方法系统·基础设施

mcp-spec-check 是一个 CLI,用黑盒方式检查已部署 MCP server 是否适配 2026-07-28 spec 的核心变化。它不需要服务器源码,而是通过远程协议交互判断 readiness,这让兼容性检查可以放进发布前或升级前流程。MCP 生态正在快速扩张,协议版本差异会直接影响 agent 工具调用稳定性,这类探针的价值会随服务数量上升。

本期重点Sqlsure4github.com原文 ↗

评测方法数据·分析

Sqlsure 面向 AI 生成 SQL 做语义检查,规则覆盖 fan-out、错误 join key、聚合可加性和策略违例。它的贡献不是再生成一条 SQL,而是在生成之后判断查询是否可能给出业务上错误的数字。对分析系统而言,`SELECT` 能跑通并不等于指标可信,Sqlsure 把这层检查显式化。

Skillscript8github.com原文 ↗

Skillscript 用声明式语言描述 agent workflow,仓库包含 runtime、compiler 和 CLI。它把多步骤代理任务从临时 prompt、shell 脚本和手写 glue code 中抽离出来,变成可编译、可运行、可复用的工作流资产。这个项目的关键点在于把 agent orchestration 当成程序结构处理,而不是只依赖对话上下文维持状态。

Containix9containix.dev原文 ↗

containix.dev

Containix 是 containerd shim,让 Kubernetes pod 直接运行 Nix flakes,而不是先构建并拉取 OCI image。它把 Nix 的可复现构建语义接入 K8s 运行时接口,缩短从源码到 pod 的路径。这个方向把镜像构建、供应链缓存和运行时隔离放进同一个问题里,适合关注容器基础设施边界的人跟进。

Kote10github.com原文 ↗

Kote 从 AI chat 和 Git 历史中自动捕获工程上下文,供后续检索和复用。它试图解决 coding-agent 多轮工作中的上下文断裂:一次会话里解释过的架构、约束和改动原因,下一次不应全部重来。项目的看点在于把对话和版本历史都纳入工程记忆,而不是只索引当前代码文件。

Agent-run11github.com原文 ↗

Agent-run 在隔离沙箱中运行 coding agent,给模型执行命令和改写代码设置更清晰的环境边界。它面向的是代理真正落地时的工程问题:依赖安装、文件修改、外部命令和潜在副作用都需要可控空间。与单纯 prompt 约束相比,沙箱提供的是运行时层面的风险收敛。

Capn-hook12github.com原文 ↗

Capn-hook 是面向 coding agent 的 hook 工具,用来记录和复用已经探索过的代码上下文。它瞄准“同一个项目里反复 grep、反复读同一批文件、反复重建调用链”的低效模式。通过把探索痕迹变成可再注入上下文,项目让 agent 会话之间具备更强连续性。

Wisp13github.com原文 ↗

Wisp 是私有桌面 AI overlay,可以从当前应用抓取文本、截图等上下文,并支持 MCP。它把桌面正在发生的状态直接提供给助手,而不是要求用户手动复制窗口内容。这个项目值得观察的地方在于端侧上下文获取、隐私边界和工具协议如何组合成日常桌面助手。

Pgnudge14github.com原文 ↗

github.com

Pgnudge 是 Python 库,用 Postgres replication 机制通知应用哪些表发生变化。它把数据库变更流转成应用层可消费的刷新信号,适合缓存失效、read model 更新或事件驱动同步。相比轮询整表或用粗粒度定时任务,它给出了更贴近数据库事实来源的触发方式。

Itara15github.com原文 ↗

github.com

Itara 把分布式系统拓扑建模成显式、可执行层。它不是只画一张架构图,而是让服务、依赖和运行关系进入工具可以读取和执行的模型。这个思路适合复杂系统的仿真、部署推理和故障分析,因为拓扑不再只是文档中的说明性对象。

Kurvengefahr16kurvengefahr.org原文 ↗

kurvengefahr.org

Kurvengefahr 是浏览器 CAD/CAM 工具,用于把线稿转换为面向 pen plotter 的路径和 G-code。它把线稿处理、路径规划和机器输出放到一个网页工作流里,降低从图形到可绘制轨迹的转换成本。对 plotter 用户来说,关键不是“又一个绘图工具”,而是 CAM 输出是否足够直接。

Ant17antjs.org原文 ↗

antjs.org

Ant 定位为 JavaScript runtime 与生态系统,覆盖 runtime、package manager、registry、hosting 和 desktop app 能力。它不是只替换单个执行引擎,而是试图把开发、包分发、托管和桌面应用打成一体。这样的项目要看的重点是端到端体验能否抵消生态迁移成本。

Ghostel.el18dakra.github.io原文 ↗

dakra.github.io

Ghostel.el 是基于 libghostty 的 Emacs terminal emulator。它把 Ghostty 终端渲染能力接入 Emacs,目标是在编辑器内部获得更现代的终端体验。技术难点会落在 libghostty 与 Emacs 缓冲区、事件循环和交互模型的衔接,而不是简单嵌入一个外部窗口。

行业动态 · Industry News

8 项 · 行业动态

Irish datacenters now guzzle 23% of the country's electricity19theregister.com原文 ↗

theregister.com

The Register 报道爱尔兰数据中心用电已占全国电力消费的 23%。这个数字把数据中心从“企业基础设施”推到国家电网规划问题上,尤其是在 AI 与云服务继续扩张的背景下。报道的信号是,算力选址不再只是土地、税收和网络延迟的函数。

Datacentres drive up big tech's carbon emissions to a third of those of France20theguardian.com原文 ↗

theguardian.com

The Guardian 汇总 Microsoft、Amazon、Google 数据中心扩张带来的碳排放,并用“三分之一个法国”的量级作对照。文章把三家公司的云和 AI 基础设施增长放到气候承诺之外重新计量。它值得注意的事实不是某个单点排放,而是头部科技公司的基础设施扩张已经足以接近国家级参照物。

AI boosts research careers but narrow the span of ideas explored: study21spectrum.ieee.org原文 ↗

spectrum.ieee.org

IEEE Spectrum 报道一项研究称,AI 工具提升科研产出和职业指标的同时,可能压缩研究者探索主题的多样性。这里的核心不是“AI 能不能帮忙写论文”,而是工具对知识生产分布的影响。若高效率同时带来更窄的选题空间,科研评价体系会获得一个新的偏置来源。

Can We Understand How Large Language Models Reason?22cacm.acm.org原文 ↗

CACM 文章梳理 LLM 推理可解释性、chain-of-thought 和机制理解之间的张力。它明确区分“模型写出一段推理文本”和“研究者知道模型内部为何得到答案”这两件事。围绕因果干预、机制解释和可审计推理的讨论,会继续影响模型评测和安全研究的设计。

Nvidia, CoreWeave, and Nebius: Inside the Circular Financing of the GPU Boom24io-fund.com原文 ↗

io-fund.com

IO Fund 分析 Nvidia、CoreWeave、Nebius 等 GPU 基础设施公司之间的融资、采购和收入关系。文章关注 AI 算力热潮中的循环结构:供应商投资、GPU 订单、云租赁收入和资本市场估值彼此支撑。这个视角有助于区分真实终端需求与基础设施链条内部放大的增长信号。

The power of collaboration: How we can reduce traffic congestion25research.google原文 ↗

research.google

Google Research 介绍用协作式信号优化和交通建模降低拥堵的研究工作。文章把交通参与者、路口信号和城市级流量放进同一个优化问题,而不是只调单个红绿灯。它展示了 AI 系统进入物理城市基础设施时,需要把局部收益和全局流量协调起来。

Firefox 12.58% for Desktop Browser Market Share in North America June 202626gs.statcounter.com原文 ↗

gs.statcounter.com

StatCounter 数据页显示,2026 年 6 月 Firefox 在北美桌面浏览器市场份额为 12.58%。这个数字的边界很明确:地区是北美,设备类型是 desktop,时间是 2026 年 6 月。对 Web 开发者来说,浏览器份额的区域性变化会影响测试矩阵、兼容性优先级和企业部署判断。

博客文章 · Blog Posts

12 项 · 博客文章

I love LLMs, I hate hype27geohot.github.io原文 ↗

geohot.github.io

George Hotz 的短文把 LLM 的实际工具价值和市场叙事拆开看。文章承认模型在编程、搜索和自动化上的实用性,同时反对把每个进步都包装成 AGI 或不可逆商业结论。它的价值在于给 LLM 讨论降温:能力、体验、成本和投资故事应该分开验证。

Old and new apps, via modern coding agents28terrytao.wordpress.com原文 ↗

Terence Tao 记录用现代 coding agents 生成和改造应用的经验,覆盖旧应用迁移和新应用试作两类任务。文章的重点不是展示一次完美自动生成,而是观察人类如何审阅、修正和约束代理输出。它提供了高水平用户视角下的 coding-agent 工作流样本。

Mesh LLM: distributed AI computing on iroh30iroh.computer原文 ↗

iroh.computer

iroh 文章介绍把 LLM 推理拆到分布式节点上运行的实验,底层使用 iroh 的点对点网络能力。它探索的是让多个节点共同承担推理,而不是把模型固定在单机或中心化云实例上。真正需要观察的是模型切分、网络延迟、节点发现和失败恢复能否被工程化处理。

Agent Harness Engineering32addyosmani.com原文 ↗

Addy Osmani 讨论 coding agent 的 harness、上下文、验证和反馈回路设计。文章把 agent 成败从模型能力转移到周围工程系统:如何给上下文、如何执行、如何测试、如何把失败反馈回循环。这个角度解释了为什么同一个模型在不同开发环境中的可靠性会差很多。

sqlite-utils 4.134simonwillison.net原文 ↗

simonwillison.net

Simon Willison 发布 sqlite-utils 4.1,其中包括 `--code` 导入等小版本功能。sqlite-utils 的长期定位是让 CSV、JSON、脚本输出等数据能快速进入 SQLite 并立刻查询。这个版本延续了工具的小步迭代路线,把命令行数据整理继续往低摩擦方向推进。

In defense of not understanding your codebase35seangoedecke.com原文 ↗

seangoedecke.com

Sean Goedecke 讨论在大型代码库中依赖局部理解、接口边界和测试来完成修改。文章反驳“必须先理解整个系统才能动手”的工程直觉,强调有效工作通常发生在可界定的变更路径里。它对团队协作的启发在于,代码库可维护性不只取决于文档数量,也取决于边界是否能支撑局部推理。

Who does Anubis actually stop?37fzakaria.com原文 ↗

fzakaria.com

Farid Zakaria 分析 Anubis proof-of-work 防护实际阻挡的流量类型。文章关心 PoW 对普通浏览器用户、批量爬虫、恶意请求和资源受限客户端分别施加什么成本。这个问题很实际,因为反爬措施的有效性必须和误伤、延迟、可访问性一起评估。

Prefer strict tables in SQLite38evanhahn.com原文 ↗

evanhahn.com

Evan Hahn 介绍 SQLite strict tables 的行为差异和使用方式。SQLite 默认类型系统较宽松,strict tables 让列类型约束更接近传统关系数据库预期。它适合希望继续使用 SQLite 的轻量部署优势,同时减少类型语义错误的项目。

引用来源 · References

47 条 · 引用
  1. 1 Automation Without Understanding. arXiv:2607.06377https://arxiv.org/abs/2607.06377 ↩ 回到正文 · back to text
  2. 2 malisper/pgrust. GitHubhttps://github.com/malisper/pgrust ↩ 回到正文 · back to text
  3. 3 Mindwalk. GitHubhttps://github.com/cosmtrek/mindwalk ↩ 回到正文 · back to text
  4. 4 Sqlsure. GitHubhttps://github.com/sqlsure/sqlsure ↩ 回到正文 · back to text
  5. 5 mcp-spec-check. GitHubhttps://github.com/Roee-Tsur/mcp-spec-check ↩ 回到正文 · back to text
  6. 6 The Energetic Costs of Cellular Computation. arXiv:1203.5426https://arxiv.org/abs/1203.5426 ↩ 回到正文 · back to text
  7. 7 Shirei. GitHubhttps://github.com/hasenj/go-shirei/ ↩ 回到正文 · back to text
  8. 8 Skillscript. GitHubhttps://github.com/sshwarts/skillscript ↩ 回到正文 · back to text
  9. 9 Containixhttps://containix.dev/ ↩ 回到正文 · back to text
  10. 10 Kote. GitHubhttps://github.com/pedroaugusto04/Kote ↩ 回到正文 · back to text
  11. 11 Agent-run. GitHubhttps://github.com/sin-ack/agent-run ↩ 回到正文 · back to text
  12. 12 Capn-hook. GitHubhttps://github.com/cyrusNuevoDia/capn-hook ↩ 回到正文 · back to text
  13. 13 Wisp. GitHubhttps://github.com/SunnyLich/Wisp-AI-Assistant ↩ 回到正文 · back to text
  14. 14 Pgnudge. GitHubhttps://github.com/janbjorge/pgnudge ↩ 回到正文 · back to text
  15. 15 Itara. GitHubhttps://github.com/itara-project/itara ↩ 回到正文 · back to text
  16. 16 Kurvengefahrhttps://kurvengefahr.org/ ↩ 回到正文 · back to text
  17. 17 Anthttps://antjs.org ↩ 回到正文 · back to text
  18. 18 Ghostel.elhttps://dakra.github.io/ghostel/ ↩ 回到正文 · back to text
  19. 19 Irish datacenters now guzzle 23% of the country's electricity. The Registerhttps://www.theregister.com/on-prem/2026/07/11/irish-datacenters-now-guzzle-23-of-the-countrys-electricity/5270013 ↩ 回到正文 · back to text
  20. 20 Datacentres drive up big tech's carbon emissions to a third of those of France. The Guardianhttps://www.theguardian.com/us-news/2026/jul/11/microsoft-amazon-google-datacentre-carbon-emissions-france ↩ 回到正文 · back to text
  21. 21 AI boosts research careers but narrow the span of ideas explored: study. IEEE Spectrumhttps://spectrum.ieee.org/ai-science-research-flattens-discovery ↩ 回到正文 · back to text
  22. 22 Can We Understand How Large Language Models Reason? CACMhttps://cacm.acm.org/news/can-we-understand-how-large-language-models-reason/ ↩ 回到正文 · back to text
  23. 23 Under federal rule, colleges must leave grads better off or lose financial aid. NPRhttps://www.npr.org/2026/06/30/nx-s1-5835631/turner-camhi-do-no-harm-college-loans ↩ 回到正文 · back to text
  24. 24 Nvidia, CoreWeave, and Nebius: Inside the Circular Financing of the GPU Boom. IO Fundhttps://io-fund.com/ai-stocks/nvidia-coreweave-nebius-circular-financing-gpu-boom ↩ 回到正文 · back to text
  25. 25 The power of collaboration: How we can reduce traffic congestion. Google Researchhttps://research.google/blog/the-power-of-collaboration-how-we-can-reduce-traffic-congestion/ ↩ 回到正文 · back to text
  26. 26 Firefox 12.58% for Desktop Browser Market Share in North America June 2026. StatCounterhttps://gs.statcounter.com/browser-market-share/desktop/north-america ↩ 回到正文 · back to text
  27. 27 I love LLMs, I hate hype. George Hotzhttps://geohot.github.io//blog/jekyll/update/2026/07/12/i-love-llms.html ↩ 回到正文 · back to text
  28. 28 Old and new apps, via modern coding agents. Terence Taohttps://terrytao.wordpress.com/2026/07/11/old-and-new-apps-via-modern-coding-agents/ ↩ 回到正文 · back to text
  29. 29 Claude Code sends 33k tokens before reading the prompt; OpenCode sends 7k. Systimahttps://systima.ai/blog/claude-code-vs-opencode-token-overhead ↩ 回到正文 · back to text
  30. 30 Mesh LLM: distributed AI computing on iroh. irohhttps://www.iroh.computer/blog/mesh-llm ↩ 回到正文 · back to text
  31. 31 What xAI's Grok Build CLI Actually Sends to xAI. GitHub Gisthttps://gist.github.com/cereblab/dc9a40bc26120f4540e4e09b75ffb547 ↩ 回到正文 · back to text
  32. 32 Agent Harness Engineering. Addy Osmanihttps://addyosmani.com/blog/agent-harness-engineering/ ↩ 回到正文 · back to text
  33. 33 Autoresearch, Claude and Constrained Optimization. Elliot C. Smithhttps://www.elliotcsmith.com/autoresearch-claude-and-constrained-optimization/ ↩ 回到正文 · back to text
  34. 34 sqlite-utils 4.1. Simon Willisonhttps://simonwillison.net/2026/Jul/11/sqlite-utils/#atom-everything ↩ 回到正文 · back to text
  35. 35 In defense of not understanding your codebase. Sean Goedeckehttps://www.seangoedecke.com/in-defense-of-not-understanding-your-codebase/ ↩ 回到正文 · back to text
  36. 36 An Agent in 100 Lines of Lisp. thebeach.devhttps://thebeach.dev/posts/lisp-agent/ ↩ 回到正文 · back to text
  37. 37 Who does Anubis actually stop? Farid Zakariahttps://fzakaria.com/2026/07/09/who-does-anubis-actually-stop ↩ 回到正文 · back to text
  38. 38 Prefer strict tables in SQLite. Evan Hahnhttps://evanhahn.com/prefer-strict-tables-in-sqlite/ ↩ 回到正文 · back to text
  39. 39 abseil/abseil-cpp. GitHubhttps://github.com/abseil/abseil-cpp ↩ 回到正文 · back to text
  40. 40 vxcontrol/pentagi. GitHubhttps://github.com/vxcontrol/pentagi ↩ 回到正文 · back to text
  41. 41 google-labs-code/stitch-skills. GitHubhttps://github.com/google-labs-code/stitch-skills ↩ 回到正文 · back to text
  42. 42 FoundationAgents/OpenManus. GitHubhttps://github.com/FoundationAgents/OpenManus ↩ 回到正文 · back to text
  43. 43 volcengine/OpenViking. GitHubhttps://github.com/volcengine/OpenViking ↩ 回到正文 · back to text
  44. 44 Skyvern-AI/skyvern. GitHubhttps://github.com/Skyvern-AI/skyvern ↩ 回到正文 · back to text
  45. 45 home-assistant/core. GitHubhttps://github.com/home-assistant/core ↩ 回到正文 · back to text
  46. 46 nasa/fprime. GitHubhttps://github.com/nasa/fprime ↩ 回到正文 · back to text
  47. 47 DayuanJiang/next-ai-draw-io. GitHubhttps://github.com/DayuanJiang/next-ai-draw-io ↩ 回到正文 · back to text