An empirical study of harness design for coding agents1 - 在固定执行循环下拆开规划、动作空间和上下文管理,比较 176 组匹配设置,给出面向模型与预算选择 harness 的实证依据。
全文 ↓今日重点 · Today's Highlights
论文 · Papers
1 项 · 论文本期重点An empirical study of harness design for coding agents1arxiv.org原文 ↗
论文将 harness 视为可拆解的执行系统,在四个模型、SWE-Bench Verified 和 Terminal-Bench 2.1 上控制变量比较规划、动作空间与上下文策略。176 组设置显示,预算越紧,上下文管理越能避免 overflow;先做规则式省略再调用 LLM 摘要的效率最好,而可恢复省略没有带来准确率收益。规划对弱模型更像准确率支架,对强模型则主要节省成本;bash 能力强的模型用 bash-only 界面也能以更低成本完成命令行任务。
开源 / 项目 · Projects
12 项 · 开源 / 项目AgentTrace6github.com原文 ↗
AgentTrace 把多步 agent 的工具调用、延迟和参数修复放进一套 SDK/仪表盘。Python 装饰器先以 Pydantic 校验 schema,失败时让 Groq 修复字符串/浮点混用、错误键名或缺失字段;FastAPI+SQLite 保存 trace,Next.js 提供 payload diff。它的价值在于把“偶发的工具参数幻觉”从致命异常变成可观察、可回放的运行时事件。
agent-term9github.com原文 ↗
AgentTerm 面向 Claude Code、Codex、Cursor CLI 等终端 agent,核心体验是区分、恢复并评论正在运行的会话,兼容 macOS 与 Windows/WSL。它把终端的文本输入输出保留下来,同时补上多会话管理和手机访问,而不是把 CLI 改造成封闭 IDE;因此更适合已有命令行习惯的团队试用。
System One Harness10github.com原文 ↗
该 harness 把有限动作编译成 typed questions,由 System One 返回动作概率,再按 read/write/destructive 风险阈值执行。内置订单示例五步完成、墙钟 0.98 秒、成本约 0.000208 美元;UHP core 40/40 conformance 说明协议层较完整,但作者明确只证明了小型确定性任务。
行业动态 · Industry News
11 项 · 行业动态OpenAI's Sam Altman to Brief UN Security Council Next Week17reuters.com原文 ↗
路透报道 Sam Altman 将于下周向联合国安理会做简报。事件把 OpenAI 的技术叙事带进多边安全机构场域,具体议程仍取决于会议安排。
Samsung is expected to more than double output of its HBM4 and HBM4E DRAM18en.sedaily.com原文 ↗
报道称三星计划明年提高 HBM4 和 HBM4E DRAM 产量,规模预计超过当前水平两倍。若按报道执行,供给扩张将直接连接 AI 加速器的内存带宽需求与韩国存储厂的产能规划。
ChatGPT now knows what you do on other websites via ad collector19buchodi.com原文 ↗
文章调查 ChatGPT 是否通过广告收集器获知用户在其他网站上的活动。它把产品个性化、广告技术和跨站隐私边界放在同一条数据流上审视,争议点不只是模型能力而是数据由谁收集、为何被关联。
Qwen Image 2.120qwen.ai原文 ↗
Qwen 页面发布 Image 2.1 图像生成模型预览。该条的可核实信息是版本升级本身,读者应把它视作产品线更新,而非在缺少可比评测时推断能力跃迁。
Microsoft director: AI scraping “the largest theft of labor in human history”21tomshardware.com原文 ↗
纽约时报诉讼文件披露,微软内部曾把抓取称为“历史上最大的劳动盗窃”,并记录 Copilot 给 NYT 的点击率最多比 Bing 低 93%;OpenAI 内部则称 ChatGPT 对出版商构成生存威胁。材料把训练数据的 fair-use 抗辩和生成式产品对原站流量的替代效应放进同一法律事实链。
Step 5 Preview: Advancing the Pareto Frontier22stepfun.com原文 ↗
StepFun 发布 Step 5 预览页,说明新模型的性能目标与预览方向。现阶段更适合把它看成路线节点,具体基准与可用范围仍应以正式发布材料为准。
How OpenAI Used Its Own LLMs to Design Its Jalapeño Chip23spectrum.ieee.org原文 ↗
IEEE 记录 Jalapeño 项目把内部 LLM 用在 RTL、验证和软件优化:DeepSeek 注意力内核从理论上限 0.31% 提升到 88.94%,约耗时 40 小时,矩阵乘单元面积又比优化的人类基线少 10%。后端布线和送厂主要由 Broadcom 承担,说明 AI 的收益集中在前端探索与首批芯片后的软件调优,而不是包办整个芯片流程。
KDE turns 30 and someone's brought an AI-native desktop proposal24theregister.com原文 ↗
KDE 30 周年 Akademy 的提案设想以加密、厂商无关的 Kadai 个人模型,为每位用户和设备动态编译 Plasma Activity。方案要求 declarative reconciliation、每组件 capability 与更丰富的 Activity metadata;它把 AI 放到桌面基础设施层,因此比侧边栏聊天更具架构野心,也更容易触发对主权和可控性的争论。
Tin: full-text search for Postgres25planetscale.com原文 ↗
PlanetScale 的 Tin 用 Postgres ctid 作为 posting 标识,借现代 CPU 做向量化交并;其词组查询达到 242 QPS、p99 212ms,Wikipedia COUNT(*) 更达到 10,260 QPS、2ms p99。作者称多数场景吞吐至少高于替代方案 8 倍,关键不在再造一个独立搜索集群,而是把索引和现有 Postgres 存储路径贴近。
The Hugging Face Hack Wasn't What It Was Cracked Up to Be26wsj.com原文 ↗
《华尔街日报》评论认为 Hugging Face 安全事件的实际影响没有标题所暗示的那么大。它提醒读者区分声势、漏洞范围与可验证后果,不能仅凭“被黑”这一标签推导平台级失守。
How Notion handles concurrent editing with CRDTs27notion.com原文 ↗
Notion 在 CRDT 中把 text instance 与 block 分离映射,并用 L/R search label 追踪拆分后的文本片段;原本可能要加载 100 个 block,标签能把查询缩到一个,紧凑编码还带来约五倍存储效率。这个设计承认并发编辑的困难不只在合并顺序,也在服务端如何低成本定位被切碎的文本。
博客文章 · Blog Posts
13 项 · 博客文章Quoting voxium28simonwillison.net原文 ↗
Simon Willison 转述 voxium 开发者对公司内部大量采用 Claude Code 的观察,焦点是 agent 从个人试验走向组织日常后的工作方式变化。条目更像一份现场经验切片,价值在于记录采用过程中的组织信号,而非宣布一项新模型能力。
Deterministic Core, Non-Deterministic Shell29outdata.net原文 ↗
文章主张把状态转换、业务规则和可复现检查放在确定性核心,让模型负责探索、解释与调度等非确定性外壳。这样的分层能把“模型偶尔答错”限制在可替换区域,同时保留传统测试对核心状态机的约束。
Adversarial examples for fast hash functions30thomasahle.com原文 ↗
作者不是用随机碰撞展示哈希风险,而是专门构造针对快速哈希的对抗输入。这个角度把性能优化后的分布假设暴露出来:在攻击者可选输入的场景,平均速度和最坏情况需要分开评估。
Software Sandboxing: The Basics (2025)31blog.emilua.org原文 ↗
Emilua 将沙箱归纳为程序化、无管理员权限的可裁量权限下降,建议用进程隔离、actor 消息和 capability 文件描述符组合出边界。作者偏爱 Capsicum 的 cap_enter,因为它关闭 ambient authority;引用的 Chromium 对比中,Capsicum 约 100 行改造即可工作,而 seccomp 方案约 11,301 行,凸显接口复杂度差异。
Prompts aren’t Real32evaluation.club原文 ↗
文章把 prompt 当作不稳定的软件接口,指出自然语言文本本身不是可靠的行为规格。它因此把评测重点移向可重复的输入、上下文和输出契约:只有能被系统化测试的行为,才配称作接口。
Trying the Software Factory Pattern33lethain.com原文 ↗
这次实验把需求、实现、测试和交付拆成可重复的流水线单元,观察角色边界和反馈节奏如何改变吞吐与返工。其启发不是机械套用工厂比喻,而是把软件过程中的隐性等待与交接显式化。
AI and the Destruction of the Creative Commons34chesterwisniewski.com原文 ↗
文章认为生成式 AI 在吸收 Creative Commons 内容时,可能绕开署名、访问和回馈机制,削弱原本支撑开放内容的激励循环。论点把版权合法性之外的生态基础设施摆到前景:内容可训练,不代表贡献者仍能持续生产。
Chat-based Large Language Models replicate the mechanisms of a psychic's con35softwarecrisis.dev原文 ↗
“LLMentalist”按冷读流程拆解聊天模型:先用模糊开场建立连接,再通过用户反应缩小目标,最后依靠主观验证让泛化陈述显得精准。它解释了流畅、迎合和用户自我投射如何共同制造“被理解”的体验,但这不是事实获取能力的证据。
Self-hosted inference orchestrators compared: LocalAI, exo, GPUStack, vLLM36nexlab.net原文 ↗
文章横向比较 LocalAI、exo、GPUStack 和 vLLM 的自托管推理编排,从部署、调度和运维路径评估它们的取舍。读者得到的是选型坐标系,而不是一个脱离硬件、模型和团队约束的绝对排名。
Why MCP Was Always a Bad Idea37maharship.com原文 ↗
这篇批评从协议边界、工具发现和状态语义入手,认为 MCP 把过多复杂性转嫁给客户端与模型。它适合作为架构反例阅读:即便工具接入变得标准化,权限、生命周期和错误语义仍必须由系统设计者明确承担。
Orchestrating Claude Code Agents: The Chief of Staff Pattern38asyncdot.com原文 ↗
chief-of-staff 模式用一个总协调会话拆解目标、分派任务、汇总结果,再让多个 Claude Code 会话各自执行。关键不在并发数量,而在委派、回报和全局上下文的显式协议;否则多个 agent 只会把未整理的状态互相放大。
Telling a Computer to Do Things39will-keleher.com原文 ↗
作者从单命令走到带条件、并发和循环的 shell,再把这条能力链连接到 agent。npm 失败处理和“测试直到失败”的例子说明,真正的自动化依赖对程序组合的理解,而不是 GUI 是否提供一个现成按钮。
What Zig felt like, coming from Rust40besok.github.io原文 ↗
Rust 转 Zig 的 JSONPath 实作暴露了两种语言的抽象差异:Rust 倾向 immutable/monadic transformation,Zig 则让作者直接操作 allocator、cursor 和列表。两者都能表达递归与 sum type,但内存管理责任的转移会重塑 API 和算法写法。
GitHub 热门 · GitHub Trending
11 项 · GitHub 热门supabase/supabase41github.com原文 ↗
Supabase 以 Postgres 为底座,组合 REST/GraphQL、JWT 认证、Realtime、S3 兼容存储、Edge Functions 和向量工具,提供 Firebase 式开发体验但保持可自托管。其 Realtime 服务从 Postgres replication 转成授权 WebSocket 事件;仓库页面显示约 110.4k stars,说明这套组合式平台已形成大型生态。
huggingface/transformers42github.com原文 ↗
Transformers 统一文本、视觉、音频、视频和多模态模型定义,训练端可接 DeepSpeed、FSDP 等,推理端可接 vLLM、SGLang、TGI。它的基础设施意义在于把“模型定义”变成跨框架接口,生态工具只需支持一次即可共享权重、配置和加载逻辑。
higgsfield-ai/higgsfield43github.com原文 ↗
Higgsfield 把 GPU 节点分配、实验排队、ZeRO-3/FSDP 分片、监控和 GitHub Actions 串成训练编排层。Llama70b 示例用 zero_stage=3 在分布式节点训练,部署脚本还负责 Docker、密钥和版本环境;它瞄准的是万亿参数实验的资源与配置管理,而不只是一个训练 loop。
本期重点docling-project/docling3github.com原文 ↗
Docling 将多格式文件解析到统一 DoclingDocument,支持 Markdown、HTML、DocTags、无损 JSON 以及 MCP/API 服务。PDF 的版面、阅读顺序、表格、公式和 OCR 是其差异化重点,新增的视频 ASR/关键帧、ODF、XBRL 和邮件解析则把输入面继续扩宽。
cloudflare/quiche44github.com原文 ↗
quiche 提供 Rust QUIC/HTTP/3 低层 API,负责数据包处理和连接状态,应用方自己接 socket 与定时器事件循环。这个边界让库可嵌入不同服务器和网络栈,也意味着使用者必须自行处理 I/O、拥塞调度和生命周期。
ruanyf/weekly45github.com原文 ↗
weekly 是每周五更新的中文科技资料库,2026 年目录已列到第 413 期,覆盖 React Native、OpenClaw、AI 机制和缓存等主题。它的技术价值不在某个单独项目,而在把分散的文章、工具与观点按周留下可搜索的编辑脉络。
yynxxxxx/Codex-X46github.com原文 ↗
Codex-X 用桌面界面管理提示词模板、官方登录与第三方 API、会话、Skills/MCP 及 TOML 配置。项目提供 5 套内置模板、连接检测、按项目整理历史会话和 token 趋势视图,解决的是多供应商 Codex 工作台的配置可见性问题。
rui314/mold47github.com原文 ↗
mold 是可替换现有 Unix linker 的高性能 Rust 实现,2026 年 8 月基准显示中位数速度约为 lld 的 4.9 倍、wild 的 1.9 倍。它覆盖 x86、ARM、RISC-V、PowerPC、s390x 等架构,并从 2021 年起用于生产,说明链接阶段仍是大型工程可观的构建瓶颈。
本期重点lahfir/agent-desktop2github.com原文 ↗
agent-desktop 通过无障碍树为 Finder、Safari、Xcode、Slack 等应用提供稳定 ref,58 个命令覆盖观察、交互、窗口、剪贴板和 trace 导出。Headless-by-default 会阻止无声焦点与粘贴板副作用,C-ABI 库还可被 Python、Go、Node 等调用;这比基于截图的坐标点击更适合重试和审计。
NVIDIA/TensorRT-LLM48github.com原文 ↗
TensorRT-LLM 以专用 kernel 和高性能 Python/C++ runtime 优化 NVIDIA 上的 LLM 与视觉生成推理。近期技术博客覆盖视频生成量化、trace replay 的 agentic serving 指标、Blackwell 上 DeepSeek 和 NVLink MoE 通信,反映它从单请求延迟优化走向模型与服务联合调参。
本期重点mem0ai/mem04github.com原文 ↗
mem0 的持久记忆层支持用户、会话和 agent 状态,新算法用 ADD-only 抽取、实体链接、语义/BM25/实体融合与时间推理。在 BEAM 1M token 规模上得分 64.1、p50 约 1.00s;项目同时声明托管平台含专有优化,开源版本只能期待方向一致而非数字复现。
引用来源 · References
48 条 · 引用- 1 An Empirical Study of Harness Design for Coding Agents. arXiv:2609.20804https://arxiv.org/abs/2609.20804 ↩ 回到正文 · back to text
- 2 agent-desktophttps://github.com/lahfir/agent-desktop ↩ 回到正文 · back to text
- 3 Doclinghttps://github.com/docling-project/docling ↩ 回到正文 · back to text
- 4 mem0https://github.com/mem0ai/mem0 ↩ 回到正文 · back to text
- 5 Openmsghttps://github.com/marciob/openmsg ↩ 回到正文 · back to text
- 6 AgentTracehttps://github.com/mohitkumar188/AgentTrace ↩ 回到正文 · back to text
- 7 Emetgatehttps://github.com/emetgate/emetgate ↩ 回到正文 · back to text
- 8 meclawhttps://github.com/mmeyerlein/meclaw/ ↩ 回到正文 · back to text
- 9 agent-termhttps://github.com/albertwujj/agent-term ↩ 回到正文 · back to text
- 10 System One Harnesshttps://github.com/HarnessRouter/SystemOneHarness ↩ 回到正文 · back to text
- 11 ZizkaDBhttps://github.com/ZIZKA-AI-SL/ZizkaDB ↩ 回到正文 · back to text
- 12 jevchttps://github.com/doronp/jevc ↩ 回到正文 · back to text
- 13 cleancodehttps://github.com/chen-985211/cleancode ↩ 回到正文 · back to text
- 14 lgtmhttps://github.com/stardeckai/lgtm ↩ 回到正文 · back to text
- 15 ColliePWAhttps://colliepwa.dev/ ↩ 回到正文 · back to text
- 16 Hushhttps://github.com/emreozyoruk/hush ↩ 回到正文 · back to text
- 17 OpenAI's Sam Altman to Brief UN Security Council Next Weekhttps://www.reuters.com/business/openais-sam-altman-to-brief-un-security-council-next-week-during-2026-09-18/ ↩ 回到正文 · back to text
- 18 Samsung is expected to more than double output of its HBM4 and HBM4E DRAMhttps://en.sedaily.com/finance/2026/09/20/samsung-to-double-hbm4-output-next-year-sources-say ↩ 回到正文 · back to text
- 19 ChatGPT now knows what you do on other websites via ad collectorhttps://www.buchodi.com/chatgpt-now-knows-what-you-do-on-other-websites-via-ad-collector/ ↩ 回到正文 · back to text
- 20 Qwen Image 2.1https://qwen.ai/blog?id=qwen-image-2.1 ↩ 回到正文 · back to text
- 21 Microsoft director: AI scraping “the largest theft of labor in human history”https://www.tomshardware.com/tech-industry/artificial-intelligence/microsoft-director-called-ai-scraping-the-largest-theft-of-labor-in-human-history-while-openai-head-brands-chatgpt-an-existential-threat-to-publishers-revelations-come-from-legal-briefs-filed-in-nyt-lawsuit ↩ 回到正文 · back to text
- 22 Step 5 Preview: Advancing the Pareto Frontierhttps://www.stepfun.com/step-5-preview ↩ 回到正文 · back to text
- 23 How OpenAI Used Its Own LLMs to Design Its Jalapeño Chiphttps://spectrum.ieee.org/llms-for-chip-design ↩ 回到正文 · back to text
- 24 KDE turns 30 and someone's brought an AI-native desktop proposalhttps://www.theregister.com/software/2026/09/18/kde-turns-30-and-someones-brought-an-ai-native-desktop-proposal/5297282 ↩ 回到正文 · back to text
- 25 Tin: full-text search for Postgreshttps://planetscale.com/blog/introducing-tin ↩ 回到正文 · back to text
- 26 The Hugging Face Hack Wasn't What It Was Cracked Up to Behttps://www.wsj.com/opinion/the-hugging-face-hack-wasnt-what-it-was-cracked-up-to-be-e00cf3fa ↩ 回到正文 · back to text
- 27 How Notion handles concurrent editing with CRDTshttps://www.notion.com/blog/how-notion-handles-concurrent-editing-with-crdts ↩ 回到正文 · back to text
- 28 Quoting voxiumhttps://simonwillison.net/2026/Sep/20/voxium/ ↩ 回到正文 · back to text
- 29 Deterministic Core, Non-Deterministic Shellhttps://outdata.net/blog/260803 ↩ 回到正文 · back to text
- 30 Adversarial examples for fast hash functionshttps://thomasahle.com/blog/adversarial-examples-for-hashes/ ↩ 回到正文 · back to text
- 31 Software Sandboxing: The Basics (2025)https://blog.emilua.org/2025/01/12/software-sandboxing-basics/ ↩ 回到正文 · back to text
- 32 Prompts aren’t Realhttps://evaluation.club ↩ 回到正文 · back to text
- 33 Trying the Software Factory Patternhttps://lethain.com/software-factory-experiment/ ↩ 回到正文 · back to text
- 34 AI and the Destruction of the Creative Commonshttps://www.chesterwisniewski.com/post/2026-09-13-ai-is-destroying-the-creative-commons/ ↩ 回到正文 · back to text
- 35 Chat-based Large Language Models replicate the mechanisms of a psychic's conhttps://softwarecrisis.dev/letters/llmentalist/ ↩ 回到正文 · back to text
- 36 Self-hosted inference orchestrators compared: LocalAI, exo, GPUStack, vLLMhttps://www.nexlab.net/articles/self-hosted-inference-orchestrators-compared-2026/ ↩ 回到正文 · back to text
- 37 Why MCP Was Always a Bad Ideahttps://maharship.com/blog/why-mcp-was-always-a-bad-idea/ ↩ 回到正文 · back to text
- 38 Orchestrating Claude Code Agents: The Chief of Staff Patternhttps://asyncdot.com/blog/chief-of-staff-pattern-orchestrating-claude-code-sessions/ ↩ 回到正文 · back to text
- 39 Telling a Computer to Do Thingshttps://will-keleher.com/posts/telling-your-computer-to-do-things/ ↩ 回到正文 · back to text
- 40 What Zig felt like, coming from Rusthttps://besok.github.io/posts/what-zig-felt-like-coming-from-rust/ ↩ 回到正文 · back to text
- 41 supabase/supabasehttps://github.com/supabase/supabase ↩ 回到正文 · back to text
- 42 huggingface/transformershttps://github.com/huggingface/transformers ↩ 回到正文 · back to text
- 43 higgsfield-ai/higgsfieldhttps://github.com/higgsfield-ai/higgsfield ↩ 回到正文 · back to text
- 44 cloudflare/quichehttps://github.com/cloudflare/quiche ↩ 回到正文 · back to text
- 45 ruanyf/weeklyhttps://github.com/ruanyf/weekly ↩ 回到正文 · back to text
- 46 yynxxxxx/Codex-Xhttps://github.com/yynxxxxx/Codex-X ↩ 回到正文 · back to text
- 47 rui314/moldhttps://github.com/rui314/mold ↩ 回到正文 · back to text
- 48 NVIDIA/TensorRT-LLMhttps://github.com/NVIDIA/TensorRT-LLM ↩ 回到正文 · back to text