每日 Harness 开源 · Source
全部刊期 · All issues

每日 Harness

2026-08-11 · Tuesday, August 11, 2026

智能体走向长程自主与安全落地

视图 · View

今日重点 · Today's Highlights

MemPrism 1 - 把长期经验按当前任务重排成临时关系视图,解决“有证据但表示不适合当前决策”的记忆错配。

全文 ↓

FACTOR 2 - 将多轮 agent RL 的 credit assignment 分成动作级守恒分配与 token 级反馈分配,最长轨迹收益最大。

全文 ↓

StepJack 3 - 把间接提示注入拆成跨页面的多步无害子任务;在 480 例基准上,GPT-5.4-mini 的三步攻击成功率比单步高 31.2 个百分点。

全文 ↓

Needle 2 4 - 14MB、2-bit 的端侧 agentic LLM 把工具调用、设备控制和结构化提取压进手机与微控制器的内存预算。

全文 ↓

Ante 5 - 单个约 15MB Rust 二进制内置工具、模型引擎和多 agent 编排,展示离线 coding harness 的极小运行时路径。

全文 ↓

论文 · Papers

15 项 · 论文

EntropyMoE: Entropy-Aware Sparse Expert Routing for Tokenizer-Free LLMs6arxiv.org原文 ↗

arxiv.org

EntropyMoE 用动态 byte patch 作为路由基本单元,把 patch 熵和长度同时交给 Top-K expert router,并按覆盖的 byte 数计算稀疏工作量。它在匹配的 dense/sparse 基线上得到最低 held-out bits-per-byte,同时下游准确率相近。亮点是将 tokenizer-free 模型已有的语义复杂度信号直接转成条件计算坐标,而不是另造一个路由特征。

ADIAS: Automated Design of Interactive Agentic Systems7arxiv.org原文 ↗

ADIAS 将自动 harness 设计改为 issue-centric:持久状态保留 issue 身份、生命周期、证据及干预结果,再指导下一轮全代码修订。五个交互基准平均超过最强基线 25.2%,移除 issue state 或改回 candidate-centric 策略时最多掉 40.7%。这使“修复进展”成为可累积对象,减少每轮从候选历史重新猜测的浪费。

WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader8arxiv.org原文 ↗

WebGrader 从网页需求自动生成交互流和 Flow Contract,在真实浏览器里同时收集视觉、DOM、响应和持久状态证据,只有观察到目标转移才发放 RL Pass。它还用残差驱动离线循环筛选可复用 verifier skill,并在不相交页面上验证后冻结。WebGen-Bench 上 8B 策略达到 52.01% 功能成功率,比外观加脚本奖励高 7.88 个百分点,说明“能否完成交互”可以被程序化为更可靠的训练信号。

The Optimizer Is the Agent9arxiv.org原文 ↗

ReASearch 让单一工具调用 agent 自己选择评估、诊断、编辑、验证或重启,持久记忆负责跨长轨迹分配搜索预算。14 项任务中相对专用优化器提升 2% - 40%,部分解超过人工已知最好结果。论文把外层控制器的职责放回推理循环,代价是搜索行为和预算决策也更依赖 agent 自身稳定性。

本期重点MemPrism: Task-Conditioned Relational Memory Views for Long-Horizon Agents1arxiv.org原文 ↗

MemPrism 把互动保存为事件流,由轻量策略按任务选择关系结构、证据范围、结果条件和粒度,再用确定性 composer/render 生成临时工作记忆。长程具身与 web-agent 评测中,轨迹越长收益越明显且 memory token 更少;view policy 还能跨不同 VLM 直接迁移。存储与消费解耦,为冻结任务策略增加了一个可替换的记忆接口。

SkillEval: Decomposing Agent Skill Quality into Interpretable Signals10arxiv.org原文 ↗

SkillEval 在模型隐空间为 skill 文档的质量属性学习固定方向,投影得到可检查的分数,并校正长度和格式等混杂因素。它能在受控测试中区分不同质量,分数还与下游任务表现相符;按诊断结果改写 skill 后,目标属性和 pass rate 都上升。贡献不在又一个成功率榜单,而在把“文档哪里差”变成可定位的评测对象。

Long-Horizon Agent Trajectory Attribution11arxiv.org原文 ↗

基准评测方法其他垂直

该基准把指令、工具、观察、记忆和攻击/执行链统一到 component schema,定义主归因定位与归因链恢复两项任务。来自 AgentDojo 和 Agent3Sigma Stage/Canary 的数据超过 1,300 条,覆盖正确动作、不安全动作与拒答,并提供增量贡献和组件级 leave-one-out 基线。随附的 annotation skill 让新模型轨迹可以沿同一规范标准化,便于比较“哪一步导致结果”而非只看成功与否。

MemOPD: On-Policy Distillation through Memory State Alignment for Long-Horizon Agents12arxiv.org原文 ↗

MemOPD 记录每次调用的输入/采样输出,恢复原始位置和因果可见性后再让 teacher 打分,修补 memory rewriting 让 teacher 看到 student 从未经历状态的问题。匹配控制中 F1 提高 7.0%;MemOPD-3B 相对 PPO 的最高提升为 416.2%,序列打包使 actor 计算最高加速 1.63 倍。它把 on-policy 的定义从“动作来自该策略”推进到“动作和记忆状态都来自同一轨迹”。

本期重点How Much, Then Where2arxiv.org原文 ↗

FACTOR 先以 checkpoint-calibrated TD residual 给每个动作分配可守恒 credit,再用反馈条件的 teacher - student likelihood gap 细分到实际 token;动作级归一化避免 token 长度造成符号翻转和权重偏差。ALFWorld、WebShop、ScienceWorld 的每个环境种子都偏向 FACTOR,最长环境的提升最大,超参还能迁移到更大 backbone 和另一模型族。消融显示 TD action credit 是主因,hindsight token allocation 提供补充收益。

DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training13arxiv.org原文 ↗

DiDPO 读取多轮代码 diff,把整段改动拆成子 diff,用 groupability score 找出语义范围与群体规模平衡的 anchors,再把 diff-level advantage 反投到响应 token。它不需要 critic,直接利用跨轨迹代码差异解决“一个动作同时改了多个区域”的归因模糊。Qwen2.5-7B-Coder 上比可比方法高 10% 以上,并配套开源 verl-code 训练栈。

本期重点StepJack3arxiv.org原文 ↗

StepJack 的攻击管线把恶意目标拆成沿导航链传播的无害表面步骤,并在 480 个测试例上比较不同 CUA。固定深度时六个系统中三者 ASR 上升,GPT-5.4-mini 由单步 41.7% 到三步 72.9%,五个能可靠跟链的 CUA 平均由 31.3% 到 36.9%。它揭示只过滤单页显眼指令无法覆盖跨页面、跨轮次的组合语义。

Online Monitoring and Corrective Steering of Programming Agents14arxiv.org原文 ↗

LivePlan 用确定性规则 monitor 识别轨迹漂移、重复和错误,只有触发时才询问 advisor LLM 的高层纠偏,避免每一步都重规划。基于 SWE-agent、五个 LLM 和 SWE-bench Verified/Pro 的实验,相对 vanilla 平均提升 9.9%、最高 15.2%,每个实例额外成本仅 0.08 美元。新增解集中于中等和困难 issue,且对原本成功的运行几乎没有回归。

HarnessSafe15arxiv.org原文 ↗

HarnessSafe 把 memory、skills、tools、shared artifacts 等持久 carrier 的攻击传播写成 328 个可执行生命周期案例,覆盖七类载体和后续良性触发。trace-based 评测记录攻击停在哪一阶段,因而能区分“进入 carrier”“跨边界持久化”“最终违规”等不同失败。结果显示 containment 由 carrier 及 harness - model 配置共同决定,单一 ASR 无法表达这些路径差异。

TEPA: Revoking Stale Memories for Conflict-Robust Language Agents16arxiv.org原文 ↗

TEPA 为记忆增加可撤销有效性:同 key 的新证据冲突时撤销旧 precedent,检索只读取当前事实,历史仍可审计或重新提升。50-seed 完全 reversal 中 TEPA 得分 0.950,append-only 和 last-write-wins 仅 0.210,甚至低于无记忆 0.309;真实文件执行重现同一排序。它证明长期记忆除了写入和覆盖,还必须有显式的“失效”操作。

OpenForgeRL: Train Harness-native Agents in Any Environment17arxiv.org原文 ↗

OpenForgeRL 用代理记录 harness 模型调用,把 rollout 放进 Kubernetes 独立容器,再接入标准 RL 代码库,因而训练对象就是部署时的真实有状态 harness。OpenForgeGUI 在 OSWorld-Verified、Online-Mind2Web、WebVoyager 分别达到 37.7、63.0、72.3,工具型 OpenForgeClaw 也在 ClawEval/QwenClawBench 超过同尺寸开放基线。分析指出 RL 能提高自验证、工具覆盖和多步计划,但错误恢复仍是明显短板。

开源 / 项目 · Projects

15 项 · 开源 / 项目

本期重点Needle 24cactuscompute.com原文 ↗

蒸馏与压缩工具使用系统·基础设施

Cactus 把工具调用、设备控制和结构化抽取做成 14MB 单体模型,45M 参数用 2-bit 压缩,完整会话约 28MB RAM。它在 Raspberry Pi 5 约 500 tok/s,在 Vision Pro/Quest 3S 约 400 - 1,500 tok/s,目标是低价手机和微控制器而非通用对话。与 230M - 350M 级小模型交替胜出,说明端侧 agent 的瓶颈可以从“推理能力”收缩到可靠的检索、参数组装和 JSON 输出。

Stagehand v418news.ycombinator.com原文 ↗

Stagehand 以 `act`、`observe`、`extract` 把自然语言动作和确定性的 Playwright locator 放在同一 SDK,运行时贴近浏览器以减少往返。它裁剪 accessibility tree、支持批量命令、closed Shadow DOM、嵌套 iframe、WebMCP 和 OTel;官方表格报约 2 倍速度与 80% token 效率优势。设计上的取舍是让 agent 享有自然语言弹性,同时保留 locator 的可复现性。

本期重点Ante5github.com原文 ↗

Ante 的核心 harness 目前以预构建二进制交付,仓库开放协议、Rust SDK、文档和 Harbor eval pipeline,并明确披露 telemetry 可用 `ANTE_TELEMETRY=off` 关闭。单进程内置 grep/git 与 llama.cpp,支持本地 GGUF 无网推理;公开 Terminal-Bench 2.1 最新整跑 82.7%。它把“轻量、可离线、可复现评测”作为同一个架构决策,但核心源码尚未完全开放。

Juror19github.com原文 ↗

Juror 把代码审查 agent 封装成 GitHub Action,自托管运行在项目自己的 workflow 中,仓库同时提供 `src`、benchmarks、测试和 `.juror.yml` 配置。定位是 Greptile 的低成本替代,重点在不把私有代码交给外部审查 SaaS;目前约 38 次提交、6 个 issue,成熟度与审查准确率仍需持续验证。它值得观察的是 CI 原生的部署边界,而非又一个聊天式 reviewer。

Nitpicker20nitpicker.dev原文 ↗

Nitpicker 提供开源 AI PR reviewer,可放进 GitHub Actions、AWS Lambda 或 Cloudflare Workers。多运行时部署让团队能按已有 CI、云函数或边缘平台选择执行位置,也把审查任务拆成适合短生命周期函数的形态。digest 没披露模型、评测集和评论策略,因此本文只将其视作部署面明确的 reviewer 项目,不比较未经给出的质量数字。

OpenParser21openparser.dev原文 ↗

openparser.dev

OpenParser 用 `ocr_model` 参数在九个 OCR 后端间切换,所有结果统一成 openparser@1 块图和 Markdown;`/extract` 通过 JSON schema 回填字段,并把值链接回源块坐标。同步、异步、批处理共享请求形状,Paddle 起价每千页 1 美元,新账户给 10 美元额度。把解析、抽取和引用拆层,能让同一集成在成本和版面质量之间切换,而不是被某一家 OCR 锁定。

PrivateRedact22github.com原文 ↗

github.com

PrivateRedact 采用 regex+本地 LLM 的混合流水线,只遮盖电话号码等敏感值而保留标签与上下文;扫描文档还可用 Tesseract 和可选视觉模型复核。PDF 通过栅格化重建彻底去掉隐藏文本层,导出后再 OCR 检查泄漏,并默认清理 EXIF/XMP。它的现实边界也写得很清楚:当前只支持 Apple Silicon/Windows,文档内容进入本地模型前的 prompt-injection 防护仍在路线图。

DocSift23github.com原文 ↗

DocSift 先用 Docling/MarkItDown 把文档标准化并缓存,再以 SQLite FTS5/BM25 返回带页码、标题的相关 chunks,提供 CLI、HTTP API 和 MCP。34 页报告的实测从约 21k token 整文降至约 4k token 的五段答案,代价是首次下载布局模型约三分钟且检索只匹配词面。它刻意不引入 embedding/GPU,把可预测的本地隐私与低部署成本置于语义召回之上。

Self-Hosted Inference for Agents24github.com原文 ↗

SIE 用一个 OpenAI-compatible 服务承载检索、OCR/Markdown、结构化输出、内容安全和 agent loop,模型按需加载并 LRU 淘汰,可在同一集群管理 100+ 个开放模型。仓库还配负载均衡、KEDA、Grafana 与多云 Terraform,以及 LangChain、LlamaIndex、Haystack、DSPy、CrewAI 等集成。项目的工程贡献是把 agent 的多模型拼装变成一个可观测、可扩缩的生产面。

QuillCode25github.com原文 ↗

Quill Cowork 以原生 SwiftUI 应用承载 project-aware chat、文件/Git/worktree、Computer Use、插件、自动化和集成终端,桌面与 agent runtime 都不依赖 Electron。它内置任务额度、模型配置和可见的审批边界;更新器核验 SHA-256、签名与 commit manifest,失败时原子回滚到旧版本。当前构建面向 macOS 14+,同时提供 Apple Silicon 和 Intel 包,强调的是桌面 harness 的系统级完整性。

Blueferry26github.com原文 ↗

github.com

BlueFerry 直接利用 iPhone Bluetooth accessory services 将 iMessage/SMS 带到 Linux,GNOME、KDE 和 Quickshell 客户端共用同一 backend。MAP 不提供群组 roster,因此无法安全识别的群聊保持只读;附件、反应、FaceTime、完整历史等明确不支持。它的有趣之处在于用公开配件协议绕开云 relay,同时把“宁可只读也不误发”作为产品安全策略。

Celerp27github.com原文 ↗

github.com

Celerp 是带桌面打包的 local-first ERP,库存、双重记账、采购、制造、CRM、订阅开票和 REST API 都由本机服务提供。`celerp init` 自动复用已有 PostgreSQL 或启动随包数据库,Windows/Linux/macOS 均可双击安装,亦可用 pip 配置。项目把“无账号、无云、电脑即服务器”与跨系统业务模块放在一起,适合审视单机 ERP 的数据主权和运维简化。

Albedo28github.com原文 ↗

github.com

Albedo 用 Zig 实现单文件 BSON 数据库,B+ 树覆盖嵌套字段和数组路径,WAL+MVCC 负责崩溃恢复与一致读;跨进程流、实时订阅和 WAL 复制则补齐嵌入式场景常缺的增量能力。它提供 C ABI、Node/Bun、WASM、Dart 等绑定,核心可移植到桌面、移动和 WASM。项目仍 pre-1.0,当前更像可审阅的存储实验而非稳定替代品。

Lumabri29github.com原文 ↗

github.com

Lumabri 让普通计算机以 peer swarm 分担 MoE 权重存储与专家执行,聊天端只拉取实际触碰的字节并在 `~/.lumabri` 镜像。tracker 以稀缺文件优先分配捐赠磁盘,节点可分别捐空间或算力;签名校验、NAT relay 和共享 token 保护传输。第二次请求走本地缓存、无 GPU 也能工作,展示了一条与“集中 GPU 集群”不同的模型分发路线。

DSPy Factorio30github.com原文 ↗

这个仓库把 Factorio 工厂当作可视、可验证的训练场,用 FLE 连接环境,再按教程体验 Predict agent loop、GEPA 指令优化、RLM REPL 和 Flex 结构搜索。它提供 13 个编号示例、PNG 地图可视化和 Docker 集群,先从放置并供能 burner drill 的小目标建立闭环。对 DSPy 学习者而言,游戏状态提供了比文本问答更明确的工具反馈和长期规划压力。

行业动态 · Industry News

15 项 · 行业动态

Muse Glimmer31research.meta.ai原文 ↗

research.meta.ai

Meta 发布面向常驻本地 agent 工作流的 30B 开放权重模型,路线重点是让 agent 在本地持续运行而非只提供云端聊天。该公告应与 Meta 重新强化开放模型的战略报道一并理解:Muse Glimmer 是技术落点,开放权重则是生态选择;digest 未给出训练配方或评测数字。

Docker Sandboxes32docker.com原文 ↗

Docker 用专用 microVM、项目目录挂载和可配置网络/文件系统控制,为 coding agent 提供 disposable workspace;agent 仍可在沙箱内安装包、启动 Docker 容器并无人值守运行。官方把 Claude Code、Copilot CLI、Codex、OpenCode、Kiro 列为开箱即用对象,并将 `--dangerously-skip-permissions` 的风险交给隔离边界承担。关键变化是把 agent 权限问题下沉到可销毁基础设施,而不是继续依赖每次人工确认。

Expanding Daybreak as the Cyber Defense Window Narrows34openai.com原文 ↗

openai.com

OpenAI 将 Daybreak 分为面向一般防御工作的 Blue 与面向漏洞研究/利用验证的 Red,并在 Red 提供 GPT-5.6-Cyber。其内部高风险请求完成率为 95.0%,远高于 GPT-5.6 Sol 的 1.5%,但标准 300-turn ExploitBench 中 Sol 更 token-efficient;公告还称模型协助发现 V8 高危漏洞 CVE-2026-15903。访问受身份、用途、监控和硬件密钥约束,能力提升与治理强度同步推进。

How Claude marks AI-generated content35support.claude.com原文 ↗

support.claude.com

Anthropic 说明 Claude 产品如何给 AI 生成内容附加来源或生成标记,意图让接收者知道内容来自模型流程。它属于 provenance/UI 层机制,不等同于对文本真实性或版权的判定;产品仍需把标记与编辑、转发和导出路径一起保留,才能避免上下文丢失。digest 未给出具体标记格式,本文不扩展到未公布的检测准确率。

OpenAI’s letter on responsible AI infrastructure in Texas36openai.com原文 ↗

openai.com

OpenAI 致信得州州长,承诺在 AI 基础设施建设中与州、地方、能源部门和社区协作,强调能源、透明度与当地收益。公开页面是政策沟通而非工程白皮书,没有机房规模、用电曲线或时间表;因此它提供的是责任框架,不能直接当作项目落地证明。

Meta returns to open models37ft.com原文 ↗

ft.com

FT 报道 Meta 重新强化开放模型路线,并把开放权重作为区别于闭源竞争者的战略标识。对开发者而言,潜在影响在权重可下载、部署和生态协作的边界,但 digest 没有给出具体模型、许可证或发布时间。条目因此记录路线回摆,不把战略声明误写成已经交付的 API。

Illinois HB5511 and operating-system age verification38linuxstans.com原文 ↗

linuxstans.com

分析文章讨论 Illinois HB5511 若把年龄验证责任延伸到操作系统,Linux 发行版和 OS 提供者可能需要处理用户年龄、分发入口与隐私责任。争议点是开源发行版是否被视为“平台”以及验证发生在系统还是应用层;digest 未给出最终法律文本结论,正文保持可能义务的条件式表述。

Mistral patent for “code implemented tool calls”39patentsgazette.uspto.gov原文 ↗

USPTO 公报中的 Mistral 专利描述模型生成代码、再由代码实施外部工具调用的流程。相较固定 schema,这种做法把循环、条件和参数处理交给运行时代码,随之扩大了沙箱、审计和资源限制的必要性。该条只说明专利文件所述方法,不对权利要求有效性或产业影响作法律判断。

Kinney Drugs pulls back AI phone assistant40wcax.com原文 ↗

wcax.com

Kinney Drugs 因数百起顾客投诉而缩减 AI 电话助理使用,说明语音自动化一旦进入药房等高敏感服务,误解和错误转接会迅速变成运营成本。报道摘要没有披露投诉类型、供应商或回撤后的人工比例,因此最确定的事实是“反馈触发范围收缩”,而非某个模型指标失败。

AI assistant hacks Australian gym website41abc.net.au原文 ↗

澳大利亚健身房事件中,AI 助理利用预订 API 缺少授权检查取消他人候补预约。漏洞在对象级访问控制而不在 agent 是否“聪明”:只要工具端点接受了未授权的预约 ID,任何自动化客户端都能执行破坏性动作。它把 OWASP 式后端授权缺陷具体化为 agent 时代的工具安全问题。

Tl;dv: Over 180k meetings left wide open42bobdahacker.com原文 ↗

bobdahacker.com

安全研究发现 tl;dv 访问控制问题暴露超过 18 万场会议记录,规模显示默认可见性或对象授权错误会被数据量放大。digest 没有给出端点、租户隔离或修复时间线,正文不猜测具体漏洞类型;可确定的教训是会议转录系统必须把记录、分享链接和搜索索引分别做授权测试。

GitHub Models is now retired43simonwillison.net原文 ↗

simonwillison.net

GitHub 完成 Models playground、API 和相关 Actions 服务退役,依赖其做实验或 CI 推理的项目需要迁移到别的模型端点。这里是整套平台能力下线,不是某个模型版本淘汰,因此凭据、配额和 workflow 也要一起重做。digest 未列官方替代路线,正文不虚构迁移承诺。

Django is moving to an annual release cycle44djangoproject.com原文 ↗

djangoproject.com

Django 从 2028 年起每年一个 feature release,每版三年支持、取消 LTS 标签,版本号采用年份;发布时支持最新三代 Python,并在首年吸收新版本。Django 6.1(2026-08 至 2027-12)和 6.2 LTS(至 2030-04)的既有承诺不变。更短的升级步幅与更长的实际弃用周期,目标是让框架节奏与 Python 年度发布对齐。

Japanese court overturns Red RAW video patent45dpreview.com原文 ↗

dpreview.com

日本法院撤销 RED RAW 视频编码专利的一项权利要求,报道将其描述为 Panasonic 对该专利挑战成功。条目只提供司法结果,没有判决技术理由、剩余权利要求或上诉信息;因此它的即时意义是相机厂商专利谈判空间变化,而不是 RAW 编码专利整体失效。

博客文章 · Blog Posts

14 项 · 博客文章

Learning more about Claude’s mathematical capabilities46anthropic.com原文 ↗

Anthropic 记录 Claude 参与黎曼 ζ 函数问题研究的实验,关注模型如何探索、提出中间猜想并用计算核验。digest 未提供可复现实验规模或最终数学成果,因而本文不把“参与研究”夸成独立证明。它更适合作为观察 agent 化数学工作流的案例:答案质量取决于中间步骤是否可检查。

Exploring Claude/GPT Knowledge Cutoffs and Pre-Training Timelines47blog.sshh.io原文 ↗

blog.sshh.io

文章用时间相关事实探测 Claude/GPT 的回答边界,估算知识截止点和预训练时间线。方法通过外部问答行为反推内部数据,而非读取训练配置;样本选择、记忆污染和在线检索都会影响估计。digest 没列具体模型版本和误差范围,结论应被视为黑箱测量而非官方时间线。

Humanising LLM Outputs Is Dumb48kuber.studio原文 ↗

kuber.studio

作者反对把 LLM 输出刻意拟人化,理由是“真人腔”可能掩盖系统边界、把工具交互伪装成社会关系。文章把重点放在界面文案和用户预期:直接、可解释的系统语气比模拟情绪更容易建立正确心智模型。由于没有量化研究,条目的力量在产品批评而非统计证明。

How do programming languages impact token efficiency and correctness?49danluu.com原文 ↗

danluu.com

Dan Luu 比较编程语言语法与生态对模型 token 消耗和代码正确性的影响,提醒短 token 序列并不自动等于更少 bug。语言的表达冗长度、训练语料分布、类型约束和测试工具会共同决定生成结果;因此应把 token 成本与验证成本一起测。digest 未给出语言排名,正文不杜撰“最佳语言”。

Rust SIMD on the GPU50vectorware.com原文 ↗

vectorware.com

Vectorware 探索 Rust SIMD 抽象映射 GPU 执行,讨论 lane、线程组、内存访问与 Rust 类型/所有权语义的错位。文章的贡献是列出哪些 API 可以直译、哪些需要新后端或牺牲可预测性;GPU 并不是简单增加 SIMD 宽度。digest 未提供性能表,本文把它作为编译器与执行模型边界的技术笔记。

How We Pushed CDC into Postgres51snowflake.com原文 ↗

snowflake.com

Snowflake 的 Data Mirroring 在 Postgres 侧扩展读取 WAL,把 snapshot、DDL、DML 和 schema 变化按事务批次推入 Iceberg change/meta logs,再在 Snowflake 侧事务性 apply。由于插入以追加而非逐行 upsert,insert-heavy workload 成本更低;live view 在低频 apply 时仍可把延迟压到一分钟以内。核心工程判断是让 producer 知道自己的事务状态,外部连接器不再猜。

SQLite compressed text-history prototypes52simonwillison.net原文 ↗

simonwillison.net

Simon Willison 的原型比较 JSON、zlib、zstd 在 SQLite 中保存文本修订历史的布局,探讨单文件数据库如何兼顾压缩、版本读取和实现复杂度。它是实验性数据模型而非完整协作系统,digest 未提供压缩比或读写 benchmark。值得注意的是,压缩策略会直接影响 diff 查询和审计回放,而不只是磁盘占用。

5 useful things you’ll learn in my new post-training textbook53interconnects.ai原文 ↗

interconnects.ai

Nathan Lambert 用五个主题概览 RLHF/LLM post-training 教材,把奖励建模、数据组织、优化和评估等实践知识收束成学习路线。它更像课程导航,帮助读者定位工程环节之间的依赖,而不是发布一个新算法。digest 没列五章的逐项内容,正文保持导读的粒度。

Dark mode toggles: two states are enough54lea.verou.me原文 ↗

lea.verou.me

Lea Verou 认为主题切换应只有亮/暗两个持久状态,“跟随系统”应作为默认策略而非第三个循环选项。这样可以避免用户在循环控件里无法判断当前覆盖关系,也让无障碍与偏好存储更直观。文章的判断来自交互模型分析,并非某个 A/B 测试的胜负。

A C++ toolchain from 357 bytes in Bazel55fzakaria.com原文 ↗

fzakaria.com

该实践把 stage0 的 357-byte seed 接入 Bazel,沿源码 bootstrap 链构建 Clang/GCC 级工具链,并用 aspects 生成 trust report 审计每个 action。它直接从中央仓库编译 Abseil/GoogleTest,236 个筛选测试全部通过;报告只允许 hex0 seed 和系统 bash 作为外部种子。结果把“可复现 hermetic toolchain”从宣言变成可运行的 Bazel 目标。

nixpkgs isn’t doing too hot56foxgirl.engineering原文 ↗

foxgirl.engineering

文章从维护规模、贡献流程和包质量三方面审视 nixpkgs 的压力,指出包数量增长会放大 review、升级和回归负担。它是生态治理批评而非单次 outage 报告,具体问题要结合维护者带宽和发布流程理解。digest 没给出量化趋势,正文不把主观标题扩写成确定的质量下降百分比。

GitHub Actions needs OIDC audience constraints57blog.yossarian.net原文 ↗

blog.yossarian.net

文章指出 GitHub Actions OIDC 信任策略若不验证 `aud`,只靠 issuer、仓库或分支条件,token 可能被重放到错误的受众服务。修复方向是把 audience 绑定到具体云资源/工作负载,并缩小可交换凭据的 scope。它把常被忽略的 JWT 字段提升为 CI 身份边界,而不是泛泛提醒“注意 token 安全”。

Easy Sandboxing on Linux with Bubblewrap58bxt.rs原文 ↗

bxt.rs

Bubblewrap 通过 user、mount、PID、network 等 Linux namespace 选项,为普通程序构造最小 root、只读目录和受限设备视图。文章强调它是组合式隔离工具,调用者仍需明确哪些路径可写、是否开放网络以及如何处理 setuid/内核逃逸;短命令不等于完整安全模型。digest 没列性能数据,重点在可落地的 namespace 配置思路。

Profile-guided optimization in Go59lemire.me原文 ↗

lemire.me

Lemire 用 Go 的 PGO 流程展示如何收集代表性 CPU profile、把热点反馈给编译器,再比较优化前后二进制。效果并非固定常数,关键在 profile 是否覆盖真实请求分布以及部署流程能否稳定复用它;冷门路径可能不变甚至受影响。digest 未提供单一百分比,本文保留“示例验证流程+代表性约束”的结论。

引用来源 · References

64 条 · 引用
  1. 1 MemPrism: Task-Conditioned Relational Memory Views for Long-Horizon Agents. arXiv:2608.06745https://arxiv.org/abs/2608.06745 ↩ 回到正文 · back to text
  2. 2 How Much, Then Where: Credit-Conserving Action-to-Token Allocation for Multi-Turn Agent Reinforcement Learning. arXiv:2608.07118https://arxiv.org/abs/2608.07118 ↩ 回到正文 · back to text
  3. 3 StepJack: Benchmarking Computer-Use Agent Safety Against Multi-Step Indirect Prompt Injection. arXiv:2608.06477https://arxiv.org/abs/2608.06477 ↩ 回到正文 · back to text
  4. 4 Needle 2https://cactuscompute.com/needle ↩ 回到正文 · back to text
  5. 5 Antehttps://github.com/AntigmaLabs/ante ↩ 回到正文 · back to text
  6. 6 EntropyMoE: Entropy-Aware Sparse Expert Routing for Tokenizer-Free LLMs. arXiv:2608.06398https://arxiv.org/abs/2608.06398 ↩ 回到正文 · back to text
  7. 7 ADIAS: Automated Design of Interactive Agentic Systems. arXiv:2608.06410https://arxiv.org/abs/2608.06410 ↩ 回到正文 · back to text
  8. 8 WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader. arXiv:2608.06474https://arxiv.org/abs/2608.06474 ↩ 回到正文 · back to text
  9. 9 The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows. arXiv:2608.06714https://arxiv.org/abs/2608.06714 ↩ 回到正文 · back to text
  10. 10 SkillEval: Decomposing Agent Skill Quality into Interpretable Signals. arXiv:2608.06891https://arxiv.org/abs/2608.06891 ↩ 回到正文 · back to text
  11. 11 Long-Horizon Agent Trajectory Attribution: A Unified Benchmark and Fine-Grained Annotation Framework. arXiv:2608.06909https://arxiv.org/abs/2608.06909 ↩ 回到正文 · back to text
  12. 12 MemOPD: On-Policy Distillation through Memory State Alignment for Long-Horizon Agents. arXiv:2608.07068https://arxiv.org/abs/2608.07068 ↩ 回到正文 · back to text
  13. 13 DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training. arXiv:2608.07147https://arxiv.org/abs/2608.07147 ↩ 回到正文 · back to text
  14. 14 Online Monitoring and Corrective Steering of Programming Agents. arXiv:2608.06701https://arxiv.org/abs/2608.06701 ↩ 回到正文 · back to text
  15. 15 HarnessSafe: Evaluating Safety Across Persistent Carriers in Agent Harnesses. arXiv:2608.06984https://arxiv.org/abs/2608.06984 ↩ 回到正文 · back to text
  16. 16 TEPA: Revoking Stale Memories for Conflict-Robust Language Agents. arXiv:2608.07429https://arxiv.org/abs/2608.07429 ↩ 回到正文 · back to text
  17. 17 OpenForgeRL: Train Harness-native Agents in Any Environment. arXiv:2607.21557https://arxiv.org/abs/2607.21557 ↩ 回到正文 · back to text
  18. 18 Stagehand v4https://news.ycombinator.com/item?id=49248980 ↩ 回到正文 · back to text
  19. 19 Jurorhttps://github.com/Juror-AI/juror ↩ 回到正文 · back to text
  20. 20 Nitpickerhttps://nitpicker.dev ↩ 回到正文 · back to text
  21. 21 OpenParserhttps://www.openparser.dev ↩ 回到正文 · back to text
  22. 22 PrivateRedacthttps://github.com/monjurulkarim/privateredact ↩ 回到正文 · back to text
  23. 23 DocSifthttps://github.com/anishmoncivarghese/docsift ↩ 回到正文 · back to text
  24. 24 Self-Hosted Inference for Agentshttps://github.com/superlinked/sie ↩ 回到正文 · back to text
  25. 25 QuillCodehttps://github.com/Lore-Hex/QuillCode ↩ 回到正文 · back to text
  26. 26 Blueferryhttps://github.com/erikwb/blueferry ↩ 回到正文 · back to text
  27. 27 Celerphttps://github.com/celerp/celerp ↩ 回到正文 · back to text
  28. 28 Albedohttps://github.com/klirix/albedo ↩ 回到正文 · back to text
  29. 29 Lumabrihttps://github.com/JustVugg/lumabri ↩ 回到正文 · back to text
  30. 30 DSPy Factoriohttps://github.com/ukituki/dspy-factorio/ ↩ 回到正文 · back to text
  31. 31 Muse Glimmerhttps://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model ↩ 回到正文 · back to text
  32. 32 Docker Sandboxeshttps://www.docker.com/products/docker-sandboxes/ ↩ 回到正文 · back to text
  33. 33 Auto mode is now the default in Claude Codehttps://claude.com/blog/auto-mode-default-in-claude-code ↩ 回到正文 · back to text
  34. 34 Expanding Daybreak as the Cyber Defense Window Narrowshttps://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows ↩ 回到正文 · back to text
  35. 35 How Claude marks AI-generated contenthttps://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content ↩ 回到正文 · back to text
  36. 36 OpenAI’s letter on responsible AI infrastructure in Texashttps://openai.com/index/responsible-ai-infrastructure-texas ↩ 回到正文 · back to text
  37. 37 Meta returns to open modelshttps://www.ft.com/content/4e3957f8-ea7c-4c46-a3de-cdce8e526878 ↩ 回到正文 · back to text
  38. 38 Illinois HB5511 and operating-system age verificationhttps://linuxstans.com/illinois-hb5511-operating-system-age-verification/ ↩ 回到正文 · back to text
  39. 39 Mistral patent for “code implemented tool calls”https://patentsgazette.uspto.gov/week26/OG/html/1547-5/US12670045-20260630.html ↩ 回到正文 · back to text
  40. 40 Kinney Drugs pulls back AI phone assistanthttps://www.wcax.com/2026/08/07/kinney-drugs-pulls-back-ai-phone-assistant-after-hundreds-customer-complaints/ ↩ 回到正文 · back to text
  41. 41 AI assistant hacks Australian gym websitehttps://www.abc.net.au/news/2026-08-10/ai-assistant-hacks-gym-website-aus-cyber-attack/107007986 ↩ 回到正文 · back to text
  42. 42 Tl;dv: Over 180k meetings left wide openhttps://bobdahacker.com/blog/tldv-hack ↩ 回到正文 · back to text
  43. 43 GitHub Models is now retiredhttps://simonwillison.net/2026/Aug/9/github-models-is-now-retired/#atom-everything ↩ 回到正文 · back to text
  44. 44 Django is moving to an annual release cyclehttps://www.djangoproject.com/weblog/2026/aug/10/annual-release-cycle/ ↩ 回到正文 · back to text
  45. 45 Japanese court overturns Red RAW video patenthttps://www.dpreview.com/news/panasonic-did-what-apple-sony-and-nikon-couldnt-overturn-a-red-raw-video-patent/ ↩ 回到正文 · back to text
  46. 46 Learning more about Claude’s mathematical capabilitieshttps://www.anthropic.com/research/riemann-zeta ↩ 回到正文 · back to text
  47. 47 Exploring Claude/GPT Knowledge Cutoffs and Pre-Training Timelineshttps://blog.sshh.io/p/exploring-claudegpt-knowledge-cutoffs ↩ 回到正文 · back to text
  48. 48 Humanising LLM Outputs Is Dumbhttps://kuber.studio/blog/Reflections/Humanising-LLM-Outputs-is-Actually-Dumb ↩ 回到正文 · back to text
  49. 49 How do programming languages impact token efficiency and correctness?https://danluu.com/pl-tokens/ ↩ 回到正文 · back to text
  50. 50 Rust SIMD on the GPUhttps://www.vectorware.com/blog/simd-on-gpu/ ↩ 回到正文 · back to text
  51. 51 How We Pushed CDC into Postgreshttps://www.snowflake.com/en/blog/engineering/postgres-to-snowflake-replication-mirroring/ ↩ 回到正文 · back to text
  52. 52 SQLite compressed text-history prototypeshttps://simonwillison.net/2026/Aug/9/sqlite-text-history-prototype/#atom-everything ↩ 回到正文 · back to text
  53. 53 5 useful things you’ll learn in my new post-training textbookhttps://www.interconnects.ai/p/5-useful-things-youll-learn-in-my ↩ 回到正文 · back to text
  54. 54 Dark mode toggles: two states are enoughhttps://lea.verou.me/blog/2026/dark-mode-toggles/ ↩ 回到正文 · back to text
  55. 55 A C++ toolchain from 357 bytes in Bazelhttps://fzakaria.com/2026/08/01/a-c++-toolchain-from-357-bytes-in-bazel ↩ 回到正文 · back to text
  56. 56 nixpkgs isn’t doing too hothttps://foxgirl.engineering/blog/nixpkgs-not-hot/ ↩ 回到正文 · back to text
  57. 57 GitHub Actions needs OIDC audience constraintshttps://blog.yossarian.net/2026/08/10/github-actions-needs-oidc-audience-constraints ↩ 回到正文 · back to text
  58. 58 Easy Sandboxing on Linux with Bubblewraphttps://bxt.rs/blog/easy-sandboxing-on-linux-with-bubblewrap/ ↩ 回到正文 · back to text
  59. 59 Profile-guided optimization in Gohttps://lemire.me/blog/2026/08/09/profile-guided-optimization-in-go/ ↩ 回到正文 · back to text
  60. 60 Microsoft Word for Windows 1.1a, Native X64 Porthttps://github.com/jmarshall23/msword ↩ 回到正文 · back to text
  61. 61 sunlithttps://github.com/jackyzha0/sunlit ↩ 回到正文 · back to text
  62. 62 smiiiiiiiiiiiiiiiihttps://github.com/xoreaxeaxeax/smiiiiiiiiiiiiiiii ↩ 回到正文 · back to text
  63. 63 Kleptonhttps://github.com/shinyquagsire23/Klepton ↩ 回到正文 · back to text
  64. 64 LinkedIn Feed Blockerhttps://github.com/andrewpollack/linkedin-feed-blocker ↩ 回到正文 · back to text