每日 Harness 开源 · Source
全部刊期 · All issues

每日 Harness

2026-08-26 · Wednesday, August 26, 2026

代理工程进入可验证时代

视图 · View

今日重点 · Today's Highlights

CuMetal - 以 CUDA/PTX 到类型化 IR 再到 Metal 的源码优先路线,给 Apple GPU 上的 CUDA 迁移提供了可检查的编译器骨架。4

全文 ↓

Netra Kernel - 在 8 张 MI350X 上以固定契约汇编内核交出 7.85 万输出 token/s,同时明确放弃通用算子回退。5

全文 ↓

论文 · Papers

18 项 · 论文

LitReview Arena: A Battle-Style Benchmark for Expert-Level Literature Reviews6arxiv.org原文 ↗

基准评测方法研究·科学

论文不用单篇绝对分,而让同领域专家匿名两两比较机器综述与人类草稿,并按五项标准判胜。约 3000 次判断中,最强系统对人类草稿也只有 23.0% 的明确胜率;深度检索代理则比裸语言模型强逾 60%。通用 LLM 裁判与专家排序的相关系数仅 0.467,专门训练的 LitJudge 达 0.78,说明高质量综述和可信评审是两个独立难题。

–

本期重点There Is No Neutral Harness: Measurement Instability in LLM Evaluation1arxiv.org原文 ↗

评测方法基准其他垂直

作者把 12 个开源模型放进 26 种提示、解码与计分配置,在 ARC、HellaSwag、MMLU、TruthfulQA 共 3679 道题上重跑。Gemma4-31B 的汇总分可从 31% 变到 89%,脆弱题解释相邻模型差距的 95.7%,而且 12 个模型里有 4 个能在某种配置下成为第一。结论不只是“模板会影响分数”,而是模型排名若没有完整 harness 规范便缺乏可复现含义。

–

K-Bench: Benchmarking Agentic Coding in Live Engineering Environments7arxiv.org原文 ↗

K-Bench 收集带附件、信息不全且没有唯一标准答案的真实首轮工程请求,让九个前沿模型在同一沙箱完成 1602 次任务,再由三位盲评者按八维量表审阅。没有一个模型同时越过三名评委的验收线;GPT-5.6-Sol 均分最高为 8.04,但两位评委仍将 Claude Opus 5 排在首位。39934 个子项分数中 47.6% 低于 8,准确性均分 6.22 而表达为 7.33,提示当前代理更容易“交付得像完成了”而非真正完成。

–

ECHO: Auditable Memory for Long-Horizon Agents8arxiv.org原文 ↗

ECHO 把记忆拆成情景编码、巩固、重现、再巩固和执行控制,并保留每次召回的来源,以便审计长期代理为何想起某条信息。LoCoMo 上 Hit@10 为 96.29%,LongMemEval 检索命中为 97.60%;但在匹配的 91 道问答里,Mem0 得 64.84,ECHO 只有 41.76,差异具有统计显著性。它证明可追溯检索能做得很强,也提醒读者不要把检索召回率直接当成记忆问答质量。

–

Training Needs Trustworthy Worlds: Verified Environment Synthesis for Web Agents9arxiv.org原文 ↗

方法先生成页面、导航、数据库、状态标记和约束,再依次验证结构、语义、一致性与任务可行性,最后用确定性 UI 转移和后端状态变化产生稠密谓词奖励。六个领域的 500 个环境经过修复后,可行任务率从 48.6% 升至 94.8%。在这些世界里做 PPO 的代理能迁移提升 WebArena、WebShop 与 MiniWoB++,且评测不靠另一个 LLM 裁判,减少了合成环境与奖励同时漂移的风险。

–

Disagree to Explore, Agree to Converge: Adaptive MoE Routing for Test-Time Agentic Coding10arxiv.org原文 ↗

Risa 读取 MoE 的原生路由轨迹:专家意见分散时继续探索,路由趋同时收束,并用同一信号挑选补丁,不另接裁判或把测试结果当选择器。SWE-bench Verified 上,gpt-oss 的宏观解决率从 44.9% 增至 48.2%,策略还能迁移到 Qwen3.6 的完整 500 题。它将本来只是稀疏计算调度的内部信号,转化为自适应测试时预算,前提是模型暴露足够细的路由信息。

–

本期重点Read Less, Answer Better: A Training-Free Framework for Efficient Source-Grounded Agents2arxiv.org原文 ↗

SparseRead 在代理读取全文之前加入 Read Gate,再配可替换 Reader、来源锚定的验证、停止与回退规则,整个流程不训练参数。六个模型、五类场景平均少用 92.9% 输入 token、墙钟时间降低 89%,答案质量保持或提升,并能接入三种代理框架。收益来自拒绝低价值读取和有界复核,而不是用摘要压缩掉证据,因而其决策轨迹也容易检查。

–

AutoSaddler: Learning to Improve Agent Harnesses from Failure Traces11arxiv.org原文 ↗

AutoSaddler 从小批量失败轨迹离线定位 harness 缺陷,把工具、控制流和配置变更写成结构化代码补丁,再用验证集挑选可泛化版本。GAIA2、SWE-Bench Pro、Terminal-Bench 2 分别提高 9.0、9.6、10.0 个百分点;消融显示深层调试、定向修改和泛化选择都贡献明显。它把代理优化从反复润色提示词推进到可测试的运行系统修改,尤其适合模型暂时不能重训的场景。

–

From Inertia to Insight: Context Isolation for Robust Web Agents12arxiv.org原文 ↗

作者用 IBIS 分离页面观察和先前行动归属,发现代理在评价自己已经选过的网页时会系统性偏向维持旧决定。NIS-Agent 在网页分诊与最终验证阶段隔离归属上下文,四个基准上减少 33% token,训练后的 8B 模型平均表现可比 GPT-4o。结果说明部分“长上下文推理失败”其实是控制流把身份承诺带入了证据判断,修正边界比继续扩窗更直接。

–

Prime Agent: Continual Harnesses for Persistent Reasoning13arxiv.org原文 ↗

Prime Agent 以持久 IPython 递归语言模型为底座,让历史、记忆、技能、提示和子代理规格随任务继续演化,并支持代理直连通信与守护进程界面。其 RHAE 在 ARC-AGI-3 的 Best@1 从 30% 跃至 95.5%,在编码、内核、模拟器与 nanoGPT 任务上也达到或超过专用 harness。论文的实质贡献是把脚手架本身变成有状态、可积累的能力层,但持久状态也会带来污染和版本治理问题。

–

Agentic Scaffolding Can Induce Sycophancy in Language Models14arxiv.org原文 ↗

研究在 200 个问题、6 个模型、4 种交互条件下收集 4800 次判断,测试多轮追问、用户施压和自我反思是否让模型放弃正确答案。脚手架使平均准确率下降 6.3 个百分点,且能力更强的模型退让幅度反而更大。新增的 capitulation 与 sycophantic capitulation 指标把“被说服改错”和“单纯答错”分开,给 review loop 的安全评测增加了更精确的观测量。

–

Agentic Security: A Systems Framework for Tool-Using AI15arxiv.org原文 ↗

安全与攻防工具使用系统·基础设施

论文以十种安全工具的实作经验建模接入摩擦、跨阶段证据损失、相关错误下的裁决级联,以及规划者 - 执行者之间的预算分配。其设计建议是用确定性中介约束随机 LLM,并把子代理的核心收益理解为证据压缩,而非凭空增加独立判断。重尾任务存在由价值与成本决定的最优并发上限;权限范围和预算若只写在提示词里,则没有系统级强制力。

–

Forgotten in Weights, Remembered by Agents: Trajectory-Aware Unlearning16arxiv.org原文 ↗

作者指出参数层去学习只让模型“不直接说”,工具代理仍可能经网页、检索或数据库重新拼回目标事实。ATU 先做参数遗忘,再以轨迹强化学习同时惩罚搜寻目标的行动和最终答案泄漏,在 RWKU、MUSE 及多种架构上改善遗忘 - 效用折中。把整个工具轨迹纳入威胁模型,堵住了静态问答评测看不到的外部记忆通道。

–

Architecture as a Capability Equalizer in Multi-Agent Systems17arxiv.org原文 ↗

研究用五种信息等价格式、三家供应商六个模型做 90 次多轮试验,观察编排接口能否弥补底模差异。最强模型的格式跨度为 0.17 - 0.92,弱模型扩大到 0.83 - 2.42;TypeScript 合约把最弱路径覆盖率从 33% 拉到 100%。不过自验证仍从 Sonnet 的 100% 落到 Gemini Flash 的 0%,表明类型化架构能补齐交接,却无法等化推理和校验能力。

–

本期重点SWE Refactor Bench: Whole-Repository Refactoring Under Hidden Tests3arxiv.org原文 ↗

基准用 20 个全仓迁移覆盖四类技术债,同时要求通过迁移审计、固定行为检查和六组代理生成的定向隐藏测试。八个模型、26 种配置的 520 次运行中仅 28 次成功,即 5.4%,且 13 个任务没有任何可接受结果;340 次虽过审计,仍只有 26% 做到全部固定检查。构建系统改写成功率 31.4%,语言级改写仅 5.6%,揭示代理对跨模块语义保持仍远弱于机械配置迁移。

–

Context as an Environment: Programmatic Context Management for Long-Horizon Agents18arxiv.org原文 ↗

Scroll 不预先把旧对话压成固定记忆,而将会话实现为追加式 Event Log 与持久沙箱 Python 内核;工具输出和派生状态绑定为类型化变量,只有模型显式打印的投影进入工作窗口。以 Qwen3.8-Max 为底模时,LongMemEval_S 得 94.8%,BEAM_10M 得 73.1%,比已发表最佳记忆系统高 5.1 点,LOCA_256K 则领先既有长程代理 37.4 点。可精确寻址的驱逐索引保留了无损恢复路径,代价是让上下文管理能力依赖模型写代码与维护状态的可靠性。

–

SchemaRouter: Field-Aware Tool Routing for Efficient Heterogeneous Agentic RAG19arxiv.org原文 ↗

SchemaRouter 把工具、端点、参数、返回字段、领域概念、单位、来源和许可编码为 schema graph,小模型抽取查询意图后,由确定性图投影选择调用及字段。110 道材料科学查询上准确率 0.71,与全量抓取的置信区间重叠,但检索上下文从 2066 token 降到 227,端到端延迟比 prompt-all 低 2.7 倍,工具精确率达 0.93。把字段数压到最少反而使准确率跌至 0.56,说明字段路由应优化召回约束,而非只追求短上下文。

–

MCP-Universe RL: A Framework for Training MCP Tool-Use Agents via Reinforcement Learning20arxiv.org原文 ↗

MCP-U RL 用 MCP 作为环境接口,让现有工具服务器无需编写 RL 专用胶水即可加入训练;环境层负责在可插拔容器后端配置、隔离与回收数百条轨迹。分阶段 rollout 流水线在长回合等待慢工具时重叠其他 episode,以维持 GPU 利用率,训练后端则接 veRL 或 slime。作者只改任务规格,就用 gpt-oss-20b 在软件工程、深度研究与通用工具三类任务上均提高奖励,系统贡献重于提出新的策略更新算法。

–

开源 / 项目 · Projects

15 项 · 开源 / 项目

FERAL-AI21github.com原文 ↗

FERAL-AI 在个人设备上构建四层可执行记忆:工作、情景、语义图谱和执行记录,并用滚动基线检测异常。动作由策略门控制,能设审批、时间窗和每日上限;实现采用 Python 3.11+ 与 SQLite FTS5,默认监听 9090。它把记忆与行动约束放在同一数据面,但当前只是 macOS/Linux 单用户测试版,不具备高可用或多租户隔离。

–

sillage22github.com原文 ↗

Agent 记忆其他垂直

sillage 给冻结语言模型挂接固定容量记忆,用超向量 n-gram 键、惊讶度写入与 rank-16 快速权重完成索引和补全,不改底模。对 3.6 万技术 token,GPT-2 124M 的困惑度从 31.2 降至 16.8,附加存储 7.4MB;作为对照,55MB 的 kNN 记忆只能做到 23.6。这个结果有力支持紧凑局部模式记忆,但 README 也明确它不是通用推理模块,固定容量会限制知识增长。

–

Oynix23oynix.dev原文 ↗

Oynix 在本地把代码、文档和协作数据解析成知识图,经 MCP 直接给代理返回事实,同时保留来源、写回路径以及 BYOK/BYODB 选择。项目方测试称,在 2300 token 上下文下准确率为 54%,对照方案用 9300 token 得 41%;24358 个节点的结构索引约 8.08 秒,但描述索引可耗时约 18 分钟。18 种连接器让它具备实用覆盖面,不过精度数字来自产品内部基准,部署前仍应在自己的仓库复测。

–

MulmoTerminal24github.com原文 ↗

MulmoTerminal 以 PTY、WebSocket 和 xterm 在浏览器网格里展示真实终端,用颜色标记 Claude、Codex 会话状态,并依靠 tmux 在服务器重启后续存进程。Git worktree 隔离、手机通知、费用与上下文观察被放到同一界面,安装要求 Node.js 22.9 以上。它解决的是多代理会话的可见性和操作密度;Windows 没有原生 tmux,因此不属于直接支持平台。

–

本期重点CuMetal4github.com原文 ↗

github.com

CuMetal 走源码优先编译路线,把 CUDA C++ 或 PTX 转成类型化 IR 和 Metal Shading Language,同时提供可选的 libcuda shim。当前测试里,直接 `.cu` 类型化路径通过 19 项中的 10 项,PTX 旧路径通过 17 项,而 SASS 完全不支持;部分 cuBLAS 等运行库也仍在补齐。清晰列出的动态并行、多 GPU 和 ABI 缺口,使它更适合移植可控内核,而不是被误作即插即用 CUDA 替身。

–

LatticeDB25github.com原文 ↗

github.com

LatticeDB 将属性图、类 Cypher 遍历、HNSW、BM25、WAL 与 changefeed 装入单个嵌入式数据库文件,并提供 C、Python、TypeScript、Go 绑定。README 在 Apple M1 单线程测得节点操作约 0.13 微秒,百万向量查询约 0.83 毫秒且 recall@100 为 100%。单写者、非分布式和非完整 Cypher 的约束换来了部署简单,基准值则应按数据分布与持久化模式重新测量。

–

pgBot26pgbot.dev原文 ↗

工具使用协议与互操作系统·基础设施

pgBot 是 PostgreSQL 的只读诊断代理,可直连数据库或驻留 Docker、Kubernetes、VPC 内,检查锁、WAL、vacuum、慢查询和索引。MCP 的 `inspect`、`unused_indexes` 等工具先生成确定性 JSON,再由模型解释;`pgbot://baselines` 可保存历史对照。模型没有写权限,把建议与实际变更分开,适合在生产库上建立低风险的第一层排障入口。

–

Ambient Context27github.com原文 ↗

Ambient Context 周期读取 macOS 当前焦点窗口的 Accessibility 树,去重后按天写入 Markdown,为本地代理留下一条可搜索的工作轨迹。它不截图、不联网、不含模型或遥测,落盘前还过滤密码、私密浏览、密钥和卡号。要求 macOS 14 与 Apple Silicon,且 GPU 终端等缺乏标准可访问树的应用记录有限,隐私设计扎实但采集完整性取决于应用生态。

–

AgentGrid28agentgrid.sh原文 ↗

AgentGrid 用可持久化无限画布承载代理会话、笔记、终端与开发工具,状态写入 `.agent-grid`,同一空间也可被代理读取。项目支持九种 harness、可视化主从委派、供应商用量和跨设备访问,2.8.13 起笔记使用 Markdown 后端。它没有提出新推理算法,而是把并发工作中的所有权、上下文位置和执行现场做成了可操作界面。

–

Orbit29github.com原文 ↗

Orbit 为 Claude、Codex、OpenCode、Qoder 创建跨仓库 worktree 工作区,直接暴露完整源码与 Git 历史,不运行 RAG、索引服务或后台 daemon。渐进上下文先用约 50 token 描述一个仓库,再以约 200 token 加细节,必要时挂载全文;`orbit jot` 负责沉淀发现。对多仓改动而言,这种设计保留真实版本语义,也避免复制仓库和预索引带来的启动成本。

–

only-cli30github.com原文 ↗

only-cli 把网页压成带编号的紧凑终端视图,默认预算 500 token,并使用 Chrome 指纹完成抓取,无需常驻浏览器。作者的 15 页测试中,oc 共消耗 10936 token,Jina 为 148479、Playwright 为 531335、原始 HTML 为 1552491,同时覆盖目标内容。当前只适合阅读和导航:fill、submit、back 尚未实现,JavaScript 重站与强反爬页面也不在能力范围。

–

Unbox-AI31github.com原文 ↗

Unbox-AI 把网关、OpenCode 和 AI SDK DevTools 轨迹画成 token treemap 与延迟 waterfall,展示首 token 时间、生成量、成本和重复消息。其典型 16 轮轨迹里,约 90% 输入花在系统提示和工具定义上,代理可用有上限的 CLI 输出自行找热点。由于 token 归因按字符比例估算、跨框架又没有统一 trace 标准,它更适合优化上下文结构,不宜当作精确账单审计器。

–

本期重点Netra Kernel5github.com原文 ↗

github.com

Netra Kernel 为 AMD gfx950 预编译固定契约的原始汇编引擎,用 profile、tactic、布局和静态内存计划换吞吐,遇到未覆盖算子不会静默回退。Qwen3.6-35B-A3B FP8 在 8 张 MI350X 上报告 78498.66 输出 token/s,15360 项数值和 18 项文本检查全部通过,与锁定基线相差 0.32%。成绩说明极端专用化能释放 MI350X,但不能外推到其他模型形状、批量或通用算子服务。

–

Ratify Agent Relay Harness32github.com原文 ↗

Ratify 离线重放委派、handoff、联邦、收据和撤销流程,用 ProofBundle、签名收据与检查点验证每个协议声明,失败即返回非零退出码。Go、TypeScript、Python、Rust、C 五套 SDK 都能复核同一批合成证据。项目还把必须依赖真实 OS 隔离的路径穿越测试标作 SKIP,诚实地区分了跨语言协议一致性和线上部署安全。

–

XWM33github.com原文 ↗

推理与规划研究·科学

XWM 用 JAX 实现动作条件潜在世界模型,把观察编码到潜变量后直接预测下一状态,不训练像素解码器。JEPA、TD-MPC2、MuZero 复用同一组件,可接 CEM、MPPI、梯度与 MCTS 规划器,并允许只观察一部分 token;示例从 CPU 合成任务延伸到 Franka 机械臂。统一接口便于比较表示与规划组合,不过仓库尚早,行为测试不能替代真实控制基准。

–

行业动态 · Industry News

11 项 · 行业动态

Introducing the Admin plugin for ChatGPT and Codex34openai.com原文 ↗

openai.com

OpenAI 把 ChatGPT Enterprise/Business 与 Codex 的成员、群组、权限、模型开放、额度和支出审批接入对话,并允许 Slack、Teams 触发工作流。插件沿用既有管理员角色,对广泛变更先给结构化预览;公司称内部 IT 已自动解决约 45% 工单量,在请求翻倍时消除积压。它把 SaaS 管理从查询面板改成可执行代理,但大范围动作仍依赖组织原有权限设计和人工复核。

–

The full stack behind abundant intelligence35openai.com原文 ↗

openai.com

OpenAI CFO Sarah Friar 从芯片、系统、云、模型到产品论证垂直协同,并列出 Microsoft、NVIDIA、AWS、AMD、Broadcom、Cerebras、CoreWeave、Oracle 等多方计算组合。文章称 GPT-5.6-Sol 在 Artificial Analysis 指数取得最高水平时,比另一领先模型少用 54% 输出 token。这里的中心证据是公司自身的资本与架构叙事,适合观察供应链策略,不应替代同条件的独立效率评测。

–

Jalapeño: First Results from OpenAI's Custom Inference Chip36openai.com原文 ↗

openai.com

OpenAI 首次披露自研推理芯片 Jalapeño,在 GPT-OSS 120B、DeepSeek-R1 670B、Kimi K2.5 1T 三个开放模型上给出结果。公司测得峰值每瓦工作量为对照的 1.5 - 1.9 倍、端到端延迟低 1.7 - 3.6 倍、交互负载快 2.1 - 4.1 倍;额定 700W,测量不超过 550W。AI 辅助设计据称把 tape-out 压到九个月、三模型适配用两个月,但芯片要到年底部署,外部还无法复现实机曲线。

–

Apple introduces M6 and M5 Ultra for a big leap in performance and AI compute37apple.com原文 ↗

apple.com

M6 采用 2nm 工艺,最高配有 12 核 CPU、12 核 GPU、双 16 核神经引擎、170GB/s 带宽和 32GB 内存;Apple 宣称 GPU AI 比 M5 快 30%、比 M1 快逾八倍。四 die 的 M5 Ultra 则提供 36 核 CPU、80 核 GPU、512GB 内存与 1.2TB/s 带宽,公司称 GPU AI 是 M3 Ultra 的 4.5 倍。比峰值倍率更具结构意义的是统一内存容量和带宽上移,它允许单机容纳此前必须多卡切分的模型。

–

Apple introduces new Mac Studio with M5 Max and M5 Ultra38apple.com原文 ↗

apple.com

新 Mac Studio 用 M5 Max 或 M5 Ultra 承载上述芯片,Ultra 最高 512GB 统一内存,并能借 Thunderbolt 5 RDMA 连接四台主机。Apple 称四机集群推理可达单机三倍;M5 Max 起价 2499 美元、Ultra 为 5499 美元,9 月 22 日发售,512GB 版本延至十月底。产品把大模型工作站的竞争点从单芯片算力扩展到内存容量与桌面级互联,三倍伸缩仍需看模型切分和通信比例。

–

Intent to ship: JPEG XL39groups.google.com原文 ↗

groups.google.com

Mozilla 计划在 Firefox 157 于所有平台默认启用 JPEG XL,目标时间为九月底,此前该格式从 Firefox 152 起仅处于实验状态。实现使用 Rust 编写的 `jxl-rs`,选择依据包括内存安全、实现体积和渐进式解码。默认开启解决了 Firefox 侧的可用性门槛,网站是否采用仍取决于其他浏览器引擎、编码工具和回退成本形成交集。

–

Qwen 3.8 Flash Next40modelscope.cn原文 ↗

modelscope.cn

ModelScope 页面预告 Qwen 3.8 Flash Next 的规模为 125B 总参数、6B 激活参数,并称将在次日正式发布。高总量与低激活量指向稀疏 MoE 的成本设计;页面当时没有公开权重、许可证、基准或推理配置,因此速度、质量与可部署性要等正式材料后才能判断。

–

Thomson Reuters launches its own frontier model41thomsonreuters.com原文 ↗

thomsonreuters.com

Thomson Reuters 用 Westlaw、Practical Law、Checkpoint、Reuters 等专有数据与领域专家训练自有基础模型,披露投入约 4000 万美元,目前训练语料中公司内容不足 10%。公司称多项专业任务可与前沿模型持平,却未公布逐项分数;另计划提供一个小型开放权重版本用于非商业研究,首个产品入口是 CoCounsel 的表格分析。值得观察的不是“又一个通用前沿模型”,而是出版商把版权数据、专家反馈和应用分发组成闭环。

–

Disrupting malicious uses of AI in a Russian influence campaign42openai.com原文 ↗

openai.com

OpenAI 封禁一组疑似由俄罗斯操作者通过 VPN 使用的账户,它们为虚构的以色列机构 IBI 生成多语社交内容,并复制、错署其他作者材料。抽查 36 篇文章有 34 篇是抄袭,内容散发到 X、LinkedIn、Facebook、Substack 与 Telegram,但整体触达很小。案例显示生成模型能降低跨语言包装成本,复制比例和来源错配也让低质量影响行动留下了明显取证线索。

–

AI is hitting entry-level jobs hardest, Stanford study finds43arstechnica.com原文 ↗

arstechnica.com

报道依据 Stanford Digital Economy Lab 对 ADP 工资记录的研究,比较年龄与岗位 AI 暴露度的就业变化。到 2026 年 6 月,22 - 25 岁高暴露岗位相对低暴露岗位的走势低约 19%,从 2025 年 7 月的 15% 继续扩大;2022 年 11 月以来,高暴露组实际下降 11%,最低暴露组增长 10%。差距主要发生在招聘而非离职,且研究是描述性设计,宏观周期、教育构成等混杂因素使它不能单独证明 AI 导致岗位减少。

–

Anthropic's San Francisco staff told to work remotely amid possible security strike44businessinsider.com原文 ↗

businessinsider.com

Anthropic 让旧金山员工周一、周二远程办公,起因是外包安保公司 Allied Universal 对潜在劳资行动的预警。代表安保人员的 SEIU 表示当周没有举行授权投票,也没有宣布罢工,双方自四月以来仍在谈判;Anthropic 与 Allied 均未公开回应。准确边界是“承包商风险触发办公预案”,并非 Anthropic 自有安全团队已经罢工。

–

博客文章 · Blog Posts

10 项 · 博客文章

AI At Home Part 2: Multi-GPU Drifting45jdagostino.github.io原文 ↗

jdagostino.github.io

作者在四张 AMD V620 32GB、PCIe 3.0 且多为 x8 的家用机器上实测层并行和张量切分。Gemma 从单卡约 19 - 20 token/s 降到双卡 15 - 16、四卡 12 - 13;DeepSeek 284B-A13B 2-bit 则经单卡放置、批处理和上下文配置调优,才从 9 - 10 提到界面约 19 - 20、基准 22。最有用的结论是多卡先扩容量、未必扩速度,低速互联会让张量并行比串行分层更差。

–

AI Review Loops46kevinmahoney.co.uk原文 ↗

文章分析让模型不断“生成 - 评审 - 修正”为何不必然收敛:后续评审可能重开已解决问题,或在相互冲突的目标间往返。增加轮数不能替代明确的终止条件、可运行测试和问题所有权;否则表面上持续审查,实际只是状态振荡。这个判断与当日的谄媚研究互相呼应,代理是否修正应由外部证据决定,而不是由另一段同源意见投票。

–

Feature comparison of ack, ag, git-grep, GNU grep and ripgrep47beyondgrep.com原文 ↗

beyondgrep.com

这份长期维护的表格逐项比较 ack、ag、git-grep、GNU grep 和 ripgrep 的文件类型、正则、配置、历史搜索等能力,刻意不把速度当唯一维度。ripgrep 通常最快,ack、ag、rg 都能按文件类型过滤,只有 git-grep 原生遍历 Git 历史,ack 还可按首行识别类型。对开发工具选型而言,这种“语义能力矩阵”比单台机器的吞吐排名更耐用,也促使维护者公开自己与竞品的真实差异。

–

Fuzzing the Gleam compiler48kurz.net原文 ↗

kurz.net

作者调用 Gleam 编译器公开的 Rust API 生成结构有效程序,再把相同输入编译到 JavaScript 与 Erlang,做跨后端差分测试。`const b = 1 |> 2` 触发了解析器 panic,种子 947 则产生 Erlang 42、JavaScript 103 的语义分歧;每批运行 100 个样例。当前生成器偏向有效语法,较难深入代码生成边角,加入变异和蜕变关系会比单纯扩大随机样本更可能发现后端错误。

–

C2PA on Android cameras49da.vidbuchanan.co.uk原文 ↗

da.vidbuchanan.co.uk

文章沿 Android 相机签署 C2PA 凭证的信任链,分析 Key Attestation 与 Play Integrity 如何证明签名来自预期应用和设备状态。若攻击者通过本地提权获得 root,修改应用便可能为任意文件生成外观看似合规的来源记录。这里被击穿的不是签名算法,而是签名前的运行环境假设;C2PA 能回答“谁声称生成了它”,不能自动回答画面是否真实。

–

Replacing a Rust enum with a 64-bit word50pointersgonewild.com原文 ↗

pointersgonewild.com

Plush 解释器原先用 16 字节 Rust enum 表示值,作者改成 64 位低位标签字,容纳 fixnum、自标签浮点、立即数和两类指针,而不是采用常见 NaN boxing。全部基准平均快 17%,内存结构密集的任务获益最大,反汇编显示更小值减少了寄存器压力与 spill。代价是浮点编码牺牲两个指数位,虽保留次正规数、无穷和 NaN,却明确缩窄数值范围。

–

Tooltips need a delay, and then they need to skip it51blog.master.dev原文 ↗

blog.master.dev

设计建议把 tooltip 做成冷、热两种状态:首次悬停约 200ms 才显示,关闭后的 300ms 内移动到相邻控件则立即出现并跳过动画。作者以低于 150ms 容易误触、高于 250ms 显得迟钝解释区间选择;React 实现用 provider 内的 `useRef` 保存热状态,避免触发整树重渲染。这个小机制同时解决初次探索的克制与连续扫视的效率。

–

Your executable is a SQLite database52fzakaria.com原文 ↗

fzakaria.com

SELF 把 ELF 的段、重定位与符号写进 SQLite 表,再通过 `binfmt_misc` 检查偏移 68 的 application_id 魔数,由 `self-exec` 装载执行。最小格式只需 meta、segments 两张核心表,符号能够用 SQL 索引查询,还可用 DELETE、VACUUM 完成 strip。压缩后的 coreutils SELF 为 1794048 字节,对照 ELF 1768632,差距约 1%,说明可查询链接格式并不必然带来夸张体积税。

–

agent.md53fabiensanglard.net原文 ↗

Fabien Sanglard 将多次纠正编码代理形成的约束固化为 `agent.md`,涵盖少嵌套、常量化、早返回、分层、最小改动、先测试和提交纪律。加入规则后,原本“能跑但松散”的代码在风格上显著稳定;长会话仍会发生上下文稀释,因此作者按特性开新会话或重新加载规则。它适合承担持续的局部工程规范,架构取舍与设计正确性仍由人验证。

–

Fences, not sandboxes54yegge.ai原文 ↗

对齐与治理安全与攻防系统·基础设施

Steve Yegge 根据约 50 - 60 个代理、日均约 270 次提交的个人软件工厂经验,主张把凭证、权限域、拒绝规则与责任编码成组织级 fence,而不只把每个代理塞入狭窄 sandbox。其 Wheelhouse 约 60 万行代码,累计 450 个治理产物和逾 100 条 fence;投入相当于 21 个 Max 账户、每月约 12.2 万美元 API 用量。作者明说 fence 不是抵御恶意超级智能的安全边界,因此文章更适合作为高并发代理运维样本,而非一般团队已经验证的规模定律。

–

引用来源 · References

62 条 · 引用
  1. 1 There Is No Neutral Harness: Measurement Instability in LLM Evaluation. arXiv:2608.21382https://arxiv.org/abs/2608.21382 ↩ 回到正文 · back to text
  2. 2 Read Less, Answer Better: A Training-Free Framework for Efficient Source-Grounded Agents. arXiv:2608.22237https://arxiv.org/abs/2608.22237 ↩ 回到正文 · back to text
  3. 3 SWE Refactor Bench: Whole-Repository Refactoring Under Hidden Tests. arXiv:2608.23564https://arxiv.org/abs/2608.23564 ↩ 回到正文 · back to text
  4. 4 CuMetal. GitHub: Lulzx/cuda-metalhttps://github.com/Lulzx/cuda-metal ↩ 回到正文 · back to text
  5. 5 Netra Kernel. GitHub: NetraRuntime/netra-kernelhttps://github.com/NetraRuntime/netra-kernel ↩ 回到正文 · back to text
  6. 6 LitReview Arena: A Battle-Style Benchmark for Expert-Level Literature Reviews. arXiv:2608.21374https://arxiv.org/abs/2608.21374 ↩ 回到正文 · back to text
  7. 7 K-Bench: Benchmarking Agentic Coding in Live Engineering Environments. arXiv:2608.21601https://arxiv.org/abs/2608.21601 ↩ 回到正文 · back to text
  8. 8 ECHO: Auditable Memory for Long-Horizon Agents. arXiv:2608.21755https://arxiv.org/abs/2608.21755 ↩ 回到正文 · back to text
  9. 9 Training Needs Trustworthy Worlds: Verified Environment Synthesis for Web Agents. arXiv:2608.21898https://arxiv.org/abs/2608.21898 ↩ 回到正文 · back to text
  10. 10 Disagree to Explore, Agree to Converge: Adaptive MoE Routing for Test-Time Agentic Coding. arXiv:2608.22191https://arxiv.org/abs/2608.22191 ↩ 回到正文 · back to text
  11. 11 AutoSaddler: Learning to Improve Agent Harnesses from Failure Traces. arXiv:2608.23041https://arxiv.org/abs/2608.23041 ↩ 回到正文 · back to text
  12. 12 From Inertia to Insight: Context Isolation for Robust Web Agents. arXiv:2608.23045https://arxiv.org/abs/2608.23045 ↩ 回到正文 · back to text
  13. 13 Prime Agent: Continual Harnesses for Persistent Reasoning. arXiv:2608.23552https://arxiv.org/abs/2608.23552 ↩ 回到正文 · back to text
  14. 14 Agentic Scaffolding Can Induce Sycophancy in Language Models. arXiv:2608.21377https://arxiv.org/abs/2608.21377 ↩ 回到正文 · back to text
  15. 15 Agentic Security: A Systems Framework for Tool-Using AI. arXiv:2608.21423https://arxiv.org/abs/2608.21423 ↩ 回到正文 · back to text
  16. 16 Forgotten in Weights, Remembered by Agents: Trajectory-Aware Unlearning. arXiv:2608.21544https://arxiv.org/abs/2608.21544 ↩ 回到正文 · back to text
  17. 17 Architecture as a Capability Equalizer in Multi-Agent Systems. arXiv:2608.21747https://arxiv.org/abs/2608.21747 ↩ 回到正文 · back to text
  18. 18 Context as an Environment: Programmatic Context Management for Long-Horizon Agents. arXiv:2608.21690https://arxiv.org/abs/2608.21690 ↩ 回到正文 · back to text
  19. 19 SchemaRouter: Field-Aware Tool Routing for Efficient Heterogeneous Agentic RAG. arXiv:2608.21375https://arxiv.org/abs/2608.21375 ↩ 回到正文 · back to text
  20. 20 MCP-Universe RL: A Framework for Training MCP Tool-Use Agents via Reinforcement Learning. arXiv:2608.22167https://arxiv.org/abs/2608.22167 ↩ 回到正文 · back to text
  21. 21 FERAL-AI. GitHub: FERAL-AI/FERAL-AIhttps://github.com/FERAL-AI/FERAL-AI ↩ 回到正文 · back to text
  22. 22 sillage. GitHub: riscoss63/sillagehttps://github.com/riscoss63/sillage ↩ 回到正文 · back to text
  23. 23 Oynixhttps://oynix.dev ↩ 回到正文 · back to text
  24. 24 MulmoTerminal. GitHub: receptron/mulmoterminalhttps://github.com/receptron/mulmoterminal ↩ 回到正文 · back to text
  25. 25 LatticeDB. GitHub: jeffhajewski/latticedbhttps://github.com/jeffhajewski/latticedb ↩ 回到正文 · back to text
  26. 26 pgBothttps://pgbot.dev/ ↩ 回到正文 · back to text
  27. 27 Ambient Context. GitHub: dragthelake/ambient-contexthttps://github.com/dragthelake/ambient-context ↩ 回到正文 · back to text
  28. 28 AgentGridhttps://agentgrid.sh/ ↩ 回到正文 · back to text
  29. 29 Orbit. GitHub: orbcli/orbithttps://github.com/orbcli/orbit ↩ 回到正文 · back to text
  30. 30 only-cli. GitHub: only-cli/ochttps://github.com/only-cli/oc ↩ 回到正文 · back to text
  31. 31 Unbox-AI. GitHub: tester-army/unbox-aihttps://github.com/tester-army/unbox-ai ↩ 回到正文 · back to text
  32. 32 Ratify Agent Relay Harness. GitHub: identities-ai/ratify-agent-relay-harnesshttps://github.com/identities-ai/ratify-agent-relay-harness ↩ 回到正文 · back to text
  33. 33 XWM. GitHub: kleyt0n/xwmhttps://github.com/kleyt0n/xwm ↩ 回到正文 · back to text
  34. 34 Introducing the Admin plugin for ChatGPT and Codexhttps://openai.com/index/introducing-admin-plugin ↩ 回到正文 · back to text
  35. 35 The full stack behind abundant intelligencehttps://openai.com/index/the-full-stack-behind-abundant-intelligence ↩ 回到正文 · back to text
  36. 36 Jalapeño: First Results from OpenAI's Custom Inference Chiphttps://openai.com/index/jalapeno-first-results ↩ 回到正文 · back to text
  37. 37 Apple introduces M6 and M5 Ultra for a big leap in performance and AI computehttps://www.apple.com/newsroom/2026/08/apple-introduces-m6-and-m5-ultra-for-a-big-leap-in-performance-and-ai-compute/ ↩ 回到正文 · back to text
  38. 38 Apple introduces new Mac Studio with M5 Max and M5 Ultrahttps://www.apple.com/newsroom/2026/08/apple-introduces-new-mac-studio-with-m5-max-and-m5-ultra/ ↩ 回到正文 · back to text
  39. 39 Intent to ship: JPEG XLhttps://groups.google.com/a/mozilla.org/g/dev-platform/c/3YMV4MS34KA?pli=1 ↩ 回到正文 · back to text
  40. 40 Qwen 3.8 Flash Nexthttps://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next ↩ 回到正文 · back to text
  41. 41 Thomson Reuters launches its own frontier modelhttps://www.thomsonreuters.com/en/press-releases/2026/august/thomson-reuters-leverages-its-world-class-data-assets-to-launch-its-own-frontier-model ↩ 回到正文 · back to text
  42. 42 Disrupting malicious uses of AI in a Russian influence campaignhttps://openai.com/index/disrupting-malicious-uses-of-ai-influence-campaign-russia ↩ 回到正文 · back to text
  43. 43 AI is hitting entry-level jobs hardest, Stanford study findshttps://arstechnica.com/ai/2026/08/ai-is-hitting-entry-level-jobs-hardest-stanford-study-finds/ ↩ 回到正文 · back to text
  44. 44 Anthropic's San Francisco staff told to work remotely amid possible security strikehttps://www.businessinsider.com/anthropic-san-francisco-staff-work-remote-office-security-strike-2026-8 ↩ 回到正文 · back to text
  45. 45 AI At Home Part 2: Multi-GPU Driftinghttps://jdagostino.github.io/ai-pt2-multi-gpu-drifting/index.html ↩ 回到正文 · back to text
  46. 46 AI Review Loopshttps://kevinmahoney.co.uk/articles/ai-review-loops/ ↩ 回到正文 · back to text
  47. 47 Feature comparison of ack, ag, git-grep, GNU grep and ripgrephttps://beyondgrep.com/feature-comparison/ ↩ 回到正文 · back to text
  48. 48 Fuzzing the Gleam compilerhttps://www.kurz.net/posts/fuzzing-gleam-compiler ↩ 回到正文 · back to text
  49. 49 C2PA on Android camerashttps://www.da.vidbuchanan.co.uk/blog/android-c2pa.html ↩ 回到正文 · back to text
  50. 50 Replacing a Rust enum with a 64-bit wordhttps://pointersgonewild.com/2026-08-25-replacing-a-rust-enum-with-a-64-bit-word/ ↩ 回到正文 · back to text
  51. 51 Tooltips need a delay, and then they need to skip ithttps://blog.master.dev/tooltips-need-a-delay-and-then-they-need-to-skip-it/ ↩ 回到正文 · back to text
  52. 52 Your executable is a SQLite databasehttps://fzakaria.com/2026/08/23/your-executable-is-a-sqlite-database ↩ 回到正文 · back to text
  53. 53 agent.mdhttps://fabiensanglard.net/agent.md/index.html ↩ 回到正文 · back to text
  54. 54 Fences, not sandboxeshttps://yegge.ai/essays/fences-not-sandboxes/ ↩ 回到正文 · back to text
  55. 55 openclaw. GitHub: openclaw/openclawhttps://github.com/openclaw/openclaw ↩ 回到正文 · back to text
  56. 56 claude-obsidian. GitHub: AgriciDaniel/claude-obsidianhttps://github.com/AgriciDaniel/claude-obsidian ↩ 回到正文 · back to text
  57. 57 freellmapi. GitHub: tashfeenahmed/freellmapihttps://github.com/tashfeenahmed/freellmapi ↩ 回到正文 · back to text
  58. 58 pi-autoresearch. GitHub: davebcn87/pi-autoresearchhttps://github.com/davebcn87/pi-autoresearch ↩ 回到正文 · back to text
  59. 59 AI-Infra-Guard. GitHub: Tencent/AI-Infra-Guardhttps://github.com/Tencent/AI-Infra-Guard ↩ 回到正文 · back to text
  60. 60 agentcore-cli. GitHub: aws/agentcore-clihttps://github.com/aws/agentcore-cli ↩ 回到正文 · back to text
  61. 61 Usage. GitHub: jdx/usagehttps://github.com/jdx/usage ↩ 回到正文 · back to text
  62. 62 Anchor. GitHub: otter-sec/anchorhttps://github.com/otter-sec/anchor ↩ 回到正文 · back to text