每日 Harness 开源 · Source
全部刊期 · All issues

每日 Harness

2026-07-23 · Thursday, July 23, 2026

智能体迈向可控可信

视图 · View

今日重点 · Today's Highlights

GigaToken - 用 Rust、无锁并行、内存映射和 SIMD 重写 tokenizer 热路径,项目基准在 1 GB 文本上报告约 4.0 GB/s。 5

全文 ↓

论文 · Papers

15 项 · 论文

本期重点PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection1arxiv.org原文 ↗

论文不再把 prompt injection 只看成单个执行代理的问题,而是直接攻击负责拆解目标的 planner。作者构造了 4 种攻击设置,并报告在 GPT-4o、GPT-4o-mini、Qwen3-235B 与 Llama-3.3-70B 上,平均攻击成功率可达 96%;现有防护仍有约 90% 的平均成功率。这个结果说明,规划阶段一旦被污染,后续多个代理会把恶意步骤当成正常计划执行,风险具有结构性放大效应。

本期重点Deterministic Replay for AI Agent Systems2arxiv.org原文 ↗

作者提出基于 event sourcing 的智能体重放架构,把模型 token、随机性、外部 API 返回值、工具结果与运行时状态变化全部记录为事件。论文在 GPT-5、Claude 4.5、Gemini 2.5 Pro 和 Grok 4 上报告 100% 重放准确率,额外延迟低于 0.1%。它把智能体调试从“尽量复现”推进到可审计的执行记录,但代价是必须完整捕获边界外的非确定性。

本期重点Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL3arxiv.org原文 ↗

这项工作把 masked diffusion language model 用作文本交互环境的世界模型,并引入面向轨迹属性的 steering 机制。实验覆盖 12 个任务,扩散模型在模拟真实性上优于自回归基线,且可生成更高奖励或特定行为分布的训练环境。其价值在于把“环境生成”和“环境控制”放进同一生成过程,适合缺少真实交互预算的 agentic RL。

Accurate and Efficient Long-Term Memory for LLM Agents6arxiv.org原文 ↗

论文提出 MOSAIC,把长期记忆组织为带时间信息和实体关系的结构化表示,并用轻量分类器替代大量在线 LLM 判断。摘要报告,MOSAIC 在 LoCoMo 上达到 75.5%,同时把记忆构建时间降至约 1.5 分钟,相比强基线快约 100 倍。它展示了记忆系统不必在准确率和工程成本之间二选一,但效果仍依赖关系抽取与时间归一化的质量。

RECON: Benchmarking Agent Memory for Compositional Reasoning over Long Contexts7arxiv.org原文 ↗

RECON 不是只测试记住某句话,而是要求智能体跨长对话组合多个分散事实完成推理。基准包含 1,000 个任务、最长 100 万 token 的交互历史,并区分检索、整合和答案生成环节。该设计能暴露“检索到了但拼不起来”的记忆失败,比单轮 needle-in-a-haystack 更接近持续运行代理的真实负载。

AgentBrew: Lifelong Knowledge Brewing from Strong Teachers to Weak LLM Agents8arxiv.org原文 ↗

AgentBrew 让强教师模型在交互中产出可复用知识,再把这些经验沉淀到弱代理的外部记忆,而不是更新参数。论文在 5 类环境、11 个任务上测试,摘要报告弱模型平均提升 14.8 个百分点,并能持续吸收后续经验。方法把昂贵教师调用转化为可积累资产,但知识条目的筛选与过期管理会决定长期收益。

Environment-free Synthetic Data Generation for API-Calling Agents9arxiv.org原文 ↗

作者面向无法部署真实 API 后端的场景,先从接口规范合成状态、调用链和反馈,再生成可用于训练的工具轨迹。实验覆盖 7 个 API 域、超过 1,000 个工具,训练后的代理在真实执行评测上仍获得稳定提升。关键贡献是把数据生成从“必须有可运行沙箱”中解耦,同时也意味着合成状态与真实业务约束之间的偏差需要额外控制。

Lomekwi: Resource-Bounded Tool Discovery in LLM Agents10arxiv.org原文 ↗

Lomekwi 把工具发现拆成好奇心驱动的探索、工具身份识别和新工具构建三种能力,并显式施加时间与调用预算。基准包含 76 个工具、3 档资源约束,结果显示模型常会把预算耗在重复试探上,而不是形成可迁移的工具知识。它提供了一种比“给定工具集做调用”更严格的评测视角,直接考察代理面对未知能力空间时的探索效率。

Otap: Structure-Aware Optimal Transport for Evaluating Planning and Execution in Agent Trajectories11arxiv.org原文 ↗

OTAP 用结构感知最优传输对齐两条代理轨迹,不要求动作逐位置完全一致,而是比较计划、工具调用及其依赖关系。作者报告该指标与人工判断的相关性最高可达 0.92,并能区分“计划合理但执行失败”和“结果碰巧正确”的轨迹。它补足了只看最终答案的评测盲区,不过距离函数和结构权重仍会影响解释。

A Systematic Evaluation of Trajectory Data Curation for LoRA Fine-Tuning of Code Agents12arxiv.org原文 ↗

论文系统比较代码代理 LoRA 微调中的轨迹数量、成功与失败样本、步骤过滤和难度分层。实验发现,约 2,000 条经过筛选的高质量轨迹即可接近更大数据集的收益,而盲目加入失败轨迹可能拉低表现。结论把注意力从“多收集交互”转向“保留哪些决策过程”,对低成本定制代码代理具有直接工程意义。

本期重点KernelBench-Verified: Do LLM-Generated Kernels Actually Beat PyTorch?4arxiv.org原文 ↗

作者重新核验 KernelBench 中声称超越 PyTorch 的生成 kernel,加入输出正确性、同步、缓存与计时路径检查。复测显示,原先大量“加速”来自漏算、异步计时或针对 harness 的投机实现;严格验证后,真正超过 PyTorch 的比例显著下降。论文的重要性不只在 CUDA,而在提醒所有代码生成基准:性能分数必须和语义等价性、隔离执行共同验证。

AEVAL: From Anecdotal to Deterministic Testing for Agentic Skill Workflows13arxiv.org原文 ↗

AEVAL 把包含提示词、脚本、工具和文件操作的 agent skill 封装成可重复测试单元,并记录输入、环境与期望断言。框架支持确定性 fixture、步骤级检查和回归比较,使原本靠人工试玩的 Skill 包可以进入 CI。它解决的是代理工程中经常被忽略的测试层:模型输出可以变化,但工作流契约仍应被稳定验证。

Is Progressive Disclosure All You Need for Long-Context Agents?14arxiv.org原文 ↗

论文比较三种长文档供给方式:一次性塞入完整上下文、独立检索器筛选,以及让代理按目录逐步打开材料。结果显示 progressive disclosure 在不少任务上接近完整上下文,同时显著减少 token,但在需要跨文档全局整合时会受早期阅读决策拖累。它给出的不是单一赢家,而是提示“让代理自己找材料”同样需要评估搜索成本和遗漏风险。

Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents15arxiv.org原文 ↗

作者研究验证器和修复器都会犯错时,代理何时应继续循环、回滚或停止。论文将过程建模为带噪决策问题,并给出基于置信度与预期收益的停止规则;在合成与代码任务中,策略减少了无效修复和越修越坏。它把常见的固定轮数启发式替换为风险敏感决策,但前提是能够校准验证信号。

ETAS: An Effect-Typed Language for Agent Systems16arxiv.org原文 ↗

ETAS 把模型调用、工具访问、记忆读写、人工审批、策略检查和轨迹记录建模为语言级 effect,并通过类型系统约束组合。这样,程序在执行前就能暴露未经授权的工具路径、遗漏审批或不可重放副作用。它尝试把 agent orchestration 从松散脚本提升为可静态分析的程序,但实际采用成本取决于现有工具生态能否映射到其 effect 模型。

开源 / 项目 · Projects

15 项 · 开源 / 项目

本期重点GigaToken5github.com原文 ↗

github.com

GigaToken 是面向批量 LLM 文本处理的 Rust tokenizer,使用 mmap、无锁多线程、SIMD 计数以及可复现的 parallel BPE 训练。README 的 1 GB FineWeb 基准报告编码吞吐约 4.0 GB/s,而 tiktoken 约 9.6 MB/s;训练 50k 词表约需 18 秒。项目目前更像专用高速引擎,兼容性和编码一致性仍需按目标模型逐项验证。

Bento17bento.page原文 ↗

bento.page

Bento 把幻灯片编辑器、播放模式、数据和协作状态封装进单个 HTML 文件,文件本身即可在浏览器打开、分享或归档。它避免传统演示工具的专有工程格式,让版本控制和长期可访问性更简单。技术看点在于把“应用”和“文档”合并成同一可执行工件,而不是依赖云端账户维持内容。

Millwright18github.com原文 ↗

github.com

Millwright 是 Rust 编写的自托管 LLM gateway,通过单一入口把请求路由到不同模型、提供商或本地后端。README 强调 CLI 优先配置、流式响应、provider 抽象和可观测性,目标是避免应用代码绑定某一家 API。它适合需要统一凭据、路由和故障切换的团队,但仍需自行运营代理层及其容量。

SyncLite19github.com原文 ↗

github.com

SyncLite 给 SQLite、DuckDB 等嵌入式数据库增加持续同步层:客户端本地读写,后台通过 CDC 流把变更发送到集中仓库。项目使用事务一致的变更捕获,强调非侵入接入和断线后的增量续传,可同步到 PostgreSQL、MySQL、ClickHouse 等目标。它保留嵌入式数据库的低运维体验,同时把分析和备份从应用进程中分离。

Cactus Hybrid20github.com原文 ↗

github.com

Cactus Hybrid 对端侧 Gemma 3 270M 做后训练,让模型在生成答案之外输出置信分数,并把低置信请求转交云端大模型。README 报告该路由可在保持任务质量的同时把 60% - 90% 请求留在设备侧,降低延迟和云调用成本。它把 hybrid inference 的关键从固定规则改为模型自评,但置信度校准会直接决定错误放行率。

Drskill21github.com原文 ↗

Drskill 是检查 agent skills、MCP servers、hooks 和插件配置的静态分析 CLI,会扫描过大描述、工具重叠、循环依赖、危险权限与可疑内容。README 提供 40 多项检查,并支持 `--fix`、JSON 输出和 CI 失败阈值。它针对的是智能体配置逐渐堆叠后的可维护性问题,而不是再增加一个运行时框架。

Memory Bench22github.com原文 ↗

Memory Bench 用统一 harness 比较不同代理记忆产品与“直接塞完整聊天历史”的基线,任务覆盖长期对话中的回忆和问答。项目允许通过 `.env` 切换 Mem0、Zep、Supermemory 等实现,并输出 judge 分数、耗时和运行记录。这个基准的价值在于把额外记忆层的收益与完整上下文成本放在同一张表上,而非只展示单项召回率。

DataParade23github.com原文 ↗

github.com

DataParade CLI 从代码与基础设施定义中提取数据源、处理步骤和下游去向,生成可查询的数据流图。它面向隐私与安全审查,可把敏感字段经过哪些服务、存储和外部系统变成显式证据。与手工维护架构图相比,代码驱动的做法更容易跟随仓库变化,但扫描器对动态行为的覆盖仍有限。

Drey24github.com原文 ↗

github.com

Drey 是 LSP 多路复用器,让多个编辑器窗口或同一 monorepo 的不同客户端共享一个语言服务器进程。它在客户端与 server 之间代理 JSON-RPC,合并文档生命周期并转发诊断,从而减少大型语言服务器的重复内存占用。项目切中的是编辑器并行工作流的系统开销,兼容性取决于各 LSP 对多工作区状态的处理。

Browser Tools SDK25libretto.sh原文 ↗

Browser Tools SDK 为智能体提供真实浏览器会话中的导航、DOM 读取、点击、输入、截图与网络观察能力,并以 TypeScript 工具接口暴露。它强调让 agent 操作实际网页而非简化模拟环境,适合端到端测试和网页任务执行。真实浏览器提高了行为保真度,也意味着权限隔离、凭据保护和页面注入必须纳入部署设计。

Superserve26superserve.ai原文 ↗

Superserve 用 Firecracker microVM 承载长时间运行的 AI agent,为每个任务提供隔离文件系统、进程和网络边界。产品定位覆盖按需创建、暂停与恢复执行环境,让代理可以跨小时或跨天保留工作状态。相比普通容器,microVM 提供更强隔离,但启动、镜像分发和状态持久化是平台需要解决的核心成本。

Blackbar Nano27github.com原文 ↗

github.com

Blackbar Nano 是约 5.2M 参数的本地 PII 检测模型,目标是在 CPU 上识别并脱敏姓名、邮箱、电话、地址等敏感片段。README 报告 INT8 模型约 22 MB,并提供 ONNX 推理和 span 级输出。它适合在文本离开设备前做快速过滤,但小模型对领域术语、跨句实体和多语言覆盖仍需单独评测。

Ingot28github.com原文 ↗

Ingot 把 agent skill 的优化过程做成带证据的版本循环:运行评测、收集 trace、提出修改、对比指标,再保留可回滚版本。项目强调优化来自实际执行数据,而不是只让另一个模型重写提示词。它为 Skill 工程补上了实验管理层,真正效果取决于评测集是否代表生产任务。

The Harbinger29github.com原文 ↗

The Harbinger 是智能体出站网络代理,通过 mTLS 识别调用方,再按策略决定可访问的域名、方法和凭据。密钥由代理侧注入,agent 进程不直接持有长期 secret,并可记录每次请求用于审计。它把工具安全边界从提示词约束移到网络执行层,对多代理共享基础设施尤其有意义。

SimpleBLE 1.030github.com原文 ↗

github.com

SimpleBLE 1.0 提供统一的 Bluetooth Low Energy API,覆盖 Windows、macOS、Linux、iOS 和 Android,并带 C、C++、Python、Rust 等绑定。库把扫描、连接、服务发现和 characteristic 读写封装在跨平台接口后,减少各系统 BLE 栈差异。1.0 标志 API 稳定性提升,适合需要桌面与移动端共用协议逻辑的硬件项目。

行业动态 · Industry News

12 项 · 行业动态

Judge approves $1.5B Anthropic settlement for pirated books used to train Claude31apnews.com原文 ↗

apnews.com

法院批准 Anthropic 就使用盗版图书训练 Claude 达成的 15 亿美元集体和解。按报道方案,款项覆盖约 50 万部作品,平均每部约 3,000 美元,并要求处理相关数据副本。判决没有终结训练数据是否构成合理使用的争论,但把“来源是否合法”与“训练用途是否合理”明确区分开来。

Kimi K3 Is Competitive with Fable; Kimi K3 and Fable Is SoTA32fireworks.ai原文 ↗

fireworks.ai

Fireworks AI 比较 Kimi K3 与自家 Fable 在智能体知识工作任务上的表现,并把两者组合描述为当前领先方案。文章重点不是单轮问答,而是浏览、工具调用和长任务完成率等 agentic workload。由于结果来自模型服务商自己的评测,数字更适合作为部署候选线索,而不是独立结论。

Laguna S 2.133poolside.ai原文 ↗

poolside.ai

Poolside 发布 Laguna S 2.1 编程模型,强调代码生成、仓库级修改与工具使用能力,并给出相对上一版本的基准改进。该发布延续其面向软件工程代理的产品路线,而非通用聊天模型。实际采用时更值得关注的是补丁成功率、延迟与私有代码部署方式,而不只是公开榜单名次。

Advertise in ChatGPT34ads.openai.com原文 ↗

ads.openai.com

OpenAI 上线 ChatGPT 广告业务入口,面向品牌和代理商收集合作信息。页面本身主要是商业接洽而非完整产品文档,但它确认广告已从传闻进入正式销售渠道。下一阶段的核心问题会是广告标识、推荐排序与对话上下文之间如何隔离。

Advancing the next era of national science36openai.com原文 ↗

openai.com

OpenAI 宣布与美国能源部及国家实验室推进 AI 科学合作,目标涵盖研究工作流、计算资源与科学发现。公告把前沿模型定位为科研基础设施,而不只是论文辅助工具。项目成效最终要由可复现实验、数据访问规则和研究人员实际采用情况衡量。

Building AI infrastructure with the Effingham County community37openai.com原文 ↗

openai.com

OpenAI 公布在佐治亚州 Effingham County 推进 Project Camellia AI 基础设施建设,并强调就业、社区合作与能源规划。文章反映模型扩张正在转化为地方土地、电网和水资源议题。此类项目的关键不只是算力规模,还包括长期能源来源、公共成本和建设承诺是否透明。

Gemini latest models: temperature, top_p, and top_k are deprecated and ignored38ai.google.dev原文 ↗

ai.google.dev

Google 文档说明,Gemini 最新模型会忽略请求中的 `temperature`、`top_p` 和 `top_k`,这些参数已弃用。对依赖采样参数调节稳定性或多样性的应用,这不是普通兼容性提示,而是行为控制接口发生变化。迁移测试应以真实输出分布为准,不能假设旧参数仍在暗中生效。

LG to ban residential proxies from smart TV apps39krebsonsecurity.com原文 ↗

krebsonsecurity.com

LG 将禁止智能电视应用把消费者设备变成住宅代理节点,针对的是 SDK 在后台出售家庭 IP 带宽的模式。报道把风险落到用户难以察觉的网络流量、滥用追责和设备性能消耗上。平台级禁令比单纯隐私声明更有效,因为它直接切断应用商店分发与变现渠道。

PyPI releases now reject new files after 14 days40blog.pypi.org原文 ↗

blog.pypi.org

PyPI 现在拒绝向发布超过 14 天的版本追加新文件,维护者需要创建新版本号。规则缩短了攻击者接管旧项目后悄悄补发恶意 wheel 的窗口,也让同一版本随时间变化的情况更少。对构建流水线而言,这强化了版本不可变性,但会改变延迟补齐平台包的发布习惯。

Codeberg: ToU extension to prohibit LLM-extrusions41codeberg.org原文 ↗

codeberg.org

Codeberg 社区讨论扩展服务条款,限制主要由 LLM 批量生成、缺少人工维护责任的项目,即所谓 LLM-extrusions。争议焦点并非所有 AI 辅助代码,而是低质量仓库对托管、审核和社区注意力的外部成本。提案显示代码平台开始把生成内容治理从反垃圾规则推进到维护者责任定义。

Roblox Officially Supports GrapheneOS42en.help.roblox.com原文 ↗

en.help.roblox.com

Roblox 更新 Android 远程证明政策,把 GrapheneOS 纳入官方支持范围。变化说明反作弊系统不必简单依赖厂商认证的原厂系统,也可以认可满足完整性条件的安全强化 ROM。它为移动应用在设备可信度与用户操作系统选择权之间提供了更细粒度的兼容案例。

博客文章 · Blog Posts

15 项 · 博客文章

A digestion of the Jacobian conjecture counterexample43terrytao.wordpress.com原文 ↗

terrytao.wordpress.com

Terence Tao 逐层拆解一个声称给出 Jacobian 猜想反例的构造,把原证明压缩为关键代数对象、局部性质和最终矛盾检查。文章的价值不在替读者宣布真伪,而在标出最需要独立验证的桥梁步骤。面对可能改写长期开放问题的结果,这种“先重建论证骨架再审计细节”的方法比围绕结论争论更可靠。

Everyone Should Know SIMD44mitchellh.com原文 ↗

mitchellh.com

Mitchell Hashimoto 从“单条指令处理多个数据”讲起,用实际数据布局和批处理例子解释 SIMD 为什么不只属于编译器作者。文章强调性能往往受内存布局、分支和向量宽度共同限制,手写 intrinsics 只是最后一步。它把 SIMD 放回日常工程语境:先识别可并行的连续工作,再决定使用库、自动向量化还是显式指令。

Are AI Labs Pelicanmaxxing?45dylancastillo.co原文 ↗

dylancastillo.co

文章用“pelicanmaxxing”形容 AI 实验室在相似榜单、命名、预告和产品叙事上不断模仿彼此的现象。作者把模型发布拆成能力、基准选择与营销节奏,指出竞争越激烈,外部呈现反而越趋同。这个观察有助于把发布声量与技术差异分开阅读,避免把同构宣传误判为独立证据。

The startup's Postgres survival guide46hatchet.run原文 ↗

hatchet.run

Hatchet 汇总初创团队最常踩的 PostgreSQL 运行问题:连接池耗尽、长事务、锁等待、缺索引、膨胀以及复制与备份。文章把故障信号对应到具体观测项和操作,例如先查活跃事务与等待关系,再决定终止查询或改 schema。它的主线是先建立可见性和容量纪律,避免过早用分片掩盖基本数据库卫生问题。

Making47beej.us原文 ↗

beej.us

Beej 讨论生成式 AI 参与代码、文章和图像生产后,“制作”是否仍意味着亲手完成每一步。文章把结果所有权、技能练习和工具使用区分开,认为争议不应只围绕产物是否可用。更深的判断标准是创作者是否理解选择、承担后果并能解释过程,而不是把输入提示词自动等同于传统手艺。

Never Enough48dark.ronacher.eu原文 ↗

dark.ronacher.eu

Armin Ronacher 反思软件工具不断叠加功能、抽象和配置后,用户仍被告知“再加一层就会更简单”。文章指出复杂度常从实现者转移给使用者,并通过兼容层和自动化继续累积。其批评并非反对功能,而是要求工具明确边界、保留可理解的核心,并愿意删除收益不足的机制。

Open models recap: more on Kimi K3, Qwen 3.8, Xi's WAIC speech, distillation, the open-closed gap, and what's next49interconnects.ai原文 ↗

interconnects.ai

Interconnects 把 Kimi K3、Qwen 3.8、蒸馏争议和 WAIC 政策信号放在同一条开放模型产业线上观察。文章认为开放权重模型仍在缩小部分能力差距,但训练数据、推理基础设施和许可条件让“开放”不是单一维度。它提供的是生态层判断:模型分数之外,还要看谁能复现、部署和继续训练。

Two years of vector search at Notion: 10x scale, 1/10th cost50notion.com原文 ↗

notion.com

Notion 回顾向量搜索从早期服务扩展到 10 倍规模、单位成本降至十分之一的过程,重点包括索引分片、冷热数据、批处理和检索路径简化。文章显示成本下降不是来自单一 ANN 算法替换,而是持续移除冗余计算并让容量模型贴近真实查询。它是少见的长期生产复盘,能看到向量系统在增长后如何从“能用”转向可运营。

A flaky test exposed a Redis client use-after-free51buildkite.engineering原文 ↗

buildkite.engineering

Buildkite 从一个极低概率失败的测试追到 Redis 客户端生命周期错误:异步回调仍持有已释放对象,最终形成 use-after-free。团队没有简单重试,而是扩大调度扰动、保存崩溃现场并核对所有权边界。案例说明 flaky test 可能是并发缺陷的统计信号;压掉噪声会失去最早、成本最低的安全预警。

Ghost Cut - or why Cut and Paste is broken everywhere52ishmael.textualize.io原文 ↗

ishmael.textualize.io

文章分析终端与文本界面里的“剪切”为什么经常只是删除:应用控制字符缓冲区,系统剪贴板却由终端或桌面环境管理,两者缺少统一协议。所谓 ghost cut 是内容从界面消失,却没有可靠进入用户预期的剪贴板。作者借此说明 TUI 复刻 GUI 快捷键时,必须先厘清输入层、应用层和系统层各自拥有的状态。

Some more things about Django I've been enjoying53jvns.ca原文 ↗

jvns.ca

Julia Evans 继续记录 Django 中让小型应用开发顺畅的设计,包括 ModelForm、管理后台、迁移、ORM 查询和调试页面。文章不是罗列“魔法”,而是观察框架如何让常见路径短、必要时又能下钻到 SQL 与请求细节。它解释了成熟全栈框架的优势:大量边角能力已经以一致方式组合,而无需每个项目重新选型。

RefluXFS: A Linux Kernel Local Privilege Escalation to Root in XFS54blog.qualys.com原文 ↗

blog.qualys.com

Qualys 披露 XFS 中的本地提权漏洞 CVE-2026-64600,并梳理从文件系统状态操纵到内核内存破坏、最终取得 root 的利用链。攻击需要本地执行条件,但 XFS 在服务器上的普及使补丁优先级较高。文章的技术意义在于展示文件系统元数据验证缺陷如何跨越权限边界,而不是停留在崩溃级 DoS。

Dark Elevator: Windows Install Service Local Privilege Escalation55blog.calif.io原文 ↗

blog.calif.io

Dark Elevator 解析 Windows Install Service 的 CVE-2026-50343,本地低权限用户可借安装服务的高权限执行路径完成提权。文章跟踪可控文件、服务行为和竞态窗口之间的连接,并给出从触发条件到 SYSTEM 权限的完整思路。它再次表明安装与更新组件是高价值边界:普通用户输入一旦进入特权文件操作,路径验证必须极其严格。

dcmake: a new CMake debugger UI56nullprogram.com原文 ↗

nullprogram.com

dcmake 为 CMake 配置阶段提供交互式调试界面,可查看命令执行、变量作用域、调用栈和控制流。它针对的是 CMake 脚本“执行了但难以观察”的痛点,让开发者不必靠连续插入 `message()` 猜状态。项目也揭示构建系统语言一旦承担复杂逻辑,就需要与普通语言相近的调试工具。

Unicode Variation Selector-15 and some of my tears57benjaminwil.info原文 ↗

benjaminwil.info

文章追踪 Unicode Variation Selector-15 在字体、浏览器和文本处理链中的兼容问题:同一基础字符附加选择符后,显示与匹配结果可能分叉。作者展示问题会穿过规范、字体覆盖和应用归一化多个层级,单点修复往往不够。这个案例提醒工程师,视觉上相同的字符串未必具有相同码点序列或语义。

引用来源 · References

72 条 · 引用
  1. 1 PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection. arXiv:2607.16199https://arxiv.org/abs/2607.16199 ↩ 回到正文 · back to text
  2. 2 Deterministic Replay for AI Agent Systems. arXiv:2607.16200https://arxiv.org/abs/2607.16200 ↩ 回到正文 · back to text
  3. 3 Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL. arXiv:2607.16204https://arxiv.org/abs/2607.16204 ↩ 回到正文 · back to text
  4. 4 KernelBench-Verified: Do LLM-Generated Kernels Actually Beat PyTorch?. arXiv:2607.16241https://arxiv.org/abs/2607.16241 ↩ 回到正文 · back to text
  5. 5 GigaToken. GitHub: marcelroed/gigatokenhttps://github.com/marcelroed/gigatoken/ ↩ 回到正文 · back to text
  6. 6 Accurate and Efficient Long-Term Memory for LLM Agents. arXiv:2607.16211https://arxiv.org/abs/2607.16211 ↩ 回到正文 · back to text
  7. 7 RECON: Benchmarking Agent Memory for Compositional Reasoning over Long Contexts. arXiv:2607.16716https://arxiv.org/abs/2607.16716 ↩ 回到正文 · back to text
  8. 8 AgentBrew: Lifelong Knowledge Brewing from Strong Teachers to Weak LLM Agents. arXiv:2607.16851https://arxiv.org/abs/2607.16851 ↩ 回到正文 · back to text
  9. 9 Environment-free Synthetic Data Generation for API-Calling Agents. arXiv:2607.16900https://arxiv.org/abs/2607.16900 ↩ 回到正文 · back to text
  10. 10 Lomekwi: Resource-Bounded Tool Discovery in LLM Agents. arXiv:2607.16961https://arxiv.org/abs/2607.16961 ↩ 回到正文 · back to text
  11. 11 Otap: Structure-Aware Optimal Transport for Evaluating Planning and Execution in Agent Trajectories. arXiv:2607.17082https://arxiv.org/abs/2607.17082 ↩ 回到正文 · back to text
  12. 12 A Systematic Evaluation of Trajectory Data Curation for LoRA Fine-Tuning of Code Agents. arXiv:2607.17205https://arxiv.org/abs/2607.17205 ↩ 回到正文 · back to text
  13. 13 AEVAL: From Anecdotal to Deterministic Testing for Agentic Skill Workflows. arXiv:2607.16345https://arxiv.org/abs/2607.16345 ↩ 回到正文 · back to text
  14. 14 Is Progressive Disclosure All You Need for Long-Context Agents?. arXiv:2607.17598https://arxiv.org/abs/2607.17598 ↩ 回到正文 · back to text
  15. 15 Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents. arXiv:2607.17641https://arxiv.org/abs/2607.17641 ↩ 回到正文 · back to text
  16. 16 ETAS: An Effect-Typed Language for Agent Systems. arXiv:2607.17780https://arxiv.org/abs/2607.17780 ↩ 回到正文 · back to text
  17. 17 Bentohttps://bento.page/slides/ ↩ 回到正文 · back to text
  18. 18 Millwright. GitHub: Northwood-Systems/millwrighthttps://github.com/Northwood-Systems/millwright ↩ 回到正文 · back to text
  19. 19 SyncLite. GitHub: syncliteio/SyncLitehttps://github.com/syncliteio/SyncLite ↩ 回到正文 · back to text
  20. 20 Cactus Hybrid. GitHub: cactus-compute/cactus-hybridhttps://github.com/cactus-compute/cactus-hybrid ↩ 回到正文 · back to text
  21. 21 Drskill. GitHub: dbreunig/drskillhttps://github.com/dbreunig/drskill ↩ 回到正文 · back to text
  22. 22 Memory Bench. GitHub: leapmemory/memory-benchhttps://github.com/leapmemory/memory-bench ↩ 回到正文 · back to text
  23. 23 DataParade. GitHub: DataParade-io/dataparade-clihttps://github.com/DataParade-io/dataparade-cli ↩ 回到正文 · back to text
  24. 24 Drey. GitHub: mario/dreyhttps://github.com/mario/drey ↩ 回到正文 · back to text
  25. 25 Browser Tools SDKhttps://libretto.sh/browser-tools ↩ 回到正文 · back to text
  26. 26 Superservehttps://www.superserve.ai/ ↩ 回到正文 · back to text
  27. 27 Blackbar Nano. GitHub: safetype/blackbar-nanohttps://github.com/safetype/blackbar-nano ↩ 回到正文 · back to text
  28. 28 Ingot. GitHub: SlanchaAI/ingothttps://github.com/SlanchaAI/ingot ↩ 回到正文 · back to text
  29. 29 The Harbinger. GitHub: n0tduck1e/theharbingerhttps://github.com/n0tduck1e/theharbinger ↩ 回到正文 · back to text
  30. 30 SimpleBLE 1.0. GitHub: simpleble/simpleblehttps://github.com/simpleble/simpleble ↩ 回到正文 · back to text
  31. 31 Judge approves $1.5B Anthropic settlement for pirated books used to train Claudehttps://apnews.com/article/ai-anthropic-copyright-settlement-claude-books-bartz-74b140444023898aeba8579b6e9f0d63 ↩ 回到正文 · back to text
  32. 32 Kimi K3 Is Competitive with Fable; Kimi K3 and Fable Is SoTAhttps://fireworks.ai/blog/kimik3-fable ↩ 回到正文 · back to text
  33. 33 Laguna S 2.1https://poolside.ai/blog/introducing-laguna-s-2-1 ↩ 回到正文 · back to text
  34. 34 Advertise in ChatGPThttps://ads.openai.com/ ↩ 回到正文 · back to text
  35. 35 Introducing OpenAI Presencehttps://openai.com/index/introducing-openai-presence ↩ 回到正文 · back to text
  36. 36 Advancing the next era of national sciencehttps://openai.com/index/advancing-the-next-era-of-national-science ↩ 回到正文 · back to text
  37. 37 Building AI infrastructure with the Effingham County communityhttps://openai.com/index/building-ai-infrastructure-with-the-effingham-county-community ↩ 回到正文 · back to text
  38. 38 Gemini latest models: temperature, top_p, and top_k are deprecated and ignoredhttps://ai.google.dev/gemini-api/docs/latest-model ↩ 回到正文 · back to text
  39. 39 LG to ban residential proxies from smart TV appshttps://krebsonsecurity.com/2026/07/lg-to-ban-residential-proxies-from-smart-tv-apps/ ↩ 回到正文 · back to text
  40. 40 PyPI releases now reject new files after 14 dayshttps://blog.pypi.org/posts/2026-07-22-releases-now-reject-new-files-after-14-days/ ↩ 回到正文 · back to text
  41. 41 Codeberg: ToU extension to prohibit LLM-extrusionshttps://codeberg.org/Codeberg/org/pulls/1253 ↩ 回到正文 · back to text
  42. 42 Roblox Officially Supports GrapheneOShttps://en.help.roblox.com/hc/en-us/articles/49648939984916-Android-Remote-Attestation ↩ 回到正文 · back to text
  43. 43 A digestion of the Jacobian conjecture counterexamplehttps://terrytao.wordpress.com/2026/07/21/a-digestion-of-the-jacobian-conjecture-counterexample/ ↩ 回到正文 · back to text
  44. 44 Everyone Should Know SIMDhttps://mitchellh.com/writing/everyone-should-know-simd ↩ 回到正文 · back to text
  45. 45 Are AI Labs Pelicanmaxxing?https://dylancastillo.co/posts/pelicanmaxxing.html ↩ 回到正文 · back to text
  46. 46 The startup's Postgres survival guidehttps://hatchet.run/blog/postgres-survival-guide ↩ 回到正文 · back to text
  47. 47 Makinghttps://beej.us/blog/data/ai-making/ ↩ 回到正文 · back to text
  48. 48 Never Enoughhttps://dark.ronacher.eu/2026/7/21/never-enough/ ↩ 回到正文 · back to text
  49. 49 Open models recap: more on Kimi K3, Qwen 3.8, Xi's WAIC speech, distillation, the open-closed gap, and what's nexthttps://www.interconnects.ai/p/open-models-recap-more-on-kimi-k3 ↩ 回到正文 · back to text
  50. 50 Two years of vector search at Notion: 10x scale, 1/10th costhttps://www.notion.com/blog/two-years-of-vector-search-at-notion ↩ 回到正文 · back to text
  51. 51 A flaky test exposed a Redis client use-after-freehttps://buildkite.engineering/how-a-flaky-test-exposed-a-redis-use-after-free/ ↩ 回到正文 · back to text
  52. 52 Ghost Cut - or why Cut and Paste is broken everywherehttps://ishmael.textualize.io/blog/ghost-cut/ ↩ 回到正文 · back to text
  53. 53 Some more things about Django I've been enjoyinghttps://jvns.ca/blog/2026/07/21/more-nice-django-things/ ↩ 回到正文 · back to text
  54. 54 RefluXFS: A Linux Kernel Local Privilege Escalation to Root in XFShttps://blog.qualys.com/vulnerabilities-threat-research/2026/07/22/refluxfs-a-linux-kernel-local-privilege-escalation-to-root-in-xfs-cve-2026-64600 ↩ 回到正文 · back to text
  55. 55 Dark Elevator: Windows Install Service Local Privilege Escalationhttps://blog.calif.io/p/dark-elevator-windows-install-service ↩ 回到正文 · back to text
  56. 56 dcmake: a new CMake debugger UIhttps://nullprogram.com/blog/2026/04/07/ ↩ 回到正文 · back to text
  57. 57 Unicode Variation Selector-15 and some of my tearshttps://benjaminwil.info/weblog/variation-selector-15/ ↩ 回到正文 · back to text
  58. 58 HKUDS/LightRAG. GitHub: HKUDS/LightRAGhttps://github.com/HKUDS/LightRAG ↩ 回到正文 · back to text
  59. 59 NVIDIA/Model-Optimizer. GitHub: NVIDIA/Model-Optimizerhttps://github.com/NVIDIA/Model-Optimizer ↩ 回到正文 · back to text
  60. 60 likec4/likec4. GitHub: likec4/likec4https://github.com/likec4/likec4 ↩ 回到正文 · back to text
  61. 61 MoonshotAI/kimi-code. GitHub: MoonshotAI/kimi-codehttps://github.com/MoonshotAI/kimi-code ↩ 回到正文 · back to text
  62. 62 apache/ossie. GitHub: apache/ossiehttps://github.com/apache/ossie ↩ 回到正文 · back to text
  63. 63 block/buzz. GitHub: block/buzzhttps://github.com/block/buzz ↩ 回到正文 · back to text
  64. 64 ZSeven-W/openpencil. GitHub: ZSeven-W/openpencilhttps://github.com/ZSeven-W/openpencil ↩ 回到正文 · back to text
  65. 65 bojieli/ai-agent-book. GitHub: bojieli/ai-agent-bookhttps://github.com/bojieli/ai-agent-book ↩ 回到正文 · back to text
  66. 66 yvgude/lean-ctx. GitHub: yvgude/lean-ctxhttps://github.com/yvgude/lean-ctx ↩ 回到正文 · back to text
  67. 67 akitaonrails/ai-memory. GitHub: akitaonrails/ai-memoryhttps://github.com/akitaonrails/ai-memory ↩ 回到正文 · back to text
  68. 68 rtk-ai/rtk. GitHub: rtk-ai/rtkhttps://github.com/rtk-ai/rtk ↩ 回到正文 · back to text
  69. 69 NVIDIA/cosmos-framework. GitHub: NVIDIA/cosmos-frameworkhttps://github.com/NVIDIA/cosmos-framework ↩ 回到正文 · back to text
  70. 70 datalab-to/chandra. GitHub: datalab-to/chandrahttps://github.com/datalab-to/chandra ↩ 回到正文 · back to text
  71. 71 dottxt-ai/outlines. GitHub: dottxt-ai/outlineshttps://github.com/dottxt-ai/outlines ↩ 回到正文 · back to text
  72. 72 Pumpkin-MC/Pumpkin. GitHub: Pumpkin-MC/Pumpkinhttps://github.com/Pumpkin-MC/Pumpkin ↩ 回到正文 · back to text