每日 Harness 开源 · Source
全部刊期 · All issues

每日 Harness

2026-07-08 · Wednesday, July 8, 2026

智能体可控工程化

视图 · View

今日重点 · Today's Highlights

[AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents](https://arxiv.org/abs/2607.02599)[^1] - 把 agent 的“过程是否合规”写成可验证的时序逻辑规则,并把同一套规则用于测量、执行期约束和训练。

全文 ↓

[CoACT: Action-Preserving Observation Compression for Coding Agents](https://arxiv.org/abs/2607.02911)[^2] - 观察压缩不再只追求短摘要,而是显式保留会影响下一步代码行动的信息。

全文 ↓

[ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents](https://arxiv.org/abs/2607.04686)[^3] - 将工具失败拆成漏调、错工具、错参数、忽略结果等可诊断环节,便于定位 agent 工具栈问题。

全文 ↓

[CLRK, an open-source agent runtime with gVisor and MitM guardrails](https://github.com/apoxy-dev/clrk)[^4] - 用 gVisor 沙箱和中间人式网络 guardrail 给 agent runtime 加上隔离、策略和可观察性。

全文 ↓

[Chrome DevTools MCP](https://github.com/ChromeDevTools/chrome-devtools-mcp)[^5] - 把真实 Chrome DevTools 暴露给 coding agent,让它直接检查 DOM、网络、性能 trace 和浏览器状态。

全文 ↓

论文 · Papers

18 项 · 论文

本期重点AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents1arxiv.org原文 ↗

这篇论文把工具型 LLM agent 的过程要求形式化为线性时序逻辑,而不是只在任务结束后看最终答案是否正确。它把同一套 trace rule 用在三处:离线测量、运行时 enforcement、以及生成/筛选训练信号。看点在于它把“先查证再行动”“不得在未授权状态下调用工具”这类工程规范变成可执行的轨迹约束,适合接入高风险 agent workflow。

本期重点CoACT: Action-Preserving Observation Compression for Coding Agents2arxiv.org原文 ↗

CoACT 处理 coding agent 的上下文膨胀问题,但目标不是做漂亮摘要,而是压缩后仍保持原本会采取的行动。论文把代码、终端输出和环境反馈中的信息按“是否改变下一步动作”来筛,避免把关键报错或文件状态压没。它值得看的是评估目标发生了变化:压缩质量由后续行动保持程度衡量,而不是摘要相似度。

本期重点ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents3arxiv.org原文 ↗

基准工具使用其他垂直

ToolFailBench 给工具调用失败做了更细的诊断切分,包括该调用时没有调用、选择了错误工具、参数填错、调用后不使用返回结果等。这样的 benchmark 比单一成功率更接近 agent 调试现场,因为同样失败可能来自 planner、schema grounding、参数抽取或结果整合。它的技术价值在于把“工具使用不行”拆成可修补的子问题。

SwarmResearch: Orchestrating Coding Agents for Open-Ended Discovery6arxiv.org原文 ↗

SwarmResearch 研究多个 coding agents 在开放式发现任务中的协作,而不是标准软件修 bug 那种目标明确的 benchmark。论文的机制重点是 orchestrator 保留多条高层研究路线,让 agent swarm 并行探索不同假设,减少早期过度收敛。它补上了多 agent 研究系统里的一个关键问题:探索路线本身如何被表示、比较和延续。

Object-Centric Environment Modeling for Agentic Tasks7arxiv.org原文 ↗

这篇提出用对象为中心的环境模型记录 agent 交互经验,把实体、属性、关系和状态变化从原始日志里抽出来。相比把历史都塞进 transcript 或向量库,对象视图更适合做一致性检查、状态复用和后续规划。论文的意义在于把 agent memory 往可维护状态模型推进,而不只是“存更多上下文”。

PLACEMEM: Toward a Compute-Aware Memory Plane for Lifelong Agents8arxiv.org原文 ↗

PLACEMEM 将 lifelong agent 的记忆层放到计算预算下设计,讨论哪些信息应持久化、何时修正、运行时是否值得检索。它把 memory plane 视作有放置策略和成本模型的系统组件,而不是无条件增长的外部存储。这个视角对长期运行 agent 很关键,因为检索本身也会消耗延迟、token 和推理注意力。

MRMS: A Multi-Resolution Memory Substrate for Long-Lived AI Agents9arxiv.org原文 ↗

MRMS 提出多分辨率记忆基底,把个人上下文、外部证据和可修订记忆分层处理。它避免把所有记忆都压缩成同一类摘要或 embedding:证据需要可追溯,状态需要可更新,长期偏好又需要稳定保留。论文的可读点在于它直接处理“长期 agent 会记错、会过期、会混淆证据和结论”这个现实问题。

Agent Step Value: State-Transition Measurement with State-Grounded LLM Evaluators10arxiv.org原文 ↗

Agent Step Value 把 agent 评估从整条轨迹的终局分数拆到单步状态转移。论文用 state-grounded LLM evaluator 判断某一步是否让环境状态更接近目标,因此能区分“中间操作合理但最终失败”和“最终成功但过程不可复现”。这种粒度更适合训练和调试多步 agent,因为它能指出哪一步开始偏航。

Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents11arxiv.org原文 ↗

这篇研究 benchmark harness 如何改变多步 agent 的状态信念。它关注 agent 在评测框架提供的提示、状态显示和工具反馈下形成的 belief,是否偏离真实部署中会形成的判断。看点不在新模型,而在提醒 benchmark 自身也是干预变量;如果 harness 改写了 agent 的世界模型,分数就不一定代表线上行为。

AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments12arxiv.org原文 ↗

AgentGym2 将 LLM agent benchmark 推向“去理想化”环境,把真实部署里的噪声、部分可观测、工具不稳定和交互约束纳入评测。它不是再造一个干净任务集,而是考 agent 在环境不完美时能否验证、恢复并持续推进。这个方向适合检验 agent 工程成熟度,因为真实系统失败往往来自边界条件而非核心能力题。

Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure13arxiv.org原文 ↗

评测方法计算机·Web

论文诊断 GUI agents 在像素截图和结构化界面信息之间如何建立状态信念。它比较视觉证据与 DOM/accessibility tree 等结构信号的作用,尤其关心两者冲突时 agent 依赖哪一边。这个问题直接关系到桌面和浏览器 agent 的可靠性:截图看起来正确,不等于可点击状态或控件语义真的一致。

FORGE: Research-Trajectory Hijacking Attacks on Deep Research Agents14arxiv.org原文 ↗

FORGE 描述的是 research-trajectory hijacking:攻击者通过污染可检索文档影响 deep research agent 的规划、证据选择和最终路线。它比单轮 prompt injection 更隐蔽,因为恶意影响会在多步检索和写作中持续累积。论文值得关注的点是攻击对象从“最终回答文本”前移到了“研究轨迹本身”。

DualView: Preventing Indirect Prompt Injection in Personal AI Agents15arxiv.org原文 ↗

DualView 面向个人 AI agents 的间接 prompt injection 防护,核心是把本地可信个人上下文和外部不可信内容分开建模。个人 agent 同时读邮件、网页、日历和文件时,攻击内容可以混进普通数据源里触发越权行为。该框架的价值在于处理跨源指令混淆,而不是只依赖单次输入过滤。

Agent Data Injection Attacks are Realistic Threats to AI Agents16arxiv.org原文 ↗

这篇系统化讨论 agent data injection:恶意内容可以藏在网页、文档、工具返回值或外部数据库中,不必直接写成用户 prompt。论文把攻击面放在 agent 的数据供应链里,分析它如何影响工具选择、决策流程和敏感动作。它把“外部数据不可信”从安全常识推进到 agent 架构层面的威胁模型。

PEEK: Predictive Queue-Informed KV Cache Management for LLM Serving17arxiv.org原文 ↗

PEEK 针对 LLM serving 中 KV cache 的调度和淘汰,利用排队请求之间的前缀共享来预测缓存价值。它的关键思想是 eviction 不只看当前 cache,还看队列里即将到来的请求是否能复用这些前缀。对高并发推理服务来说,这把 KV cache 从被动显存占用变成了可预测的队列资源。

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving18arxiv.org原文 ↗

这篇综述将 KV cache 管理按 locality、lifetime、ownership 和 substrate 分类,从单卡 tensor buffer 扩展到分布式内存层级。它覆盖显存、主存、远端存储和跨请求共享等设计面,说明 KV cache 已经不是简单优化项,而是 LLM serving 系统结构的一部分。适合用来梳理近期 PagedAttention、prefix cache、offloading 和调度策略之间的关系。

The Remarkable Effectiveness of Providing AI Agents with Natural Language Tools20arxiv.org原文 ↗

工具使用其他垂直

论文比较自然语言工具和结构化工具调用在多模型上的表现,核心发现是工具接口形式本身会显著影响 agent 能力。自然语言工具把能力描述成模型熟悉的文本语境,在一些任务上可接近甚至优于严格 schema。它挑战了“结构化调用一定更可靠”的默认假设,尤其适合重新审视工具 API 设计。

开源 / 项目 · Projects

17 项 · 开源 / 项目

本期重点CLRK, an open-source agent runtime with gVisor and MitM guardrails4github.com原文 ↗

CLRK 是框架无关的 agent runtime,重点是把执行隔离、网络策略和观测能力从上层 agent 框架中抽出来。README 中最具体的组合是 gVisor 沙箱加中间人式网络 guardrail,可以在 agent 跑代码、访问网页或调用工具时施加边界。它的看点不是再做一个 agent SDK,而是补 runtime 层的安全和治理空缺。

本期重点Chrome DevTools MCP5github.com原文 ↗

Chrome DevTools MCP 把真实 Chrome DevTools 接到 MCP,让 coding agent 能检查页面结构、网络请求、控制台、性能 trace 和浏览器运行状态。它直接使用 Chrome,而不是用简化浏览器模拟环境,因此适合前端调试、自动化回归和网页 agent 任务。对 coding agent 来说,这相当于把“看页面”升级成“用 DevTools 读页面”。

Rowboat21github.com原文 ↗

Rowboat 是本地优先的 AI 工作区,定位为 Claude Desktop 替代品,但重点在可构建的自定义操作界面。项目把聊天、工具调用、状态和小型 UI 放在同一工作区里,支持围绕重复任务搭建自己的 agent surface。它体现了一个趋势:桌面 AI 客户端正在从单一 chat box 变成可配置工作台。

Docx-CLI22github.com原文 ↗

工具使用其他垂直

Docx-CLI 提供命令行方式读取和编辑 Word `.docx` 文档,目标用户明确包括 agent。它让模型或脚本能检查文档结构、正文和段落并执行修改,而不用依赖 Word GUI 或脆弱的手工复制。这个项目的实用点在办公自动化:很多 agent 能处理纯文本,却卡在真实文档格式上。

Davit23davit.app原文 ↗

davit.app

Davit 是 Apple Containers 的图形界面客户端,把容器创建、启动、状态检查和管理放进桌面 UI。它不是泛化的 Docker Desktop 替代品,而是围绕 Apple Containers 生态提供可视化操作入口。对 macOS 开发者来说,条目的意义在于 Apple 新容器栈已经开始出现配套工具层。

Fence24news.ycombinator.com原文 ↗

Fence 的定位是在 coding agent 执行 shell 命令前拦截危险操作。它把风险控制放在命令真正落地之前,尤其针对删除、覆盖、权限、网络访问等高风险命令。这个项目反映出 agent 安全的一个朴素但有效切入点:先守住本地执行边界,再谈更复杂的策略系统。

Wayflow25wayflow.build原文 ↗

Wayflow 是可嵌入的 AI workflow builder,将节点编辑器和运行时连接起来。它面向产品内嵌,而不是独立低代码平台;应用可以把 workflow 画布、节点状态和 AI 调用接入自有界面。这个形态适合需要给用户开放自动化能力、但又不想从头做编排器的产品。

Revector26github.com原文 ↗

Revector 是 Qdrant 的 schema migration 工具,作者把它类比为向量数据库版 Alembic。它管理 collections、vectors、payload indexes 等结构变化,让向量库 schema 演进可以进入版本化 migration 流程。随着 RAG 和向量检索进入生产系统,这类工具把“向量库配置”从一次性脚本变成可审计变更。

Graphene27github.com原文 ↗

github.com

Graphene 是本地 Git wrapper,用于管理 stacked branches 和 stacked pull requests。它维护分支栈关系,帮助开发者在本地改动、重排、同步和提交多层 PR。这个项目面向小步 review 流程,解决的是原生 Git 能做但操作成本较高的栈式开发体验。

TextGrab28github.com原文 ↗

github.com

TextGrab 在 Android 上做本地 OCR 截图选字,特别面向 de-Googled 设备。它解决的是手机应用中图片文字、不可选文本和隐私敏感场景下的复制需求。项目看点在于不依赖 Google 服务仍提供屏幕文字提取能力,这对替代 Android 生态很实用。

Shadow Web29github.com原文 ↗

Shadow Web 为 LLM agent 压缩网页 token 表示,把网页转换成更适合模型消费的紧凑内容。它试图剔除导航、重复 DOM 文本和页面噪声,同时保留 agent 浏览需要的主要信息。这个工具的技术焦点是网页理解成本:长网页不是不能读,而是上下文预算和相关性管理会迅速变差。

Claude Code Live Memory30github.com原文 ↗

Claude Code Live Memory 是 Claude Code plugin / MCP server,用低成本模型持续维护代码库记忆。它在编码会话之外提炼项目结构、约定和近期变化,供后续 Claude Code 调用。项目的看点是把代码库理解从“每次重新扫描”改成“持续增量维护”。

L9gpu31github.com原文 ↗

github.com

L9gpu 将 GPU telemetry 关联到 Kubernetes pod 或 Slurm job,覆盖 GPU 利用率、显存、功耗等指标的归因。共享集群常见问题是能看到卡在忙,却难以快速定位哪个工作负载造成压力。这个项目把 ML 平台和 HPC 运维里最基础的资源归属问题做成可观测层。

Ternlight32ternlight-demo.vercel.app原文 ↗

ternlight-demo.vercel.app

Ternlight 展示约 7 MB 的浏览器端 WASM embedding model demo。这个数字说明小型 embedding 模型已经能进入客户端页面,用于本地向量化、离线语义搜索或隐私保留匹配。它的价值不在模型规模炫技,而在把 embedding 从后端服务移到浏览器执行。

Fable turned reMarkable into Tom Riddle's diary from Harry Potter33github.com原文 ↗

github.com

Riddle 把 reMarkable 平板改造成交互式文本日记体验,灵感来自 Tom Riddle 的日记。项目利用电子墨水平板的书写和显示特性,让设备表现得像会回应的日记。它更像人机交互和硬件改造实验,展示低刷新率设备也能承载有叙事感的 AI 界面。

CoMaps34comaps.app原文 ↗

comaps.app

CoMaps 是 FOSS 离线地图应用,强调自由开源和离线可用。它面向无网络、弱网络或不希望依赖商业地图服务的导航场景。这个项目的技术意义在于地图应用的可控性:数据、客户端和使用方式都更接近社区维护模式。

OpenWrt One35openwrt.org原文 ↗

openwrt.org

OpenWrt One 是 OpenWrt 官方开放硬件路由器,条目指向 OpenWrt wiki 设备页。它的看点是为 OpenWrt 提供更透明、可刷写、社区友好的参考硬件,而不是让用户在消费路由器兼容列表里碰运气。对网络设备生态来说,官方硬件能降低固件维护和长期支持的不确定性。

行业动态 · Industry News

12 项 · 行业动态

Chat Control passed first round in EU Parliament36heise.de原文 ↗

heise.de

Heise 报道 Chat Control 1.0 在欧洲议会通过首轮程序,这意味着私密通信扫描相关提案继续留在立法轨道上。这里的关键事实是“首轮程序通过”,不是最终法律已经生效。它值得关注的原因在于加密通信、平台合规和儿童保护监管之间的冲突仍在推进。

Better Auth is joining Vercel38better-auth.com原文 ↗

better-auth.com

Better Auth 官方宣布加入 Vercel,项目定位是 TypeScript 生态里的认证方案。交易的实际影响会落在开发者体验、部署集成和全栈框架生态上,而不是单纯品牌归属变化。它也说明 auth 这类基础能力正在被平台厂商纳入更完整的应用开发链路。

Astro 7.039astro.build原文 ↗

astro.build

Astro 发布 7.0 major release,开发者需要关注升级变化、构建链路和生态包兼容性。Astro 的核心路线仍围绕内容站点、islands 架构和多框架组件体验。作为 major version,这条新闻的价值在于判断现有 Astro 项目何时升级,以及哪些默认行为可能影响部署。

OpenSSH 10.4/10.4p1 Released40openssh.org原文 ↗

openssh.org

OpenSSH 发布 10.4/10.4p1 release notes,覆盖上游和 portable 版本。OpenSSH release notes 通常直接关系到安全修复、协议/算法调整、兼容性变化和工具行为。对运维和发行版维护者来说,这类版本说明比二手摘要更重要,因为配置影响往往藏在细节里。

Microsoft fire idTech team at Id software41gamefromscratch.com原文 ↗

gamefromscratch.com

GameFromScratch 报道称 Microsoft 裁撤 id Software 的 idTech 团队。idTech 是 Doom 等系列背后的核心技术栈,因此团队变化不只是普通人事新闻,也可能影响内部引擎演进、工具维护和未来项目技术路线。需要把它放在微软游戏业务重组的大背景下读。

Resetting Xbox42news.xbox.com原文 ↗

news.xbox.com

Xbox 官方发布“Resetting Xbox”说明,给出业务重组和平台策略的官方表述。它讨论的是 Xbox 如何调整组织、产品重点和跨设备游戏平台方向。相比传闻类裁员消息,这条更适合作为微软自己对游戏业务变化的引用来源。

Microsoft Can Track Users via a Windows Device ID44pcmag.com原文 ↗

pcmag.com

PCMag 报道一起黑客被捕案件中暴露出的 Windows device ID 追踪能力。技术焦点在于设备标识如何关联用户、设备和活动记录,而不是案件猎奇本身。它触及操作系统遥测、账户体系和执法取证之间的边界。

Europe's company websites are mostly served by US vendors45ciphercue.com原文 ↗

ciphercue.com

Ciphercue 分析欧洲公司网站的托管和供应商分布,结论指向大量欧洲企业网站仍由美国供应商服务。这个角度把数字主权问题具体化到网页供应链、托管、CDN 和服务商选择上。它提供的不是政策口号,而是从网站基础设施观察依赖关系。

Small AI Models Gain Traction In places with unreliable networks46spectrum.ieee.org原文 ↗

spectrum.ieee.org

IEEE Spectrum 报道小模型在网络不稳定环境中的部署案例,强调 small language models 的价值不只来自成本。离线、低带宽、边缘设备和高可靠要求会让较小模型比云端大模型更可用。它说明 AI 部署的约束条件常常是网络和运维,而不是榜单能力。

AMD Ryzen AI Halo - $4k AI Dev Kit47lttlabs.com原文 ↗

lttlabs.com

LTT Labs 评测 AMD Ryzen AI Halo 开发套件,标题给出的价格约为 4000 美元。评测关注 CPU/GPU/NPU 组合、内存带宽、软件栈和实际推理体验。这个产品的判断点不是“能不能跑 AI”,而是同价位下相对工作站、GPU 盒子和云服务是否有合理位置。

博客文章 · Blog Posts

11 项 · 博客文章

Harness Engineering for Self-Improvement48lilianweng.github.io原文 ↗

Lilian Weng 讨论自改进 AI 系统中的 harness 设计,把 harness 看作生成任务、评价结果、提供反馈和限制搜索空间的系统组件。文章的关键点是自改进不只靠更强模型,还依赖评测、数据生成、反馈闭环和防 reward hacking 的工程设计。它把“让模型自己变好”拆成可以审视的实验系统。

sqlite-utils 4.0, now with database schema migrations49simonwillison.net原文 ↗

simonwillison.net

Simon Willison 记录 sqlite-utils 4.0,新版本加入 database schema migrations,并提到 nested transactions 和 compound foreign keys。sqlite-utils 原本偏向快速操作 SQLite,现在开始覆盖版本化 schema 演进。对小型数据应用来说,这让 SQLite 项目也能采用更接近生产数据库的迁移流程。

tencent/Hy350simonwillison.net原文 ↗

simonwillison.net

Simon Willison 记录 Tencent Hy3 的模型规模、许可和基准信息,把模型发布整理成开发者可判断的几个硬指标。文章关注的不只是“又一个模型”,而是参数规模、许可证限制、公开 benchmark 和推理门槛。这样的短评适合快速判断是否值得下载、试跑或纳入评测池。

You Only Need 1 Layer for RLVR?51mail.bycloud.ai原文 ↗

The AI Timeline 这期覆盖 7 月 1 日至 7 日的 AI research/news,标题抓住 RLVR 只需一层的讨论。它把一周论文、发布和社区动向放在同一封邮件中,适合观察研究主题如何在几天内聚集。RLVR 话题本身指向推理训练、验证器和强化学习成本的再评估。

not much happened today52news.smol.ai原文 ↗

news.smol.ai

smol.ai 汇总 2026-07-04 至 2026-07-06 的 AI 社区动态。标题很轻,但内容属于社区脉搏型日报,覆盖模型、工具、发布和讨论串。它的价值在正式论文之外:很多工程趋势会先以仓库、demo 和社交讨论的形式出现。

AI Meets Cryptography 1: What AI Found in Cloudflare's Circl53blog.zksecurity.xyz原文 ↗

blog.zksecurity.xyz

zkSecurity 记录 AI 辅助分析 Cloudflare Circl 加密库 bug 的过程。文章把模型用于真实密码学代码审计,而不是人为构造的玩具漏洞。它的看点是双重的:AI 可以加速可疑实现的定位,但密码学语义和风险判断仍需要专家把关。

Local, CPU-Friendly, High-Quality TTS with Kokoro54ariya.io原文 ↗

ariya.io

Ariya Hidayat 演示在本地 CPU 上运行 Kokoro TTS,主题是 local、CPU-friendly、high-quality text-to-speech。文章围绕安装、模型调用和本地语音生成体验展开,强调无需云 API 或 GPU 也能得到可用结果。它代表了语音生成从云服务向本地轻量部署迁移的一条实用路径。

Why we built yet another Postgres connection pooler55pgdog.dev原文 ↗

pgdog.dev

PgDog 解释为什么还需要一个 Postgres connection pooler,从现有方案限制切入讨论连接复用、负载均衡、故障转移和查询路由。文章不是简单复刻 PgBouncer,而是面向更复杂的 Postgres 集群工作负载。它适合读来理解 pooler 在云数据库和多节点架构中承担的范围正在扩大。

Your Rust Service Isn't Leaking - It Could Be the Allocator56pranitha.dev原文 ↗

pranitha.dev

文章解释 Rust 服务 RSS 增长不一定等同逻辑内存泄漏,allocator 可能保留已释放内存以便复用。它提醒排查时区分对象仍被引用、碎片化、arena/cache 行为和操作系统归还策略。这个角度对生产服务很实际,因为“看起来占用不降”常常会被误判成 Rust 代码泄漏。

Notes on Software Quality57anthonyhobday.com原文 ↗

anthonyhobday.com

Anthony Hobday 把软件质量拆成多个维度和权衡,而不是给一个单一分数。文章讨论可靠性、可维护性、性能、可理解性、一致性、可测试性等属性如何互相牵制。它适合用于工程评审语言:先说清楚质量指哪一类质量,再讨论取舍。

GLM 5.2 and the coming AI margin collapse58martinalderson.com原文 ↗

martinalderson.com

Martin Alderson 分析 GLM 5.2 的价格、性能和推理成本结构,并把它放到 AI margin collapse 的商业叙事中。文章的核心判断是模型能力趋近和价格下降会挤压 API 提供商与应用层利润空间。它不是模型测评本身,而是用模型发布观察 AI 服务经济结构的变化。

引用来源 · References

68 条 · 引用
  1. 1 AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents. arXiv:2607.02599https://arxiv.org/abs/2607.02599 ↩ 回到正文 · back to text
  2. 2 CoACT: Action-Preserving Observation Compression for Coding Agents. arXiv:2607.02911https://arxiv.org/abs/2607.02911 ↩ 回到正文 · back to text
  3. 3 ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents. arXiv:2607.04686https://arxiv.org/abs/2607.04686 ↩ 回到正文 · back to text
  4. 4 CLRK, an open-source agent runtime with gVisor and MitM guardrails. GitHub repositoryhttps://github.com/apoxy-dev/clrk ↩ 回到正文 · back to text
  5. 5 Chrome DevTools MCP. GitHub repositoryhttps://github.com/ChromeDevTools/chrome-devtools-mcp ↩ 回到正文 · back to text
  6. 6 SwarmResearch: Orchestrating Coding Agents for Open-Ended Discovery. arXiv:2607.02807https://arxiv.org/abs/2607.02807 ↩ 回到正文 · back to text
  7. 7 Object-Centric Environment Modeling for Agentic Tasks. arXiv:2607.02846https://arxiv.org/abs/2607.02846 ↩ 回到正文 · back to text
  8. 8 PLACEMEM: Toward a Compute-Aware Memory Plane for Lifelong Agents. arXiv:2607.04089https://arxiv.org/abs/2607.04089 ↩ 回到正文 · back to text
  9. 9 MRMS: A Multi-Resolution Memory Substrate for Long-Lived AI Agents. arXiv:2607.04617https://arxiv.org/abs/2607.04617 ↩ 回到正文 · back to text
  10. 10 Agent Step Value: State-Transition Measurement with State-Grounded LLM Evaluators. arXiv:2607.04419https://arxiv.org/abs/2607.04419 ↩ 回到正文 · back to text
  11. 11 Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents. arXiv:2607.04528https://arxiv.org/abs/2607.04528 ↩ 回到正文 · back to text
  12. 12 AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments. arXiv:2607.05174https://arxiv.org/abs/2607.05174 ↩ 回到正文 · back to text
  13. 13 Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure. arXiv:2607.04334https://arxiv.org/abs/2607.04334 ↩ 回到正文 · back to text
  14. 14 FORGE: Research-Trajectory Hijacking Attacks on Deep Research Agents. arXiv:2607.04718https://arxiv.org/abs/2607.04718 ↩ 回到正文 · back to text
  15. 15 DualView: Preventing Indirect Prompt Injection in Personal AI Agents. arXiv:2607.03821https://arxiv.org/abs/2607.03821 ↩ 回到正文 · back to text
  16. 16 Agent Data Injection Attacks are Realistic Threats to AI Agents. arXiv:2607.05120https://arxiv.org/abs/2607.05120 ↩ 回到正文 · back to text
  17. 17 PEEK: Predictive Queue-Informed KV Cache Management for LLM Serving. arXiv:2607.02525https://arxiv.org/abs/2607.02525 ↩ 回到正文 · back to text
  18. 18 From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving. arXiv:2607.02574https://arxiv.org/abs/2607.02574 ↩ 回到正文 · back to text
  19. 19 SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference. arXiv:2607.03333https://arxiv.org/abs/2607.03333 ↩ 回到正文 · back to text
  20. 20 The Remarkable Effectiveness of Providing AI Agents with Natural Language Tools. arXiv:2607.03953https://arxiv.org/abs/2607.03953 ↩ 回到正文 · back to text
  21. 21 Rowboat. GitHub repositoryhttps://github.com/rowboatlabs/rowboat ↩ 回到正文 · back to text
  22. 22 Docx-CLI. GitHub repositoryhttps://github.com/kklimuk/docx-cli ↩ 回到正文 · back to text
  23. 23 Davithttps://davit.app ↩ 回到正文 · back to text
  24. 24 Fencehttps://news.ycombinator.com/item?id=48821039 ↩ 回到正文 · back to text
  25. 25 Wayflowhttps://wayflow.build/ ↩ 回到正文 · back to text
  26. 26 Revector. GitHub repositoryhttps://github.com/diegoglozano/revector ↩ 回到正文 · back to text
  27. 27 Graphene. GitHub repositoryhttps://github.com/alexghr/graphene ↩ 回到正文 · back to text
  28. 28 TextGrab. GitHub repositoryhttps://github.com/notune/TextGrab ↩ 回到正文 · back to text
  29. 29 Shadow Web. GitHub repositoryhttps://github.com/ulinycoin/shadow-web ↩ 回到正文 · back to text
  30. 30 Claude Code Live Memory. GitHub repositoryhttps://github.com/shofer-dev/claude-code-live-memory ↩ 回到正文 · back to text
  31. 31 L9gpu. GitHub repositoryhttps://github.com/last9/gpu-telemetry ↩ 回到正文 · back to text
  32. 32 Ternlighthttps://ternlight-demo.vercel.app/ ↩ 回到正文 · back to text
  33. 33 Fable turned reMarkable into Tom Riddle's diary from Harry Potter. GitHub repositoryhttps://github.com/MaximeRivest/Riddle ↩ 回到正文 · back to text
  34. 34 CoMapshttps://www.comaps.app/ ↩ 回到正文 · back to text
  35. 35 OpenWrt Onehttps://openwrt.org/toh/openwrt/one ↩ 回到正文 · back to text
  36. 36 Chat Control passed first round in EU Parliamenthttps://www.heise.de/en/news/Showdown-in-Strasbourg-The-unexpected-return-of-Chat-Control-1-0-11356680.html ↩ 回到正文 · back to text
  37. 37 Every new car sold in the European Union must include a driver monitoring camerahttps://allaboutcookies.org/eu-mandatory-distracted-driver-system ↩ 回到正文 · back to text
  38. 38 Better Auth is joining Vercelhttps://better-auth.com/blog/better-auth-joins-vercel ↩ 回到正文 · back to text
  39. 39 Astro 7.0https://astro.build/blog/astro-7/ ↩ 回到正文 · back to text
  40. 40 OpenSSH 10.4/10.4p1 Releasedhttps://www.openssh.org/txt/release-10.4 ↩ 回到正文 · back to text
  41. 41 Microsoft fire idTech team at Id softwarehttps://gamefromscratch.com/microsoft-fire-idtech-team-at-id-software/ ↩ 回到正文 · back to text
  42. 42 Resetting Xboxhttps://news.xbox.com/en-us/2026/07/06/resetting-xbox/ ↩ 回到正文 · back to text
  43. 43 Nintendo announces new product revisions in Europe with replaceable batterieshttps://www.nintendo.com/en-gb/Support/Nintendo-Switch-2/Information-about-upcoming-battery-related-revisions-to-some-Nintendo-products-3132901.html ↩ 回到正文 · back to text
  44. 44 Microsoft Can Track Users via a Windows Device IDhttps://www.pcmag.com/news/a-hackers-arrest-reveals-microsoft-can-track-users-via-a-windows-device ↩ 回到正文 · back to text
  45. 45 Europe's company websites are mostly served by US vendorshttps://ciphercue.com/blog/european-web-hosting-vendor-share-2026 ↩ 回到正文 · back to text
  46. 46 Small AI Models Gain Traction In places with unreliable networkshttps://spectrum.ieee.org/small-language-models-ai-pharmaceuticals ↩ 回到正文 · back to text
  47. 47 AMD Ryzen AI Halo - $4k AI Dev Kithttps://www.lttlabs.com/articles/2026/07/06/amd-ryzen-ai-halo ↩ 回到正文 · back to text
  48. 48 Harness Engineering for Self-Improvementhttps://lilianweng.github.io/posts/2026-07-04-harness/ ↩ 回到正文 · back to text
  49. 49 sqlite-utils 4.0, now with database schema migrationshttps://simonwillison.net/2026/Jul/7/sqlite-utils-4/#atom-everything ↩ 回到正文 · back to text
  50. 50 tencent/Hy3https://simonwillison.net/2026/Jul/6/hy3/#atom-everything ↩ 回到正文 · back to text
  51. 51 You Only Need 1 Layer for RLVR?https://mail.bycloud.ai/p/you-only-need-1-layer-for-rlvr ↩ 回到正文 · back to text
  52. 52 not much happened todayhttps://news.smol.ai/issues/26-07-06-not-much/ ↩ 回到正文 · back to text
  53. 53 AI Meets Cryptography 1: What AI Found in Cloudflare's Circlhttps://blog.zksecurity.xyz/posts/circl-bugs/ ↩ 回到正文 · back to text
  54. 54 Local, CPU-Friendly, High-Quality TTS with Kokorohttps://ariya.io/2026/03/local-cpu-friendly-high-quality-tts-text-to-speech-with-kokoro/ ↩ 回到正文 · back to text
  55. 55 Why we built yet another Postgres connection poolerhttps://pgdog.dev/blog/why-yet-another-connection-pooler ↩ 回到正文 · back to text
  56. 56 Your Rust Service Isn't Leaking - It Could Be the Allocatorhttps://pranitha.dev/posts/rust-and-memory-allocators/ ↩ 回到正文 · back to text
  57. 57 Notes on Software Qualityhttps://anthonyhobday.com/blog/20260410 ↩ 回到正文 · back to text
  58. 58 GLM 5.2 and the coming AI margin collapsehttps://martinalderson.com/posts/the-upcoming-ai-margin-collapse-part-1-glm-5-2/ ↩ 回到正文 · back to text
  59. 59 altic-dev/FluidVoice. GitHub repositoryhttps://github.com/altic-dev/FluidVoice ↩ 回到正文 · back to text
  60. 60 huggingface/speech-to-speech. GitHub repositoryhttps://github.com/huggingface/speech-to-speech ↩ 回到正文 · back to text
  61. 61 immich-app/immich. GitHub repositoryhttps://github.com/immich-app/immich ↩ 回到正文 · back to text
  62. 62 ComposioHQ/awesome-claude-skills. GitHub repositoryhttps://github.com/ComposioHQ/awesome-claude-skills ↩ 回到正文 · back to text
  63. 63 JuliusBrussee/caveman. GitHub repositoryhttps://github.com/JuliusBrussee/caveman ↩ 回到正文 · back to text
  64. 64 TibixDev/winboat. GitHub repositoryhttps://github.com/TibixDev/winboat ↩ 回到正文 · back to text
  65. 65 Dokploy/dokploy. GitHub repositoryhttps://github.com/Dokploy/dokploy ↩ 回到正文 · back to text
  66. 66 tonhowtf/omniget. GitHub repositoryhttps://github.com/tonhowtf/omniget ↩ 回到正文 · back to text
  67. 67 bradautomates/claude-video. GitHub repositoryhttps://github.com/bradautomates/claude-video ↩ 回到正文 · back to text
  68. 68 karakeep-app/karakeep. GitHub repositoryhttps://github.com/karakeep-app/karakeep ↩ 回到正文 · back to text