[AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents](https://arxiv.org/abs/2607.02599)[^1] - 把 agent 的“过程是否合规”写成可验证的时序逻辑规则,并把同一套规则用于测量、执行期约束和训练。
全文 ↓今日重点 · Today's Highlights
[CoACT: Action-Preserving Observation Compression for Coding Agents](https://arxiv.org/abs/2607.02911)[^2] - 观察压缩不再只追求短摘要,而是显式保留会影响下一步代码行动的信息。
全文 ↓[ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents](https://arxiv.org/abs/2607.04686)[^3] - 将工具失败拆成漏调、错工具、错参数、忽略结果等可诊断环节,便于定位 agent 工具栈问题。
全文 ↓[CLRK, an open-source agent runtime with gVisor and MitM guardrails](https://github.com/apoxy-dev/clrk)[^4] - 用 gVisor 沙箱和中间人式网络 guardrail 给 agent runtime 加上隔离、策略和可观察性。
全文 ↓[Chrome DevTools MCP](https://github.com/ChromeDevTools/chrome-devtools-mcp)[^5] - 把真实 Chrome DevTools 暴露给 coding agent,让它直接检查 DOM、网络、性能 trace 和浏览器状态。
全文 ↓论文 · Papers
18 项 · 论文本期重点AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents1arxiv.org原文 ↗
这篇论文把工具型 LLM agent 的过程要求形式化为线性时序逻辑,而不是只在任务结束后看最终答案是否正确。它把同一套 trace rule 用在三处:离线测量、运行时 enforcement、以及生成/筛选训练信号。看点在于它把“先查证再行动”“不得在未授权状态下调用工具”这类工程规范变成可执行的轨迹约束,适合接入高风险 agent workflow。
本期重点CoACT: Action-Preserving Observation Compression for Coding Agents2arxiv.org原文 ↗
CoACT 处理 coding agent 的上下文膨胀问题,但目标不是做漂亮摘要,而是压缩后仍保持原本会采取的行动。论文把代码、终端输出和环境反馈中的信息按“是否改变下一步动作”来筛,避免把关键报错或文件状态压没。它值得看的是评估目标发生了变化:压缩质量由后续行动保持程度衡量,而不是摘要相似度。
本期重点ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents3arxiv.org原文 ↗
ToolFailBench 给工具调用失败做了更细的诊断切分,包括该调用时没有调用、选择了错误工具、参数填错、调用后不使用返回结果等。这样的 benchmark 比单一成功率更接近 agent 调试现场,因为同样失败可能来自 planner、schema grounding、参数抽取或结果整合。它的技术价值在于把“工具使用不行”拆成可修补的子问题。
SwarmResearch: Orchestrating Coding Agents for Open-Ended Discovery6arxiv.org原文 ↗
SwarmResearch 研究多个 coding agents 在开放式发现任务中的协作,而不是标准软件修 bug 那种目标明确的 benchmark。论文的机制重点是 orchestrator 保留多条高层研究路线,让 agent swarm 并行探索不同假设,减少早期过度收敛。它补上了多 agent 研究系统里的一个关键问题:探索路线本身如何被表示、比较和延续。
Object-Centric Environment Modeling for Agentic Tasks7arxiv.org原文 ↗
这篇提出用对象为中心的环境模型记录 agent 交互经验,把实体、属性、关系和状态变化从原始日志里抽出来。相比把历史都塞进 transcript 或向量库,对象视图更适合做一致性检查、状态复用和后续规划。论文的意义在于把 agent memory 往可维护状态模型推进,而不只是“存更多上下文”。
PLACEMEM: Toward a Compute-Aware Memory Plane for Lifelong Agents8arxiv.org原文 ↗
PLACEMEM 将 lifelong agent 的记忆层放到计算预算下设计,讨论哪些信息应持久化、何时修正、运行时是否值得检索。它把 memory plane 视作有放置策略和成本模型的系统组件,而不是无条件增长的外部存储。这个视角对长期运行 agent 很关键,因为检索本身也会消耗延迟、token 和推理注意力。
MRMS: A Multi-Resolution Memory Substrate for Long-Lived AI Agents9arxiv.org原文 ↗
MRMS 提出多分辨率记忆基底,把个人上下文、外部证据和可修订记忆分层处理。它避免把所有记忆都压缩成同一类摘要或 embedding:证据需要可追溯,状态需要可更新,长期偏好又需要稳定保留。论文的可读点在于它直接处理“长期 agent 会记错、会过期、会混淆证据和结论”这个现实问题。
Agent Step Value: State-Transition Measurement with State-Grounded LLM Evaluators10arxiv.org原文 ↗
Agent Step Value 把 agent 评估从整条轨迹的终局分数拆到单步状态转移。论文用 state-grounded LLM evaluator 判断某一步是否让环境状态更接近目标,因此能区分“中间操作合理但最终失败”和“最终成功但过程不可复现”。这种粒度更适合训练和调试多步 agent,因为它能指出哪一步开始偏航。
Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents11arxiv.org原文 ↗
这篇研究 benchmark harness 如何改变多步 agent 的状态信念。它关注 agent 在评测框架提供的提示、状态显示和工具反馈下形成的 belief,是否偏离真实部署中会形成的判断。看点不在新模型,而在提醒 benchmark 自身也是干预变量;如果 harness 改写了 agent 的世界模型,分数就不一定代表线上行为。
AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments12arxiv.org原文 ↗
AgentGym2 将 LLM agent benchmark 推向“去理想化”环境,把真实部署里的噪声、部分可观测、工具不稳定和交互约束纳入评测。它不是再造一个干净任务集,而是考 agent 在环境不完美时能否验证、恢复并持续推进。这个方向适合检验 agent 工程成熟度,因为真实系统失败往往来自边界条件而非核心能力题。
Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure13arxiv.org原文 ↗
论文诊断 GUI agents 在像素截图和结构化界面信息之间如何建立状态信念。它比较视觉证据与 DOM/accessibility tree 等结构信号的作用,尤其关心两者冲突时 agent 依赖哪一边。这个问题直接关系到桌面和浏览器 agent 的可靠性:截图看起来正确,不等于可点击状态或控件语义真的一致。
FORGE: Research-Trajectory Hijacking Attacks on Deep Research Agents14arxiv.org原文 ↗
FORGE 描述的是 research-trajectory hijacking:攻击者通过污染可检索文档影响 deep research agent 的规划、证据选择和最终路线。它比单轮 prompt injection 更隐蔽,因为恶意影响会在多步检索和写作中持续累积。论文值得关注的点是攻击对象从“最终回答文本”前移到了“研究轨迹本身”。
DualView: Preventing Indirect Prompt Injection in Personal AI Agents15arxiv.org原文 ↗
DualView 面向个人 AI agents 的间接 prompt injection 防护,核心是把本地可信个人上下文和外部不可信内容分开建模。个人 agent 同时读邮件、网页、日历和文件时,攻击内容可以混进普通数据源里触发越权行为。该框架的价值在于处理跨源指令混淆,而不是只依赖单次输入过滤。
Agent Data Injection Attacks are Realistic Threats to AI Agents16arxiv.org原文 ↗
这篇系统化讨论 agent data injection:恶意内容可以藏在网页、文档、工具返回值或外部数据库中,不必直接写成用户 prompt。论文把攻击面放在 agent 的数据供应链里,分析它如何影响工具选择、决策流程和敏感动作。它把“外部数据不可信”从安全常识推进到 agent 架构层面的威胁模型。
PEEK: Predictive Queue-Informed KV Cache Management for LLM Serving17arxiv.org原文 ↗
PEEK 针对 LLM serving 中 KV cache 的调度和淘汰,利用排队请求之间的前缀共享来预测缓存价值。它的关键思想是 eviction 不只看当前 cache,还看队列里即将到来的请求是否能复用这些前缀。对高并发推理服务来说,这把 KV cache 从被动显存占用变成了可预测的队列资源。
From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving18arxiv.org原文 ↗
这篇综述将 KV cache 管理按 locality、lifetime、ownership 和 substrate 分类,从单卡 tensor buffer 扩展到分布式内存层级。它覆盖显存、主存、远端存储和跨请求共享等设计面,说明 KV cache 已经不是简单优化项,而是 LLM serving 系统结构的一部分。适合用来梳理近期 PagedAttention、prefix cache、offloading 和调度策略之间的关系。
SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference19arxiv.org原文 ↗
SPORK 观察到 agent 循环中工具调用等待会让模型推理链路空转,于是提出 self-speculative forking。模型在等待真实工具结果时先 fork 出多个可能后续分支,等结果返回后再保留可用路径。这个方法抓住的是 agentic inference 的端到端延迟,而不是单次 token 解码速度。
The Remarkable Effectiveness of Providing AI Agents with Natural Language Tools20arxiv.org原文 ↗
论文比较自然语言工具和结构化工具调用在多模型上的表现,核心发现是工具接口形式本身会显著影响 agent 能力。自然语言工具把能力描述成模型熟悉的文本语境,在一些任务上可接近甚至优于严格 schema。它挑战了“结构化调用一定更可靠”的默认假设,尤其适合重新审视工具 API 设计。
开源 / 项目 · Projects
17 项 · 开源 / 项目本期重点Chrome DevTools MCP5github.com原文 ↗
Chrome DevTools MCP 把真实 Chrome DevTools 接到 MCP,让 coding agent 能检查页面结构、网络请求、控制台、性能 trace 和浏览器运行状态。它直接使用 Chrome,而不是用简化浏览器模拟环境,因此适合前端调试、自动化回归和网页 agent 任务。对 coding agent 来说,这相当于把“看页面”升级成“用 DevTools 读页面”。
Shadow Web29github.com原文 ↗
Shadow Web 为 LLM agent 压缩网页 token 表示,把网页转换成更适合模型消费的紧凑内容。它试图剔除导航、重复 DOM 文本和页面噪声,同时保留 agent 浏览需要的主要信息。这个工具的技术焦点是网页理解成本:长网页不是不能读,而是上下文预算和相关性管理会迅速变差。
Claude Code Live Memory30github.com原文 ↗
Claude Code Live Memory 是 Claude Code plugin / MCP server,用低成本模型持续维护代码库记忆。它在编码会话之外提炼项目结构、约定和近期变化,供后续 Claude Code 调用。项目的看点是把代码库理解从“每次重新扫描”改成“持续增量维护”。
Fable turned reMarkable into Tom Riddle's diary from Harry Potter33github.com原文 ↗
Riddle 把 reMarkable 平板改造成交互式文本日记体验,灵感来自 Tom Riddle 的日记。项目利用电子墨水平板的书写和显示特性,让设备表现得像会回应的日记。它更像人机交互和硬件改造实验,展示低刷新率设备也能承载有叙事感的 AI 界面。
OpenWrt One35openwrt.org原文 ↗
OpenWrt One 是 OpenWrt 官方开放硬件路由器,条目指向 OpenWrt wiki 设备页。它的看点是为 OpenWrt 提供更透明、可刷写、社区友好的参考硬件,而不是让用户在消费路由器兼容列表里碰运气。对网络设备生态来说,官方硬件能降低固件维护和长期支持的不确定性。
行业动态 · Industry News
12 项 · 行业动态Chat Control passed first round in EU Parliament36heise.de原文 ↗
Heise 报道 Chat Control 1.0 在欧洲议会通过首轮程序,这意味着私密通信扫描相关提案继续留在立法轨道上。这里的关键事实是“首轮程序通过”,不是最终法律已经生效。它值得关注的原因在于加密通信、平台合规和儿童保护监管之间的冲突仍在推进。
Every new car sold in the European Union must include a driver monitoring camera37allaboutcookies.org原文 ↗
这篇文章介绍欧盟新车强制驾驶员注意力监控系统的要求,焦点是车内摄像头和分心/疲劳驾驶检测。它把道路安全目标和车内传感器常态化放在一起讨论。对汽车软件和隐私合规来说,驾驶舱正在变成持续感知环境。
Better Auth is joining Vercel38better-auth.com原文 ↗
Better Auth 官方宣布加入 Vercel,项目定位是 TypeScript 生态里的认证方案。交易的实际影响会落在开发者体验、部署集成和全栈框架生态上,而不是单纯品牌归属变化。它也说明 auth 这类基础能力正在被平台厂商纳入更完整的应用开发链路。
Astro 7.039astro.build原文 ↗
Astro 发布 7.0 major release,开发者需要关注升级变化、构建链路和生态包兼容性。Astro 的核心路线仍围绕内容站点、islands 架构和多框架组件体验。作为 major version,这条新闻的价值在于判断现有 Astro 项目何时升级,以及哪些默认行为可能影响部署。
OpenSSH 10.4/10.4p1 Released40openssh.org原文 ↗
OpenSSH 发布 10.4/10.4p1 release notes,覆盖上游和 portable 版本。OpenSSH release notes 通常直接关系到安全修复、协议/算法调整、兼容性变化和工具行为。对运维和发行版维护者来说,这类版本说明比二手摘要更重要,因为配置影响往往藏在细节里。
Microsoft fire idTech team at Id software41gamefromscratch.com原文 ↗
GameFromScratch 报道称 Microsoft 裁撤 id Software 的 idTech 团队。idTech 是 Doom 等系列背后的核心技术栈,因此团队变化不只是普通人事新闻,也可能影响内部引擎演进、工具维护和未来项目技术路线。需要把它放在微软游戏业务重组的大背景下读。
Resetting Xbox42news.xbox.com原文 ↗
Xbox 官方发布“Resetting Xbox”说明,给出业务重组和平台策略的官方表述。它讨论的是 Xbox 如何调整组织、产品重点和跨设备游戏平台方向。相比传闻类裁员消息,这条更适合作为微软自己对游戏业务变化的引用来源。
Nintendo announces new product revisions in Europe with replaceable batteries43nintendo.com原文 ↗
Nintendo 公布欧洲部分产品即将进行可替换电池相关修订。公告指向硬件设计对电池法规、维修可持续性和欧洲市场要求的响应。它显示 right-to-repair 与电池可维护性正在改变消费电子产品的区域版本设计。
Microsoft Can Track Users via a Windows Device ID44pcmag.com原文 ↗
PCMag 报道一起黑客被捕案件中暴露出的 Windows device ID 追踪能力。技术焦点在于设备标识如何关联用户、设备和活动记录,而不是案件猎奇本身。它触及操作系统遥测、账户体系和执法取证之间的边界。
Europe's company websites are mostly served by US vendors45ciphercue.com原文 ↗
Ciphercue 分析欧洲公司网站的托管和供应商分布,结论指向大量欧洲企业网站仍由美国供应商服务。这个角度把数字主权问题具体化到网页供应链、托管、CDN 和服务商选择上。它提供的不是政策口号,而是从网站基础设施观察依赖关系。
Small AI Models Gain Traction In places with unreliable networks46spectrum.ieee.org原文 ↗
IEEE Spectrum 报道小模型在网络不稳定环境中的部署案例,强调 small language models 的价值不只来自成本。离线、低带宽、边缘设备和高可靠要求会让较小模型比云端大模型更可用。它说明 AI 部署的约束条件常常是网络和运维,而不是榜单能力。
AMD Ryzen AI Halo - $4k AI Dev Kit47lttlabs.com原文 ↗
LTT Labs 评测 AMD Ryzen AI Halo 开发套件,标题给出的价格约为 4000 美元。评测关注 CPU/GPU/NPU 组合、内存带宽、软件栈和实际推理体验。这个产品的判断点不是“能不能跑 AI”,而是同价位下相对工作站、GPU 盒子和云服务是否有合理位置。
博客文章 · Blog Posts
11 项 · 博客文章sqlite-utils 4.0, now with database schema migrations49simonwillison.net原文 ↗
Simon Willison 记录 sqlite-utils 4.0,新版本加入 database schema migrations,并提到 nested transactions 和 compound foreign keys。sqlite-utils 原本偏向快速操作 SQLite,现在开始覆盖版本化 schema 演进。对小型数据应用来说,这让 SQLite 项目也能采用更接近生产数据库的迁移流程。
tencent/Hy350simonwillison.net原文 ↗
Simon Willison 记录 Tencent Hy3 的模型规模、许可和基准信息,把模型发布整理成开发者可判断的几个硬指标。文章关注的不只是“又一个模型”,而是参数规模、许可证限制、公开 benchmark 和推理门槛。这样的短评适合快速判断是否值得下载、试跑或纳入评测池。
You Only Need 1 Layer for RLVR?51mail.bycloud.ai原文 ↗
The AI Timeline 这期覆盖 7 月 1 日至 7 日的 AI research/news,标题抓住 RLVR 只需一层的讨论。它把一周论文、发布和社区动向放在同一封邮件中,适合观察研究主题如何在几天内聚集。RLVR 话题本身指向推理训练、验证器和强化学习成本的再评估。
not much happened today52news.smol.ai原文 ↗
smol.ai 汇总 2026-07-04 至 2026-07-06 的 AI 社区动态。标题很轻,但内容属于社区脉搏型日报,覆盖模型、工具、发布和讨论串。它的价值在正式论文之外:很多工程趋势会先以仓库、demo 和社交讨论的形式出现。
AI Meets Cryptography 1: What AI Found in Cloudflare's Circl53blog.zksecurity.xyz原文 ↗
zkSecurity 记录 AI 辅助分析 Cloudflare Circl 加密库 bug 的过程。文章把模型用于真实密码学代码审计,而不是人为构造的玩具漏洞。它的看点是双重的:AI 可以加速可疑实现的定位,但密码学语义和风险判断仍需要专家把关。
Local, CPU-Friendly, High-Quality TTS with Kokoro54ariya.io原文 ↗
Ariya Hidayat 演示在本地 CPU 上运行 Kokoro TTS,主题是 local、CPU-friendly、high-quality text-to-speech。文章围绕安装、模型调用和本地语音生成体验展开,强调无需云 API 或 GPU 也能得到可用结果。它代表了语音生成从云服务向本地轻量部署迁移的一条实用路径。
Why we built yet another Postgres connection pooler55pgdog.dev原文 ↗
PgDog 解释为什么还需要一个 Postgres connection pooler,从现有方案限制切入讨论连接复用、负载均衡、故障转移和查询路由。文章不是简单复刻 PgBouncer,而是面向更复杂的 Postgres 集群工作负载。它适合读来理解 pooler 在云数据库和多节点架构中承担的范围正在扩大。
Your Rust Service Isn't Leaking - It Could Be the Allocator56pranitha.dev原文 ↗
文章解释 Rust 服务 RSS 增长不一定等同逻辑内存泄漏,allocator 可能保留已释放内存以便复用。它提醒排查时区分对象仍被引用、碎片化、arena/cache 行为和操作系统归还策略。这个角度对生产服务很实际,因为“看起来占用不降”常常会被误判成 Rust 代码泄漏。
Notes on Software Quality57anthonyhobday.com原文 ↗
Anthony Hobday 把软件质量拆成多个维度和权衡,而不是给一个单一分数。文章讨论可靠性、可维护性、性能、可理解性、一致性、可测试性等属性如何互相牵制。它适合用于工程评审语言:先说清楚质量指哪一类质量,再讨论取舍。
GLM 5.2 and the coming AI margin collapse58martinalderson.com原文 ↗
Martin Alderson 分析 GLM 5.2 的价格、性能和推理成本结构,并把它放到 AI margin collapse 的商业叙事中。文章的核心判断是模型能力趋近和价格下降会挤压 API 提供商与应用层利润空间。它不是模型测评本身,而是用模型发布观察 AI 服务经济结构的变化。
GitHub 热门 · GitHub Trending
10 项 · GitHub 热门altic-dev/FluidVoice59github.com原文 ↗
FluidVoice 是 macOS 本地语音转文字应用,带 on-device STT 和文本增强模型。它把录音、转写、润色或格式化尽量留在本机完成,减少云服务依赖。项目适合观察桌面端语音输入如何从“调用在线听写”变成可组合的本地 AI 输入层。
huggingface/speech-to-speech60github.com原文 ↗
Hugging Face 的 speech-to-speech 是模块化本地 voice-agent pipeline,组件包括 VAD、STT、LLM、TTS,并提供 OpenAI Realtime 兼容 WebSocket API。它把实时语音 agent 拆成可替换模块,方便开发者在本地组合不同模型。兼容 Realtime API 是一个实际工程点:现有客户端可以较低成本迁移或对比实现。
immich-app/immich61github.com原文 ↗
Immich 是自托管照片和视频管理系统,覆盖移动端自动备份、网页浏览、媒体管理、搜索和家庭共享等功能。它的目标是提供接近消费级云相册的体验,但数据放在用户自己的服务器上。项目长期热门说明个人数据应用里,自托管并不只追求“能用”,还要追上主流产品体验。
ComposioHQ/awesome-claude-skills62github.com原文 ↗
awesome-claude-skills 是 Claude Skills、插件和 agent workflow 的资源列表。它以 curated list 的方式整理技能包、扩展和示例工作流,价值主要来自发现和分类。这个仓库反映 Claude Skills 生态正在从零散技巧转向可复用组件目录。
JuliusBrussee/caveman63github.com原文 ↗
Caveman 是面向 AI coding agent 的 skill/plugin,用更短、更直接的输出风格减少 token 消耗。它约束 agent 的沟通方式和中间叙述,把上下文预算留给代码、命令和关键状态。这个项目很小,但抓住了 coding agent 的真实成本项:语言冗余也会吃掉窗口和账单。
TibixDev/winboat64github.com原文 ↗
Winboat 试图在 Linux 上运行 Windows 应用并提供桌面集成。它关注的不只是“能启动 Windows 程序”,还包括窗口、文件和日常桌面体验的衔接。对于 Linux 桌面用户,这类项目的价值取决于兼容层和交互整合是否足够无感。
Dokploy/dokploy65github.com原文 ↗
Dokploy 是自托管 PaaS,定位为 Vercel、Netlify、Heroku 的开源替代品。它提供应用部署、数据库、Docker/Compose 工作流、域名和证书等能力,让团队在自有服务器上获得平台化部署体验。项目看点是把“买一台 VPS”与“维护一套部署平台”之间的操作鸿沟继续缩小。
tonhowtf/omniget66github.com原文 ↗
Omniget 是 Tauri/Rust 桌面应用,用于下载、整理和学习媒体内容。它把下载管理、媒体归档和学习流程放进同一个本地工具,面向视频、音频和资料收集后的继续使用。这个项目体现了 Tauri/Rust 桌面应用在个人知识和媒体工具上的扩张。
bradautomates/claude-video67github.com原文 ↗
claude-video 是让 Claude 下载、抽帧、转录并处理视频的 skill。它把视频转换成模型可操作的文本、图像帧和时间线信息,使 Claude 能总结、分析或引用片段。这个仓库的实用点在于把多模态材料预处理包装成 agent 可调用工作流。
karakeep-app/karakeep68github.com原文 ↗
Karakeep 是自托管 bookmark-everything 应用,支持链接、笔记、图片、AI tagging 和全文搜索。它把稍后读、资料收藏和个人知识库合在一起,并用自动标签和搜索降低整理成本。作为 trending 项目,它说明个人信息管理仍在向“全类型收藏 + 本地可控 + AI 辅助整理”靠拢。
引用来源 · References
68 条 · 引用- 1 AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents. arXiv:2607.02599https://arxiv.org/abs/2607.02599 ↩ 回到正文 · back to text
- 2 CoACT: Action-Preserving Observation Compression for Coding Agents. arXiv:2607.02911https://arxiv.org/abs/2607.02911 ↩ 回到正文 · back to text
- 3 ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents. arXiv:2607.04686https://arxiv.org/abs/2607.04686 ↩ 回到正文 · back to text
- 4 CLRK, an open-source agent runtime with gVisor and MitM guardrails. GitHub repositoryhttps://github.com/apoxy-dev/clrk ↩ 回到正文 · back to text
- 5 Chrome DevTools MCP. GitHub repositoryhttps://github.com/ChromeDevTools/chrome-devtools-mcp ↩ 回到正文 · back to text
- 6 SwarmResearch: Orchestrating Coding Agents for Open-Ended Discovery. arXiv:2607.02807https://arxiv.org/abs/2607.02807 ↩ 回到正文 · back to text
- 7 Object-Centric Environment Modeling for Agentic Tasks. arXiv:2607.02846https://arxiv.org/abs/2607.02846 ↩ 回到正文 · back to text
- 8 PLACEMEM: Toward a Compute-Aware Memory Plane for Lifelong Agents. arXiv:2607.04089https://arxiv.org/abs/2607.04089 ↩ 回到正文 · back to text
- 9 MRMS: A Multi-Resolution Memory Substrate for Long-Lived AI Agents. arXiv:2607.04617https://arxiv.org/abs/2607.04617 ↩ 回到正文 · back to text
- 10 Agent Step Value: State-Transition Measurement with State-Grounded LLM Evaluators. arXiv:2607.04419https://arxiv.org/abs/2607.04419 ↩ 回到正文 · back to text
- 11 Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents. arXiv:2607.04528https://arxiv.org/abs/2607.04528 ↩ 回到正文 · back to text
- 12 AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments. arXiv:2607.05174https://arxiv.org/abs/2607.05174 ↩ 回到正文 · back to text
- 13 Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure. arXiv:2607.04334https://arxiv.org/abs/2607.04334 ↩ 回到正文 · back to text
- 14 FORGE: Research-Trajectory Hijacking Attacks on Deep Research Agents. arXiv:2607.04718https://arxiv.org/abs/2607.04718 ↩ 回到正文 · back to text
- 15 DualView: Preventing Indirect Prompt Injection in Personal AI Agents. arXiv:2607.03821https://arxiv.org/abs/2607.03821 ↩ 回到正文 · back to text
- 16 Agent Data Injection Attacks are Realistic Threats to AI Agents. arXiv:2607.05120https://arxiv.org/abs/2607.05120 ↩ 回到正文 · back to text
- 17 PEEK: Predictive Queue-Informed KV Cache Management for LLM Serving. arXiv:2607.02525https://arxiv.org/abs/2607.02525 ↩ 回到正文 · back to text
- 18 From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving. arXiv:2607.02574https://arxiv.org/abs/2607.02574 ↩ 回到正文 · back to text
- 19 SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference. arXiv:2607.03333https://arxiv.org/abs/2607.03333 ↩ 回到正文 · back to text
- 20 The Remarkable Effectiveness of Providing AI Agents with Natural Language Tools. arXiv:2607.03953https://arxiv.org/abs/2607.03953 ↩ 回到正文 · back to text
- 21 Rowboat. GitHub repositoryhttps://github.com/rowboatlabs/rowboat ↩ 回到正文 · back to text
- 22 Docx-CLI. GitHub repositoryhttps://github.com/kklimuk/docx-cli ↩ 回到正文 · back to text
- 23 Davithttps://davit.app ↩ 回到正文 · back to text
- 24 Fencehttps://news.ycombinator.com/item?id=48821039 ↩ 回到正文 · back to text
- 25 Wayflowhttps://wayflow.build/ ↩ 回到正文 · back to text
- 26 Revector. GitHub repositoryhttps://github.com/diegoglozano/revector ↩ 回到正文 · back to text
- 27 Graphene. GitHub repositoryhttps://github.com/alexghr/graphene ↩ 回到正文 · back to text
- 28 TextGrab. GitHub repositoryhttps://github.com/notune/TextGrab ↩ 回到正文 · back to text
- 29 Shadow Web. GitHub repositoryhttps://github.com/ulinycoin/shadow-web ↩ 回到正文 · back to text
- 30 Claude Code Live Memory. GitHub repositoryhttps://github.com/shofer-dev/claude-code-live-memory ↩ 回到正文 · back to text
- 31 L9gpu. GitHub repositoryhttps://github.com/last9/gpu-telemetry ↩ 回到正文 · back to text
- 32 Ternlighthttps://ternlight-demo.vercel.app/ ↩ 回到正文 · back to text
- 33 Fable turned reMarkable into Tom Riddle's diary from Harry Potter. GitHub repositoryhttps://github.com/MaximeRivest/Riddle ↩ 回到正文 · back to text
- 34 CoMapshttps://www.comaps.app/ ↩ 回到正文 · back to text
- 35 OpenWrt Onehttps://openwrt.org/toh/openwrt/one ↩ 回到正文 · back to text
- 36 Chat Control passed first round in EU Parliamenthttps://www.heise.de/en/news/Showdown-in-Strasbourg-The-unexpected-return-of-Chat-Control-1-0-11356680.html ↩ 回到正文 · back to text
- 37 Every new car sold in the European Union must include a driver monitoring camerahttps://allaboutcookies.org/eu-mandatory-distracted-driver-system ↩ 回到正文 · back to text
- 38 Better Auth is joining Vercelhttps://better-auth.com/blog/better-auth-joins-vercel ↩ 回到正文 · back to text
- 39 Astro 7.0https://astro.build/blog/astro-7/ ↩ 回到正文 · back to text
- 40 OpenSSH 10.4/10.4p1 Releasedhttps://www.openssh.org/txt/release-10.4 ↩ 回到正文 · back to text
- 41 Microsoft fire idTech team at Id softwarehttps://gamefromscratch.com/microsoft-fire-idtech-team-at-id-software/ ↩ 回到正文 · back to text
- 42 Resetting Xboxhttps://news.xbox.com/en-us/2026/07/06/resetting-xbox/ ↩ 回到正文 · back to text
- 43 Nintendo announces new product revisions in Europe with replaceable batterieshttps://www.nintendo.com/en-gb/Support/Nintendo-Switch-2/Information-about-upcoming-battery-related-revisions-to-some-Nintendo-products-3132901.html ↩ 回到正文 · back to text
- 44 Microsoft Can Track Users via a Windows Device IDhttps://www.pcmag.com/news/a-hackers-arrest-reveals-microsoft-can-track-users-via-a-windows-device ↩ 回到正文 · back to text
- 45 Europe's company websites are mostly served by US vendorshttps://ciphercue.com/blog/european-web-hosting-vendor-share-2026 ↩ 回到正文 · back to text
- 46 Small AI Models Gain Traction In places with unreliable networkshttps://spectrum.ieee.org/small-language-models-ai-pharmaceuticals ↩ 回到正文 · back to text
- 47 AMD Ryzen AI Halo - $4k AI Dev Kithttps://www.lttlabs.com/articles/2026/07/06/amd-ryzen-ai-halo ↩ 回到正文 · back to text
- 48 Harness Engineering for Self-Improvementhttps://lilianweng.github.io/posts/2026-07-04-harness/ ↩ 回到正文 · back to text
- 49 sqlite-utils 4.0, now with database schema migrationshttps://simonwillison.net/2026/Jul/7/sqlite-utils-4/#atom-everything ↩ 回到正文 · back to text
- 50 tencent/Hy3https://simonwillison.net/2026/Jul/6/hy3/#atom-everything ↩ 回到正文 · back to text
- 51 You Only Need 1 Layer for RLVR?https://mail.bycloud.ai/p/you-only-need-1-layer-for-rlvr ↩ 回到正文 · back to text
- 52 not much happened todayhttps://news.smol.ai/issues/26-07-06-not-much/ ↩ 回到正文 · back to text
- 53 AI Meets Cryptography 1: What AI Found in Cloudflare's Circlhttps://blog.zksecurity.xyz/posts/circl-bugs/ ↩ 回到正文 · back to text
- 54 Local, CPU-Friendly, High-Quality TTS with Kokorohttps://ariya.io/2026/03/local-cpu-friendly-high-quality-tts-text-to-speech-with-kokoro/ ↩ 回到正文 · back to text
- 55 Why we built yet another Postgres connection poolerhttps://pgdog.dev/blog/why-yet-another-connection-pooler ↩ 回到正文 · back to text
- 56 Your Rust Service Isn't Leaking - It Could Be the Allocatorhttps://pranitha.dev/posts/rust-and-memory-allocators/ ↩ 回到正文 · back to text
- 57 Notes on Software Qualityhttps://anthonyhobday.com/blog/20260410 ↩ 回到正文 · back to text
- 58 GLM 5.2 and the coming AI margin collapsehttps://martinalderson.com/posts/the-upcoming-ai-margin-collapse-part-1-glm-5-2/ ↩ 回到正文 · back to text
- 59 altic-dev/FluidVoice. GitHub repositoryhttps://github.com/altic-dev/FluidVoice ↩ 回到正文 · back to text
- 60 huggingface/speech-to-speech. GitHub repositoryhttps://github.com/huggingface/speech-to-speech ↩ 回到正文 · back to text
- 61 immich-app/immich. GitHub repositoryhttps://github.com/immich-app/immich ↩ 回到正文 · back to text
- 62 ComposioHQ/awesome-claude-skills. GitHub repositoryhttps://github.com/ComposioHQ/awesome-claude-skills ↩ 回到正文 · back to text
- 63 JuliusBrussee/caveman. GitHub repositoryhttps://github.com/JuliusBrussee/caveman ↩ 回到正文 · back to text
- 64 TibixDev/winboat. GitHub repositoryhttps://github.com/TibixDev/winboat ↩ 回到正文 · back to text
- 65 Dokploy/dokploy. GitHub repositoryhttps://github.com/Dokploy/dokploy ↩ 回到正文 · back to text
- 66 tonhowtf/omniget. GitHub repositoryhttps://github.com/tonhowtf/omniget ↩ 回到正文 · back to text
- 67 bradautomates/claude-video. GitHub repositoryhttps://github.com/bradautomates/claude-video ↩ 回到正文 · back to text
- 68 karakeep-app/karakeep. GitHub repositoryhttps://github.com/karakeep-app/karakeep ↩ 回到正文 · back to text