每日 Harness 开源 · Source
全部刊期 · All issues

每日 Harness

2026-07-04 · Saturday, July 4, 2026

智能体进入可审计时代

视图 · View

今日重点 · Today's Highlights

Agent4cs2 - 这篇论文把大型代码库摘要从“把仓库塞进上下文”改成多 agent 按层级和依赖协作,适合观察代码理解 agent 如何利用结构信息。

全文 ↓

SemHash-LLM3 - 多粒度语义哈希把 MinHash、对比学习和 LLM 判别串起来,针对训练数据清洗里最麻烦的近重复文档。

全文 ↓

Chrome DevTools MCP4 - Chrome DevTools 团队把真实浏览器调试能力暴露给 MCP,前端 coding agent 可以直接检查 DOM、网络、控制台和性能状态。

全文 ↓

Mcpsnoop5 - MCP 透明代理加实时 TUI,让 agent 与 MCP server 的协议消息可以被现场观察,是调试工具生态开始成熟的信号。

全文 ↓

论文 · Papers

12 项 · 论文

本期重点Agent4cs: A Multi-agent System for Code Summarization in Large Hierarchical Codebases2arxiv.org原文 ↗

Agent4cs 做的是大型分层代码库摘要:先识别目录、模块和依赖关系,再让多个 agent 生成局部摘要、关系摘要和顶层说明。关键机制是显式利用 hierarchical structure 和 dependency links,而不是把仓库当作一段超长文本处理。它值得看在于代码摘要问题被重新表述为结构化协作任务,这比单 agent 长上下文总结更接近真实大型仓库的维护方式。

Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows6arxiv.org原文 ↗

论文把 RLVR 用到 Atlassian 工作流里的工具调用 agent,奖励来自可验证的 API 调用顺序、参数完整性和任务状态,而不是只看自然语言回答。具体任务围绕 issue、workspace、project 等 SaaS 操作,强调 agent 必须按业务流程完成状态变化。它的看点是把工具调用训练从“像不像答案”推进到“外部系统是否真的被正确操作”。

Janus: a Playground for User-Involved Agentic Permission Management7arxiv.org原文 ↗

Janus 构建了一个研究 agent 权限管理的 playground,把用户确认、授权策略、工具调用控制和执行轨迹放在同一个实验环境中。它比较的对象包括用户参与程度不同的 permission flow,而不是只给 agent 一个静态 allowlist。论文的价值在于把 agent 安全从抽象原则落到交互协议:什么时候问用户、问什么、授权后如何限制工具能力。

本期重点SemHash-LLM: A Multi-Granularity Semantic Hashing Framework for Document Deduplication3arxiv.org原文 ↗

arxiv.org

SemHash-LLM 面向大规模文档去重,组合 MinHash 候选召回、对比学习语义表示和 LLM 判别,覆盖完全重复、局部重复和语义改写。多粒度设计是关键事实:它不是只在整篇文档上做相似度,而是同时处理片段和文档级别的重复。这个方向适合训练语料清洗,因为近重复数据会污染评测、放大记忆,并降低语料多样性。

Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling8arxiv.org原文 ↗

论文研究 LLM 置信度校准,并把置信信号用于决定测试时是否增加采样、验证或推理计算。关键设定是 adaptive test-time scaling:预算不是固定平均分配,而是向低置信问题倾斜。它值得跟进,因为测试时扩展如果没有可靠置信度,很容易把计算浪费在模型本来已经能解的问题上。

Diverse Evidence, Better Forecasts: Multi-Agent Deliberation Under Information Asymmetry9arxiv.org原文 ↗

这篇论文分析多 agent 预测在信息不对称下的 deliberation:不同 agent 持有不同证据,再通过讨论形成群体判断。核心事实是它把 evidence diversity 作为实验变量,观察讨论机制是否改善校准和预测质量。它提供了一个有用视角:多 agent 的收益不来自 agent 数量本身,而来自证据分布和汇总协议是否真的互补。

本期重点Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification1arxiv.org原文 ↗

Vera 提供端到端 agent 安全测试流程,先自动发现风险,再从执行轨迹里抽取证据,最后用 evidence-grounded verification 判定问题是否成立。论文的关键贡献是把 red-teaming 的主观判断拆成三个可审计步骤,尤其适合有工具调用、文件访问或外部 API 的 agent。它值得读,因为安全测试的难点已从“能否写出坏 prompt”转向“能否大规模证明 agent 真的做了危险动作”。

SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use10arxiv.org原文 ↗

SkillCoach 研究 agent 对可复用 skill 的选择和执行质量,用自演化 rubric 从轨迹中更新评价标准。它不是只打一个 pass/fail 分数,而是让 rubric 随任务分布提炼新的评分维度。技术意义在于 skill-based agent 需要可维护的评估体系,否则 skill 数量增长后很难判断 agent 是选错技能、参数错了,还是执行策略不合适。

Rethinking Complexity Metrics for LLM-Integrated Applications: Beyond Source Code11arxiv.org原文 ↗

HECATE 认为 LLM 应用复杂度不能只看源代码,还要把 prompt、上下文拼装、模型调用和非确定性行为纳入度量。论文的具体转向是从传统 code complexity 扩展到 prompt-layer behavior,这覆盖了 RAG、agent 和多阶段 LLM workflow 中最容易被静态分析漏掉的部分。它值得一读,因为 LLM 应用的维护成本往往藏在 prompt 与运行时交互里,而不是函数圈复杂度里。

A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory12arxiv.org原文 ↗

Agent 记忆其他垂直

A-TMA 讨论长期 agent 记忆里的 state-aware failure,尤其是 ghost memory:旧事实、当前事实和状态转移事实在检索时混到一起。论文的关键拆分是把记忆错误和状态变化绑定,要求记忆系统理解事实何时失效、何时被替代。它切中长期 agent 的实际问题:向量相似度能找回相关片段,却不保证找回的是当前世界状态下仍然成立的片段。

PACE: A Proxy for Agentic Capability Evaluation13arxiv.org原文 ↗

评测方法基准其他垂直

PACE 试图用更便宜的非 agentic 能力测试预测昂贵 agent benchmark 的结果,目标包括 SWE-Bench、GAIA 这类需要长轨迹和环境验证的评测。关键事实是它把模型筛选前置为 proxy evaluation,减少每次都运行完整 agent benchmark 的成本。这个方向适合评测工程,因为 agent benchmark 的价格、时延和不稳定性正在成为模型迭代的现实瓶颈。

ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning14arxiv.org原文 ↗

ReContext 提出 recursive evidence replay,用 harness 反复检查模型是否真正利用长上下文中已给出的证据。它关注的不是扩大 context window,而是追踪模型在长文档中是否回到关键证据并保持推理一致。这个问题在法律、审计、研究综述和复杂客服场景都很具体:答案看似合理并不等于证据链被正确使用。

开源 / 项目 · Projects

12 项 · 开源 / 项目

本期重点Mcpsnoop5github.com原文 ↗

Mcpsnoop 是一个 MCP 透明代理和实时 TUI,插在 agent 与 MCP server 之间显示请求、响应和工具调用。关键设计是代理层观察协议消息,因此不需要改造每个 server 才能调试。它适合 MCP 工具链开发者,因为很多 agent 失败不是模型回答错,而是工具参数、返回结构或协议状态在中间出了问题。

pxpipe15github.com原文 ↗

pxpipe 把代码转成图像,再让模型通过 OCR 读取,目标是在 Claude/Fable 等工作流里降低文本上下文成本。这个项目的具体实验点是把代码上下文从 token 序列换成视觉载体,绕开一部分 BPE 计费和窗口压力。它不是通用生产方案,但作为“上下文压缩可以跨模态”的探索很有技术味道。

Opbox16opbox.dev原文 ↗

opbox.dev

Opbox 是基于 CRDT 的本地文本文件同步 daemon,把一个普通目录变成多人协作工作区。它的做法保留本地文件工作流,同时处理实时编辑、冲突合并和状态同步。这个项目有意思的地方在于它没有要求用户迁移到专有文档系统,而是试图把协作能力贴到已有文件系统语义上。

Mycli 2.017github.com原文 ↗

github.com

Mycli 是 MySQL/MariaDB 交互式 REPL,2.0 版加入 fuzzy history、LLM 命令、结果重定向、keyring 和批处理恢复能力。具体变化覆盖查询历史、凭据处理、脚本化和 AI 辅助命令,而不是单点 UI 调整。它值得数据库工具用户关注,因为命令行 SQL 客户端正在从“输入查询”演化成更完整的本地数据工作台。

Contextify18contextify.sh原文 ↗

Contextify 本地索引 Claude Code 和 Codex 会话,支持跨工具检索历史 transcript。它做的不是把所有旧对话塞进 prompt,而是把过往决策、命令、代码修改和讨论变成可搜索材料。对于长期项目,这类工具的核心价值是找回上下文来源,而不是幻想原始 transcript 本身就是高质量记忆。

Quicktok19github.com原文 ↗

上下文工程系统·基础设施

Quicktok 是精确 BPE tokenizer,项目描述称比 tiktoken 更快。它瞄准的是 token 计数、截断、批量预处理和上下文预算估算这类底层路径,而这些路径在高吞吐 RAG 或日志处理系统里会被频繁调用。值得注意的是 tokenizer 性能经常被忽略,但它会直接影响服务端延迟和离线数据处理成本。

TaskPeace20taskpeace.com原文 ↗

TaskPeace 把任务队列通过 MCP 暴露给 AI coding agents,让 agent 可以拉取、处理并回写工作项。它把人给 agent 的工作从一次性自然语言委托改成 queue-based dispatch,边界更像持续集成系统里的 job。这个形态适合多 agent 或多人协作场景,因为任务状态、所有权和重复执行需要被显式管理。

Scopewalker21github.com原文 ↗

Scopewalker 是本地只读 MCP server,为 agent 提供代码行数、复杂度、嵌套深度和参数数量等指标。它通过工具调用把代码库形状暴露给模型,帮助 agent 在重构或审查前判断风险区域。这个项目的亮点是克制:只读指标不会替模型做决定,却能减少模型对代码规模和复杂度的主观猜测。

MothRAG22github.com原文 ↗

检索与知识接地数据·分析

MothRAG 是多跳 RAG 项目,强调不依赖图重建来完成跨文档推理。它瞄准的问题是复杂查询常常需要把多段证据串起来,而图构建和维护成本会拖慢迭代。项目值得观察,因为多跳检索如果能用更轻量流程实现,会降低许多企业知识库从单跳问答升级到复杂推理的门槛。

Brume23brumeorg.github.io原文 ↗

brumeorg.github.io

Brume 是 Postgres 假名化工具,重点是在脱敏数据时保持跨表外键关系一致。它处理的是开发、测试和分析环境常见痛点:单列 mask 很容易破坏引用关系,让数据形状失真。这个项目有实际工程价值,因为可用的脱敏数据必须同时满足隐私约束和关系完整性。

Wordgard24wordgard.net原文 ↗

wordgard.net

Wordgard 是 ProseMirror 作者开发的新浏览器富文本编辑器。它的技术看点在文档模型、选择状态、复杂编辑交互和扩展性,而不是又包一层 contenteditable。富文本编辑器长期是前端工程里最容易低估的领域,作者背景让这个项目值得观察其底层模型如何取舍。

zkGolf25zk.golf原文 ↗

zk.golf

zkGolf 是零知识电路优化竞赛平台,目标是减少约束数量和证明成本。它把 zk 工程优化做成可比较的题目和指标,关注 constraint count、proof cost 和 verification efficiency。这个平台的意义在于把抽象密码学实现拉回工程基准:同一个功能电路,不同写法的成本差异可以非常具体。

行业动态 · Industry News

10 项 · 行业动态

Google loses fight over record $4.7B EU antitrust fine26cnbc.com原文 ↗

cnbc.com

CNBC 报道 Google 在 Android 相关欧盟反垄断罚款上诉中失利,案件围绕 Android 生态里的搜索、浏览器和应用商店捆绑行为。报道给出的核心数字是约 47 亿美元罚款,这仍是平台监管中非常大的单案规模。这条新闻说明欧盟对移动操作系统默认入口和分发控制的监管路线没有松动。

Alibaba to ban Claude Code in workplace over alleged backdoor risks, source says27reuters.com原文 ↗

Reuters 报道称,Alibaba 因所谓后门风险计划在工作场景禁用 Claude Code。这里的关键事实不是某个单独工具被点名,而是企业开始把 AI coding agent 的仓库访问、命令执行和外部服务连接视为安全审计对象。它反映了 coding agent 进入公司内网后,合规团队会把模型能力与供应链风险放在同一张表里评估。

Gemini Code Assist will be shut down on July 1728docs.cloud.google.com原文 ↗

docs.cloud.google.com

Google Cloud 文档显示 Gemini Code Assist 的 repo code review 功能将在 7 月 17 日停止。这个日期很具体,意味着依赖该功能做仓库级自动 review 的团队需要迁移工作流。它也提醒开发者,平台托管的 AI review 功能仍处在快速调整期,产品名字稳定并不等于接口和能力稳定。

Virginia bans sale of precise geolocation data29hunton.com原文 ↗

hunton.com

Hunton 隐私律师博客整理了 Virginia 对出售精确地理位置数据的新限制。关键变化是 precise geolocation data 被作为高敏感类别单独处理,影响数据经纪、广告技术和移动 SDK 生态。此类州级法律继续把隐私监管从“告知与同意”推向对具体数据交易行为的直接限制。

AI Data Centers Use More Water Than Most Tech Giants Report30wsj.com原文 ↗

wsj.com

WSJ 报道 AI 数据中心用水统计与大型科技公司披露口径之间存在差距,争议集中在外包设施、间接用水和区域水资源压力是否完整计入。文章把 AI 基础设施成本从电力扩展到水资源,尤其是冷却和本地供水约束。它值得产业侧关注,因为环境披露口径会影响数据中心选址、许可和社区关系。

Amazon has enough satellites to launch its Starlink competitor31theverge.com原文 ↗

theverge.com

The Verge 报道 Amazon 的低轨卫星网络已经达到启动 Starlink 竞争服务所需规模。新闻围绕 Project Kuiper 从试验部署跨过商业服务门槛展开,后续压力会转向覆盖、终端、容量和服务定价。它说明卫星互联网竞争正在从“能否发射”进入“能否运营可用网络”的阶段。

Valve open-source the Steam Machine e-ink screen so you can make your own32gamingonlinux.com原文 ↗

gamingonlinux.com

GamingOnLinux 整理称 Valve 开源 Steam Machine e-ink 屏幕相关设计和软件,让用户可以制作或改造类似模块。关键点是开源内容覆盖硬件周边与控制软件,而不是只发布展示图片。它对硬件社区的意义在于,游戏设备生态的附属显示和状态屏可以被复制、移植和二次开发。

Podman v6.0.033blog.podman.io原文 ↗

blog.podman.io

Podman 官方博客发布 6.0.0,列出容器运行时、CLI 和工具链更新。作为无 daemon、OCI 兼容、强调 rootless 的容器栈,Podman 大版本变化通常会影响本地开发、CI、镜像管理和 Docker 替代路径。对平台工程团队来说,这类发布需要重点看兼容性、网络和 compose 相关变化,而不只是版本号升级。

The Safari MCP server for web developers34webkit.org原文 ↗

WebKit 团队发布 Safari MCP server,让开发工具和 agent 可以控制 Safari、检查页面并执行调试任务。它把 MCP 接到真实浏览器运行时,使 agent 能根据 Safari 的实际渲染、网络和开发者工具状态行动。随着 Chrome 和 Safari 都出现 MCP 调试入口,浏览器正在成为 coding agent 的一等工具环境。

Core dump epidemiology: fixing an 18-year-old bug35openai.com原文 ↗

openai.com

OpenAI 工程博客复盘一个存在 18 年的数据基础设施 bug,核心方法是把大量 core dump 当作可分析样本来找分布、聚类和共同因子。文章的具体事实是 bug 年龄达到 18 年,这类长期缺陷往往不能靠单次复现定位。它值得工程团队阅读,因为生产事故分析有时需要统计视角,而不是只追一条崩溃栈。

博客文章 · Blog Posts

10 项 · 博客文章

Open Source AI Gap Map36simonwillison.net原文 ↗

simonwillison.net

Simon Willison 介绍 Current AI 的 Gap Map v0.1,一个索引开源 AI 软件、工具和模型的目录。它不是模型排行榜,而是尝试按生态组件和能力空白组织开源 AI 资产。这个项目适合观察开源 AI 的缺口:哪些基础设施已有多种实现,哪些环节仍依赖少数闭源服务。

Fable's judgement37simonwillison.net原文 ↗

Simon Willison 记录 Claude Code 团队关于 Fable 的经验,重点是让模型自行判断何时测试、如何执行和何时停止。文章讨论的核心变量是 judgement:过度硬编码流程可能压制模型在具体上下文中的判断。它与“短反馈控制”形成有趣对照,说明 coding agent 的有效边界仍在工具约束和模型自主之间摆动。

llm-coding-agent 0.1a038simonwillison.net原文 ↗

Simon Willison 发布基于 `llm` Python 库的实验性 coding agent。这个版本把模型调用、文件编辑、命令执行和循环控制做成较小实现,便于理解 coding agent 的基本组成。它的价值在教育和实验:先看清最小闭环,再评估商业工具里复杂策略到底增加了什么。

not much happened today39news.smol.ai原文 ↗

news.smol.ai

smol.ai 汇总 2026-07-01 至 2026-07-02 的 AI 社区动态,标题轻描淡写,但内容覆盖模型、agent、工具链和社区讨论。它的具体时间范围是两天,适合看短周期信息密度而不是单条发布。此类日更通讯的作用是把分散在社交媒体、论文和 GitHub 的小信号整理成趋势脉络。

Memorizing session transcripts isn't useful4012gramsofcarbon.com原文 ↗

文章批评 agent 记忆系统直接保存完整会话 transcript 的做法,认为原始对话很快会变成噪声密集、检索困难的历史堆。它主张提炼决策、偏好、约束和长期事实,并记录哪些信息会过期。这个观点切中 agent memory 的核心:记忆不是存储越多越好,而是要把可复用信息从会话流水里蒸馏出来。

Understanding is the new bottleneck41geoffreylitt.com原文 ↗

Geoffrey Litt 讨论 AI 降低生成代码成本后,理解系统状态、业务约束、历史决策和副作用正在成为新的瓶颈。文章把开发效率问题从打字速度转向认知负荷,指出“能写更多代码”不等于“能安全改变系统”。它适合放在 agent 编程讨论里看,因为模型越能产出补丁,理解和验证就越成为稀缺环节。

The Short Leash AI Coding Method For Beating Fable42blog.okturtles.org原文 ↗

这篇文章描述短反馈周期的 AI coding 方法:小步任务、频繁检查、快速测试和明确边界。它的策略是把 agent 控制在短回路里,让人类持续校准方向,而不是把一个大目标交给模型长时间自主运行。这个方法的工程含义很直接:减少漂移、缩短回滚距离,并让错误在局部暴露。

Please stop the AI confidence theater43elenaverna.com原文 ↗

评测方法其他垂直

Elena Verna 批评 AI 产品叙事中的“confidence theater”,即界面和营销把不确定结果包装得过于确定。文章强调用户需要看到概率、限制和失败模式,才能判断何时信任、何时验证。它把模型校准问题转译成产品设计问题:不确定性不是缺陷提示语,而是交互契约的一部分。

PostgreSQL and the OOM killer: Why we use strict memory overcommit44ubicloud.com原文 ↗

ubicloud.com

Ubicloud 工程博客解释 PostgreSQL 部署中采用严格 memory overcommit 的原因,核心风险是 Linux OOM killer 在压力下杀掉关键数据库进程。文章把 Postgres 进程模型、内存承诺和失败模式连起来,说明更早、更可控的分配失败优于运行时随机崩溃。它是基础设施文章里很实用的一类:策略选择来自故障模型,而不是配置偏好。

14× faster embeddings: how we rebuilt the ONNX path in Manticore45manticoresearch.com原文 ↗

manticoresearch.com

Manticore Search 介绍重建 ONNX embedding 路径后获得 14 倍加速。优化集中在推理管线本身,包括减少数据转换、改进批处理和让向量生成更贴近搜索引擎执行模型。它提醒工程团队,embedding 性能不只由模型决定,周围的数据路径和执行器同样可能是主要瓶颈。

引用来源 · References

54 条 · 引用
  1. 1 Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification. arXiv:2607.01793https://arxiv.org/abs/2607.01793 ↩ 回到正文 · back to text
  2. 2 Agent4cs: A Multi-agent System for Code Summarization in Large Hierarchical Codebases. arXiv:2607.01425https://arxiv.org/abs/2607.01425 ↩ 回到正文 · back to text
  3. 3 SemHash-LLM: A Multi-Granularity Semantic Hashing Framework for Document Deduplication. arXiv:2607.01601https://arxiv.org/abs/2607.01601 ↩ 回到正文 · back to text
  4. 4 ChromeDevTools/chrome-devtools-mcp. GitHub: ChromeDevTools/chrome-devtools-mcphttps://github.com/ChromeDevTools/chrome-devtools-mcp ↩ 回到正文 · back to text
  5. 5 Mcpsnoop. GitHub: kerlenton/mcpsnoophttps://github.com/kerlenton/mcpsnoop ↩ 回到正文 · back to text
  6. 6 Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows. arXiv:2607.01465https://arxiv.org/abs/2607.01465 ↩ 回到正文 · back to text
  7. 7 Janus: a Playground for User-Involved Agentic Permission Management. arXiv:2607.01510https://arxiv.org/abs/2607.01510 ↩ 回到正文 · back to text
  8. 8 Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling. arXiv:2607.01612https://arxiv.org/abs/2607.01612 ↩ 回到正文 · back to text
  9. 9 Diverse Evidence, Better Forecasts: Multi-Agent Deliberation Under Information Asymmetry. arXiv:2607.01661https://arxiv.org/abs/2607.01661 ↩ 回到正文 · back to text
  10. 10 SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use. arXiv:2607.01874https://arxiv.org/abs/2607.01874 ↩ 回到正文 · back to text
  11. 11 Rethinking Complexity Metrics for LLM-Integrated Applications: Beyond Source Code. arXiv:2607.01903https://arxiv.org/abs/2607.01903 ↩ 回到正文 · back to text
  12. 12 A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory. arXiv:2607.01935https://arxiv.org/abs/2607.01935 ↩ 回到正文 · back to text
  13. 13 PACE: A Proxy for Agentic Capability Evaluation. arXiv:2607.02032https://arxiv.org/abs/2607.02032 ↩ 回到正文 · back to text
  14. 14 ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning. arXiv:2607.02509https://arxiv.org/abs/2607.02509 ↩ 回到正文 · back to text
  15. 15 pxpipe. GitHub: teamchong/pxpipehttps://github.com/teamchong/pxpipe ↩ 回到正文 · back to text
  16. 16 Opboxhttps://www.opbox.dev/ ↩ 回到正文 · back to text
  17. 17 Mycli 2.0. GitHub: dbcli/myclihttps://github.com/dbcli/mycli ↩ 回到正文 · back to text
  18. 18 Contextifyhttps://contextify.sh/ ↩ 回到正文 · back to text
  19. 19 Quicktok. GitHub: dmatth1/quicktokhttps://github.com/dmatth1/quicktok ↩ 回到正文 · back to text
  20. 20 TaskPeacehttps://taskpeace.com/ ↩ 回到正文 · back to text
  21. 21 Scopewalker. GitHub: timohaa/scopewalker-mcphttps://github.com/timohaa/scopewalker-mcp ↩ 回到正文 · back to text
  22. 22 MothRAG. GitHub: juliangeymonat-jpg/mothraghttps://github.com/juliangeymonat-jpg/mothrag ↩ 回到正文 · back to text
  23. 23 Brumehttps://brumeorg.github.io/ ↩ 回到正文 · back to text
  24. 24 Wordgardhttps://wordgard.net/ ↩ 回到正文 · back to text
  25. 25 zkGolfhttps://zk.golf/ ↩ 回到正文 · back to text
  26. 26 Google loses fight over record $4.7B EU antitrust finehttps://www.cnbc.com/2026/07/02/alphabet-google-android-eu-antitrust-fine-4-1-billion-euro-appeal.html ↩ 回到正文 · back to text
  27. 27 Alibaba to ban Claude Code in workplace over alleged backdoor risks, source sayshttps://www.reuters.com/world/china/alibaba-ban-claude-code-workplace-over-alleged-backdoor-risks-source-says-2026-07-03/ ↩ 回到正文 · back to text
  28. 28 Gemini Code Assist will be shut down on July 17https://docs.cloud.google.com/gemini/docs/code-review/review-repo-code ↩ 回到正文 · back to text
  29. 29 Virginia bans sale of precise geolocation datahttps://www.hunton.com/privacy-and-cybersecurity-law-blog/virginia-bans-sale-of-geolocation-data ↩ 回到正文 · back to text
  30. 30 AI Data Centers Use More Water Than Most Tech Giants Reporthttps://www.wsj.com/tech/ai/ai-data-centers-water-use-901e2902 ↩ 回到正文 · back to text
  31. 31 Amazon has enough satellites to launch its Starlink competitorhttps://www.theverge.com/science/960563/amazon-leo-service-tipping-point ↩ 回到正文 · back to text
  32. 32 Valve open-source the Steam Machine e-ink screen so you can make your ownhttps://www.gamingonlinux.com/2026/07/valve-open-source-the-steam-machine-e-ink-screen-so-you-can-make-your-own/ ↩ 回到正文 · back to text
  33. 33 Podman v6.0.0https://blog.podman.io/2026/07/introducing-podman-v6-0-0/ ↩ 回到正文 · back to text
  34. 34 The Safari MCP server for web developershttps://webkit.org/blog/18136/introducing-the-safari-mcp-server-for-web-developers/ ↩ 回到正文 · back to text
  35. 35 Core dump epidemiology: fixing an 18-year-old bughttps://openai.com/index/core-dump-epidemiology-data-infrastructure-bug/ ↩ 回到正文 · back to text
  36. 36 Open Source AI Gap Maphttps://simonwillison.net/2026/Jul/3/open-source-ai-gap-map/#atom-everything ↩ 回到正文 · back to text
  37. 37 Fable's judgementhttps://simonwillison.net/2026/Jul/3/judgement/#atom-everything ↩ 回到正文 · back to text
  38. 38 llm-coding-agent 0.1a0https://simonwillison.net/2026/Jul/2/llm-coding-agent/#atom-everything ↩ 回到正文 · back to text
  39. 39 not much happened todayhttps://news.smol.ai/issues/26-07-02-not-much/ ↩ 回到正文 · back to text
  40. 40 Memorizing session transcripts isn't usefulhttps://12gramsofcarbon.com/p/agentics-memorizing-session-transcripts ↩ 回到正文 · back to text
  41. 41 Understanding is the new bottleneckhttps://www.geoffreylitt.com/2026/07/02/understanding-is-the-new-bottleneck.html ↩ 回到正文 · back to text
  42. 42 The Short Leash AI Coding Method For Beating Fablehttps://blog.okturtles.org/2026/07/short-leash-ai-method/ ↩ 回到正文 · back to text
  43. 43 Please stop the AI confidence theaterhttps://www.elenaverna.com/p/please-stop-the-ai-confidence-theater ↩ 回到正文 · back to text
  44. 44 PostgreSQL and the OOM killer: Why we use strict memory overcommithttps://www.ubicloud.com/blog/postgresql-and-the-oom-killer-why-we-use-strict-memory-overcommit ↩ 回到正文 · back to text
  45. 45 14× faster embeddings: how we rebuilt the ONNX path in Manticorehttps://manticoresearch.com/blog/onnx-embeddings-speedup/ ↩ 回到正文 · back to text
  46. 46 actions/checkout. GitHub: actions/checkouthttps://github.com/actions/checkout ↩ 回到正文 · back to text
  47. 47 agentskills/agentskills. GitHub: agentskills/agentskillshttps://github.com/agentskills/agentskills ↩ 回到正文 · back to text
  48. 48 openai/codex-plugin-cc. GitHub: openai/codex-plugin-cchttps://github.com/openai/codex-plugin-cc ↩ 回到正文 · back to text
  49. 49 langflow-ai/langflow. GitHub: langflow-ai/langflowhttps://github.com/langflow-ai/langflow ↩ 回到正文 · back to text
  50. 50 harvard-edge/cs249r_book. GitHub: harvard-edge/cs249r_bookhttps://github.com/harvard-edge/cs249r_book ↩ 回到正文 · back to text
  51. 51 OpenCut-app/OpenCut. GitHub: OpenCut-app/OpenCuthttps://github.com/OpenCut-app/OpenCut ↩ 回到正文 · back to text
  52. 52 modelcontextprotocol/ext-apps. GitHub: modelcontextprotocol/ext-appshttps://github.com/modelcontextprotocol/ext-apps ↩ 回到正文 · back to text
  53. 53 sopaco/deepwiki-rs. GitHub: sopaco/deepwiki-rshttps://github.com/sopaco/deepwiki-rs ↩ 回到正文 · back to text
  54. 54 Hmbown/CodeWhale. GitHub: Hmbown/CodeWhalehttps://github.com/Hmbown/CodeWhale ↩ 回到正文 · back to text