Safety Testing LLM Agents at Scale1 - Vera 把 agent 安全测试拆成风险发现、轨迹证据收集和规则化验证,技术焦点是让工具型 agent 的违规行为可复查、可规模化统计。
全文 ↓今日重点 · Today's Highlights
SemHash-LLM3 - 多粒度语义哈希把 MinHash、对比学习和 LLM 判别串起来,针对训练数据清洗里最麻烦的近重复文档。
全文 ↓Chrome DevTools MCP4 - Chrome DevTools 团队把真实浏览器调试能力暴露给 MCP,前端 coding agent 可以直接检查 DOM、网络、控制台和性能状态。
全文 ↓论文 · Papers
12 项 · 论文本期重点Agent4cs: A Multi-agent System for Code Summarization in Large Hierarchical Codebases2arxiv.org原文 ↗
Agent4cs 做的是大型分层代码库摘要:先识别目录、模块和依赖关系,再让多个 agent 生成局部摘要、关系摘要和顶层说明。关键机制是显式利用 hierarchical structure 和 dependency links,而不是把仓库当作一段超长文本处理。它值得看在于代码摘要问题被重新表述为结构化协作任务,这比单 agent 长上下文总结更接近真实大型仓库的维护方式。
Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows6arxiv.org原文 ↗
论文把 RLVR 用到 Atlassian 工作流里的工具调用 agent,奖励来自可验证的 API 调用顺序、参数完整性和任务状态,而不是只看自然语言回答。具体任务围绕 issue、workspace、project 等 SaaS 操作,强调 agent 必须按业务流程完成状态变化。它的看点是把工具调用训练从“像不像答案”推进到“外部系统是否真的被正确操作”。
Janus: a Playground for User-Involved Agentic Permission Management7arxiv.org原文 ↗
Janus 构建了一个研究 agent 权限管理的 playground,把用户确认、授权策略、工具调用控制和执行轨迹放在同一个实验环境中。它比较的对象包括用户参与程度不同的 permission flow,而不是只给 agent 一个静态 allowlist。论文的价值在于把 agent 安全从抽象原则落到交互协议:什么时候问用户、问什么、授权后如何限制工具能力。
本期重点SemHash-LLM: A Multi-Granularity Semantic Hashing Framework for Document Deduplication3arxiv.org原文 ↗
SemHash-LLM 面向大规模文档去重,组合 MinHash 候选召回、对比学习语义表示和 LLM 判别,覆盖完全重复、局部重复和语义改写。多粒度设计是关键事实:它不是只在整篇文档上做相似度,而是同时处理片段和文档级别的重复。这个方向适合训练语料清洗,因为近重复数据会污染评测、放大记忆,并降低语料多样性。
Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling8arxiv.org原文 ↗
论文研究 LLM 置信度校准,并把置信信号用于决定测试时是否增加采样、验证或推理计算。关键设定是 adaptive test-time scaling:预算不是固定平均分配,而是向低置信问题倾斜。它值得跟进,因为测试时扩展如果没有可靠置信度,很容易把计算浪费在模型本来已经能解的问题上。
Diverse Evidence, Better Forecasts: Multi-Agent Deliberation Under Information Asymmetry9arxiv.org原文 ↗
这篇论文分析多 agent 预测在信息不对称下的 deliberation:不同 agent 持有不同证据,再通过讨论形成群体判断。核心事实是它把 evidence diversity 作为实验变量,观察讨论机制是否改善校准和预测质量。它提供了一个有用视角:多 agent 的收益不来自 agent 数量本身,而来自证据分布和汇总协议是否真的互补。
本期重点Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification1arxiv.org原文 ↗
Vera 提供端到端 agent 安全测试流程,先自动发现风险,再从执行轨迹里抽取证据,最后用 evidence-grounded verification 判定问题是否成立。论文的关键贡献是把 red-teaming 的主观判断拆成三个可审计步骤,尤其适合有工具调用、文件访问或外部 API 的 agent。它值得读,因为安全测试的难点已从“能否写出坏 prompt”转向“能否大规模证明 agent 真的做了危险动作”。
SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use10arxiv.org原文 ↗
SkillCoach 研究 agent 对可复用 skill 的选择和执行质量,用自演化 rubric 从轨迹中更新评价标准。它不是只打一个 pass/fail 分数,而是让 rubric 随任务分布提炼新的评分维度。技术意义在于 skill-based agent 需要可维护的评估体系,否则 skill 数量增长后很难判断 agent 是选错技能、参数错了,还是执行策略不合适。
Rethinking Complexity Metrics for LLM-Integrated Applications: Beyond Source Code11arxiv.org原文 ↗
HECATE 认为 LLM 应用复杂度不能只看源代码,还要把 prompt、上下文拼装、模型调用和非确定性行为纳入度量。论文的具体转向是从传统 code complexity 扩展到 prompt-layer behavior,这覆盖了 RAG、agent 和多阶段 LLM workflow 中最容易被静态分析漏掉的部分。它值得一读,因为 LLM 应用的维护成本往往藏在 prompt 与运行时交互里,而不是函数圈复杂度里。
A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory12arxiv.org原文 ↗
A-TMA 讨论长期 agent 记忆里的 state-aware failure,尤其是 ghost memory:旧事实、当前事实和状态转移事实在检索时混到一起。论文的关键拆分是把记忆错误和状态变化绑定,要求记忆系统理解事实何时失效、何时被替代。它切中长期 agent 的实际问题:向量相似度能找回相关片段,却不保证找回的是当前世界状态下仍然成立的片段。
PACE: A Proxy for Agentic Capability Evaluation13arxiv.org原文 ↗
PACE 试图用更便宜的非 agentic 能力测试预测昂贵 agent benchmark 的结果,目标包括 SWE-Bench、GAIA 这类需要长轨迹和环境验证的评测。关键事实是它把模型筛选前置为 proxy evaluation,减少每次都运行完整 agent benchmark 的成本。这个方向适合评测工程,因为 agent benchmark 的价格、时延和不稳定性正在成为模型迭代的现实瓶颈。
ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning14arxiv.org原文 ↗
ReContext 提出 recursive evidence replay,用 harness 反复检查模型是否真正利用长上下文中已给出的证据。它关注的不是扩大 context window,而是追踪模型在长文档中是否回到关键证据并保持推理一致。这个问题在法律、审计、研究综述和复杂客服场景都很具体:答案看似合理并不等于证据链被正确使用。
开源 / 项目 · Projects
12 项 · 开源 / 项目Contextify18contextify.sh原文 ↗
Contextify 本地索引 Claude Code 和 Codex 会话,支持跨工具检索历史 transcript。它做的不是把所有旧对话塞进 prompt,而是把过往决策、命令、代码修改和讨论变成可搜索材料。对于长期项目,这类工具的核心价值是找回上下文来源,而不是幻想原始 transcript 本身就是高质量记忆。
Scopewalker21github.com原文 ↗
Scopewalker 是本地只读 MCP server,为 agent 提供代码行数、复杂度、嵌套深度和参数数量等指标。它通过工具调用把代码库形状暴露给模型,帮助 agent 在重构或审查前判断风险区域。这个项目的亮点是克制:只读指标不会替模型做决定,却能减少模型对代码规模和复杂度的主观猜测。
行业动态 · Industry News
10 项 · 行业动态Google loses fight over record $4.7B EU antitrust fine26cnbc.com原文 ↗
CNBC 报道 Google 在 Android 相关欧盟反垄断罚款上诉中失利,案件围绕 Android 生态里的搜索、浏览器和应用商店捆绑行为。报道给出的核心数字是约 47 亿美元罚款,这仍是平台监管中非常大的单案规模。这条新闻说明欧盟对移动操作系统默认入口和分发控制的监管路线没有松动。
Alibaba to ban Claude Code in workplace over alleged backdoor risks, source says27reuters.com原文 ↗
Reuters 报道称,Alibaba 因所谓后门风险计划在工作场景禁用 Claude Code。这里的关键事实不是某个单独工具被点名,而是企业开始把 AI coding agent 的仓库访问、命令执行和外部服务连接视为安全审计对象。它反映了 coding agent 进入公司内网后,合规团队会把模型能力与供应链风险放在同一张表里评估。
Gemini Code Assist will be shut down on July 1728docs.cloud.google.com原文 ↗
Google Cloud 文档显示 Gemini Code Assist 的 repo code review 功能将在 7 月 17 日停止。这个日期很具体,意味着依赖该功能做仓库级自动 review 的团队需要迁移工作流。它也提醒开发者,平台托管的 AI review 功能仍处在快速调整期,产品名字稳定并不等于接口和能力稳定。
Virginia bans sale of precise geolocation data29hunton.com原文 ↗
Hunton 隐私律师博客整理了 Virginia 对出售精确地理位置数据的新限制。关键变化是 precise geolocation data 被作为高敏感类别单独处理,影响数据经纪、广告技术和移动 SDK 生态。此类州级法律继续把隐私监管从“告知与同意”推向对具体数据交易行为的直接限制。
AI Data Centers Use More Water Than Most Tech Giants Report30wsj.com原文 ↗
WSJ 报道 AI 数据中心用水统计与大型科技公司披露口径之间存在差距,争议集中在外包设施、间接用水和区域水资源压力是否完整计入。文章把 AI 基础设施成本从电力扩展到水资源,尤其是冷却和本地供水约束。它值得产业侧关注,因为环境披露口径会影响数据中心选址、许可和社区关系。
Amazon has enough satellites to launch its Starlink competitor31theverge.com原文 ↗
The Verge 报道 Amazon 的低轨卫星网络已经达到启动 Starlink 竞争服务所需规模。新闻围绕 Project Kuiper 从试验部署跨过商业服务门槛展开,后续压力会转向覆盖、终端、容量和服务定价。它说明卫星互联网竞争正在从“能否发射”进入“能否运营可用网络”的阶段。
Valve open-source the Steam Machine e-ink screen so you can make your own32gamingonlinux.com原文 ↗
GamingOnLinux 整理称 Valve 开源 Steam Machine e-ink 屏幕相关设计和软件,让用户可以制作或改造类似模块。关键点是开源内容覆盖硬件周边与控制软件,而不是只发布展示图片。它对硬件社区的意义在于,游戏设备生态的附属显示和状态屏可以被复制、移植和二次开发。
Podman v6.0.033blog.podman.io原文 ↗
Podman 官方博客发布 6.0.0,列出容器运行时、CLI 和工具链更新。作为无 daemon、OCI 兼容、强调 rootless 的容器栈,Podman 大版本变化通常会影响本地开发、CI、镜像管理和 Docker 替代路径。对平台工程团队来说,这类发布需要重点看兼容性、网络和 compose 相关变化,而不只是版本号升级。
The Safari MCP server for web developers34webkit.org原文 ↗
WebKit 团队发布 Safari MCP server,让开发工具和 agent 可以控制 Safari、检查页面并执行调试任务。它把 MCP 接到真实浏览器运行时,使 agent 能根据 Safari 的实际渲染、网络和开发者工具状态行动。随着 Chrome 和 Safari 都出现 MCP 调试入口,浏览器正在成为 coding agent 的一等工具环境。
Core dump epidemiology: fixing an 18-year-old bug35openai.com原文 ↗
OpenAI 工程博客复盘一个存在 18 年的数据基础设施 bug,核心方法是把大量 core dump 当作可分析样本来找分布、聚类和共同因子。文章的具体事实是 bug 年龄达到 18 年,这类长期缺陷往往不能靠单次复现定位。它值得工程团队阅读,因为生产事故分析有时需要统计视角,而不是只追一条崩溃栈。
博客文章 · Blog Posts
10 项 · 博客文章Open Source AI Gap Map36simonwillison.net原文 ↗
Simon Willison 介绍 Current AI 的 Gap Map v0.1,一个索引开源 AI 软件、工具和模型的目录。它不是模型排行榜,而是尝试按生态组件和能力空白组织开源 AI 资产。这个项目适合观察开源 AI 的缺口:哪些基础设施已有多种实现,哪些环节仍依赖少数闭源服务。
Fable's judgement37simonwillison.net原文 ↗
Simon Willison 记录 Claude Code 团队关于 Fable 的经验,重点是让模型自行判断何时测试、如何执行和何时停止。文章讨论的核心变量是 judgement:过度硬编码流程可能压制模型在具体上下文中的判断。它与“短反馈控制”形成有趣对照,说明 coding agent 的有效边界仍在工具约束和模型自主之间摆动。
llm-coding-agent 0.1a038simonwillison.net原文 ↗
Simon Willison 发布基于 `llm` Python 库的实验性 coding agent。这个版本把模型调用、文件编辑、命令执行和循环控制做成较小实现,便于理解 coding agent 的基本组成。它的价值在教育和实验:先看清最小闭环,再评估商业工具里复杂策略到底增加了什么。
not much happened today39news.smol.ai原文 ↗
smol.ai 汇总 2026-07-01 至 2026-07-02 的 AI 社区动态,标题轻描淡写,但内容覆盖模型、agent、工具链和社区讨论。它的具体时间范围是两天,适合看短周期信息密度而不是单条发布。此类日更通讯的作用是把分散在社交媒体、论文和 GitHub 的小信号整理成趋势脉络。
Memorizing session transcripts isn't useful4012gramsofcarbon.com原文 ↗
文章批评 agent 记忆系统直接保存完整会话 transcript 的做法,认为原始对话很快会变成噪声密集、检索困难的历史堆。它主张提炼决策、偏好、约束和长期事实,并记录哪些信息会过期。这个观点切中 agent memory 的核心:记忆不是存储越多越好,而是要把可复用信息从会话流水里蒸馏出来。
Understanding is the new bottleneck41geoffreylitt.com原文 ↗
Geoffrey Litt 讨论 AI 降低生成代码成本后,理解系统状态、业务约束、历史决策和副作用正在成为新的瓶颈。文章把开发效率问题从打字速度转向认知负荷,指出“能写更多代码”不等于“能安全改变系统”。它适合放在 agent 编程讨论里看,因为模型越能产出补丁,理解和验证就越成为稀缺环节。
The Short Leash AI Coding Method For Beating Fable42blog.okturtles.org原文 ↗
这篇文章描述短反馈周期的 AI coding 方法:小步任务、频繁检查、快速测试和明确边界。它的策略是把 agent 控制在短回路里,让人类持续校准方向,而不是把一个大目标交给模型长时间自主运行。这个方法的工程含义很直接:减少漂移、缩短回滚距离,并让错误在局部暴露。
Please stop the AI confidence theater43elenaverna.com原文 ↗
Elena Verna 批评 AI 产品叙事中的“confidence theater”,即界面和营销把不确定结果包装得过于确定。文章强调用户需要看到概率、限制和失败模式,才能判断何时信任、何时验证。它把模型校准问题转译成产品设计问题:不确定性不是缺陷提示语,而是交互契约的一部分。
PostgreSQL and the OOM killer: Why we use strict memory overcommit44ubicloud.com原文 ↗
Ubicloud 工程博客解释 PostgreSQL 部署中采用严格 memory overcommit 的原因,核心风险是 Linux OOM killer 在压力下杀掉关键数据库进程。文章把 Postgres 进程模型、内存承诺和失败模式连起来,说明更早、更可控的分配失败优于运行时随机崩溃。它是基础设施文章里很实用的一类:策略选择来自故障模型,而不是配置偏好。
14× faster embeddings: how we rebuilt the ONNX path in Manticore45manticoresearch.com原文 ↗
Manticore Search 介绍重建 ONNX embedding 路径后获得 14 倍加速。优化集中在推理管线本身,包括减少数据转换、改进批处理和让向量生成更贴近搜索引擎执行模型。它提醒工程团队,embedding 性能不只由模型决定,周围的数据路径和执行器同样可能是主要瓶颈。
GitHub 热门 · GitHub Trending
10 项 · GitHub 热门本期重点ChromeDevTools/chrome-devtools-mcp4github.com原文 ↗
这个仓库是 Chrome DevTools 的 MCP server,为 agent 提供浏览器自动化和调试能力。它把真实 Chrome 实例接入 agent 工具链,使模型可以检查 DOM、网络请求、控制台输出和性能状态。对于前端任务,这减少了“只读源码猜 UI”的盲区,让 agent 能用运行时证据定位问题。
actions/checkout46github.com原文 ↗
actions/checkout 是 GitHub Actions 官方 checkout action,几乎所有 GitHub CI workflow 都会用到它来检出仓库。新版本加强 fork PR 场景的安全默认值,同时保留 fetch-depth、submodules、sparse checkout 和凭据控制等能力。它值得关注的原因很简单:基础 action 的默认行为变化会影响大量 CI 的权限边界。
agentskills/agentskills47github.com原文 ↗
agentskills/agentskills 定义 Agent Skills 规范和 `SKILL.md` 文档格式,用于给 agent 安装可复用能力。仓库把技能说明、资源和工作流约束打包,避免把所有领域知识塞进一个巨大系统提示。它反映了 agent 能力工程的一条路线:把提示变成可分发、可版本化、可按任务加载的模块。
openai/codex-plugin-cc48github.com原文 ↗
openai/codex-plugin-cc 让 Claude Code 可以调用 Codex 做代码 review 或任务委派。项目的机制是把另一个 coding agent 接入当前工作流,用于审查、验证或分担子任务。它的技术看点在多 agent 组合:不同模型系统不一定要互相替代,也可以通过插件成为同一个开发会话里的协作者。
langflow-ai/langflow49github.com原文 ↗
Langflow 是可视化构建、部署 AI agents 和 workflows 的平台,把模型、提示、工具、向量库和流程节点组织成可编辑图。它适合快速搭建和调试 LLM 应用,因为链路结构被显性化,不必完全埋在代码里。项目的长期价值取决于可视化便利性与工程可维护性之间能否保持平衡。
harvard-edge/cs249r_book50github.com原文 ↗
这个仓库承载 Harvard CS249r Machine Learning Systems 教材,主题覆盖模型、编译、硬件、部署、可靠性和边缘系统。它把机器学习当作系统工程对象,而不是只讲训练算法。对于构建 AI 应用的人,这类材料补齐的是从模型能力到真实部署之间的中间层知识。
OpenCut-app/OpenCut51github.com原文 ↗
OpenCut 是开源视频编辑器,目标覆盖 web、desktop 和 mobile,并提供插件与自动化接口。项目同时面对时间线编辑、媒体处理、实时预览、素材管理和导出性能等难题。它值得观察,因为视频编辑器的开放实现很容易在 UI 上做出雏形,但真正的挑战在跨平台媒体管线和扩展系统。
modelcontextprotocol/ext-apps52github.com原文 ↗
modelcontextprotocol/ext-apps 是 MCP Apps 协议和 SDK,用于在 AI chat 客户端中嵌入交互式 UI。它把 MCP 从文本工具调用扩展到可视化应用承载层,让 agent 可以与表单、图表或小应用共同完成任务。这个仓库重要在协议方向:复杂工作流很难永远靠聊天消息和 JSON 工具结果表达。
sopaco/deepwiki-rs53github.com原文 ↗
deepwiki-rs 用 Rust 把代码库生成结构化技术文档和 agent 上下文。它面向大型 repo 缺少稳定概览的问题,让开发者或 agent 不必每次从零 grep 代码结构。Rust 本地实现强调性能和可运行性,适合把文档生成纳入 CI 或本地分析流程。
Hmbown/CodeWhale54github.com原文 ↗
CodeWhale 是 Rust 编写的终端 coding agent harness,面向多模型和开源模型工作流。它把模型选择、命令行交互、工具调用和执行循环放在本地终端里。这个项目的看点是为不同模型提供统一运行壳,降低实验开源 coding agent 时对单一供应商工具的依赖。
引用来源 · References
54 条 · 引用- 1 Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification. arXiv:2607.01793https://arxiv.org/abs/2607.01793 ↩ 回到正文 · back to text
- 2 Agent4cs: A Multi-agent System for Code Summarization in Large Hierarchical Codebases. arXiv:2607.01425https://arxiv.org/abs/2607.01425 ↩ 回到正文 · back to text
- 3 SemHash-LLM: A Multi-Granularity Semantic Hashing Framework for Document Deduplication. arXiv:2607.01601https://arxiv.org/abs/2607.01601 ↩ 回到正文 · back to text
- 4 ChromeDevTools/chrome-devtools-mcp. GitHub: ChromeDevTools/chrome-devtools-mcphttps://github.com/ChromeDevTools/chrome-devtools-mcp ↩ 回到正文 · back to text
- 5 Mcpsnoop. GitHub: kerlenton/mcpsnoophttps://github.com/kerlenton/mcpsnoop ↩ 回到正文 · back to text
- 6 Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows. arXiv:2607.01465https://arxiv.org/abs/2607.01465 ↩ 回到正文 · back to text
- 7 Janus: a Playground for User-Involved Agentic Permission Management. arXiv:2607.01510https://arxiv.org/abs/2607.01510 ↩ 回到正文 · back to text
- 8 Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling. arXiv:2607.01612https://arxiv.org/abs/2607.01612 ↩ 回到正文 · back to text
- 9 Diverse Evidence, Better Forecasts: Multi-Agent Deliberation Under Information Asymmetry. arXiv:2607.01661https://arxiv.org/abs/2607.01661 ↩ 回到正文 · back to text
- 10 SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use. arXiv:2607.01874https://arxiv.org/abs/2607.01874 ↩ 回到正文 · back to text
- 11 Rethinking Complexity Metrics for LLM-Integrated Applications: Beyond Source Code. arXiv:2607.01903https://arxiv.org/abs/2607.01903 ↩ 回到正文 · back to text
- 12 A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory. arXiv:2607.01935https://arxiv.org/abs/2607.01935 ↩ 回到正文 · back to text
- 13 PACE: A Proxy for Agentic Capability Evaluation. arXiv:2607.02032https://arxiv.org/abs/2607.02032 ↩ 回到正文 · back to text
- 14 ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning. arXiv:2607.02509https://arxiv.org/abs/2607.02509 ↩ 回到正文 · back to text
- 15 pxpipe. GitHub: teamchong/pxpipehttps://github.com/teamchong/pxpipe ↩ 回到正文 · back to text
- 16 Opboxhttps://www.opbox.dev/ ↩ 回到正文 · back to text
- 17 Mycli 2.0. GitHub: dbcli/myclihttps://github.com/dbcli/mycli ↩ 回到正文 · back to text
- 18 Contextifyhttps://contextify.sh/ ↩ 回到正文 · back to text
- 19 Quicktok. GitHub: dmatth1/quicktokhttps://github.com/dmatth1/quicktok ↩ 回到正文 · back to text
- 20 TaskPeacehttps://taskpeace.com/ ↩ 回到正文 · back to text
- 21 Scopewalker. GitHub: timohaa/scopewalker-mcphttps://github.com/timohaa/scopewalker-mcp ↩ 回到正文 · back to text
- 22 MothRAG. GitHub: juliangeymonat-jpg/mothraghttps://github.com/juliangeymonat-jpg/mothrag ↩ 回到正文 · back to text
- 23 Brumehttps://brumeorg.github.io/ ↩ 回到正文 · back to text
- 24 Wordgardhttps://wordgard.net/ ↩ 回到正文 · back to text
- 25 zkGolfhttps://zk.golf/ ↩ 回到正文 · back to text
- 26 Google loses fight over record $4.7B EU antitrust finehttps://www.cnbc.com/2026/07/02/alphabet-google-android-eu-antitrust-fine-4-1-billion-euro-appeal.html ↩ 回到正文 · back to text
- 27 Alibaba to ban Claude Code in workplace over alleged backdoor risks, source sayshttps://www.reuters.com/world/china/alibaba-ban-claude-code-workplace-over-alleged-backdoor-risks-source-says-2026-07-03/ ↩ 回到正文 · back to text
- 28 Gemini Code Assist will be shut down on July 17https://docs.cloud.google.com/gemini/docs/code-review/review-repo-code ↩ 回到正文 · back to text
- 29 Virginia bans sale of precise geolocation datahttps://www.hunton.com/privacy-and-cybersecurity-law-blog/virginia-bans-sale-of-geolocation-data ↩ 回到正文 · back to text
- 30 AI Data Centers Use More Water Than Most Tech Giants Reporthttps://www.wsj.com/tech/ai/ai-data-centers-water-use-901e2902 ↩ 回到正文 · back to text
- 31 Amazon has enough satellites to launch its Starlink competitorhttps://www.theverge.com/science/960563/amazon-leo-service-tipping-point ↩ 回到正文 · back to text
- 32 Valve open-source the Steam Machine e-ink screen so you can make your ownhttps://www.gamingonlinux.com/2026/07/valve-open-source-the-steam-machine-e-ink-screen-so-you-can-make-your-own/ ↩ 回到正文 · back to text
- 33 Podman v6.0.0https://blog.podman.io/2026/07/introducing-podman-v6-0-0/ ↩ 回到正文 · back to text
- 34 The Safari MCP server for web developershttps://webkit.org/blog/18136/introducing-the-safari-mcp-server-for-web-developers/ ↩ 回到正文 · back to text
- 35 Core dump epidemiology: fixing an 18-year-old bughttps://openai.com/index/core-dump-epidemiology-data-infrastructure-bug/ ↩ 回到正文 · back to text
- 36 Open Source AI Gap Maphttps://simonwillison.net/2026/Jul/3/open-source-ai-gap-map/#atom-everything ↩ 回到正文 · back to text
- 37 Fable's judgementhttps://simonwillison.net/2026/Jul/3/judgement/#atom-everything ↩ 回到正文 · back to text
- 38 llm-coding-agent 0.1a0https://simonwillison.net/2026/Jul/2/llm-coding-agent/#atom-everything ↩ 回到正文 · back to text
- 39 not much happened todayhttps://news.smol.ai/issues/26-07-02-not-much/ ↩ 回到正文 · back to text
- 40 Memorizing session transcripts isn't usefulhttps://12gramsofcarbon.com/p/agentics-memorizing-session-transcripts ↩ 回到正文 · back to text
- 41 Understanding is the new bottleneckhttps://www.geoffreylitt.com/2026/07/02/understanding-is-the-new-bottleneck.html ↩ 回到正文 · back to text
- 42 The Short Leash AI Coding Method For Beating Fablehttps://blog.okturtles.org/2026/07/short-leash-ai-method/ ↩ 回到正文 · back to text
- 43 Please stop the AI confidence theaterhttps://www.elenaverna.com/p/please-stop-the-ai-confidence-theater ↩ 回到正文 · back to text
- 44 PostgreSQL and the OOM killer: Why we use strict memory overcommithttps://www.ubicloud.com/blog/postgresql-and-the-oom-killer-why-we-use-strict-memory-overcommit ↩ 回到正文 · back to text
- 45 14× faster embeddings: how we rebuilt the ONNX path in Manticorehttps://manticoresearch.com/blog/onnx-embeddings-speedup/ ↩ 回到正文 · back to text
- 46 actions/checkout. GitHub: actions/checkouthttps://github.com/actions/checkout ↩ 回到正文 · back to text
- 47 agentskills/agentskills. GitHub: agentskills/agentskillshttps://github.com/agentskills/agentskills ↩ 回到正文 · back to text
- 48 openai/codex-plugin-cc. GitHub: openai/codex-plugin-cchttps://github.com/openai/codex-plugin-cc ↩ 回到正文 · back to text
- 49 langflow-ai/langflow. GitHub: langflow-ai/langflowhttps://github.com/langflow-ai/langflow ↩ 回到正文 · back to text
- 50 harvard-edge/cs249r_book. GitHub: harvard-edge/cs249r_bookhttps://github.com/harvard-edge/cs249r_book ↩ 回到正文 · back to text
- 51 OpenCut-app/OpenCut. GitHub: OpenCut-app/OpenCuthttps://github.com/OpenCut-app/OpenCut ↩ 回到正文 · back to text
- 52 modelcontextprotocol/ext-apps. GitHub: modelcontextprotocol/ext-appshttps://github.com/modelcontextprotocol/ext-apps ↩ 回到正文 · back to text
- 53 sopaco/deepwiki-rs. GitHub: sopaco/deepwiki-rshttps://github.com/sopaco/deepwiki-rs ↩ 回到正文 · back to text
- 54 Hmbown/CodeWhale. GitHub: Hmbown/CodeWhalehttps://github.com/Hmbown/CodeWhale ↩ 回到正文 · back to text