PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection - 把规划器上下文确认为多智能体系统的单点放大攻击面,并用多种攻击设置展示一次注入如何污染后续任务分解与执行。 1
全文 ↓今日重点 · Today's Highlights
Deterministic Replay for AI Agent Systems - 将模型采样、工具响应与运行时状态统一写入事件日志,使跨模型、跨工具的智能体轨迹可以确定性复现。 2
全文 ↓Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL - 用掩码扩散模型充当可控文本世界模型,在保持模拟质量的同时允许对环境属性做细粒度引导。 3
全文 ↓KernelBench-Verified: Do LLM-Generated Kernels Actually Beat PyTorch? - 重新执行并核验 LLM 生成的 CUDA kernel,区分真实加速、错误实现与针对基准计时机制的 reward hacking。 4
全文 ↓论文 · Papers
15 项 · 论文本期重点PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection1arxiv.org原文 ↗
论文不再把 prompt injection 只看成单个执行代理的问题,而是直接攻击负责拆解目标的 planner。作者构造了 4 种攻击设置,并报告在 GPT-4o、GPT-4o-mini、Qwen3-235B 与 Llama-3.3-70B 上,平均攻击成功率可达 96%;现有防护仍有约 90% 的平均成功率。这个结果说明,规划阶段一旦被污染,后续多个代理会把恶意步骤当成正常计划执行,风险具有结构性放大效应。
本期重点Deterministic Replay for AI Agent Systems2arxiv.org原文 ↗
作者提出基于 event sourcing 的智能体重放架构,把模型 token、随机性、外部 API 返回值、工具结果与运行时状态变化全部记录为事件。论文在 GPT-5、Claude 4.5、Gemini 2.5 Pro 和 Grok 4 上报告 100% 重放准确率,额外延迟低于 0.1%。它把智能体调试从“尽量复现”推进到可审计的执行记录,但代价是必须完整捕获边界外的非确定性。
本期重点Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL3arxiv.org原文 ↗
这项工作把 masked diffusion language model 用作文本交互环境的世界模型,并引入面向轨迹属性的 steering 机制。实验覆盖 12 个任务,扩散模型在模拟真实性上优于自回归基线,且可生成更高奖励或特定行为分布的训练环境。其价值在于把“环境生成”和“环境控制”放进同一生成过程,适合缺少真实交互预算的 agentic RL。
Accurate and Efficient Long-Term Memory for LLM Agents6arxiv.org原文 ↗
论文提出 MOSAIC,把长期记忆组织为带时间信息和实体关系的结构化表示,并用轻量分类器替代大量在线 LLM 判断。摘要报告,MOSAIC 在 LoCoMo 上达到 75.5%,同时把记忆构建时间降至约 1.5 分钟,相比强基线快约 100 倍。它展示了记忆系统不必在准确率和工程成本之间二选一,但效果仍依赖关系抽取与时间归一化的质量。
Environment-free Synthetic Data Generation for API-Calling Agents9arxiv.org原文 ↗
作者面向无法部署真实 API 后端的场景,先从接口规范合成状态、调用链和反馈,再生成可用于训练的工具轨迹。实验覆盖 7 个 API 域、超过 1,000 个工具,训练后的代理在真实执行评测上仍获得稳定提升。关键贡献是把数据生成从“必须有可运行沙箱”中解耦,同时也意味着合成状态与真实业务约束之间的偏差需要额外控制。
开源 / 项目 · Projects
15 项 · 开源 / 项目Millwright18github.com原文 ↗
Millwright 是 Rust 编写的自托管 LLM gateway,通过单一入口把请求路由到不同模型、提供商或本地后端。README 强调 CLI 优先配置、流式响应、provider 抽象和可观测性,目标是避免应用代码绑定某一家 API。它适合需要统一凭据、路由和故障切换的团队,但仍需自行运营代理层及其容量。
Cactus Hybrid20github.com原文 ↗
Cactus Hybrid 对端侧 Gemma 3 270M 做后训练,让模型在生成答案之外输出置信分数,并把低置信请求转交云端大模型。README 报告该路由可在保持任务质量的同时把 60% - 90% 请求留在设备侧,降低延迟和云调用成本。它把 hybrid inference 的关键从固定规则改为模型自评,但置信度校准会直接决定错误放行率。
DataParade23github.com原文 ↗
DataParade CLI 从代码与基础设施定义中提取数据源、处理步骤和下游去向,生成可查询的数据流图。它面向隐私与安全审查,可把敏感字段经过哪些服务、存储和外部系统变成显式证据。与手工维护架构图相比,代码驱动的做法更容易跟随仓库变化,但扫描器对动态行为的覆盖仍有限。
Blackbar Nano27github.com原文 ↗
Blackbar Nano 是约 5.2M 参数的本地 PII 检测模型,目标是在 CPU 上识别并脱敏姓名、邮箱、电话、地址等敏感片段。README 报告 INT8 模型约 22 MB,并提供 ONNX 推理和 span 级输出。它适合在文本离开设备前做快速过滤,但小模型对领域术语、跨句实体和多语言覆盖仍需单独评测。
SimpleBLE 1.030github.com原文 ↗
SimpleBLE 1.0 提供统一的 Bluetooth Low Energy API,覆盖 Windows、macOS、Linux、iOS 和 Android,并带 C、C++、Python、Rust 等绑定。库把扫描、连接、服务发现和 characteristic 读写封装在跨平台接口后,减少各系统 BLE 栈差异。1.0 标志 API 稳定性提升,适合需要桌面与移动端共用协议逻辑的硬件项目。
行业动态 · Industry News
12 项 · 行业动态Judge approves $1.5B Anthropic settlement for pirated books used to train Claude31apnews.com原文 ↗
法院批准 Anthropic 就使用盗版图书训练 Claude 达成的 15 亿美元集体和解。按报道方案,款项覆盖约 50 万部作品,平均每部约 3,000 美元,并要求处理相关数据副本。判决没有终结训练数据是否构成合理使用的争论,但把“来源是否合法”与“训练用途是否合理”明确区分开来。
Kimi K3 Is Competitive with Fable; Kimi K3 and Fable Is SoTA32fireworks.ai原文 ↗
Fireworks AI 比较 Kimi K3 与自家 Fable 在智能体知识工作任务上的表现,并把两者组合描述为当前领先方案。文章重点不是单轮问答,而是浏览、工具调用和长任务完成率等 agentic workload。由于结果来自模型服务商自己的评测,数字更适合作为部署候选线索,而不是独立结论。
Laguna S 2.133poolside.ai原文 ↗
Poolside 发布 Laguna S 2.1 编程模型,强调代码生成、仓库级修改与工具使用能力,并给出相对上一版本的基准改进。该发布延续其面向软件工程代理的产品路线,而非通用聊天模型。实际采用时更值得关注的是补丁成功率、延迟与私有代码部署方式,而不只是公开榜单名次。
Advertise in ChatGPT34ads.openai.com原文 ↗
OpenAI 上线 ChatGPT 广告业务入口,面向品牌和代理商收集合作信息。页面本身主要是商业接洽而非完整产品文档,但它确认广告已从传闻进入正式销售渠道。下一阶段的核心问题会是广告标识、推荐排序与对话上下文之间如何隔离。
Introducing OpenAI Presence35openai.com原文 ↗
OpenAI 发布 Presence,提供部署企业语音和聊天智能体所需的渠道接入、会话运行与运营工具。产品把实时模型能力包装成面向客服和业务流程的托管平台,减少团队自行拼装电话、消息和 agent runtime 的工作。它也使可观测性、人工接管和合规记录成为平台竞争的一部分。
Advancing the next era of national science36openai.com原文 ↗
OpenAI 宣布与美国能源部及国家实验室推进 AI 科学合作,目标涵盖研究工作流、计算资源与科学发现。公告把前沿模型定位为科研基础设施,而不只是论文辅助工具。项目成效最终要由可复现实验、数据访问规则和研究人员实际采用情况衡量。
Building AI infrastructure with the Effingham County community37openai.com原文 ↗
OpenAI 公布在佐治亚州 Effingham County 推进 Project Camellia AI 基础设施建设,并强调就业、社区合作与能源规划。文章反映模型扩张正在转化为地方土地、电网和水资源议题。此类项目的关键不只是算力规模,还包括长期能源来源、公共成本和建设承诺是否透明。
Gemini latest models: temperature, top_p, and top_k are deprecated and ignored38ai.google.dev原文 ↗
Google 文档说明,Gemini 最新模型会忽略请求中的 `temperature`、`top_p` 和 `top_k`,这些参数已弃用。对依赖采样参数调节稳定性或多样性的应用,这不是普通兼容性提示,而是行为控制接口发生变化。迁移测试应以真实输出分布为准,不能假设旧参数仍在暗中生效。
LG to ban residential proxies from smart TV apps39krebsonsecurity.com原文 ↗
LG 将禁止智能电视应用把消费者设备变成住宅代理节点,针对的是 SDK 在后台出售家庭 IP 带宽的模式。报道把风险落到用户难以察觉的网络流量、滥用追责和设备性能消耗上。平台级禁令比单纯隐私声明更有效,因为它直接切断应用商店分发与变现渠道。
PyPI releases now reject new files after 14 days40blog.pypi.org原文 ↗
PyPI 现在拒绝向发布超过 14 天的版本追加新文件,维护者需要创建新版本号。规则缩短了攻击者接管旧项目后悄悄补发恶意 wheel 的窗口,也让同一版本随时间变化的情况更少。对构建流水线而言,这强化了版本不可变性,但会改变延迟补齐平台包的发布习惯。
Codeberg: ToU extension to prohibit LLM-extrusions41codeberg.org原文 ↗
Codeberg 社区讨论扩展服务条款,限制主要由 LLM 批量生成、缺少人工维护责任的项目,即所谓 LLM-extrusions。争议焦点并非所有 AI 辅助代码,而是低质量仓库对托管、审核和社区注意力的外部成本。提案显示代码平台开始把生成内容治理从反垃圾规则推进到维护者责任定义。
Roblox Officially Supports GrapheneOS42en.help.roblox.com原文 ↗
Roblox 更新 Android 远程证明政策,把 GrapheneOS 纳入官方支持范围。变化说明反作弊系统不必简单依赖厂商认证的原厂系统,也可以认可满足完整性条件的安全强化 ROM。它为移动应用在设备可信度与用户操作系统选择权之间提供了更细粒度的兼容案例。
博客文章 · Blog Posts
15 项 · 博客文章A digestion of the Jacobian conjecture counterexample43terrytao.wordpress.com原文 ↗
Terence Tao 逐层拆解一个声称给出 Jacobian 猜想反例的构造,把原证明压缩为关键代数对象、局部性质和最终矛盾检查。文章的价值不在替读者宣布真伪,而在标出最需要独立验证的桥梁步骤。面对可能改写长期开放问题的结果,这种“先重建论证骨架再审计细节”的方法比围绕结论争论更可靠。
Everyone Should Know SIMD44mitchellh.com原文 ↗
Mitchell Hashimoto 从“单条指令处理多个数据”讲起,用实际数据布局和批处理例子解释 SIMD 为什么不只属于编译器作者。文章强调性能往往受内存布局、分支和向量宽度共同限制,手写 intrinsics 只是最后一步。它把 SIMD 放回日常工程语境:先识别可并行的连续工作,再决定使用库、自动向量化还是显式指令。
Are AI Labs Pelicanmaxxing?45dylancastillo.co原文 ↗
文章用“pelicanmaxxing”形容 AI 实验室在相似榜单、命名、预告和产品叙事上不断模仿彼此的现象。作者把模型发布拆成能力、基准选择与营销节奏,指出竞争越激烈,外部呈现反而越趋同。这个观察有助于把发布声量与技术差异分开阅读,避免把同构宣传误判为独立证据。
The startup's Postgres survival guide46hatchet.run原文 ↗
Hatchet 汇总初创团队最常踩的 PostgreSQL 运行问题:连接池耗尽、长事务、锁等待、缺索引、膨胀以及复制与备份。文章把故障信号对应到具体观测项和操作,例如先查活跃事务与等待关系,再决定终止查询或改 schema。它的主线是先建立可见性和容量纪律,避免过早用分片掩盖基本数据库卫生问题。
Never Enough48dark.ronacher.eu原文 ↗
Armin Ronacher 反思软件工具不断叠加功能、抽象和配置后,用户仍被告知“再加一层就会更简单”。文章指出复杂度常从实现者转移给使用者,并通过兼容层和自动化继续累积。其批评并非反对功能,而是要求工具明确边界、保留可理解的核心,并愿意删除收益不足的机制。
Open models recap: more on Kimi K3, Qwen 3.8, Xi's WAIC speech, distillation, the open-closed gap, and what's next49interconnects.ai原文 ↗
Interconnects 把 Kimi K3、Qwen 3.8、蒸馏争议和 WAIC 政策信号放在同一条开放模型产业线上观察。文章认为开放权重模型仍在缩小部分能力差距,但训练数据、推理基础设施和许可条件让“开放”不是单一维度。它提供的是生态层判断:模型分数之外,还要看谁能复现、部署和继续训练。
Two years of vector search at Notion: 10x scale, 1/10th cost50notion.com原文 ↗
Notion 回顾向量搜索从早期服务扩展到 10 倍规模、单位成本降至十分之一的过程,重点包括索引分片、冷热数据、批处理和检索路径简化。文章显示成本下降不是来自单一 ANN 算法替换,而是持续移除冗余计算并让容量模型贴近真实查询。它是少见的长期生产复盘,能看到向量系统在增长后如何从“能用”转向可运营。
A flaky test exposed a Redis client use-after-free51buildkite.engineering原文 ↗
Buildkite 从一个极低概率失败的测试追到 Redis 客户端生命周期错误:异步回调仍持有已释放对象,最终形成 use-after-free。团队没有简单重试,而是扩大调度扰动、保存崩溃现场并核对所有权边界。案例说明 flaky test 可能是并发缺陷的统计信号;压掉噪声会失去最早、成本最低的安全预警。
Ghost Cut - or why Cut and Paste is broken everywhere52ishmael.textualize.io原文 ↗
文章分析终端与文本界面里的“剪切”为什么经常只是删除:应用控制字符缓冲区,系统剪贴板却由终端或桌面环境管理,两者缺少统一协议。所谓 ghost cut 是内容从界面消失,却没有可靠进入用户预期的剪贴板。作者借此说明 TUI 复刻 GUI 快捷键时,必须先厘清输入层、应用层和系统层各自拥有的状态。
Some more things about Django I've been enjoying53jvns.ca原文 ↗
Julia Evans 继续记录 Django 中让小型应用开发顺畅的设计,包括 ModelForm、管理后台、迁移、ORM 查询和调试页面。文章不是罗列“魔法”,而是观察框架如何让常见路径短、必要时又能下钻到 SQL 与请求细节。它解释了成熟全栈框架的优势:大量边角能力已经以一致方式组合,而无需每个项目重新选型。
RefluXFS: A Linux Kernel Local Privilege Escalation to Root in XFS54blog.qualys.com原文 ↗
Qualys 披露 XFS 中的本地提权漏洞 CVE-2026-64600,并梳理从文件系统状态操纵到内核内存破坏、最终取得 root 的利用链。攻击需要本地执行条件,但 XFS 在服务器上的普及使补丁优先级较高。文章的技术意义在于展示文件系统元数据验证缺陷如何跨越权限边界,而不是停留在崩溃级 DoS。
Dark Elevator: Windows Install Service Local Privilege Escalation55blog.calif.io原文 ↗
Dark Elevator 解析 Windows Install Service 的 CVE-2026-50343,本地低权限用户可借安装服务的高权限执行路径完成提权。文章跟踪可控文件、服务行为和竞态窗口之间的连接,并给出从触发条件到 SYSTEM 权限的完整思路。它再次表明安装与更新组件是高价值边界:普通用户输入一旦进入特权文件操作,路径验证必须极其严格。
dcmake: a new CMake debugger UI56nullprogram.com原文 ↗
dcmake 为 CMake 配置阶段提供交互式调试界面,可查看命令执行、变量作用域、调用栈和控制流。它针对的是 CMake 脚本“执行了但难以观察”的痛点,让开发者不必靠连续插入 `message()` 猜状态。项目也揭示构建系统语言一旦承担复杂逻辑,就需要与普通语言相近的调试工具。
Unicode Variation Selector-15 and some of my tears57benjaminwil.info原文 ↗
文章追踪 Unicode Variation Selector-15 在字体、浏览器和文本处理链中的兼容问题:同一基础字符附加选择符后,显示与匹配结果可能分叉。作者展示问题会穿过规范、字体覆盖和应用归一化多个层级,单点修复往往不够。这个案例提醒工程师,视觉上相同的字符串未必具有相同码点序列或语义。
GitHub 热门 · GitHub Trending
15 项 · GitHub 热门HKUDS/LightRAG58github.com原文 ↗
LightRAG 把实体关系图检索与向量文本检索结合:文档摄取时抽取实体和关系,查询时可走局部、全局或混合模式。项目支持多种 LLM、向量库、图存储和文档解析器,并提供 API server。它适合需要跨片段关系推理的知识库,但图抽取成本和实体合并质量会影响最终收益。
NVIDIA/Model-Optimizer59github.com原文 ↗
NVIDIA Model Optimizer 将量化、剪枝、蒸馏、稀疏化、推测解码和部署导出整合为一套模型优化库。它覆盖 PyTorch 到 TensorRT-LLM 等路径,目标是在训练后或微调阶段压缩模型,同时保留硬件友好格式。统一工具链减少了多个优化器之间的格式转换,但最优配置仍依赖具体 GPU、延迟目标与精度容忍度。
likec4/likec460github.com原文 ↗
LikeC4 用声明式代码描述系统、容器、组件和关系,再生成可交互架构图与多层视图。模型文件可进入 Git 审查,图形随代码持续更新,并支持嵌入文档和 IDE 预览。它把架构图从静态插图变成可验证资产,前提是团队愿意维护模型与实际系统的一致性。
MoonshotAI/kimi-code61github.com原文 ↗
Kimi Code 是终端编程代理,可读取仓库、编辑文件、运行命令并在任务中维护上下文。项目支持多模型后端和工具调用,工作方式接近可脚本化的 coding agent,而非单纯补全插件。开源实现便于审计提示词与执行边界,也让团队能按自身审批和沙箱策略改造。
apache/ossie62github.com原文 ↗
Apache OSSIE 定义可交换的语义元数据规范,让指标、维度、实体和业务含义能在 BI、分析与 AI 系统之间共享。项目关注模型表示和互操作,而不是再造一个数据仓库。若生态采用,它可减少每个工具重复翻译语义层的成本;挑战在于如何兼容各平台已有的计算表达与权限模型。
block/buzz63github.com原文 ↗
Buzz 把团队聊天、Git 托管事件和 AI agent 协作集中到一个可自托管工作区。代理可以在对话中接收任务、访问代码并反馈执行状态,人类仍保留讨论和审查界面。它尝试把 agent 从独立 CLI 拉进团队协作流,但权限继承与自动执行边界必须设计清楚。
ZSeven-W/openpencil64github.com原文 ↗
OpenPencil 是开源矢量设计工具,支持提示词生成界面、Design-as-Code、MCP 接入和多智能体协作。设计对象既能在画布中编辑,也能作为结构化表示被 agent 修改,形成视觉与代码双向工作流。项目的技术难点不在生成一张图,而在保持布局、组件语义和后续人工编辑能力。
bojieli/ai-agent-book65github.com原文 ↗
该仓库开放 AI Agent 工程书籍正文、电子书构建和配套实验代码,内容覆盖规划、记忆、工具使用、评测与部署。读者可以把概念章节与可运行示例对应起来,并通过 Git 获取持续更新。它更像一套可复现实验教材,而非只讲提示词技巧的概览读物。
yvgude/lean-ctx66github.com原文 ↗
lean-ctx 用本地 Rust 进程管理代理上下文、记忆、访问控制和持久化记录,对外提供统一接口。它把上下文选择从单次 prompt 拼装提升为独立服务,可在多个 agent 间复用并记录读取历史。轻量本地架构有利于隐私和低延迟,但策略质量取决于压缩、召回与权限规则的组合。
akitaonrails/ai-memory67github.com原文 ↗
ai-memory 为不同厂商的 coding agent 保存项目目标、已完成步骤、关键决定和待办,使任务可跨客户端交接。项目关注的是结构化工作状态,而不是无差别存储全部对话。这样可以降低更换模型或终端工具时的上下文损失,同时避免把大量历史原样塞回窗口。
rtk-ai/rtk68github.com原文 ↗
RTK 是位于 shell 命令与 LLM 之间的 Rust CLI 代理,先过滤、归并和压缩输出,再送入模型上下文。它针对测试日志、构建输出和版本控制信息中的重复噪声,保留错误与关键差异。项目的收益可直接体现为 token 与注意力预算下降,但过滤规则必须避免删除诊断所需的上下文。
NVIDIA/cosmos-framework69github.com原文 ↗
Cosmos Framework 为 NVIDIA 世界模型提供统一训练、微调、数据处理和推理部署入口,覆盖视频与物理 AI 场景。仓库把模型组件、并行训练和评估流程放进同一框架,便于复现实验和扩展任务。其价值在于降低世界模型工程碎片化,不过运行完整训练仍需要高端 GPU 基础设施。
datalab-to/chandra70github.com原文 ↗
Chandra 面向复杂文档 OCR,可把表格、表单、手写内容和 PDF 转换成保留结构的 HTML、Markdown 或 JSON。项目不仅识别字符,还尝试恢复阅读顺序、单元格与布局层级,便于后续检索和数据抽取。相比纯文本 OCR,它更适合文档智能管线,但版面忠实度应按真实扫描件单独验证。
dottxt-ai/outlines71github.com原文 ↗
Outlines 通过 JSON Schema、正则表达式或形式语法约束 LLM 解码,使输出在生成时就满足结构,而非事后反复修 JSON。库支持多种模型后端,并把 constrained generation 封装成接近普通 Python 类型调用的接口。它能显著减少解析失败,但复杂语法会增加解码开销,也不能保证字段内容本身正确。
Pumpkin-MC/Pumpkin72github.com原文 ↗
Pumpkin 用 Rust 从头实现 Minecraft 服务器,目标是高性能、低内存和模块化扩展,而不是包装原版 Java 服务端。项目逐步实现协议、世界、实体与插件能力,并利用 Rust 的并发和类型安全控制服务器状态。它为大型或定制服务器提供新底座,但与成熟插件生态及游戏版本行为保持兼容是长期工作。
引用来源 · References
72 条 · 引用- 1 PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection. arXiv:2607.16199https://arxiv.org/abs/2607.16199 ↩ 回到正文 · back to text
- 2 Deterministic Replay for AI Agent Systems. arXiv:2607.16200https://arxiv.org/abs/2607.16200 ↩ 回到正文 · back to text
- 3 Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL. arXiv:2607.16204https://arxiv.org/abs/2607.16204 ↩ 回到正文 · back to text
- 4 KernelBench-Verified: Do LLM-Generated Kernels Actually Beat PyTorch?. arXiv:2607.16241https://arxiv.org/abs/2607.16241 ↩ 回到正文 · back to text
- 5 GigaToken. GitHub: marcelroed/gigatokenhttps://github.com/marcelroed/gigatoken/ ↩ 回到正文 · back to text
- 6 Accurate and Efficient Long-Term Memory for LLM Agents. arXiv:2607.16211https://arxiv.org/abs/2607.16211 ↩ 回到正文 · back to text
- 7 RECON: Benchmarking Agent Memory for Compositional Reasoning over Long Contexts. arXiv:2607.16716https://arxiv.org/abs/2607.16716 ↩ 回到正文 · back to text
- 8 AgentBrew: Lifelong Knowledge Brewing from Strong Teachers to Weak LLM Agents. arXiv:2607.16851https://arxiv.org/abs/2607.16851 ↩ 回到正文 · back to text
- 9 Environment-free Synthetic Data Generation for API-Calling Agents. arXiv:2607.16900https://arxiv.org/abs/2607.16900 ↩ 回到正文 · back to text
- 10 Lomekwi: Resource-Bounded Tool Discovery in LLM Agents. arXiv:2607.16961https://arxiv.org/abs/2607.16961 ↩ 回到正文 · back to text
- 11 Otap: Structure-Aware Optimal Transport for Evaluating Planning and Execution in Agent Trajectories. arXiv:2607.17082https://arxiv.org/abs/2607.17082 ↩ 回到正文 · back to text
- 12 A Systematic Evaluation of Trajectory Data Curation for LoRA Fine-Tuning of Code Agents. arXiv:2607.17205https://arxiv.org/abs/2607.17205 ↩ 回到正文 · back to text
- 13 AEVAL: From Anecdotal to Deterministic Testing for Agentic Skill Workflows. arXiv:2607.16345https://arxiv.org/abs/2607.16345 ↩ 回到正文 · back to text
- 14 Is Progressive Disclosure All You Need for Long-Context Agents?. arXiv:2607.17598https://arxiv.org/abs/2607.17598 ↩ 回到正文 · back to text
- 15 Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents. arXiv:2607.17641https://arxiv.org/abs/2607.17641 ↩ 回到正文 · back to text
- 16 ETAS: An Effect-Typed Language for Agent Systems. arXiv:2607.17780https://arxiv.org/abs/2607.17780 ↩ 回到正文 · back to text
- 17 Bentohttps://bento.page/slides/ ↩ 回到正文 · back to text
- 18 Millwright. GitHub: Northwood-Systems/millwrighthttps://github.com/Northwood-Systems/millwright ↩ 回到正文 · back to text
- 19 SyncLite. GitHub: syncliteio/SyncLitehttps://github.com/syncliteio/SyncLite ↩ 回到正文 · back to text
- 20 Cactus Hybrid. GitHub: cactus-compute/cactus-hybridhttps://github.com/cactus-compute/cactus-hybrid ↩ 回到正文 · back to text
- 21 Drskill. GitHub: dbreunig/drskillhttps://github.com/dbreunig/drskill ↩ 回到正文 · back to text
- 22 Memory Bench. GitHub: leapmemory/memory-benchhttps://github.com/leapmemory/memory-bench ↩ 回到正文 · back to text
- 23 DataParade. GitHub: DataParade-io/dataparade-clihttps://github.com/DataParade-io/dataparade-cli ↩ 回到正文 · back to text
- 24 Drey. GitHub: mario/dreyhttps://github.com/mario/drey ↩ 回到正文 · back to text
- 25 Browser Tools SDKhttps://libretto.sh/browser-tools ↩ 回到正文 · back to text
- 26 Superservehttps://www.superserve.ai/ ↩ 回到正文 · back to text
- 27 Blackbar Nano. GitHub: safetype/blackbar-nanohttps://github.com/safetype/blackbar-nano ↩ 回到正文 · back to text
- 28 Ingot. GitHub: SlanchaAI/ingothttps://github.com/SlanchaAI/ingot ↩ 回到正文 · back to text
- 29 The Harbinger. GitHub: n0tduck1e/theharbingerhttps://github.com/n0tduck1e/theharbinger ↩ 回到正文 · back to text
- 30 SimpleBLE 1.0. GitHub: simpleble/simpleblehttps://github.com/simpleble/simpleble ↩ 回到正文 · back to text
- 31 Judge approves $1.5B Anthropic settlement for pirated books used to train Claudehttps://apnews.com/article/ai-anthropic-copyright-settlement-claude-books-bartz-74b140444023898aeba8579b6e9f0d63 ↩ 回到正文 · back to text
- 32 Kimi K3 Is Competitive with Fable; Kimi K3 and Fable Is SoTAhttps://fireworks.ai/blog/kimik3-fable ↩ 回到正文 · back to text
- 33 Laguna S 2.1https://poolside.ai/blog/introducing-laguna-s-2-1 ↩ 回到正文 · back to text
- 34 Advertise in ChatGPThttps://ads.openai.com/ ↩ 回到正文 · back to text
- 35 Introducing OpenAI Presencehttps://openai.com/index/introducing-openai-presence ↩ 回到正文 · back to text
- 36 Advancing the next era of national sciencehttps://openai.com/index/advancing-the-next-era-of-national-science ↩ 回到正文 · back to text
- 37 Building AI infrastructure with the Effingham County communityhttps://openai.com/index/building-ai-infrastructure-with-the-effingham-county-community ↩ 回到正文 · back to text
- 38 Gemini latest models: temperature, top_p, and top_k are deprecated and ignoredhttps://ai.google.dev/gemini-api/docs/latest-model ↩ 回到正文 · back to text
- 39 LG to ban residential proxies from smart TV appshttps://krebsonsecurity.com/2026/07/lg-to-ban-residential-proxies-from-smart-tv-apps/ ↩ 回到正文 · back to text
- 40 PyPI releases now reject new files after 14 dayshttps://blog.pypi.org/posts/2026-07-22-releases-now-reject-new-files-after-14-days/ ↩ 回到正文 · back to text
- 41 Codeberg: ToU extension to prohibit LLM-extrusionshttps://codeberg.org/Codeberg/org/pulls/1253 ↩ 回到正文 · back to text
- 42 Roblox Officially Supports GrapheneOShttps://en.help.roblox.com/hc/en-us/articles/49648939984916-Android-Remote-Attestation ↩ 回到正文 · back to text
- 43 A digestion of the Jacobian conjecture counterexamplehttps://terrytao.wordpress.com/2026/07/21/a-digestion-of-the-jacobian-conjecture-counterexample/ ↩ 回到正文 · back to text
- 44 Everyone Should Know SIMDhttps://mitchellh.com/writing/everyone-should-know-simd ↩ 回到正文 · back to text
- 45 Are AI Labs Pelicanmaxxing?https://dylancastillo.co/posts/pelicanmaxxing.html ↩ 回到正文 · back to text
- 46 The startup's Postgres survival guidehttps://hatchet.run/blog/postgres-survival-guide ↩ 回到正文 · back to text
- 47 Makinghttps://beej.us/blog/data/ai-making/ ↩ 回到正文 · back to text
- 48 Never Enoughhttps://dark.ronacher.eu/2026/7/21/never-enough/ ↩ 回到正文 · back to text
- 49 Open models recap: more on Kimi K3, Qwen 3.8, Xi's WAIC speech, distillation, the open-closed gap, and what's nexthttps://www.interconnects.ai/p/open-models-recap-more-on-kimi-k3 ↩ 回到正文 · back to text
- 50 Two years of vector search at Notion: 10x scale, 1/10th costhttps://www.notion.com/blog/two-years-of-vector-search-at-notion ↩ 回到正文 · back to text
- 51 A flaky test exposed a Redis client use-after-freehttps://buildkite.engineering/how-a-flaky-test-exposed-a-redis-use-after-free/ ↩ 回到正文 · back to text
- 52 Ghost Cut - or why Cut and Paste is broken everywherehttps://ishmael.textualize.io/blog/ghost-cut/ ↩ 回到正文 · back to text
- 53 Some more things about Django I've been enjoyinghttps://jvns.ca/blog/2026/07/21/more-nice-django-things/ ↩ 回到正文 · back to text
- 54 RefluXFS: A Linux Kernel Local Privilege Escalation to Root in XFShttps://blog.qualys.com/vulnerabilities-threat-research/2026/07/22/refluxfs-a-linux-kernel-local-privilege-escalation-to-root-in-xfs-cve-2026-64600 ↩ 回到正文 · back to text
- 55 Dark Elevator: Windows Install Service Local Privilege Escalationhttps://blog.calif.io/p/dark-elevator-windows-install-service ↩ 回到正文 · back to text
- 56 dcmake: a new CMake debugger UIhttps://nullprogram.com/blog/2026/04/07/ ↩ 回到正文 · back to text
- 57 Unicode Variation Selector-15 and some of my tearshttps://benjaminwil.info/weblog/variation-selector-15/ ↩ 回到正文 · back to text
- 58 HKUDS/LightRAG. GitHub: HKUDS/LightRAGhttps://github.com/HKUDS/LightRAG ↩ 回到正文 · back to text
- 59 NVIDIA/Model-Optimizer. GitHub: NVIDIA/Model-Optimizerhttps://github.com/NVIDIA/Model-Optimizer ↩ 回到正文 · back to text
- 60 likec4/likec4. GitHub: likec4/likec4https://github.com/likec4/likec4 ↩ 回到正文 · back to text
- 61 MoonshotAI/kimi-code. GitHub: MoonshotAI/kimi-codehttps://github.com/MoonshotAI/kimi-code ↩ 回到正文 · back to text
- 62 apache/ossie. GitHub: apache/ossiehttps://github.com/apache/ossie ↩ 回到正文 · back to text
- 63 block/buzz. GitHub: block/buzzhttps://github.com/block/buzz ↩ 回到正文 · back to text
- 64 ZSeven-W/openpencil. GitHub: ZSeven-W/openpencilhttps://github.com/ZSeven-W/openpencil ↩ 回到正文 · back to text
- 65 bojieli/ai-agent-book. GitHub: bojieli/ai-agent-bookhttps://github.com/bojieli/ai-agent-book ↩ 回到正文 · back to text
- 66 yvgude/lean-ctx. GitHub: yvgude/lean-ctxhttps://github.com/yvgude/lean-ctx ↩ 回到正文 · back to text
- 67 akitaonrails/ai-memory. GitHub: akitaonrails/ai-memoryhttps://github.com/akitaonrails/ai-memory ↩ 回到正文 · back to text
- 68 rtk-ai/rtk. GitHub: rtk-ai/rtkhttps://github.com/rtk-ai/rtk ↩ 回到正文 · back to text
- 69 NVIDIA/cosmos-framework. GitHub: NVIDIA/cosmos-frameworkhttps://github.com/NVIDIA/cosmos-framework ↩ 回到正文 · back to text
- 70 datalab-to/chandra. GitHub: datalab-to/chandrahttps://github.com/datalab-to/chandra ↩ 回到正文 · back to text
- 71 dottxt-ai/outlines. GitHub: dottxt-ai/outlineshttps://github.com/dottxt-ai/outlines ↩ 回到正文 · back to text
- 72 Pumpkin-MC/Pumpkin. GitHub: Pumpkin-MC/Pumpkinhttps://github.com/Pumpkin-MC/Pumpkin ↩ 回到正文 · back to text