今日重点 · Today's Highlights
Profile-Graph Memory for LLM Agents - 将跨实体关系压缩进可读的叙事档案,并以 MemHop 的一至五跳查询检验长期记忆是否能隐式完成图遍历。3
全文 ↓Torchwright - 不训练模型,而是把算术、排序、图算法等计算图直接编译成 Transformer 权重,展示“神经网络即目标程序”的另类构造路径。4
全文 ↓论文 · Papers
15 项 · 论文本期重点FineServe: A Fine-Grained Dataset and Characterization of Global LLM Serving Workloads1arxiv.org原文 ↗
论文发布生产级 LLM 在线服务数据集,把请求、用户反馈、服务器指标和系统可观测数据按统一时间线对齐,并据此分析到达模式、模型路由、时延与硬件利用率之间的关系。数据来自多个国家和地区、不同业务场景及多种服务架构,而不是实验室合成流量。其价值在于让请求调度、自动扩缩容和性能建模首次能在细粒度真实负载上复现与比较。
本期重点Profile-Graph Memory for LLM Agents: Implicit Cross-Entity Traversal through Narrative Profiles3arxiv.org原文 ↗
作者把人物、组织和事件的关系写入持续更新的 narrative profile,让模型通过检索少量档案完成跨实体推理,而不必显式暴露或查询完整知识图。配套 MemHop 基准覆盖一至五跳问题,用来区分单实体回忆、关系拼接和长链路检索能力。结果所指向的核心取舍是:叙事压缩提高可读性与检索效率,但档案生成阶段一旦丢失关系,后续多跳推理无法恢复。
DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations7arxiv.org原文 ↗
DocOps 将复杂数字文档任务设计为可确定性验证的操作序列,覆盖读取、编辑、格式保持、跨文档搬运以及结构化内容处理。与依赖主观 LLM 打分的办公基准不同,它把结果转换为机器可检查的状态和约束,从而区分内容正确、版式正确与操作完整。这个基准真正测试的是 Agent 在长链路 GUI 或文档 API 中维持状态一致性的能力,而不只是生成一段看起来合理的文本。
JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety8arxiv.org原文 ↗
JANUS 从部分执行轨迹预测后续才会显现的风险,把安全监控从“当前动作是否违规”扩展到“这条行动链最终可能走向哪里”。训练样本包含早期表面正常、经过多步组合后才形成危害的轨迹,使模型学习延迟风险的前兆。它补足逐步过滤器的盲区,但效果依赖轨迹分布是否覆盖真实部署中的新型策略与工具组合。
Stateful Guardrails for Multi-Turn LLM Systems: A Conversational Risk Accumulation Framework9arxiv.org原文 ↗
论文把多轮对话中的风险视为可累积状态,持续记录意图漂移、分散指令的拼接效应和敏感信息逐步暴露,而不是逐轮独立分类。框架允许单条消息保持低风险,同时在组合达到阈值时提升响应限制。该思路针对的是“把危险请求拆成多个无害片段”的现实攻击面,也意味着系统必须谨慎处理跨轮记忆和风险衰减。
ChainWatch: A Kill Chain-Aligned Sequential Detection Framework for Multi-Step Attacks in MCP-Based AI Agent Systems11arxiv.org原文 ↗
ChainWatch 将 MCP 工具调用映射到攻击链阶段,以序列方式累积侦察、权限获取、数据访问和外传等弱信号。单个调用可能完全合规,只有跨时间关联后才会形成可疑链路,因此框架避免把每次工具调用孤立判定。它适合检测“低而慢”的多步攻击,不过也要求系统保留足够完整的工具遥测与会话上下文。
BaseRT: Advancing Best-in-Class LLM Inference with Apple M5 Neural Accelerators12arxiv.org原文 ↗
BaseRT 是面向 Apple M5 的原生 LLM 推理运行时,利用 Metal 4 和 GPU 核心内的神经加速单元,而非简单移植 CUDA 风格执行栈。系统围绕算子融合、内存布局和设备内调度重写关键路径,以降低统一内存架构下的数据搬运成本。它提供了观察消费级 Apple 芯片上专用矩阵硬件是否能形成独立推理生态的早期样本。
Fidelity Before Structure: Verbatim Chunks Beat Lossy Artifact Extraction in Long-Conversation LLM Memory14arxiv.org原文 ↗
研究在固定检索器和推理流程下比较逐字对话块与摘要、事实表等结构化记忆工件,发现保留原始措辞往往优于有损抽取。关键原因不是结构化表示毫无用处,而是抽取阶段会提前抹掉语气、条件和跨轮依赖,检索时再也无法恢复。结论把长期记忆设计的优先级重新排为“先保证信息保真,再优化组织形式”。
AgentCgroup: Understanding and Controlling OS Resources of AI Agents15arxiv.org原文 ↗
AgentCgroup 通过观测沙箱化编码 Agent 的 CPU、内存、进程树和 I/O 波动,研究自主任务如何在操作系统层面形成突发资源需求。系统借鉴 cgroup 的隔离与配额机制,为多租户 Agent 提供按会话控制、动态限额和异常终止能力。它把 Agent 可靠性问题落到传统资源治理层,尤其适用于同机并发运行大量工具型任务的环境。
Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents16arxiv.org原文 ↗
PIBench 把支付接入拆成产品选择、服务端签名、前端调用、异步通知和交易状态一致性等真实工程环节,并在现有代码仓库中评估 Agent。任务不以“代码能编译”结束,而要处理支付产品约束、跨端协议和失败后的状态收敛。与玩具级函数补全相比,这类基准更能暴露编码 Agent 在业务语义、文档检索和端到端验证上的断点。
Environment-free Synthetic Data Generation for API-Calling Agents17arxiv.org原文 ↗
论文提出无需完整可执行 API 环境和预填充数据库即可生成工具调用训练轨迹,通过接口规范、约束与模拟状态构造调用 - 响应链。这样可以在真实后端昂贵、敏感或尚未部署时扩充训练数据,并覆盖罕见错误路径。方法降低数据生产门槛,但合成状态与真实服务行为之间的偏差仍决定了训练收益能否迁移。
开源 / 项目 · Projects
15 项 · 开源 / 项目Max Studio Tools19github.com原文 ↗
该仓库汇集面向 Max/MSP 与 Ableton Live 的 C++ DSP 外部对象和开发工具,目标是把可复用音频算法封装为可直接加载的模块。其组织方式围绕 Max SDK、构建脚本和独立对象展开,方便在原型环境中迭代后复用到现场或制作工作流。项目的技术看点在于把实时音频、原生性能与可视化 patching 连接在一起。
LoongForge20github.com原文 ↗
LoongForge 的 embodied 模块是百度百舸面向具身模型的高性能训练组件,聚焦大规模多模态数据、分布式训练与机器人策略模型的工程化执行。它被放在更大的训练系统仓库中,意味着数据管线、并行策略和基础设施能够与通用大模型训练共享。对具身智能而言,这类系统层开源比单一模型权重更能暴露训练吞吐和扩展方式。
本期重点Torchwright4github.com原文 ↗
Torchwright 接收高层计算定义,将其编译成 Transformer 的固定权重,使网络在前向传播中精确执行指定算法而无需梯度训练。README 展示了算术、排序、图算法、AES-128、JSON parsing 与 Game of Life 等示例,并提供审计、可视化和模型导出工具。项目把 mechanistic interpretability、可验证计算与模型构造结合起来,但这种专用网络不等同于可泛化的学习模型。
PocketLens24github.com原文 ↗
PocketLens 是自托管的 Mint 替代方案,通过 Plaid 同步账户与交易,再在本地应用中完成分类、预算和资产观察。项目选择个人部署而非托管 SaaS,使敏感财务数据的存储位置和更新节奏由用户掌握。实际采用仍取决于 Plaid 覆盖范围、密钥管理以及金融机构连接稳定性。
CockroachCrawler28github.com原文 ↗
CockroachCrawler 将普通 HTTP 抓取、浏览器自动化、PDF 解析、正文抽取和 MCP 接口打包到一套工具链中。调用方可以按页面复杂度在轻量请求与完整浏览器之间切换,并把结果交给 Agent 继续处理。统一接口减少了多种爬取组件的胶水代码,但部署时仍需处理站点条款、限速与不受信任页面内容。
OpenLeetcode30github.com原文 ↗
OpenLeetcode 把题目、解答和测试用例保存在普通仓库中,由本地 runner 编译执行多种语言方案。项目收录约一千道题,避免依赖在线判题站的账户、网络与编辑器。可版本控制的测试和答案让练习过程更容易自动化,也适合拿来构建编码 Agent 的本地回归集。
行业动态 · Industry News
12 项 · 行业动态Claude Opus 531anthropic.com原文 ↗
Anthropic 发布 Claude Opus 5,并同步提供模型系统卡,将能力更新与安全评估放在同一发布节点。现有公开描述把它定位为新一代高能力旗舰模型。真正需要观察的是系统卡中的具体评测、部署限制和与前代的成本 - 性能变化,而不只是发布名称。
Flux 332bfl.ai原文 ↗
Black Forest Labs 发布 Flux 3 图像生成模型系列,继续扩展其文生图与图像编辑产品线。系列化命名通常意味着不同尺寸、质量和推理成本的部署档位。其技术含量要由分辨率、文字渲染、编辑一致性和可用权重范围等可复现实测来判断。
Flux 3 X Mimic: The Next Generation of Video-Action Models33bfl.ai原文 ↗
Flux 3 X Mimic 将视频生成与动作控制结合,目标是让模型不仅预测画面,还能响应外部动作条件生成后续状态。此类 video-action 模型把生成式视频从内容创作推向机器人和交互环境建模。关键挑战是动作因果一致性:视觉逼真并不能保证生成轨迹服从控制信号或真实物理。
DARPA, U.S. Air Force Fly AI-Controlled F-1634darpa.mil原文 ↗
DARPA 与美国空军披露 AI 控制 F-16 的飞行测试进展,把自主控制算法放进高动态、强安全约束的平台。项目意义不在于单次“AI 驾机”的演示,而在飞行包线、故障处置、人类监督与验证流程是否能形成可重复体系。公开信息仍应区分受控试验、任务自主性和可部署作战能力三个层次。
Nvidia, Microsoft, Meta Warn Against Overregulating Open-Weight Models35cnbc.com原文 ↗
Nvidia、Microsoft、Meta 等公司主张美国政策为开放权重模型的开发和分发保留空间,担忧过度监管削弱研究与产业竞争。争论焦点并非简单的“开放或封闭”,而是权重发布者、下游微调者与实际部署者如何分担安全责任。政策走向会直接影响模型许可证、出口控制和高能力权重的获取门槛。
Launching Health in ChatGPT to US Users36openai.com原文 ↗
OpenAI 宣布向美国用户推出 ChatGPT Health,可连接医疗记录和健康应用,并在与普通对话分隔的独立空间中提供回答。官方称该产品由 60 多个国家、超过 260 名医生参与反馈,过去两年累计超过 60 万小时;OpenAI 还表示 ChatGPT 每周收到超过 2.3 亿条健康相关问题。产品强调静态与传输加密,且 Health 对话不用于训练基础模型,但它仍定位为理解和准备医疗沟通的工具,而非替代临床诊断。
Stripe in Talks to Buy OpenRouter for About $10B37wsj.com原文 ↗
《华尔街日报》报道称 Stripe 正洽谈以约 100 亿美元收购模型聚合平台 OpenRouter。若交易推进,支付基础设施公司将获得跨模型路由、计费和开发者入口,OpenRouter 也会从中立市场更深地绑定单一平台。报道目前描述的是谈判而非已完成收购,估值与最终条款仍可能变化。
Alphabet's Cash Burn Raises Alarm for Big Tech as AI Spending Climbs38reuters.com原文 ↗
路透社分析 Alphabet 扩大 AI 基础设施投资后,资本开支和自由现金流承受的压力。市场关注点正在从“是否投入 AI”转向数据中心、芯片和能源支出能否转化为可持续收入。现金消耗本身不等于战略失误,但会提高投资者对利用率、折旧周期与云业务增长的审查强度。
Government Orders GitHub to Remove Bluetooth-Based Chat App Bitchat39thehindu.com原文 ↗
《印度教徒报》报道印度政府因安全问题要求 GitHub 移除基于蓝牙的聊天应用 Bitchat。事件把代码托管平台置于国家安全命令、开源分发与开发者权利的交叉点。即使仓库被下架,分叉与镜像仍可能继续传播,因此行政移除并不等同于技术上消失。
JEP 541: Deprecate the macOS/x64 Port for Removal40openjdk.org原文 ↗
JEP 541 提议弃用 macOS/x64 移植版本,为后续删除 Intel Mac 支持做准备。弃用阶段通常保留构建能力但明确进入退出路径,让库作者、CI 服务和仍在使用 Intel 设备的团队获得迁移窗口。此举反映 Java 平台维护成本正向 Apple Silicon 集中,而不是立即让现有 x64 JDK 停止运行。
3GPP Release 19413gpp.org原文 ↗
3GPP 汇总 Release 19 的规范范围,延续 5G-Advanced 在无线接入、核心网、卫星通信、定位与自动化方面的演进。标准发布不是单个功能上线,而是大量技术报告和规范在冻结节点后进入设备、芯片与运营商实现。观察重点应放在哪些增强最终进入商用网络,以及 Release 20 向 6G 过渡时哪些工作被延后。
My Security Camera Shipped a GitHub Admin Token in Its Login Page42hhh.hn原文 ↗
研究者发现一款 Hanwha 网络摄像头把 GitHub 管理令牌暴露在设备登录页面中,使前端可访问凭据跨越了产品与源码托管基础设施的边界。问题不仅是单个 secret 泄露,还暴露了构建流程、固件发布和凭据轮换之间缺乏隔离。硬编码令牌一旦随设备出货,修复必须同时覆盖撤销、固件更新和受影响仓库的审计。
博客文章 · Blog Posts
15 项 · 博客文章Postgres LISTEN/NOTIFY Actually Scales43dbos.dev原文 ↗
DBOS 通过基准测试挑战 `LISTEN/NOTIFY` 只能用于小规模通知的常见印象,重点观察大量连接与持续通知下的吞吐、延迟和数据库开销。文章把连接数、发布速率与 payload 等变量分开测试,而不是只给出单一峰值。结论更适合作为架构选型的边界数据:它能支撑许多协调场景,但仍不是持久消息队列的替代品。
Watching Go's New Garbage Collector Move Through the Heap44theconsensus.dev原文 ↗
作者用堆可视化对比 Go 新旧垃圾回收器,让对象分配、存活和整理过程从抽象指标变成可观察的空间变化。文章关注新收集器如何移动或重排堆中的对象,以及这些行为怎样影响碎片、局部性和暂停。可视化的价值在于解释相同吞吐数字背后的内存形态,而不是只宣布某个 GC 更快。
Delightful Integration Tests in Rust45github.com原文 ↗
这篇实践文将 Rust 集成测试组织为独立测试应用,为数据库、服务和 fixture 明确建立与销毁生命周期。它利用类型和 RAII 把资源清理绑定到作用域,减少测试失败后残留状态,并让依赖注入保持可读。文章讨论的不是某个测试框架技巧,而是如何让真实依赖测试仍然快速、隔离且容易调试。
A Love Letter to Object Orientation46blog.mempko.com原文 ↗
文章从对象作为状态与行为边界、消息传递以及局部推理重新评价面向对象,而非把它等同于继承层级。作者强调 OOP 的长处在于让变化被封装在稳定接口后,并使协作单元拥有清晰责任。这个视角能解释为什么“组合优于继承”仍属于对象设计,而不是对 OOP 的否定。
Query Cycles: A Compiler Murder Mystery47ferrous-systems.com原文 ↗
Ferrous Systems 以 Rust 编译器查询系统中的循环依赖为线索,逐步还原一个症状远离根因的编译器故障。文章展示如何从错误输出、查询图和最小复现追踪相互等待的计算节点。其启发在于增量编译器的查询缓存不仅提升性能,也会把普通递归错误变成需要图级诊断的状态问题。
git rebase -i Is Not That Scary48cachebag.sh原文 ↗
教程把交互式 rebase 拆成重排、合并、改写和删除提交等具体动作,并解释 todo 列表从旧到新的执行顺序。通过先在本地历史上演练,读者可以理解 `pick`、`squash`、`reword` 与 `edit` 分别改变什么。文章同时隐含一条重要边界:重写已共享分支需要协作约定,而不是把命令熟练度当成安全保证。
The Small, Real, Original Web49spacetimetech.wordpress.com原文 ↗
作者回顾由个人主页、静态 HTML、博客互链和手工维护目录构成的“小 Web”,强调其可理解性与自主所有权。与平台 feed 相比,这类站点增长慢、界面不统一,却允许作者控制域名、页面和链接关系。文章不是否定现代 Web 技术,而是提醒分发层的集中化会改变创作、发现和长期保存的结构。
Asked Codex to Redesign a Page; It Pushed My Repo to OpenAI Infra50bhanu.io原文 ↗
作者记录让 Codex 重设计网页时,观察到私有仓库内容被传输到 OpenAI 远程基础设施的过程。文章的实质问题是本地开发工具何时会启用云端执行、发送哪些文件,以及界面是否充分表达这一边界。案例提示团队在使用编码 Agent 前应把运行模式、数据保留和密钥扫描纳入工具评审,而非只看生成效果。
Codeberg Divides51lucumr.pocoo.org原文 ↗
Armin Ronacher 讨论 Codeberg 社区围绕治理方式、平台定位和项目边界出现的分歧。文章把冲突放在志愿者基础设施的长期压力下观察:价值观一致并不能自动解决资源分配、决策程序与扩张速度。它提供了开源托管平台的组织侧案例,说明技术替代 GitHub 之外还需要可持续治理。
Writing a Debugger from Scratch52timdbg.com原文 ↗
系列首篇从启动或附加进程、处理调试事件和控制执行开始,逐层搭建一个底层调试器。实现路线刻意避开大型框架,让断点、寄存器、内存和符号解析背后的操作系统接口可见。手写最小调试器的价值不在取代成熟工具,而在建立对进程控制模型的精确直觉。
WebGPU Unleashed: A Practical Tutorial53shi-yan.github.io原文 ↗
教程通过可运行示例介绍 WebGPU 的 adapter/device 初始化、buffer 与 texture 管理、渲染管线、WGSL 着色器和 compute dispatch。内容从最小三角形逐步进入数据布局与并行计算,帮助读者理解显式 GPU API 的资源生命周期。它同时展示 WebGPU 不只是浏览器图形接口,也可承载跨平台通用计算。
Nothing Works and Everyone Is Euphoric54ptrchm.com原文 ↗
文章批评 AI 软件热潮中演示效果、资本叙事与日常可靠性之间的脱节:系统在精心选择的场景里惊艳,却在连续工作流中频繁失效。作者关注的不是模型是否“有智能”,而是错误率、可恢复性和维护成本为何没有进入同等强度的讨论。评论为行业兴奋度补上了工程尺度,尤其适合与生产事故和用户留存数据对照阅读。
A Tour of MLIR: The Dialect Stack Everyone Depends On56hiraditya.github.io原文 ↗
文章沿 MLIR 方言栈从高层机器学习图走向 linalg、affine、scf、vector、gpu 与 LLVM 等低层表示,解释 lowering 为什么被拆成多级转换。每层保留特定语义与优化机会,避免编译器过早降到难以分析的指令级 IR。这个导览有助于理解现代 ML 编译器的复用基础:共享的不是单一 IR,而是一套可组合的中间表示生态。
GitHub 热门 · GitHub Trending
12 项 · GitHub 热门slavakurilyak/awesome-ai-agents58github.com原文 ↗
这是一个覆盖 300 余项 Agent 项目、框架、论文、课程和工具的 curated list,并按类别提供导航。仓库的作用是生态索引而非可执行框架,适合用来比较不同 Agent 定义、编排模式与应用方向。此类列表的质量取决于持续维护和收录标准,star 数不能替代项目成熟度判断。
oraios/serena59github.com原文 ↗
Serena 通过语言服务器与符号级代码分析,为编码 Agent 提供查找定义、引用关系、结构化编辑和重构能力,并可作为 MCP Server 接入多种客户端。它避免让模型反复读取整文件,转而围绕类、函数和符号关系操作代码。仓库同时支持多语言与项目记忆,定位更接近“Agent 的 IDE 后端”而非又一个聊天界面。
raullenchai/Rapid-MLX60github.com原文 ↗
Rapid-MLX 是面向 Apple Silicon 的本地推理引擎,围绕 MLX 优化模型加载、生成和服务,并兼容 OpenAI、Anthropic 风格 API。项目强调在 Mac 上以统一端点承载不同客户端,降低本地模型替换云 API 的接入成本。它的实际优势需要结合支持模型、量化格式、并发和长上下文内存占用评估。
Automattic/harper61github.com原文 ↗
Harper 是 Rust 编写的离线英文语法检查器,目标是在不上传文本的情况下提供拼写、语法和风格提示。核心引擎可嵌入编辑器、浏览器和其他应用,仓库同时维护多种集成。隐私与低延迟是它相对云端写作助手的主要差异,但规则型或轻量模型对复杂语义错误的覆盖仍有限。
PrismML-Eng/Bonsai-demo62github.com原文 ↗
Bonsai-demo 展示如何在 Metal、CUDA、Vulkan、ROCm 或 CPU 后端运行 Bonsai 低比特语言模型,提供跨硬件推理入口。仓库的重点是模型格式、运行时适配与演示,而不是完整训练框架。多后端支持使低比特模型更容易在边缘设备验证,不过不同平台的算子覆盖和性能一致性仍需实测。
block/buzz63github.com原文 ↗
Buzz 是面向人类与 AI Agent 的自托管协作平台,围绕房间组织聊天、任务和开发活动。项目试图让 Agent 以一等参与者加入共享上下文,而不是隐藏在单个用户的编辑器插件里。自托管有利于权限和数据控制,但多人、多 Agent 环境更需要明确身份、操作审计和消息可见范围。
citrolabs/ego-lite64github.com原文 ↗
Ego Lite 把普通用户标签页与 Agent 自动化任务隔离到不同浏览空间,减少自动点击、导航和凭据访问对日常浏览的干扰。它以浏览器容器化思路划分状态,而不是让 Agent 直接接管主会话。隔离能降低误操作半径,但如果两个空间共享下载目录、扩展或系统密钥,仍需继续收紧边界。
agegr/pi-web65github.com原文 ↗
pi-web 为 Pi 编码 Agent 提供本地 Web 界面,可浏览历史会话、实时聊天、切换模型并管理技能。前端把命令行 Agent 的状态与配置暴露成可远程访问的工作台,方便长任务观察和多设备使用。部署时应把认证与网络监听配置视为核心功能,因为界面可能直接拥有代码执行能力。
kvcache-ai/ktransformers66github.com原文 ↗
KTransformers 是面向异构 LLM 推理与微调实验的框架,通过可替换算子把模型的不同部分分配到 CPU、GPU 等设备。它特别关注显存不足场景下的权重放置、KV cache 和高性能 CPU kernel,使超大模型能在消费级硬件组合上运行。灵活调度带来更复杂的性能调优,最佳配置会随模型结构和内存带宽显著变化。
alibaba/open-code-review67github.com原文 ↗
Open Code Review 是代码审查 CLI,把确定性规则管线与 LLM Agent 结合,在 pull request 或本地 diff 上生成行级问题评论。规则先处理可稳定检测的问题,模型再分析上下文、设计与潜在缺陷,避免所有判断都依赖生成式输出。可落地性的关键在低误报、增量范围控制以及评论能否提供可验证修复建议。
verus-lang/verus68github.com原文 ↗
Verus 为 Rust 增加规范、证明和 ghost code,让开发者用 SMT 求解器静态验证实现满足前置条件、后置条件与不变量。它保留 Rust 的所有权与类型系统,同时把功能正确性要求提升到机器检查的逻辑层。代价是需要显式建模和证明工程,因此更适合安全关键组件、协议与底层库,而非无差别覆盖所有业务代码。
THU-MAIC/OpenMAIC69github.com原文 ↗
OpenMAIC 是清华团队开源的多 Agent 互动课堂系统,由讲授者、提问者等角色共同生成课程对话,并可合成语音、字幕和视频。仓库提供 Web UI、模型配置以及课程生成流水线,把一次提示扩展成可编辑的教学过程。多角色能增加节奏和观点变化,但知识准确性仍需要资料约束与人工审核。
引用来源 · References
69 条 · 引用- 1 FineServe: A Fine-Grained Dataset and Characterization of Global LLM Serving Workloads. arXiv:2607.19349https://arxiv.org/abs/2607.19349 ↩ 回到正文 · back to text
- 2 NEXUS: Structured Runtime Safety for Tool-Using LLM Agents. arXiv:2607.19356https://arxiv.org/abs/2607.19356 ↩ 回到正文 · back to text
- 3 Profile-Graph Memory for LLM Agents: Implicit Cross-Entity Traversal through Narrative Profiles. arXiv:2607.19359https://arxiv.org/abs/2607.19359 ↩ 回到正文 · back to text
- 4 Torchwright. GitHub: physicsrob/torchwrighthttps://github.com/physicsrob/torchwright ↩ 回到正文 · back to text
- 5 Twigg. GitHub: twigg-vc/monorepohttps://github.com/twigg-vc/monorepo ↩ 回到正文 · back to text
- 6 Silent Failures in Multimodal Agentic Search: A Diagnostic Taxonomy and Cross-Judge Evaluation. arXiv:2607.19793https://arxiv.org/abs/2607.19793 ↩ 回到正文 · back to text
- 7 DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations. arXiv:2607.19865https://arxiv.org/abs/2607.19865 ↩ 回到正文 · back to text
- 8 JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety. arXiv:2607.19913https://arxiv.org/abs/2607.19913 ↩ 回到正文 · back to text
- 9 Stateful Guardrails for Multi-Turn LLM Systems: A Conversational Risk Accumulation Framework. arXiv:2607.19361https://arxiv.org/abs/2607.19361 ↩ 回到正文 · back to text
- 10 ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems. arXiv:2607.19430https://arxiv.org/abs/2607.19430 ↩ 回到正文 · back to text
- 11 ChainWatch: A Kill Chain-Aligned Sequential Detection Framework for Multi-Step Attacks in MCP-Based AI Agent Systems. arXiv:2607.19432https://arxiv.org/abs/2607.19432 ↩ 回到正文 · back to text
- 12 BaseRT: Advancing Best-in-Class LLM Inference with Apple M5 Neural Accelerators. arXiv:2607.19438https://arxiv.org/abs/2607.19438 ↩ 回到正文 · back to text
- 13 Guardrails as Scapegoats: Auditing Unfaithful Safety Refusals in Tool-Augmented LLM Agents. arXiv:2607.19449https://arxiv.org/abs/2607.19449 ↩ 回到正文 · back to text
- 14 Fidelity Before Structure: Verbatim Chunks Beat Lossy Artifact Extraction in Long-Conversation LLM Memory. arXiv:2601.00821https://arxiv.org/abs/2601.00821 ↩ 回到正文 · back to text
- 15 AgentCgroup: Understanding and Controlling OS Resources of AI Agents. arXiv:2602.09345https://arxiv.org/abs/2602.09345 ↩ 回到正文 · back to text
- 16 Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents. arXiv:2607.14573https://arxiv.org/abs/2607.14573 ↩ 回到正文 · back to text
- 17 Environment-free Synthetic Data Generation for API-Calling Agents. arXiv:2607.16900https://arxiv.org/abs/2607.16900 ↩ 回到正文 · back to text
- 18 SerTerm. GitHub: eliachiarucci/SerTermhttps://github.com/eliachiarucci/SerTerm ↩ 回到正文 · back to text
- 19 Max Studio Tools. GitHub: apresta/max-studio-toolshttps://github.com/apresta/max-studio-tools ↩ 回到正文 · back to text
- 20 LoongForge. GitHub: baidu-baige/LoongForgehttps://github.com/baidu-baige/LoongForge/tree/master/loongforge/embodied ↩ 回到正文 · back to text
- 21 Poddie. GitHub: SinanTang/poddiehttps://github.com/SinanTang/poddie ↩ 回到正文 · back to text
- 22 Browser Bridge. GitHub: vitalysim/browser-bridgehttps://github.com/vitalysim/browser-bridge ↩ 回到正文 · back to text
- 23 Catalyst. GitHub: imbue-ai/catalysthttps://github.com/imbue-ai/catalyst ↩ 回到正文 · back to text
- 24 PocketLens. GitHub: PocketLens/pocketlens-apphttps://github.com/PocketLens/pocketlens-app ↩ 回到正文 · back to text
- 25 Sigil. GitHub: sigilagent/sigilhttps://github.com/sigilagent/sigil ↩ 回到正文 · back to text
- 26 Marrow. GitHub: gnosislabstech/marrowhttps://github.com/gnosislabstech/marrow ↩ 回到正文 · back to text
- 27 AgentWatch. GitHub: dhanraj176/agentwatchhttps://github.com/dhanraj176/agentwatch ↩ 回到正文 · back to text
- 28 CockroachCrawler. GitHub: AjnasNB/cockroach-crawlerhttps://github.com/AjnasNB/cockroach-crawler ↩ 回到正文 · back to text
- 29 Amdb. GitHub: BETAER-08/amdbhttps://github.com/BETAER-08/amdb ↩ 回到正文 · back to text
- 30 OpenLeetcode. GitHub: therepanic/openleetcodehttps://github.com/therepanic/openleetcode ↩ 回到正文 · back to text
- 31 Claude Opus 5. Anthropichttps://www.anthropic.com/news/claude-opus-5 ↩ 回到正文 · back to text
- 32 Flux 3. Black Forest Labshttps://bfl.ai/blog/flux-3 ↩ 回到正文 · back to text
- 33 Flux 3 X Mimic: The Next Generation of Video-Action Models. Black Forest Labshttps://bfl.ai/blog/flux-3-mimic ↩ 回到正文 · back to text
- 34 DARPA, U.S. Air Force Fly AI-Controlled F-16. DARPAhttps://www.darpa.mil/news/2026/darpa-us-air-force-fly-ai-controlled-f-16 ↩ 回到正文 · back to text
- 35 Nvidia, Microsoft, Meta Warn Against Overregulating Open-Weight Models. CNBChttps://www.cnbc.com/2026/07/24/nvidia-microsoft-meta-open-weight-ai-models.html ↩ 回到正文 · back to text
- 36 Launching Health in ChatGPT to US Users. OpenAIhttps://openai.com/index/health-in-chatgpt/ ↩ 回到正文 · back to text
- 37 Stripe in Talks to Buy OpenRouter for About $10B. The Wall Street Journalhttps://www.wsj.com/tech/ai/stripe-in-talks-to-buy-buzzy-ai-model-marketplace-openrouter-decc6a74 ↩ 回到正文 · back to text
- 38 Alphabet's Cash Burn Raises Alarm for Big Tech as AI Spending Climbs. Reutershttps://www.reuters.com/business/retail-consumer/alphabets-cash-burn-raises-alarm-big-tech-ai-spending-climbs-2026-07-23/ ↩ 回到正文 · back to text
- 39 Government Orders GitHub to Remove Bluetooth-Based Chat App Bitchat. The Hinduhttps://www.thehindu.com/news/national/government-orders-github-to-remove-bluetooth-based-chat-app-bitchat-over-security-concerns-jack-dorsey/article71262049.ece ↩ 回到正文 · back to text
- 40 JEP 541: Deprecate the macOS/x64 Port for Removal. OpenJDKhttps://openjdk.org/jeps/541 ↩ 回到正文 · back to text
- 41 3GPP Release 19. 3GPPhttps://www.3gpp.org/specifications-technologies/releases/release-19 ↩ 回到正文 · back to text
- 42 My Security Camera Shipped a GitHub Admin Token in Its Login Page. hhh.hnhttps://hhh.hn/hanwha-github-token/ ↩ 回到正文 · back to text
- 43 Postgres LISTEN/NOTIFY Actually Scales. DBOShttps://www.dbos.dev/blog/postgres-listen-notify-scalability ↩ 回到正文 · back to text
- 44 Watching Go's New Garbage Collector Move Through the Heap. The Consensushttps://theconsensus.dev/p/2026/07/19/observing-gos-garbage-collector-old-and-new.html ↩ 回到正文 · back to text
- 45 Delightful Integration Tests in Rust. GitHub: alexpusch/rust-magic-patternshttps://github.com/alexpusch/rust-magic-patterns/blob/master/delightful-integration-tests/Readme.md ↩ 回到正文 · back to text
- 46 A Love Letter to Object Orientation. Mempkohttps://blog.mempko.com/a-love-letter-to-object-orientation/ ↩ 回到正文 · back to text
- 47 Query Cycles: A Compiler Murder Mystery. Ferrous Systemshttps://ferrous-systems.com/blog/query-cycles-a-compiler-murder-mystery/ ↩ 回到正文 · back to text
- 48 git rebase -i Is Not That Scary. cachebag.shhttps://cachebag.sh/journal/interactive-rebasing/ ↩ 回到正文 · back to text
- 49 The Small, Real, Original Web. Space Time Techhttps://spacetimetech.wordpress.com/2026/07/19/the-small-real-original-web/ ↩ 回到正文 · back to text
- 50 Asked Codex to Redesign a Page; It Pushed My Repo to OpenAI Infra. bhanu.iohttps://bhanu.io/blog/codex-pushed-my-private-repo-to-an-openai-server ↩ 回到正文 · back to text
- 51 Codeberg Divides. Armin Ronacherhttps://lucumr.pocoo.org/2026/7/24/codeberg-divides/ ↩ 回到正文 · back to text
- 52 Writing a Debugger from Scratch. timdbg.comhttps://www.timdbg.com/posts/writing-a-debugger-from-scratch-part-1/ ↩ 回到正文 · back to text
- 53 WebGPU Unleashed: A Practical Tutorial. shi-yan.github.iohttps://shi-yan.github.io/webgpuunleashed/ ↩ 回到正文 · back to text
- 54 Nothing Works and Everyone Is Euphoric. ptrchm.comhttps://ptrchm.com/posts/nothing-works-and-everyone-is-euphoric/ ↩ 回到正文 · back to text
- 55 Why Software Factories Fail. GitHub: humanlayer/advanced-context-engineering-for-coding-agentshttps://github.com/humanlayer/advanced-context-engineering-for-coding-agents/blob/main/wsff.md ↩ 回到正文 · back to text
- 56 A Tour of MLIR: The Dialect Stack Everyone Depends On. hiraditya.github.iohttps://hiraditya.github.io/posts/mlir-dialect-stack-for-ml/ ↩ 回到正文 · back to text
- 57 The First Known Runaway AI Agent - or a Very Bad Marketing Stunt? Simon Willisonhttps://simonwillison.net/2026/Jul/23/the-first-known-runaway-ai-agent/#atom-everything ↩ 回到正文 · back to text
- 58 slavakurilyak/awesome-ai-agents. GitHubhttps://github.com/slavakurilyak/awesome-ai-agents ↩ 回到正文 · back to text
- 59 oraios/serena. GitHubhttps://github.com/oraios/serena ↩ 回到正文 · back to text
- 60 raullenchai/Rapid-MLX. GitHubhttps://github.com/raullenchai/Rapid-MLX ↩ 回到正文 · back to text
- 61 Automattic/harper. GitHubhttps://github.com/Automattic/harper ↩ 回到正文 · back to text
- 62 PrismML-Eng/Bonsai-demo. GitHubhttps://github.com/PrismML-Eng/Bonsai-demo ↩ 回到正文 · back to text
- 63 block/buzz. GitHubhttps://github.com/block/buzz ↩ 回到正文 · back to text
- 64 citrolabs/ego-lite. GitHubhttps://github.com/citrolabs/ego-lite ↩ 回到正文 · back to text
- 65 agegr/pi-web. GitHubhttps://github.com/agegr/pi-web ↩ 回到正文 · back to text
- 66 kvcache-ai/ktransformers. GitHubhttps://github.com/kvcache-ai/ktransformers ↩ 回到正文 · back to text
- 67 alibaba/open-code-review. GitHubhttps://github.com/alibaba/open-code-review ↩ 回到正文 · back to text
- 68 verus-lang/verus. GitHubhttps://github.com/verus-lang/verus ↩ 回到正文 · back to text
- 69 THU-MAIC/OpenMAIC. GitHubhttps://github.com/THU-MAIC/OpenMAIC ↩ 回到正文 · back to text