- 01 BatchDAG: LLM-Planned Execution Graphs for Scalable Ad-Hoc Analysis Over Enterprise Data 把跨实体分析编译为类型化批处理 DAG,实验报告最高降低 55.7% 运行时间与 72.5% token 成本。
- 02 Binding Drift in Multi-Step Tool-Augmented Agents 用 3,500 余条轨迹刻画多步工具调用中实体身份从正确绑定逐渐漂移的故障。
- 03 Decode-Time Grammars 以可组合的解码期语法屏蔽非法 token,为低资源 DSL 和定制 API 提供无需微调的结构保证。
- 04 AgentDebugX 把 agent 轨迹组织成可追溯的故障定位、责任归因与恢复流程,而非停留在日志浏览。
最新一刊 · Latest issue
No.55
2026-07-25 · 周六 · Saturday
智能体走向可控与可信
15论文 · Papers
15开源 · Projects
12行业 · Industry
15博客 · Blog
12热门 · Trending
今日重点 · Today’s Highlights
- 01 FineServe 把覆盖全球生产流量的 LLM 服务轨迹、用户反馈与后端遥测统一到同一数据集中,为容量规划和调度研究提供了此前缺失的细粒度实证底座。
- 02 NEXUS 用“结构化计划 - 规则校验 - 四级干预”替代只看文本的安全分类器,使工具调用在真正执行前就能被放行、阻断、确认或修订。
- 03 Profile-Graph Memory for LLM Agents 将跨实体关系压缩进可读的叙事档案,并以 MemHop 的一至五跳查询检验长期记忆是否能隐式完成图遍历。
- 04 Torchwright 不训练模型,而是把算术、排序、图算法等计算图直接编译成 Transformer 权重,展示“神经网络即目标程序”的另类构造路径。
- 05 Twigg 以 Jujutsu、Rust 与自建 CI/CD 组合出本地优先的软件开发平台,试图把超大单仓的版本控制和自动化工作流带出大型科技公司。
近期刊期 · Recent issues
- 01 PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection 把规划器上下文确认为多智能体系统的单点放大攻击面,并用多种攻击设置展示一次注入如何污染后续任务分解与执行。
- 02 Deterministic Replay for AI Agent Systems 将模型采样、工具响应与运行时状态统一写入事件日志,使跨模型、跨工具的智能体轨迹可以确定性复现。
- 03 Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL 用掩码扩散模型充当可控文本世界模型,在保持模拟质量的同时允许对环境属性做细粒度引导。
- 04 KernelBench-Verified: Do LLM-Generated Kernels Actually Beat PyTorch? 重新执行并核验 LLM 生成的 CUDA kernel,区分真实加速、错误实现与针对基准计时机制的 reward hacking。
- 01 Greedy is optimal for single-pass semi-streaming matching 以紧下界证明单遍半流式最大匹配不可能优于 1/2 近似,正式确认朴素贪心已达模型极限。
- 02 Datalevin Datalog 数据库 1.0 把事务、图、全文、向量和文档路径索引统一到一个事实模型,并补齐 WAL、只读副本与多语言绑定。
- 03 Incremental Jane Street 的自调整计算库用依赖图传播变化,为复杂状态系统提供只重算受影响节点的成熟范式。
- 04 Nativ 原生 Apple Silicon 本地模型工作台把 MLX 推理、聊天、API 服务和性能遥测装进同一个开源 macOS 应用。
- 01 Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3? 四个嵌套 Codex-agent 变体把世界模型、简化和 replay verification 拆成可消融组件;公开 ARC-AGI-3 上完整 verification 变体在四个主设置中都排第一。
- 02 ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning 从近 400 个 MCP 与约 4,500 个工具生成长程可执行任务,直接把 agentic RL 的环境规模推到真实工具生态。
- 03 Cache-Aware Prompt Compression:A Two-Tier Cost Model for LLM API Caching 把 prompt compression 放回 API prefix cache 的计费现实中分析,给出 query-aware 压缩何时反而亏钱的实测边界。
- 04 Provena: Open-Source Library for AI Agent Context Governance 将 provenance、freshness 与 tamper-evident logging 放到 agent context 输入层,而不是只治理模型输出。
- 01 Co-evolution of self-replication and function in a digital primordial soup 从随机 32-byte Z80 程序出发,论文把自复制和任务功能放进同一个数字生态里观察共同演化。
- 02 Subrust, a no_std, no alloc Subset-of-Rust interpreter Rust 子集解释器把“可被 rustc 接受”和“解释器语义一致”作为设计约束,适合研究极小可信脚本环境。
- 03 Transcribe.cpp C/C++ STT 推理库用 ggml/GGUF 覆盖 16 个语音识别模型族,并把 Metal、Vulkan、CUDA 和 CPU tinyBLAS 放到同一运行时路径里。
- 04 BlazeRules YAML 规则引擎把流式记录重投影到列式执行路径,项目主张可达到约 3M records/sec。
- 01 Aurora DSQL: Scalable, Multi-Region OLTP 把 serverless、强一致事务和主动-主动多区域 OLTP 放进同一套数据库设计里,技术看点集中在事务协调和存储解耦。
- 02 Qubes OS Security in the Public Record 不是又一篇隔离系统介绍,而是把 2010-2024 年公开漏洞、披露和修复记录整理成可审视的安全史。
- 03 Safehttp Go 里的 SSRF 防护被做成默认安全的 HTTP client,直接瞄准“服务端代用户请求 URL”这一高频风险点。
- 04 code-review-graph 给 CLI/MCP 审查工具提供本地持久代码图,让 agent 审 diff 时能找回相关符号、依赖和上下文。