- 01 [AutoGym: Blueprint-First Generation of Verifiable Agent Gyms](https://arxiv.org/abs/2609.22592)[^1] [AgentRouter: Heterogeneous Model Routing for Cost-Optimal Multi-Step Agentic Workflows](https://arxiv.org/abs/2609.22951)[^2] - 用 12M 参数、<5ms/步的分类器在四档模型间路由轨迹子任务;50,000 步训练后,成本降 72% 而保留 97.3% frontier 质量,说明逐步路由比单轮选择更贴近 agent 的真实成本结构。
- 02 [Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents](https://arxiv.org/abs/2609.23986)[^3] [Toollery: Scaling LLM Agents to Thousands of Skills and Tools](https://arxiv.org/abs/2609.22218)[^4] - 以工具说明生成意图查询,再把数万候选压到固定 top-k;在约 79K 能力库和 3,396 个座舱请求上保持可控上下文,工程重点是候选集管理而非再训练一个更大的选择模型。
最新一刊 · Latest issue
No.106
2026-09-25 · 周五 · Friday
智能体迈向可验证高效协同
15论文 · Papers
15开源 · Projects
12行业 · Industry
10博客 · Blog
10热门 · Trending
今日重点 · Today’s Highlights
- 01 TwinCheck: Evidence-Grounded Negative-Twin Verification for Stateful Tool Agents TwinCheck 只在轨迹证据支持失败假设时构造反事实工具动作,并用成对验证器和 exact replay 把“修复”限制在首次可疑调用之前;BFCL V4 上 GPT-5.6 Sol 从 45.3% 提升到 58.5%,且没有观察到成功任务被改坏。
- 02 DRSR: Learning Set-Level Deletion Risk for Efficient Long-Horizon Agents 它把历史压缩从逐块重要性排序改成删除集合的反事实风险估计,在 WorkBuddyBench Full260 上把 reward 从 0.699 推到 0.802,同时少用 20.820% token,说明上下文块之间的协同关系不能被独立打分替代。
- 03 StateComp: Learning When to Compress History in Long Horizon Agents KEEP/READY 路由器学习何时安全替换历史,并以连续 READY 片段为单位生成摘要;实验报告总 token 降低 52.27%、表示提取加速 12.67 倍,把压缩时机变成可训练的状态决策。
- 04 AgentRun: DSL to turn agents into workflows AgentRun 用 JSON 或 TypeScript DSL 将工具、类型化判断、并行 map、有限循环和人工升级组合成可校验工作流;其 support demo 用规则约束来源与 Jev 置信度,不满足时才调用 agent,体现了“模型负责调查、流程负责边界”的工程分工。
- 05 Busbar Busbar 把凭据、路由、预算、熔断和证据审计放进模型/MCP/A2A 之间的自托管热路径;在 AWS m7g.4xlarge 四核上 README 报告 p99 额外延迟 82µs、67,837 req/s 且零失败,治理功能没有被实现成高延迟旁路。
近期刊期 · Recent issues
- 01 How Much of a Real Workload Can LLM-Generated GPU Kernels Actually Reach? 把 kernel 正确率、可寻址运行时间和检查器漏洞放进同一套实测,前沿模型虽达 91.1% 正确率,Transformer 端到端收益仍约 1%。
- 02 CodeMidas: Scaling Agentic Coding RL Environments from Code Itself 用代码库本身自动生成可验证 RL 环境,5,545 个任务带来跨语言、跨领域的编码代理训练规模。
- 03 Authorization Revocation for Long-Running AI Agents 将撤销从“杀进程/收回 token”提升为可证明的根作用域 quiescence,覆盖队列、回调和多跳委托。
- 04 Strata 以 scope、分层记忆和逐条 LLM judge 把多代理共享知识变成可审计的本地服务,同时明确记忆隔离不是安全边界。
- 01 smolvm 把硬件虚拟化 VM 做成可嵌入、可分支的 agent 沙箱,冷启动目标低于 200ms,并能从运行中状态批量分叉。
- 02 DAPO 将解耦裁剪、动态采样和完整训练基础设施一起开源,在 Qwen2.5-32B 上以约一半训练步数达到 AIME 2024 50 分。
- 03 json-render 让模型只能从开发者预定义的组件和动作目录生成 UI,以 JSON schema 换取跨 React、Vue、移动端和文档渲染的一致性。
- 04 Foremerge 在 Git 冲突出现前登记并比较 agent 的语义意图,用确定性依赖和声明检查发现“不同文件、同一架构”的碰撞。
- 01 An empirical study of harness design for coding agents 在固定执行循环下拆开规划、动作空间和上下文管理,比较 176 组匹配设置,给出面向模型与预算选择 harness 的实证依据。
- 02 agent-desktop 用无障碍树和稳定引用替代像素猜测,渐进式遍历在密集桌面应用中可减少 78 - 96% token。
- 03 Docling 把 PDF 版面、表格、公式、OCR 及新加入的视频/XBRL 内容统一成可供生成式 AI 消费的结构化文档。
- 04 mem0 以单次抽取、实体链接、混合检索和时间推理构建持久记忆,在 LoCoMo 上把分数从 71.4 推到 92.5。
- 01 MAGS: Multi-agent Auto-formalization Guarantees Safety for Agentic Outputs 把编码代理输出送入 Dafny 验证链,在 220 个 CUDA、终端和机械臂样例上实现可机检的安全保证。
- 02 Closed-World Resolution Against Tool Hallucination in LLM Agents 将工具注册表与签名解析前置到权限门控之前,并用 322 次单注册表幻觉和 154 次 MCP 合并面幻觉说明缺口的结构性。
- 03 Chronicle: Cut-Point Replay for Regression Testing of LLM Agents 把非确定性边界记录成可组合的回放切点,让代理事故变成可在 CI 中重复执行的回归测试。
- 04 An Empirical Study of Harness Design for Coding Agents 用 176 个匹配设置拆开规划、动作空间和上下文管理的作用,显示 harness 取舍会随模型能力和上下文预算改变。
- 01 GraphEcho 用固定证据、可变图路径和来源控制,直接测量 agent 会不会把重复游走误认为独立佐证;实验还显示减少重访可能牺牲来源覆盖。
- 02 A Four-Stage Decomposition of Word-Problem Solving 把应用题推理定位为四阶段层间流水线,并用双向因果干预把干扰句的破坏锁定到运算规划。
- 03 Beyond Truncation: Rethinking LLM Decoding as Ensemble Pruning 以 Mahalanobis 几何关系剪掉候选 token 的语义冗余,在保留高概率项的同时避免只看标量概率。
- 04 AutoTuneBench 从 619 次调优调用中抽出可复现性陷阱,并把基线、来源、反作弊与预注册读数固化成测量协议。