每日 Harness 开源 · Source
全部刊期 · All issues

每日 Harness

2026-08-29 · Saturday, August 29, 2026

智能体可靠性与运行时治理

视图 · View

今日重点 · Today's Highlights

When Tool Outputs Become Commands4 - SARA 将动作诱导与执行授权分离,并在 AgentDojo/AgentDyn 四种设置中把攻击成功率压到 0.63% 以下,展示了运行时来源审计的实际收益。

全文 ↓

Conduct5 - 开源 Guard 在 LLM、shell、MCP 三个入口执行签名策略和哈希链审计,默认 fail-closed,并附带 20+ 合规包与 22 个可编辑 playbook。

全文 ↓

论文 · Papers

15 项 · 论文

Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment6arxiv.org原文 ↗

arxiv.org

Station 让不同模型在无中央协调的开放环境中自行选题、实验、互评并形成共享文献。12 个 AlphaEvolve 构造题加两个案例里,系统在五题拿到相对既有文献的新结果,还产出解释构造的定理与分析;公开原始对话、证明和验证代码,使“发现”可以被数学家复核。

–

本期重点Invocation-Level Reliability of Tool-Using Agents2arxiv.org原文 ↗

arxiv.org

在五个开源模型和深度 1 - 8 的多步任务中,作者分别测量工具选择与参数生成,并对比 teacher-forced 与自由运行上下文。深度 6 时约 70% 的干净上下文能力被自身早期错误吞噬;对 869 个中毒步骤和 580 个恢复步骤的 exact-match 结果显示严重度被评分规则固定为 0、恢复不可观测,条件于状态的重评分可把估计推入内部区间。

–

本期重点Same Model, Different Harness: Different Coding-Agent Results1arxiv.org原文 ↗

arxiv.org

实验只改变 harness 的上下文压缩和停滞响应,模型权重、任务与记录保持不变。169 个 SWE-bench Verified 任务使用 480 秒终止点,处理组完整解由 43% 提升到 72%,同时 F2PF 上升到 49%;宽窗口 Qwen3.6 对比则趋于接近,说明上下文压力是关键条件而非普遍增益。

–

Agent Mesh: Reliability Primitives for Non-Idempotent Agent Delegation7arxiv.org原文 ↗

arxiv.org

研究团队把服务 mesh 的重试、超时、熔断假设与 81 次生产运行的 147 起事故逐一对照,发现不可幂等委派会让这些机制给出自信但错误的决定。记录中出现 54 次连续成功调用、第三轮维修即误熔断、一次委派累积 21 个事件和误唤醒五个组件;作者归纳出身份充分性、证据充分性等七个以 delegation 为单位的原语,并承认尚未完成受控验证。

–

The Reasoning Tax: Token Economics of LLM Reasoning Across Task Types and Deployment Contexts8arxiv.org原文 ↗

arxiv.org

Token Economy Score 用准确率边际提升除以 token 倍率,直接回答“多想一会儿是否值得”。基于 7 个基准、151 次运行的分析发现,AIME 2025 和 LiveCodeBench 的链式结构带来高 TES,而 MMLU-Pro 的知识回忆即便困难也低效;更高 reasoning effort 还会出现递减收益乃至降准,RCS 与 DCM 则把内部思考和部署地点纳入成本模型。

–

本期重点SKILL.state: Scalable Long-Horizon Agent Skills3arxiv.org原文 ↗

arxiv.org

运行时只向模型提供不变技能规范、结构化状态和最新观察,状态更新通过校验后立即丢弃中间思路,避免 append-only 历史污染。论文跨数据集、模型和环境报告准确率提升与累计 token 明显下降;它把长流程记忆从“保留所有对话”改成“维护可验证状态”,接口与底层模型解耦。

–

Approved Too Late: Verdict Staleness in LLM-Guarded Self-Adaptive Systems9arxiv.org原文 ↗

arxiv.org

这项工作把 guardrail 批准后到真正执行间的过期视为 TOCTOU 问题,分开报告固定动作重放、闭环轨迹和 judge 条件三种失效。五个环境在八步偏移下 verdict 变化率为 5.3 - 48.4%;Freshness-Bounded Shield 用安全裕度和特征波动估计批准寿命,把 oracle 失效率从 3.4 - 24.7% 压到 0 - 1.8%,但四类 judge 仍留下非零使用时无效。

–

Don't Overthink, Don't Underthink: Toward Adaptive Reasoning in Agentic AI10arxiv.org原文 ↗

arxiv.org

作者在 MATH-500 和 GAIA 上把过度/不足推理定义为随任务演化而错配的资源分配,观测工具决策延迟、token 上限和答案正确率。过度推理增加计算却没有相称精度,推理不足则持续导致错误或半成品;论文因此把研究重点从预先估计难度转向执行中根据规划、检索和交互动态调节。

–

PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents11arxiv.org原文 ↗

arxiv.org

PILOT 让独立 supervisor 在 worker 运行中实时引导或中止,并把当场暴露的流程和失败蒸馏成可复用技能。两个 backbone、三个基准的六种配置中五种排名第一;Terminal-Bench 2.0 最高高出 9.8 个百分点,GLM-5.1 与 Kimi-K2.6 的自改进增益分别为 14.6 和 12.4 点,输出 token 同时减少 42.9% 和 47.4%。

–

DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows12arxiv.org原文 ↗

arxiv.org

基准从生产平台匿名会话重建 200 个任务,保留前置对话、持久配置和工作区,再在 Docker 中注入资源不足、不稳定、噪声三种扰动。任务覆盖 8 类场景和 17 类能力,五个框架配四个模型的严格完成率均出现缺口;结果把失败归因到模型能力与框架实现的联合作用,而非只看模型排行榜。

–

AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling13arxiv.org原文 ↗

arxiv.org

AgentJudgeBench 用 3,808 个 DAG 工作流实例、六种拓扑和三档难度,系统比较五个生成器与六个 judge 在有无 ground truth 时的对齐。困难且无真值的样本中,所有 judge 都挤在 77 - 82% 的窄区间,显示规模无法越过由任务结构造成的上限;结构化 rubric 最多带来 6.5 点改善,而 chain-of-thought 和温度调节几乎不起作用。

–

Five Primitives for Governing Autonomous AI Agents at Runtime14arxiv.org原文 ↗

arxiv.org

论文以 discovery、identity、governance、attestation、supply chain 五问重构企业 agent 控制面,动作先对照租户动作词表授权,再进入可验证的哈希链签名账本。作者同时列出工程代价:关键路径上的强制点、每工作负载一个 sidecar,以及 fail-closed 对可用性的影响;四项原语已在私有试点运行,第五项仍未接入请求路径。

–

GraphMemix: Query-Aware Evidence Forests for Long-Term Multimodal Agent Memory15arxiv.org原文 ↗

arxiv.org

GraphMemix 不做昂贵的全局摘要,而是从多视角种子扩展查询相关图,分开计算直接证据效用与关系验证成本,再在预算内挑选森林结构。四个长期多模态记忆基准显示跨模型改进,并形成准确率 - 生命周期成本的新 Pareto 前沿;其重点是找互补低相似证据,同时压制重复或冲突上下文。

–

本期重点When Tool Outputs Become Commands: Separating Action Induction from Runtime Authorization in Tool-Augmented LLM Agents4arxiv.org原文 ↗

arxiv.org

SARA 在观察侧以隔离 Action Probe 持久记录诱导语义和来源,在执行侧只接受由用户目标与已授权成功调用支撑的工具请求。No-History-Promotion 阻止旧观察把不可信指令升级成权限,AgentDojo 和 AgentDyn 四个主设置的 ASR 不超过 0.63%,说明来源链与授权链分离能直接降低副作用风险。

–

What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents16arxiv.org原文 ↗

arxiv.org

综述用 (E,q,τ,v) 统一环境、任务、交互和验证器,再以 ACE 约束生成分布:Accuracy 先筛掉不可执行经验,Complexity 按学习者能力投放难度,diversity 处理覆盖与冗余。作者观察到领域正在从单纯扩充数量转向执行验证、学习者相对难度和非表面多样性;数据管线因此需要持续重配有效经验,而非一次性堆库。

–

开源 / 项目 · Projects

15 项 · 开源 / 项目

本期重点Conduct5github.com原文 ↗

github.com

仓库把 Guard 策略点放在 CLI hook、MCP 层和 Router 三个 chokepoint,统一覆盖 LLM 调用与 shell 工具。Docker Compose 会同时启动 FastAPI、Next.js Canvas、Redis 和 Postgres,默认附 OWASP、SOC 2、HIPAA、EU AI Act 等 20+ 合规包以及 22 个 YAML playbook,适合把审计证据和动作阻断放进同一控制面。

–

Sesame17usesesame.app原文 ↗

usesesame.app

这是默认本地存储、无需账户的开源密码管理器。其设计把凭据保管的主要信任边界放在用户设备,适用于不希望先注册云端账号的个人部署;digest 未给出同步或加密实现细节,因此这里只评价已明确的本地优先取向。

–

Rundown18github.com原文 ↗

github.com

这款 Tauri 桌面客户端把 Hacker News 文章和数百条评论合成 briefing、digest 与可追问聊天,引用会保留原评论并先核对线程。它调用本机已登录的 Claude 或 Codex CLI,Library 能跨线程检索和综合,Reader 则把链接文章整理成 Markdown,数据不离开本机。

–

Boop19github.com原文 ↗

github.com

Boop 用 Go 提供自托管通知收件箱,并配套 iOS 客户端把应用事件送到手机。项目刻意保持单一用途和小型部署面,适合希望自己掌握通知服务器、避免第三方 SaaS 账号依赖的开发者;README 没有宣称更复杂的编排功能。

–

AI Shipcheck20github.com原文 ↗

github.com

Shipcheck 在本地对 AI 生成应用做九类静态发布检查,63 条规则覆盖 secrets、RLS、授权、超时、测试、日志、性能和 LLM 费用。一次示例扫描 9 个文件、28 ms 完成,并可通过 `--fail-on critical` 或 GitHub Action 阈值阻断 CI;规则在 20 个公开仓库上分诊后减少 51% 误报,但仅分析 JS/TS 词法,不能视作安全认证。

–

Agentctl21github.com原文 ↗

github.com

agentctl 以 workspace.toml 为单一声明源,把模型、提示、技能和审批策略渲染到 OpenCode、Agy、Claude Code、Codex 四类 harness。`validate` 负责引用检查,`preview` 只输出彩色 diff,`apply` 先做时间戳备份再原子替换;环境变量展开让密钥留在运行时而非配置文件中。

–

Blast22github.com原文 ↗

github.com

BLAST 是网页浏览 AI 的 serving 引擎,以 OpenAI 兼容接口提供流式输出、并行执行、前缀缓存和并发资源管理。`pip install blastai && blastai serve` 即可启动本地端点,定位是把浏览器动作服务化并压低自动化工作流延迟,而不是再造一个模型。

–

Weir23github.com原文 ↗

github.com

Weir 读取 agent 已产生的 OpenTelemetry trace,重建会话图并沿节点传播 taint,检查敏感数据是否到达禁用 sink。`gauge` 会先报告参数与内容采集是否足以支撑结论,`scan` 失败时给出 witness path;因此测试重点从“输出像不像预期”转为“数据流是否越过边界”。

–

URML24github.com原文 ↗

github.com

physical-ai-safety-eval 将意图与硬件 manifest、部署 envelope 对照,拒绝时返回代码和证据类别,只有通过项才降级成设备读写调用。示例的七个意图含两个可接受、五个命名失败模式,脚本无需模型或设备即可在数秒内运行并对报告做 CI 字节断言;它验证声明一致性,不验证真实物理。

–

AgentConnect25github.com原文 ↗

github.com

AgentConnect 把多种 ACP agent 放进 Slack、Telegram、Discord、Lark、GitHub 和 GitLab 的共同会话,让人和 agent 在同一线程分工、互相调用并共享记忆。每个 agent 可独立绑定模型、工具、工作区和沙箱策略,触发器还包括 PR、webhook 与计划任务;Apache-2.0 栈提供知识库、技能、权限与后台 daemon。

–

Grith26github.com原文 ↗

github.com

grith 在 Linux 内核边界拦截 agent 的文件、网络、shell 和进程 syscall,按风险分数低于 3 放行、3 - 8 排队、高于 8 拒绝。它支持 11 个 agent 配置档,默认离线并将审计写本地 SQLite,发行版带 checksum、cosign、SBOM 和 SLSA 证明;macOS/Windows 后端仍未实现。

–

IndexFlow27github.com原文 ↗

github.com

IndexFlow 用 Rust 把 sitemap 解析和技术 SEO 校验做成可组合库:indexflow-sitemap 支持 XML sitemap/index 与 URL 提取,indexflow-seo 检查 HTML、canonical、robots 和元数据。两个 crate 已发布到 crates.io,而 Search Console、IndexNow、配额调度和多站点监控仍在平台路线图,项目因此更像基础积木而非完整 SEO SaaS。

–

Experiential28github.com原文 ↗

github.com

Experiential 为托管、BYOK、本地和自定义模型提供一个 OpenAI/Anthropic 兼容网关,并按身份、用例和预算决定路由。`exp build` 可从 OTEL 轨迹构建项目模拟,`exp optimize model` 再训练自有模型;本地向导默认显示 50 美元命令预算,匿名 PostHog 遥测不含提示词、轨迹或凭据。

–

Opslane29github.com原文 ↗

github.com

Opslane 从浏览器 SDK 收集错误和会话录像,按受影响用户数与新近度排序,再让 worker 在沙箱中调查、回归测试并由第二模型复核,验证通过才开 PR。整体由摄取服务、Postgres/MinIO、dashboard 和 MCP 组成,现阶段端到端支持 JavaScript;外部依赖明确是 Anthropic、E2B 与 GitHub。

–

AI Engineer Notebooks30github.com原文 ↗

github.com

这套 Colab notebook 用原始 API 从模型调用一路实现 RAG、eval、agent loop、MCP、技能、LoRA、服务和安全,刻意不依赖 LangChain 等框架。Groq 免费 API 覆盖大多数练习,LoRA/自托管提供可选 T4 附录;三个案例把生产支持调试、pipeline/agent 成本和红队评测串成完整工程路径。

–

行业动态 · Industry News

10 项 · 行业动态

GLM-5.3 is now open-weight31z.ai原文 ↗

z.ai

Z.ai 宣布 GLM-5.3 的能力增量来自后训练,官方自有 Code Bench 比 5.2 高 50%,Terminal-Bench 3.0 从 4.6 提升到 28.3。模型在 CyberGym 达 84.5%、ExploitBench 达 54.4%,但安全评估完成前权重延后两周开放;API 取消关闭思考,仅保留 low/high/max 三档 effort。

–

EPA says power for data centers can sidestep pollution laws33epa.gov原文 ↗

epa.gov

EPA 指导称不接入公共电网的孤岛发电设施通常不受酸雨计划约束,除非出售电力或需向 DOE 报告。文件同时要求签署 Ratepayer Protection Pledge 的公司承担能源和配套基础设施全成本,并提醒未来接入电网后可能重新纳入 ARP。

–

Luanti removed from Google Play due to baseless AI copyright notice34blog.luanti.org原文 ↗

blog.luanti.org

Luanti 团队称 Tracer.AI 代表 Microsoft 提交的 DMCA 通知导致 Android 应用从 Google Play 下架,但通知没有指出具体侵权素材。项目声明引擎不含 Minecraft 代码或资产,并指出 2023 年同一公司通知曾被成功申诉,事件凸显自动化版权投诉的误伤成本。

–

htmx 4.0.0 has been released35four.htmx.org原文 ↗

four.htmx.org

htmx 4.0 经过约八个月开发,将内部请求从 XMLHttpRequest 改为 fetch(),并吸收 fixi 的流式 HTML 经验。团队暂不把 4.0 标为 npm latest,让 2.x 继续服务未锁版本的 CDN 用户,4.0 先留在 next 频道至 2027 年初;行为差异被描述为较小但升级仍需阅读 API 变更。

–

Gemini Omni 1.1 Flash36blog.google原文 ↗

blog.google

Gemini Omni 1.1 Flash 为生成视频增加首尾帧插值、场景延长和 4K 输出,延长模式可读取最多 10 秒上下文并以 10 秒步进累积到 40 秒。360p 草稿最多快 60%、成本约为 720p 的三分之一,模型已通过 AI Studio 与 Gemini Enterprise Agent Platform API 提供。

–

Gemini-3.5-Transcribe37blog.google原文 ↗

blog.google

Google 将 Gemini 3.5 Transcribe 分成 Live API 的双向流式转写和 Interactions API 的录音处理,后者带说话人归属和逐词时间戳。官方引用平均 WER 4.0%(流式)与 2.6%(非流式)、85+ 语言和最多三名说话人;与 Chirp 3 相比,最终转写时间改善 70%。

–

Supporting Thailand’s next generation of AI startups38openai.com原文 ↗

openai.com

OpenAI 与泰国 MHESI 为医疗健康和教育领域十家初创公司启动八周加速器,每队获得 2,000 美元 API 额度、一名导师及测试、评估、隐私和成本课程。项目要求 Demo Day 展示真实用户证据和落地路线;OpenAI 称泰国 Codex 周活跃使用量自 2026 年初增长超过 350 倍。

–

Sovereign Tech Agency invests €500k in Flatpak39modal.cx原文 ↗

modal.cx

德国 Sovereign Tech Agency 通过 Sovereign Tech Fund 向 Flatpak 投入 508,640 欧元,周期两年、由 Modal Collective 协同。资金指向沙箱化桌面分发平台的安全与维护能力,属于基础设施投入而非单次版本发布,具体里程碑将由项目后续计划落实。

–

Stripe said to abandon $50B pursuit of PayPal40bloomberg.com原文 ↗

bloomberg.com

Bloomberg 称 Advent 与 Stripe 财团已放弃收购 PayPal,知情人士此前透露的报价超过 500 亿美元;Axios 报道原报价约 60.50 美元/股、总值 530 亿美元。并购退出发生在 PayPal 面临支付技术现代化和竞争压力之际,也说明大型金融科技交易对估值与融资条件高度敏感。

–

博客文章 · Blog Posts

10 项 · 博客文章

Breaking Claude Code Opus 5 Auto Mode41simonwillison.net原文 ↗

simonwillison.net

Simon Willison 转述 Johann Rehberger 的攻击链:诱导 Claude Code 下载并解压归档,再借本地 `struct.py` 触发代码执行,声称成功率约 80%。更反常的是 Auto Mode 偶尔允许恶意进程启动,却拦截 agent 的终止命令;作者因此要求无人值守运行必须用容器/VM、限制出网并隔离 SSH 与云凭据。

–

How cats.txt showed llms.txt evidence is GEO astrology42markwilliamscook.substack.com原文 ↗

markwilliamscook.substack.com

作者故意发布描述虚构猫咪的 cats.txt,并验证它同样会被 bot 抓取、Google 索引、LLM 引用甚至得到 ChatGPT 的积极评价。这个反例说明“被抓取/被回答”不等于标准产生因果效果;文章还引用 Ahrefs 对 10 万域名的观察,指出 llms.txt 在真实爬虫中大多被忽略。

–

GUIs should be fully keyboard-driven43ckardaris.com原文 ↗

ckardaris.com

文章认为 TUI 的键盘优势暴露的是 GUI 实现懈怠,而不是 GUI 做不到;GNOME 规范本就要求每项动作可由键盘完成。作者在 Klisi 中实践全套快捷键,同时承认绘图等任务仍需要鼠标,主张把键盘可达性作为所有图形应用的基础质量指标。

–

Don't use musl if you care about performance44blog.brokk.ai原文 ↗

blog.brokk.ai

Brokk 的实测显示 musl 加 mimalloc 在四核 EC2 上仍比 glibc 慢约 26%,拖慢来源还包括 memcpy/memset,而不只是 allocator。几乎不分配内存的任务也出现回归,作者遂从性能敏感的 Bifrost 预构建中移除 musl,只在更看重静态简洁的小项目保留它。

–

How Dactyl Works45dactyl.dev原文 ↗

dactyl.dev

Dactyl 把 SwiftUI 风格框架编译到 Wasm,浏览器端自研引擎将绘制命令写入线性内存,再由 JavaScript Canvas2D 主机呈现。该路线绕开远程 iOS 模拟器的启动和计费,为没有 Mac 的开发者提供即时预览;相机、传感器等能力在浏览器预览与真机发布间尽量复用同一代码。

–

I Used AWS Cognito for a Startup. I Wouldn't Do It Again46joshkaramuth.com原文 ↗

joshkaramuth.com

作者记录 Cognito 文档混杂多个受众、Amplify v5 到 v6 需要重写认证流程,以及本地离线测试难以逼真复现。一次把邮箱误设为 custom attribute 的小错误最终只能迁移用户池,因为该属性永久不可改;文章建议用包含邮箱验证、密码重置和自定义属性的 POC 计算真实工程成本。

–

The load-bearing vocabulary of Claude47louisabraham.github.io原文 ↗

louisabraham.github.io

项目把 603 天、461,121 条 GitHub PR 描述按词汇做 KL-kmeans 聚类,词语进入词表至少要由 50 个账号使用。作者特别指出模型没有时间参数,页面上的“词汇上升”只是描述归属按周统计后的分布变化;自检、整周窗口和机器人过滤用于防止重复文本把趋势伪造出来。

–

Select * from Internet.blogposts48pfrazee.leaflet.pub原文 ↗

pfrazee.leaflet.pub

Paul Frazee 以 Nitter 收到律师函为引子,认为固定 API 无法支持跨服务查询、全量索引和可操作迁移,封闭平台最终会把第三方变成风险。atproto 的解法是 PDS、事件日志复制和 Jetstream firehose;文章给出的网络规模为 4,610 万账户、245 亿记录、每秒 500 - 1000 次写事件和 5,000+ PDS。

–

How I made Rustdoc 33% faster in one week49noahlev.org原文 ↗

noahlev.org

Rustdoc 团队通过减少 impl 处理、排序等路径的无谓工作,把平均 wall-time 降低 25%,即 33% speedup;hyper、bitmaps 等真实 crate 最多快 40%,helloworld 微基准快 60%。优化从 Crater 发现递归限制回归开始,文章展示了用基准和回归测试快速验证编译器改动的过程。

–

Hilariously Fast Volume Computation with the Divergence Theorem50alyssarosenzweig.ca原文 ↗

alyssarosenzweig.ca

文章把闭合三角网格的体积积分改写成表面积分,对每个三角形计算向量场通量后线性累加,避开体素化和内部采样。方法的速度来自几何与向量微积分的直接对应,但前提是网格闭合、面向一致;破洞或非流形输入仍需先修复。

–

引用来源 · References

60 条 · 引用
  1. 1 Same Model, Different Harness: Different Coding-Agent Results. arXiv:2608.26218https://arxiv.org/abs/2608.26218 ↩ 回到正文 · back to text
  2. 2 Invocation-Level Reliability of Tool-Using Agents. arXiv:2608.26189https://arxiv.org/abs/2608.26189 ↩ 回到正文 · back to text
  3. 3 SKILL.state: Scalable Long-Horizon Agent Skills. arXiv:2608.26263https://arxiv.org/abs/2608.26263 ↩ 回到正文 · back to text
  4. 4 When Tool Outputs Become Commands: Separating Action Induction from Runtime Authorization in Tool-Augmented LLM Agents. arXiv:2608.27146https://arxiv.org/abs/2608.27146 ↩ 回到正文 · back to text
  5. 5 Conduct. GitHubhttps://github.com/sseshachala/conductai ↩ 回到正文 · back to text
  6. 6 Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment. arXiv:2608.23691https://arxiv.org/abs/2608.23691 ↩ 回到正文 · back to text
  7. 7 Agent Mesh: Reliability Primitives for Non-Idempotent Agent Delegation. arXiv:2608.26225https://arxiv.org/abs/2608.26225 ↩ 回到正文 · back to text
  8. 8 The Reasoning Tax: Token Economics of LLM Reasoning Across Task Types and Deployment Contexts. arXiv:2608.26235https://arxiv.org/abs/2608.26235 ↩ 回到正文 · back to text
  9. 9 Approved Too Late: Verdict Staleness in LLM-Guarded Self-Adaptive Systems. arXiv:2608.26306https://arxiv.org/abs/2608.26306 ↩ 回到正文 · back to text
  10. 10 Don't Overthink, Don't Underthink: Toward Adaptive Reasoning in Agentic AI. arXiv:2608.26442https://arxiv.org/abs/2608.26442 ↩ 回到正文 · back to text
  11. 11 PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents. arXiv:2608.26530https://arxiv.org/abs/2608.26530 ↩ 回到正文 · back to text
  12. 12 DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows. arXiv:2608.26546https://arxiv.org/abs/2608.26546 ↩ 回到正文 · back to text
  13. 13 AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling. arXiv:2608.26623https://arxiv.org/abs/2608.26623 ↩ 回到正文 · back to text
  14. 14 Five Primitives for Governing Autonomous AI Agents at Runtime. arXiv:2608.26696https://arxiv.org/abs/2608.26696 ↩ 回到正文 · back to text
  15. 15 GraphMemix: Query-Aware Evidence Forests for Long-Term Multimodal Agent Memory. arXiv:2608.26983https://arxiv.org/abs/2608.26983 ↩ 回到正文 · back to text
  16. 16 What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents. arXiv:2608.27260https://arxiv.org/abs/2608.27260 ↩ 回到正文 · back to text
  17. 17 Sesamehttps://usesesame.app/ ↩ 回到正文 · back to text
  18. 18 Rundown. GitHubhttps://github.com/nilbuild/rundown ↩ 回到正文 · back to text
  19. 19 Boop. GitHubhttps://github.com/chrisgreg/boop ↩ 回到正文 · back to text
  20. 20 AI Shipcheck. GitHubhttps://github.com/sinceaihq/ai-shipcheck ↩ 回到正文 · back to text
  21. 21 Agentctl. GitHubhttps://github.com/RomanVolkov/agentctl ↩ 回到正文 · back to text
  22. 22 Blast. GitHubhttps://github.com/stanford-mast/blast ↩ 回到正文 · back to text
  23. 23 Weir. GitHubhttps://github.com/IdoGol24/weir ↩ 回到正文 · back to text
  24. 24 URML physical-ai-safety-eval. GitHubhttps://github.com/URML-MARS/URML/tree/main/examples/physical-ai-safety-eval ↩ 回到正文 · back to text
  25. 25 AgentConnect. GitHubhttps://github.com/agentconnect-md/agentconnect ↩ 回到正文 · back to text
  26. 26 Grith. GitHubhttps://github.com/grith-ai/grith ↩ 回到正文 · back to text
  27. 27 IndexFlow. GitHubhttps://github.com/IndexFlowing/IndexFlow-core ↩ 回到正文 · back to text
  28. 28 Experiential. GitHubhttps://github.com/experientiallabs/experiential ↩ 回到正文 · back to text
  29. 29 Opslane. GitHubhttps://github.com/opslane/opslane ↩ 回到正文 · back to text
  30. 30 AI Engineer Notebooks. GitHubhttps://github.com/calmrocks/ai-engineer-notebooks ↩ 回到正文 · back to text
  31. 31 GLM-5.3 is now open-weighthttps://z.ai/blog/glm-5.3 ↩ 回到正文 · back to text
  32. 32 Pentagon's blacklisting of Anthropic was unlawful, US judge rules. Reutershttps://www.reuters.com/legal/government/us-judge-blocks-pentagons-anthropic-blacklisting-2026-08-28/ ↩ 回到正文 · back to text
  33. 33 EPA says power for data centers can sidestep pollution lawshttps://www.epa.gov/newsreleases/epa-issues-permitting-guidance-further-president-trumps-agenda-promoting-data-centers ↩ 回到正文 · back to text
  34. 34 Luanti removed from Google Play due to baseless AI copyright noticehttps://blog.luanti.org/2026/08/27/luanti-dmca-tracer-ai/ ↩ 回到正文 · back to text
  35. 35 htmx 4.0.0 has been releasedhttps://four.htmx.org/announcements/2026-08-28-htmx-4.0.0-is-released ↩ 回到正文 · back to text
  36. 36 Gemini Omni 1.1 Flashhttps://blog.google/innovation-and-ai/technology/developers-tools/build-with-gemini-omni-1-1-flash/ ↩ 回到正文 · back to text
  37. 37 Gemini-3.5-Transcribehttps://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/ ↩ 回到正文 · back to text
  38. 38 Supporting Thailand’s next generation of AI startups. OpenAIhttps://openai.com/index/supporting-next-generation-ai-startups-thailand ↩ 回到正文 · back to text
  39. 39 Sovereign Tech Agency invests €500k in Flatpakhttps://modal.cx/blog/announcing-flatpak-sta/ ↩ 回到正文 · back to text
  40. 40 Stripe said to abandon $50B pursuit of PayPal. Bloomberghttps://www.bloomberg.com/news/articles/2026-08-28/advent-stripe-consortium-is-said-to-drop-pursuit-of-paypal ↩ 回到正文 · back to text
  41. 41 Breaking Claude Code Opus 5 Auto Modehttps://simonwillison.net/2026/Aug/27/breaking-claude-code-opus-5-auto-mode/ ↩ 回到正文 · back to text
  42. 42 How cats.txt showed llms.txt evidence is GEO astrologyhttps://markwilliamscook.substack.com/p/how-catstxt-showed-llmstxt-evidence ↩ 回到正文 · back to text
  43. 43 GUIs should be fully keyboard-drivenhttps://ckardaris.com/blog/2026/08/28/keyboard-driven-guis.html ↩ 回到正文 · back to text
  44. 44 Don't use musl if you care about performancehttps://blog.brokk.ai/dont-use-musl-if-you-care-about-performance/ ↩ 回到正文 · back to text
  45. 45 How Dactyl Workshttps://dactyl.dev/blog/how-dactyl-works/ ↩ 回到正文 · back to text
  46. 46 I Used AWS Cognito for a Startup. I Wouldn't Do It Againhttps://joshkaramuth.com/blog/aws-cognito-authentication-startup-nightmare/ ↩ 回到正文 · back to text
  47. 47 The load-bearing vocabulary of Claudehttps://louisabraham.github.io/load-bearing/ ↩ 回到正文 · back to text
  48. 48 Select * from Internet.blogpostshttps://pfrazee.leaflet.pub/3mu3p2smmis22 ↩ 回到正文 · back to text
  49. 49 How I made Rustdoc 33% faster in one weekhttps://noahlev.org/blog/2026/08/27/making-rustdoc-faster/ ↩ 回到正文 · back to text
  50. 50 Hilariously Fast Volume Computation with the Divergence Theoremhttps://alyssarosenzweig.ca/blog/hilariously-fast-volume-computation-with-the-divergence-theorem.html ↩ 回到正文 · back to text
  51. 51 awesome-agent-skills. GitHubhttps://github.com/VoltAgent/awesome-agent-skills ↩ 回到正文 · back to text
  52. 52 free-claude-code. GitHubhttps://github.com/Alishahryar1/free-claude-code ↩ 回到正文 · back to text
  53. 53 screenshot-to-code. GitHubhttps://github.com/abi/screenshot-to-code ↩ 回到正文 · back to text
  54. 54 flash-linear-attention. GitHubhttps://github.com/fla-org/flash-linear-attention ↩ 回到正文 · back to text
  55. 55 hve-core. GitHubhttps://github.com/microsoft/hve-core ↩ 回到正文 · back to text
  56. 56 gods-eye-view. GitHubhttps://github.com/bilawalsidhu/gods-eye-view ↩ 回到正文 · back to text
  57. 57 GitNexus. GitHubhttps://github.com/abhigyanpatwari/GitNexus ↩ 回到正文 · back to text
  58. 58 go-modern-guidelines. GitHubhttps://github.com/JetBrains/go-modern-guidelines ↩ 回到正文 · back to text
  59. 59 tailcat. GitHubhttps://github.com/tailscale/tailcat ↩ 回到正文 · back to text
  60. 60 Agenta. GitHubhttps://github.com/Agenta-AI/agenta ↩ 回到正文 · back to text