每日 Harness 开源 · Source
全部刊期 · All issues

每日 Harness

2026-08-06 · Thursday, August 6, 2026

智能体走向可靠执行

视图 · View

今日重点 · Today's Highlights

Screenshots or Tools? - 同一组 309 个 GUI 任务中,文本工具让推理模型提高 4.0 个百分点,却使非推理模型下降 5.9 个百分点,说明接口收益受模型推理方式支配。

全文 ↓

DataSpace - 以 7,439 个真实形态的数据制品检验跨文件分析,最佳模型也只完成 66.34%,把“能读长上下文”与“能可靠分析数据”区分开来。

全文 ↓

SparSEEty - 从 TDX 机密虚拟机外观察稀疏神经元访问即可重建 token,文本 BLEU 超过 0.95,而监控开销仅 3.7% - 7.2%。

全文 ↓

Celld - 用对象存储 CAS 和每对象 SQLite 组合出无中心控制面的 Durable Objects 运行时,架构简洁但节点间 HTTP 与兼容性边界仍需正视。

全文 ↓

Qapla - 在约 8 美元的 ESP32-S3 上用手写 C 完成 31.9 万参数模型的反向传播与训练,把端侧实验推进到“设备上学”而不只是量化推理。

全文 ↓

论文 · Papers

15 项 · 论文

HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents1arxiv.org原文 ↗

HyperAgent 将工具调用建模为有向超图:工具是从输入 schema 指向输出 schema 的超边,再从相关上下文图生成 schema-aware 任务 DAG,并按能力缺口扩展计划。AppWorld 实验显示,这种显式结构能提高任务完成度,同时减少冗余 API 调用、模型交互和 token;真正的贡献是让规划约束来自接口结构,而非只靠自然语言反思。

BAP-SQL: Budget-Aware Observation Planning for Agentic Text-to-SQL2arxiv.org原文 ↗

BAP-SQL 在查询前估计风险,据此改写 SQL 并设置运行时观察护栏,把“看多少数据库信息”变成可分配的预算。BIRD 衍生任务上,它相对匹配的 SFT 基线提升 3.4 和 3.6 个百分点,并少用 4.5% 和 5.0% token;不过模型更强或预算更宽时收益缩小,最宽松设置下甚至反转。论文因此更像一项资源控制结果,而不是普遍优于扩上下文的结论。

Verifiable Memory3arxiv.org原文 ↗

该方法把长期记忆、活跃上下文和 episodic 状态置于同一操作空间,用监督微调加三阶段强化学习训练代理执行 7 种记忆操作。局部验证器检查状态转移,全局验证器约束证据一致性和终态记忆;在 5 个基准、2 个骨干模型的大多数指标上取得最佳结果。验证器只在训练期使用,因而推理时没有额外裁判成本,但效果仍取决于训练时可判定的记忆规范。

Distractor-Aware Truncation4arxiv.org原文 ↗

作者指出,长上下文截断同时删掉干扰项和答案证据,传统“截得越多越差”不能直接证明上下文长度本身的价值。他们在 BABILong 与 GraphWalks 上分别保留 100%、75%、50% 和 25% 内容;朴素截断到 25% 时答案证据保留率不足 1%,而保信号的截断可维持甚至改善准确率。结果把长上下文评测的核心变量从长度改为信号保真度,但在 Opus 4.7、GPT-5.5 等高端模型上存在天花板效应。

本期重点Screenshots or Tools?5arxiv.org原文 ↗

论文在 OSWorld-MCP 的 309 个任务上固定工具集合,只改变模型能否及如何调用文本工具,并重复运行 5 次。工具令推理模型提升 4.0 个百分点,却让非推理模型下降 5.9 个百分点;前者实际只在 55/309 个任务中调用工具,而可由工具触达的任务占 23.9%。经上下文压缩和再训练后,得分从 33.0 升至 37.8,输入成本降至原来的 53%,显示关键不是工具数量,而是模型是否会判断何时值得付出调用成本。

本期重点DataSpace6arxiv.org原文 ↗

DataSpace 构造了 410 个跨语言分析任务,底层含 7,439 个制品、总计 15.01 GB,格式横跨 CSV、JSON、SQLite、Markdown、PDF 和视频,并用确定性表格评估器核对结果。6 个前沿多模态模型搭配 5 种 agent harness 后,最佳准确率仍只有 66.34%;同一骨干换 harness 的最大差距达到 15.36 个百分点。这个基准的启发在于,数据代理能力既是模型问题,也是执行框架和结果可验证性问题。

ContinualSkillBench7arxiv.org原文 ↗

ContinualSkillBench 用 5 个领域、每域 100 个相互关联且逐步变难的任务,测试代理能否持续生成、修订和复用外部技能。顺序执行总体有益,但显式技能维护的平均表现与把历史直接放进上下文相近;收益主要集中在可复用程序和精确输出格式,较弱模型反而更容易产生碎片化技能。它给“技能文件会自然累积成能力”加上了必要条件:任务必须共享稳定结构,维护策略也要能抑制低质量沉淀。

Permission Denied8arxiv.org原文 ↗

研究者在 Terminal-Bench 2.1 上给 12 个编码代理施加嵌套安全策略,包括只读文件系统、受限凭据和网络隔离,并先验证任务在这些边界内仍可解。最严格环境使成功率最多下降 18.3 个百分点,成本最多膨胀 167.3%;同时发布 Boundary-Bench 插件用于复现实验。数据说明,沙箱不是透明基础设施:代理若不能理解权限边界,安全强化会直接转化为规划失败和重复尝试。

Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures9arxiv.org原文 ↗

论文针对超时、延迟可见和部分写入这类“调用可能已生效、响应却不确定”的故障,在工具层加入后置条件、重试前验证和幂等语义。受控故障注入表明,该协议在保持相近任务成功率的同时显著减少重复副作用。它把可靠性责任从代理的猜测式重试下沉为可检查的调用契约,适合支付、消息发送和资源创建等不可随意重放的动作。

TraceCompiler10arxiv.org原文 ↗

TraceCompiler 从多条含探索、失败和重试的轨迹中抽取“有证据的生产者 - 消费者边”,再编译为确定性工作流。其 15,775 条依赖边达到 0.928 精确率和 0.943 召回率;AppWorld 子集上的 563 条边精确率为 0.993,但这部分依赖自一致性标注。在 Venmo 案例中,34 次调用被压到 11 次,留一验证通过 15/21 个任务;结果有吸引力,不过论文没有把离线编译成本计入净效率。

本期重点SparSEEty11arxiv.org原文 ↗

arxiv.org

SparSEEty 展示了激活稀疏化如何把模型内部行为变成机密计算侧信道:攻击者先建立稀疏神经元访问的 oracle,再从 Intel TDX 虚拟机外部观测并反演 token。恢复出的提示与回答 BLEU 均超过 0.95,监控只增加 3.7% - 7.2% 开销。它揭示的不是传统内存泄漏,而是优化策略本身破坏了“访问模式不泄密”的假设,因而防护需要重新审视稀疏执行的可观测性。

Search, Inspect, Fetch12arxiv.org原文 ↗

SIEVE 把网页检索拆成按标题、章节和元数据搜索,检查候选结构,再只抓取选中章节的三阶段流程。它在 3 个问答集合上都高于最佳 Search-Visit 基线,同时少用 20.7% - 50.6% token。方法的技术含义很直接:深度研究代理不必先吞整页再决定相关性,字段级可寻址性本身就是检索能力的一部分。

CUADebug13arxiv.org原文 ↗

CUADebug 对 204 条计算机使用代理失败轨迹建立分层诊断,其中推理/控制错误 110 条、感知 36 条、grounding 25 条、外部故障 13 条、不可行任务 20 条。加入错误子型和出错步骤后诊断准确率从 11.2% 升至 19.6%;单次重执行修复率约 28.47%,作者方法为 29.90%,而只给历史的方案仅 13.89%。持续修复把成功率从 12.2% 拉到 25.86%,仍低于人工的 29.21%,说明定位信息有用但远未解决 GUI 轨迹恢复。

Fail-Fast, Restart-Smart14arxiv.org原文 ↗

该工作用 0.6B 参数前缀监视器配合一次同策略新 rollout,在软件工程代理尚未耗尽预算前判断轨迹是否值得终止。SWE-bench Verified 跨多种策略可节省 14.6% - 20.4% token,同时把误杀率控制在 5%;即使容许 25% 误杀,重启策略仍将解决率从 66.6% 提到 71.8%,冷重启仅为 66.8%。这表明测试时扩展不应只讨论“跑更多”,还应把预算从低前景轨迹动态转给新的尝试。

Test-Time Scaling in Reasoning LLMs15arxiv.org原文 ↗

这篇综述把推理模型的测试时扩展归纳为单轨迹延长、叶节点终态规约和前缀搜索三类,并区分精确复现与分布式结果复现。作者同时发布约 20 亿 token 的完整推理轨迹,试图让采样、验证与搜索策略可以在统一材料上比较。它的价值主要是清理术语和复现实验边界;作为综述,并没有提出一个能跨任务取胜的新缩放算法。

开源 / 项目 · Projects

15 项 · 开源 / 项目

本期重点Celld16github.com原文 ↗

github.com

Celld 自托管 Workers 与 Durable Objects,每个对象使用 SQLite,并把副本写入 S3 兼容对象存储;节点通过对象存储上的 compare-and-swap 协调,不设控制面或共识集群。运行层沿用 V8 与 Wrangler,部署路径相对贴近 Cloudflare 生态。README 同时注明节点间 HTTP 没有 TLS、应置于私网,兼容面仍在变化,因此它更适合研究轻量分布式对象架构而非直接替代成熟生产平台。

Sula17sagredo.dev原文 ↗

sagredo.dev

Sula 是使用 Scryer Prolog 编写的 Gemini 协议服务器。

Capy18github.com原文 ↗

github.com

Capy 以 `branch`、`sync`、`deploy`、`revoke` 等 Git 式命令管理团队密钥,但服务端只保存密文和成员关系,值在本地逐项加密。它采用两层密钥包装,移除成员时 `kick` 只使被撤销者的包装密钥失效,避免级联重加密;`capy.lock` 则固定版本状态。架构把协作体验和零知识存储放在一起,不过自托管者仍要审视客户端、成员邀请与恢复流程的完整威胁模型。

Greenlight19github.com原文 ↗

github.com

Greenlight 在本地扫描源代码、manifest、IPA、APK 和 AAB,用规则提前发现 App Store 与 Google Play 审核风险,报告会指向具体规则。仓库列出 24 条代码规则,中型项目单次扫描为个位数毫秒;需要真实商店交互的账号删除、恢复购买和 Apple 登录检查则放进可选云端 `verify`。这种分层避免把静态可判定问题送上云端,也清楚区分“代码合规线索”与“运行时政策证明”。

ClickBench Playground20benchmark.clickhouse.com原文 ↗

benchmark.clickhouse.com

ClickBench Playground 让用户在同一页面对 110 多个数据库系统运行 SQL,可多选后一次执行,并并列展示状态、耗时、输出和错误。它把 ClickBench 从静态排行榜变成可交互的查询对照台;但单次页面结果仍受各后端配置与当前负载影响,不能替代受控基准复现。

OpenEdit21github.com原文 ↗

OpenEdit 不提供传统时间线 GUI,而让编码代理直接生成和修改视频工程,字幕样式由 HTML/CSS 描述。当前 Apple Silicon、macOS 26 路径使用 VEED 的闭源但免费渲染器,仓库给出的内部初步数据最高比 Chrome 快 2.2 倍,尚没有外部可复现基准;v1 重点也仍是字幕。它值得观察的是“视频编辑即代码”的接口设计,而非现阶段的跨平台成熟度。

dstest22github.com原文 ↗

github.com

dstest 通过 Lua 脚本注入真实故障,并在容器中执行确定性模拟测试。

Dr. PD23github.com原文 ↗

github.com

Dr. PD 是开放软硬件的 USB-C Power Delivery 分析仪兼可编程负载,覆盖 SPR、EPR、PPS 和 AVS,额定可到 48V、5A、240W。设备可免驱从浏览器使用,也提供 Python、JavaScript、SCPI 与 USBTMC 接口。规格足以覆盖 USB PD 3.1 的高功率协商,但项目仍处验证和众筹阶段,测量精度与保护设计应等待硬件实测。

Arxid24github.com原文 ↗

github.com

Arxid 用 4 轮、40 位 ARX Feistel 置换把整数编码成 7 位 Base62 短 ID,并提供 Rust 与 TypeScript 实现及 61 个跨语言测试向量。README 报告雪崩率 0.5001、编码约 49.4 ns;同时明确它不是加密、认证或 MAC,也没有独立安全审计。适用范围因此很窄但清晰:隐藏连续编号和减少可枚举性,而不是保护有价值的秘密。

Pistachio25github.com原文 ↗

github.com

Pistachio 用 `pg_query_go` 解析期望 SQL,和现有 PostgreSQL schema 做 DDL 差异,再通过 plan/apply 两阶段执行。删除操作默认被抑制,计划可以先审阅,现有 dump 也可拆分为声明式文件。它把数据库迁移从手写时间序列改为状态收敛,同时保留了对破坏性变更的人为门槛。

Labgrid MCP26github.com原文 ↗

Labgrid MCP 将实验室的预约、电源、串口、mux、刷写和 SSH 暴露为 47 个工具与 5 个资源,并给操作加只读或破坏性注解。刷写和删除默认关闭,演示环境可直接通过 `uvx` 启动。相比通用 shell MCP,它把硬件实验室的资源占用和危险动作显式建模,更便于客户端做权限与确认策略。

AgentTerm27github.com原文 ↗

AgentTerm 不要求改造现有编码代理 CLI,而是在终端层统一多会话状态、预览和历史,再让用户从桌面或手机查看、评论终端输出与 diff。其 `review://` 协议把审阅意见送回会话,手机端只需出站 HTTPS,也可用语音输入。项目解决的是长任务中的人在环路由,而不是再造一套代理执行内核。

fec28github.com原文 ↗

github.com

这个 Rust 库提供卷积码 Viterbi 硬/软判决和 GF(2^8) Reed - Solomon,包含 CCSDS 255,223 配置,并以 `std::simd` 加运行时指令集分派加速。README 在 Zen 4 上报告 k=7 Viterbi 约 158 Mbps、CCSDS RS 约 568 Mbps,同时提供 libfec 兼容接口和 C ABI shim。它将现代 Rust 的内存安全与既有通信软件接口结合,数据也给出了可核验的性能量级。

Hubmesh29github.com原文 ↗

Hubmesh 先以多组件 Personalized PageRank 从种子扩散相关性,再把结构、覆盖和冗余纳入预算选择,查询阶段不调用 LLM。后端支持 Qdrant、Chroma,并可通过 MCP 暴露检索能力。其意义在于把多跳 RAG 的“为什么选这些节点”落到确定性图算法,降低生成模型参与检索带来的成本与漂移。

本期重点Qapla30github.com原文 ↗

github.com

Qapla 在 ESP32-S3 上训练并推理一个约 31.9 万参数、31 字符词表、上下文长度 32 的小模型,反向传播和 SGD 都是手写 C。梯度检查相对误差为 1.07e-8;5,000 步训练约需两天,loss 降到约 1.87。它不具备聊天或语义推理能力,却用一块约 8 美元芯片证明了端侧训练全链路可以在微控制器资源预算内闭合。

行业动态 · Industry News

12 项 · 行业动态

Shieldstral34mistral.ai原文 ↗

mistral.ai

Mistral 发布用于多模态内容审核的 30 亿参数开放权重模型 Shieldstral。

Qwen 3.0 Image Pro35qwencloud.com原文 ↗

qwencloud.com

Qwen-Image-3.0-Pro 支持最长 4.5k token 输入、图中图和密集版面,页面宣称能渲染小至 10 px 的文字,原生覆盖 12 种语言与 20 多种字体。API 标价为 1K/2K 输入图每张 0.003 美元,1K 输出 0.04 美元、2K 输出 0.075 美元,当前页面限速为每分钟 1 次。它把复杂排版和可读文字作为主卖点,但低速率意味着首发阶段更适合离线生成而非高并发产品流量。

Flowise Is Shutting Down36flowiseai.com原文 ↗

flowiseai.com

Flowise 认为复杂任务正从刚性低代码工作流转向编码代理,因此决定停止产品和托管服务。时间表是 7 月 29 日冻结代码、8 月 10 日归档仓库并弃用 npm/Docker 制品、8 月 31 日结束核心团队活动;Apache 2.0 代码仍可永久查看和 fork。它既是一项停服通知,也暴露了低代码代理编排在需求快速变化时的维护压力。

OpenAI Economic Research Exchange40openai.com原文 ↗

openai.com

OpenAI Economic Research Exchange 以结构化项目合作支持外部研究者分析 AI 对劳动者、企业、机构和宏观经济的影响,并在隐私与治理约束下提供工具和数据。项目设置里程碑、数据治理和评审,筛选强调因果推断、测量、劳动经济与生产率等实证能力。计划的可评价之处将是最终能否产出可独立检验的外部证据,而不只是案例汇编。

博客文章 · Blog Posts

12 项 · 博客文章

Born Against46blog.fogus.me原文 ↗

blog.fogus.me

文章讨论业余编程社区反对 LLM 生成代码的文化和协作规范。

Your Agentic Workflow's Cache Keepalive Costs 8x Too Much48blog.mempko.com原文 ↗

作者用 100k token 前缀、4 家提供商和最长 40 分钟空闲做缓存保活测量,发现常见 30 秒 ping 比 4 分钟方案贵 7.8 倍。Anthropic 的较优间隔约 4 分钟、OpenAI 约 8 分钟;在前者上用 8 分钟会越过 5 分钟 TTL,成本甚至达到完全不保活的 4 倍。结论不是“总要延长 ping”,而是只在缓存即将淘汰且仍未越过盈亏线的狭窄区间续命。

引用来源 · References

66 条 · 引用
  1. 1 HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents. arXiv:2608.02650https://arxiv.org/abs/2608.02650 ↩ 回到正文 · back to text
  2. 2 BAP-SQL: Budget-Aware Observation Planning for Agentic Text-to-SQL. arXiv:2608.02876https://arxiv.org/abs/2608.02876 ↩ 回到正文 · back to text
  3. 3 Verifiable Memory. arXiv:2608.03137https://arxiv.org/abs/2608.03137 ↩ 回到正文 · back to text
  4. 4 Distractor-Aware Truncation. arXiv:2608.03297https://arxiv.org/abs/2608.03297 ↩ 回到正文 · back to text
  5. 5 Screenshots or Tools? arXiv:2608.03327https://arxiv.org/abs/2608.03327 ↩ 回到正文 · back to text
  6. 6 DataSpace. arXiv:2608.03451https://arxiv.org/abs/2608.03451 ↩ 回到正文 · back to text
  7. 7 ContinualSkillBench. arXiv:2608.03874https://arxiv.org/abs/2608.03874 ↩ 回到正文 · back to text
  8. 8 Permission Denied. arXiv:2608.02670https://arxiv.org/abs/2608.02670 ↩ 回到正文 · back to text
  9. 9 Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures. arXiv:2608.02645https://arxiv.org/abs/2608.02645 ↩ 回到正文 · back to text
  10. 10 TraceCompiler. arXiv:2608.02680https://arxiv.org/abs/2608.02680 ↩ 回到正文 · back to text
  11. 11 SparSEEty. arXiv:2608.02995https://arxiv.org/abs/2608.02995 ↩ 回到正文 · back to text
  12. 12 Search, Inspect, Fetch. arXiv:2608.02751https://arxiv.org/abs/2608.02751 ↩ 回到正文 · back to text
  13. 13 CUADebug. arXiv:2608.02643https://arxiv.org/abs/2608.02643 ↩ 回到正文 · back to text
  14. 14 Fail-Fast, Restart-Smart. arXiv:2608.03222https://arxiv.org/abs/2608.03222 ↩ 回到正文 · back to text
  15. 15 Test-Time Scaling in Reasoning LLMs. arXiv:2608.04001https://arxiv.org/abs/2608.04001 ↩ 回到正文 · back to text
  16. 16 Celld. GitHub repositoryhttps://github.com/denoland/celld ↩ 回到正文 · back to text
  17. 17 Sula. Project pagehttps://sagredo.dev/projects/sula/ ↩ 回到正文 · back to text
  18. 18 Capy. GitHub repositoryhttps://github.com/capysc/capy-cli ↩ 回到正文 · back to text
  19. 19 Greenlight. GitHub repositoryhttps://github.com/RevylAI/greenlight ↩ 回到正文 · back to text
  20. 20 ClickBench Playground. Project pagehttps://benchmark.clickhouse.com/playground/ ↩ 回到正文 · back to text
  21. 21 OpenEdit. GitHub repositoryhttps://github.com/veedstudio/open-edit ↩ 回到正文 · back to text
  22. 22 dstest. GitHub repositoryhttps://github.com/bxrne/dstest ↩ 回到正文 · back to text
  23. 23 Dr. PD. GitHub repositoryhttps://github.com/T76-org/drpd ↩ 回到正文 · back to text
  24. 24 Arxid. GitHub repositoryhttps://github.com/lucasolopes/arxid ↩ 回到正文 · back to text
  25. 25 Pistachio. GitHub repositoryhttps://github.com/winebarrel/pistachio ↩ 回到正文 · back to text
  26. 26 Labgrid MCP. GitHub repositoryhttps://github.com/onurcelep/labgrid-mcp ↩ 回到正文 · back to text
  27. 27 AgentTerm. GitHub repositoryhttps://github.com/albertwujj/agent-term ↩ 回到正文 · back to text
  28. 28 fec. GitHub repositoryhttps://github.com/brian-armstrong/fec ↩ 回到正文 · back to text
  29. 29 Hubmesh. GitHub repositoryhttps://github.com/DemigodDSK/hubmesh ↩ 回到正文 · back to text
  30. 30 Qapla. GitHub repositoryhttps://github.com/Carloscodix/qapla ↩ 回到正文 · back to text
  31. 31 Changes at Google DeepMind. Google Bloghttps://blog.google/company-news/inside-google/message-ceo/next-chapter-ai-momentum/ ↩ 回到正文 · back to text
  32. 32 Cloudflare OS. Cloudflare Bloghttps://blog.cloudflare.com/cloudflare-os/ ↩ 回到正文 · back to text
  33. 33 Muse Code and Muse Spark 1.2. Meta AIhttps://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1.2 ↩ 回到正文 · back to text
  34. 34 Shieldstral. Mistral AIhttps://mistral.ai/news/shieldstral/ ↩ 回到正文 · back to text
  35. 35 Qwen 3.0 Image Pro. Qwen Cloudhttps://www.qwencloud.com/models/qwen-image-3.0-pro ↩ 回到正文 · back to text
  36. 36 Flowise Is Shutting Down. Flowisehttps://flowiseai.com/sunset ↩ 回到正文 · back to text
  37. 37 Rust 仓库采用 LLM 政策. Rust Bloghttps://blog.rust-lang.org/inside-rust/2026/08/05/rust-langrust-is-adopting-an-llm-policy/ ↩ 回到正文 · back to text
  38. 38 Keyv and Friends Compromised. Aikido Securityhttps://www.aikido.dev/blog/keyv-and-friends-compromised-in-npm-supply-chain-attack ↩ 回到正文 · back to text
  39. 39 慕尼黑市资助 libexpat. Hartwork Bloghttps://blog.hartwork.org/posts/libexpat-city-of-munich-open-source-sabbatical/ ↩ 回到正文 · back to text
  40. 40 OpenAI Economic Research Exchange. OpenAIhttps://openai.com/index/introducing-the-openai-economic-research-exchange ↩ 回到正文 · back to text
  41. 41 Waymo in Dallas. Waymohttps://waymo.com/blog/shorts/dallas-open-to-all/ ↩ 回到正文 · back to text
  42. 42 Meta 投放含 AI 生成儿童性虐待图像的广告. Wiredhttps://www.wired.com/story/meta-ran-ads-that-contained-ai-generated-child-sexual-abuse-imagery/ ↩ 回到正文 · back to text
  43. 43 Prime Agent. Prime Intellecthttps://www.primeintellect.ai/blog/prime-agent ↩ 回到正文 · back to text
  44. 44 Nvidia's Vera Whitepaper Has a Thread Loose. Chips and Cheesehttps://chipsandcheese.com/p/nvidias-vera-whitepaper-has-a-thread ↩ 回到正文 · back to text
  45. 45 I'm Switching My Phone from Android to Linux. Runarhttps://runarcn.no/android-to-linux/ ↩ 回到正文 · back to text
  46. 46 Born Against. Fogushttps://blog.fogus.me/llm/born-against.html ↩ 回到正文 · back to text
  47. 47 Beating GPT-5.6 Sol on Retrieval with 100x Cheaper Open Models. Neonhttps://neon.com/blog/how-castform-neon-beats-frontier-models-on-price-and-efficiency ↩ 回到正文 · back to text
  48. 48 Your Agentic Workflow's Cache Keepalive Costs 8x Too Much. Mempkohttps://blog.mempko.com/your-agentic-workflows-cache-keepalive-costs-8x-too-much-v2-the-interval-frontier/ ↩ 回到正文 · back to text
  49. 49 Pi's Minimalism Is Its Advantage. Earendilhttps://earendil.com/posts/pi-autoresearch-and-databricks/ ↩ 回到正文 · back to text
  50. 50 Eight Myths on Software Engineering and GenAI. ACM Queuehttps://queue.acm.org/detail.cfm?id=3807963 ↩ 回到正文 · back to text
  51. 51 LLM 0.32. Simon Willisonhttps://simonwillison.net/2026/Aug/4/new-release-of-llm/#atom-everything ↩ 回到正文 · back to text
  52. 52 How Compiler Explorer Runs on AWS in 2026. Xaniahttps://xania.org/202608/how-compiler-explorer-runs-on-aws ↩ 回到正文 · back to text
  53. 53 The Valley of Webhooks. Welihttps://weli.dev/blog/the-valley-of-webhooks/ ↩ 回到正文 · back to text
  54. 54 Faster Than Ninja. build2https://build2.org/blog/faster-than-ninja.xhtml ↩ 回到正文 · back to text
  55. 55 cloudflare/computer. GitHub repositoryhttps://github.com/cloudflare/computer ↩ 回到正文 · back to text
  56. 56 huangruiteng/loopx. GitHub repositoryhttps://github.com/huangruiteng/loopx ↩ 回到正文 · back to text
  57. 57 uber/ADR. GitHub repositoryhttps://github.com/uber/ADR ↩ 回到正文 · back to text
  58. 58 esengine/DeepSeek-Reasonix. GitHub repositoryhttps://github.com/esengine/DeepSeek-Reasonix ↩ 回到正文 · back to text
  59. 59 NovaSky-AI/SkyRL. GitHub repositoryhttps://github.com/NovaSky-AI/SkyRL ↩ 回到正文 · back to text
  60. 60 sierra-research/tau2-bench. GitHub repositoryhttps://github.com/sierra-research/tau2-bench ↩ 回到正文 · back to text
  61. 61 Comfy-Org/workflow_templates. GitHub repositoryhttps://github.com/Comfy-Org/workflow_templates ↩ 回到正文 · back to text
  62. 62 blader/humanizer. GitHub repositoryhttps://github.com/blader/humanizer ↩ 回到正文 · back to text
  63. 63 WeaveMindAI/weft. GitHub repositoryhttps://github.com/WeaveMindAI/weft ↩ 回到正文 · back to text
  64. 64 FalkorDB/FalkorDB. GitHub repositoryhttps://github.com/FalkorDB/FalkorDB ↩ 回到正文 · back to text
  65. 65 czlonkowski/n8n-mcp. GitHub repositoryhttps://github.com/czlonkowski/n8n-mcp ↩ 回到正文 · back to text
  66. 66 mpfaffenberger/code_puppy. GitHub repositoryhttps://github.com/mpfaffenberger/code_puppy ↩ 回到正文 · back to text