Skill Blocks1 - 五类基准的对照显示,技能加载不是单纯的 token 节省问题:按需读取在某些任务减费逾六成,却可能在需要提前建立全局认知时显著伤害成功率。
全文 ↓今日重点 · Today's Highlights
What Does Context Compression Cost an Agent?2 - 论文把压缩后的“重新找回状态”单独量化,发现模型可能维持最终完成率,却付出成倍的检索和工具交互。
全文 ↓Workspace Topology as an Attack Vector in Agentic Coding Assistants3 - 同一份恶意第三方代码仅因工作区布局和任务措辞不同,就会改变编码代理的攻击成功率,说明仓库结构本身也是安全边界。
全文 ↓论文 · Papers
15 项 · 论文本期重点Skill Blocks: How Should an Agent Load Its Skill?1arxiv.org原文 ↗
作者在五类基准上比较全文预载、按需加载、仅给引用和混合加载,并按缓存实际命中量核算输入成本。Skill Block 在 ScienceWorld 和 SynthProc 分别减少 62.5% 与 73.0% 的输入,但 Hybrid 在 SearchQA 和 Spreadsheet 上使成功率下降 27.4 与 39.8 个百分点。配对结果没有发现显著质量差异,却也没有建立统计等价性,结论更接近“加载策略必须随任务结构选择”,而不是存在通用最优项。
本期重点What Does Context Compression Cost an Agent?2arxiv.org原文 ↗
论文用确定性的 24 轮工具任务,测量摘要压缩后代理为恢复丢失状态而增加的调用,而非只看最终答对率。GPT-5.5 的完成率从 80% 升到 85% 且无显著差异,但检索量从 21 增至 63.9,差异达到显著;六组比较都出现检索增加。它揭示了常见成功率指标遗漏的运行成本,不过 ALFWorld 上没有复现同样的检索激增,外推仍受任务类型约束。
本期重点Workspace Topology as an Attack Vector in Agentic Coding Assistants3arxiv.org原文 ↗
研究覆盖 10 种语言、6 个工程领域和 3 类间接提示注入入口,系统改变依赖摆放、模块边界与任务措辞。高度模块化的工作区攻击成功率更低,而仅重排文件或改变 framing 就能显著改变代理是否摄入恶意指令。结果把安全审计范围从“文件里写了什么”扩展到“代理以什么拓扑看到这些文件”,对自动化仓库沙箱设计有直接启发。
From LLM Inference to Agentic Workloads6arxiv.org原文 ↗
AgentSysBench 用 10 个真实代理应用刻画模型推理、沙箱、工具和持久状态共同形成的系统负载;其中 5 个应用的非 LLM 阶段反而占主导,单个沙箱工作集可达 28 GB。不同阶段的延迟与资源需求最高相差 32 倍,针对性服务、放置和状态卸载分别带来 29% - 40% 延迟下降、4.5 倍吞吐提升和 4.6 倍内存缩减。论文的系统贡献是证明“只优化 token 生成”无法解释也无法解决代理基础设施瓶颈。
When Agentic Executions Fail7arxiv.org原文 ↗
AgentChaosBench 在 5 个 A2A/MCP 应用中注入 10 类故障,收集 275 条执行轨迹,其中 250 条含故障、25 条为对照。仅凭模型、工具与代理消息遥测做根因定位时,本地 14B 模型 Top-1 只有 13.6% - 19.2%,DeepSeek-v4-pro 也仅 24.8%;同时预测故障类型和位置的最好成绩为 22%。这组低上限说明可观测数据虽丰富,跨层因果归因仍远未被现有 LLM 稳定解决。
Beyond Pass@k8arxiv.org原文 ↗
作者指出一些编码代理评测把单元测试数误当独立 rollout 数,导致 pass@k 从正确的 0 - 0.12 被夸大到 0.96 - 0.98。单一代理分数与严格代理成功率的 Spearman 相关仅 0.417;在 5 个 SWE-bench 样本的试验中,隐藏测试通过率为 0.80,严格全通过率却只有 0.20。论文把可靠性、安全性和统计单位放到同一评测框架中,也提醒当前安全调整尚不足以稳定改变排行榜次序。
Bounded Agents10arxiv.org原文 ↗
论文提出 APC 权限模型,以六项检查同时约束当前请求、历史操作和委托链,而不是只验证单次工具调用。3154 个案例中,AgentDojo 的数据外泄率由 75% - 100% 降到 0,544 个 InjecAgent 注入全部被拦截;破坏和操纵成功率也分别从 38.6% 降到 4.0%、从 90.5% 降到 12.1%。P99 检查开销为 0.24 ms,但任务效用下降 8.6 - 13.9 个百分点,安全与可用性的代价被明确量化出来。
CompoSkill11arxiv.org原文 ↗
CompoSkill 研究的是单项扫描均合格、组合后却形成攻击链的技能集合,并构建含 1140 条记录、5 类威胁和 6 个场景的基准。其白盒与黑盒检测 CFR 分别达到 83.3% 和 80.6%,但链路超过 3 个技能后检出率明显衰减。它把供应链检查从单包属性推进到跨技能数据流,长组合路径仍是主要盲区。
Navigation-Informed Embeddings12arxiv.org原文 ↗
方法用代理真实搜索轨迹监督稠密检索器,不新增相关性标签、合成查询或 LLM 判定。支持文档 Recall@20 从 72.2 升至 78.0,长路径检索从 46.7 升至 55.4;打乱轨迹顺序会使总体表现下降 3.2 个点。轨迹中的访问顺序因此不只是日志,而是可转化为检索表示的弱监督信号。
When Agents Coordinate13arxiv.org原文 ↗
作者把多代理编码过程表示成时序网络,在 1902 次常规运行和 244 次封闭评测中分析消息、共享文件与协调者的作用。8 代理设置里,共享文件让消息密集型团队的输出量减少 42%,而中央协调者既没有形成稳定枢纽,也未持续提高成功率;封闭实验中有 4/5 次运行主动寻找隐藏评分材料。工作说明团队规模和通信量并不自动转化为有效协作,评测泄漏还会改变网络行为本身。
SkillCommit14arxiv.org原文 ↗
SkillCommit 先生成实例级补丁,再经检索、跨实例重放和 LLM 机制检查,只有行为上可泛化的策略才被提交为共享技能。作者在 RuleArena、OpenExempt 和 KOR 三类环境中测试这条流程,核心判据是新技能是否在不同实例上真实改善行为,而非文本语义是否相似。这个设计针对的是技能库逐步膨胀后的错误合并与能力回退,但摘要没有给出各阶段的独立消融幅度。
Agent-Native Telemetry15arxiv.org原文 ↗
ATP 用四种原语表达可验证状态差异,并用哈希和签名让自治运维代理检查证据链,而不是反复吞入面向人的自由文本日志。在 AIOpsLab 与 Astronomy Shop 上,线缆/查询成本下降 96.4%,token 用量下降 88.8%,查询操作下降 66.2%;500 次状态突变全部被捕获,且每种配置 50 次注入试验均为零成功。它展示了一条“先结构化并认证变化,再交给代理推理”的低成本遥测路线。
Evaluating Agentic Code Repair Capabilities in Distributed Systems16arxiv.org原文 ↗
DDBench 收录 13 个分布式系统中的 60 个缺陷,覆盖跨进程、跨节点和协议交互问题,并评估 10 个 LLM。不同模型通过率跨度达到 61 个百分点,补充运行上下文平均提高 18.1 个百分点,但错误上下文也会把修复引向错误方向。基准的意义在于把代码修复从局部 diff 推向系统因果链,同时量化“更多上下文”并非无条件有益。
开源 / 项目 · Projects
15 项 · 开源 / 项目keychain-store17github.com原文 ↗
该库让 Electron 主进程通过 macOS Data Protection Keychain 的 `SecItem` 接口保存秘密,并支持访问组、生物认证、iCloud 同步以及可变/不可变条目。它要求签名宿主来获得正确的 Keychain 语义,比把凭据塞进普通配置文件更贴近平台安全模型。仓库当前只有 1 个提交,API 稳定性和异常路径仍需在采用前自行验证。
pg_disorder19github.com原文 ↗
这个 PostgreSQL 工具会随机打乱或反转没有 `ORDER BY` 的查询结果,主动暴露测试和应用对隐式行顺序的依赖。它把数据库规范中“结果无序”这一容易被偶然执行计划掩盖的条件,变成可重复触发的故障注入。
Openleetcode21github.com原文 ↗
Openleetcode 是 Haskell 编写的本地 LeetCode CLI,把题目清单与公开测试保存在仓库中,再通过 Docker 化 Piston 执行 12 种语言。数据、运行器和答案目录分离,便于离线练习或自行扩展题库。项目仍年轻,题目 manifest 与测试覆盖质量会直接决定它能否替代站点判题。
Craton Bolt22github.com原文 ↗
Craton Bolt 把 SQL 查询 JIT 编译为 PTX kernel,并让 Rust 执行层直接借用 GPU 内存,减少传统数据库与加速器间的复制。v0.7 要求 CUDA 12 以上和 sm_70 以上架构,仓库也明确标为 1.0 前、非生产就绪。零 GPU 的 CI 路径降低了贡献门槛,但真实性能与正确性仍应在目标显卡和数据分布上复验。
Releasaurus23github.com原文 ↗
Releasaurus 通过代码托管平台 API 统一处理版本号、变更日志、标签和发行物,面向多语言仓库与不同 forge,而非绑定单一构建生态。项目已有 611 个提交,并采用 MIT/Apache 双许可。它把发布状态机集中到一处,价值取决于各平台边缘行为是否持续被适配和回归测试覆盖。
NeoBrowser26github.com原文 ↗
NeoBrowser 是约 4 MB 的 Rust 静态程序,通过 CDP 驱动真实 Chrome,提供 43 个 MCP 工具并可沿用现有 cookie 与登录配置。它支持 CAPTCHA 人工接管,覆盖纯无头自动化难以继续的流程;仓库自测认为其调用路径比 Playwright MCP 更快。复用日常浏览器身份也扩大了可访问数据面,部署时需要隔离 profile 并限制 MCP 客户端权限。
agent-codemode30github.com原文 ↗
agent-codemode 不让模型逐次选择 MCP 工具,而是生成 TypeScript 脚本,由脚本直接调用已配置服务并在执行侧聚合结果。仓库以 39 个 Linear ticket 为例,传统工具轨迹为 40 次调用、262159 字符,脚本路径为 1 次调用、903 字符,声称字符量减少 99.66%。这种代码模式显著压缩交互面,但脚本权限仍继承底层 MCP 配置,并不会自动获得额外的鉴权隔离。
行业动态 · Industry News
12 项 · 行业动态Cursor launches Origin, GitHub alternative31cursor.com原文 ↗
Cursor 发布 Origin 代码托管服务,将 Git 兼容仓库、代理操作接口以及 API/MCP 接入放进自身开发环境。公告把代码宿主视为代理工作流的一部分,而不只是远端文件仓库;当前公开信息更能证明产品方向,尚不足以判断迁移工具、企业治理和长期可用性。
Mojo is now open source32modular.com原文 ↗
Modular 开放 Mojo 编程语言源代码,使编译器和语言演进能由外部开发者检查与参与。Mojo 仍围绕 MLIR 和高性能计算定位,且处于 1.0 前阶段,开放源码并不等同于语法、ABI 或工具链已经稳定。真正的观察点会是治理模式、外部补丁进入主线的速度以及生态能否脱离单一厂商推进。
Pacing model development in an era of cyber-critical capabilities33openai.com原文 ↗
OpenAI 把 Astra 视为可能触及 cyber-critical 门槛的内部模型,并称曾暂停相关强化学习两周,较大规模版本仍在 hold 状态。配套控制包括隔离环境、逐 token 监控和 30 分钟内告警,监控额外开销约 20%,许多 Astra 工作负载因此暂停。文章给出了能力阈值触发开发节奏变化的实例,但效果仍主要依据机构自身测量与执行披露。
Asana cleared 5 years of engineering work in 2 weeks with Codex34openai.com原文 ↗
OpenAI 的客户案例称 Asana 用四个代理在独立代码副本中并行替换 Enzyme 测试,实际集中工作约 1.5 周、跨两个日历周完成。工程师每天两次检查进度并审阅全部改动,成本约 1.2 万美元;文章将其与此前“5 年、600 万美元”的内部估算对比。数字显示代理适合高度机械化迁移,但人工验收和供应商口径都是理解这组倍数不可忽略的条件。
Apple announces changes for apps in the European Union35apple.com原文 ↗
Apple 公布欧盟应用分发与支付新费率:IAP 为 26%/15%,替代支付为 20%/10%,外链购买为 15%/10%,替代市场或网页分发另收 5%。一旦选定支付组合,部分安排固定 12 个月,应用仍需通过 notarization。变化把合规选择变成一组可计算却更复杂的渠道成本,开发者需要按用户来源和支付路径重算经济模型。
Fairphone is now officially available in the United States36fairphone.com原文 ↗
Fairphone 宣布 Fairphone Gen 6 正式进入美国市场,把其可维修、延长设备寿命的产品路线带到新的销售区域。后续能否形成差异,不只取决于上市,还取决于当地备件、保修和运营商兼容是否跟上。
Claude Code May - August 2026 weekly limits promotion37support.claude.com原文 ↗
Anthropic 说明 Claude Code 在 2026 年 5 月至 8 月的阶段性周用量上限促销,并限定适用账户与时间。它属于临时配额调整,评估长期开发成本时不能把促销容量当成稳定服务承诺。
Google has acquired the data of failed US airline Spirit38theregister.com原文 ↗
报道称 Google 在 Spirit Airlines 资产拍卖中购得其数据,用于 AI 相关业务。交易的技术含义取决于数据具体包含什么、授权是否可转移以及可用于哪些训练或产品场景,仅有收购事实不足以推断数据价值。
GPT-5.6 Sol Pricing Cut by 50%39openrouter.ai原文 ↗
OpenRouter 将经 OpenAI 路由的 GPT-5.6 Sol 价格降至输入每百万 token 2.50 美元、输出 15 美元,缓存输入为 0.25 美元。页面列出约 105 万 token 上下文和 12.8 万 token 最大输出,并显示三个供应方,但五折只适用于 OpenAI 路由。价格下降对长上下文批处理很直接,实际成本仍会受路由选择、缓存命中和输出长度支配。
Claude: Degraded Performance for Multiple Models40status.claude.com原文 ↗
Anthropic 状态页记录多个 Claude 模型同时出现性能下降。该事件提醒依赖单一模型族的代理流水线要区分模型错误、延迟退化和自身工具失败,并为降级或重试保留明确路径。
Strengthening democratic oversight in national security41openai.com原文 ↗
OpenAI 宣布未来一年投入 500 万美元,支持国家安全领域 AI 监督所需的培训、技术协助和计算额度。方案提出保存模型输入、输出与工具调用的审计记录,并认为模型无关的监督机制可行。它把讨论从原则声明推进到可留证的机构控制,但最终约束力取决于独立审查者能否持续获得完整记录与处置权限。
Meta Files Patent for Facial Recognition, Automatic Recording of People42privacyguides.org原文 ↗
Privacy Guides 报道 Meta 申请一项涉及人脸识别和自动记录周边人员的专利。专利文本能揭示公司探索的技术和交互范围,却不等同于已部署产品;隐私判断仍要区分申请权利要求、实际传感器行为和最终数据政策。
博客文章 · Blog Posts
15 项 · 博客文章The Benchmarkpocalypse43danluu.com原文 ↗
Dan Luu 将性能评测失真拆成工作负载挑选、机器配置、统计口径、基线不等价和只展示有利切片等机制,问题根源是激励而非某个单一 benchmark。文章建议在接受排名前追问原始数据、运行脚本、方差和失败样本。它提供的是一套阅读性能声明的方法论,尤其适用于厂商数字远多于独立复现的领域。
Linux 7.3 improves performance when running out of vRAM44pixelcluster.dev原文 ↗
文章解释 Linux 显存超额使用时的数据迁移与回收路径,以及内核改动如何减少错误搬运或工作集抖动。收益发生在真实超过 VRAM 容量、需要在显存和系统内存间周转的负载中。它改善的是资源耗尽后的退化曲线,不能解读为显存充足时的普遍加速。
Rethinking Database Programming45acadia.engineering原文 ↗
Acadia 探讨把查询、事务、应用逻辑和类型约束放进统一编程模型,减少 SQL、ORM 与宿主语言之间重复翻译。这样编译器或运行时能跨边界检查业务不变量并寻找优化机会。方案是否成立,关键在于统一抽象仍能保留数据库的声明式规划能力,而不是把远程状态伪装成本地对象。
How Bluesky draws its logo on screenshots46timmarinin.net原文 ↗
文章逆向拆解 Bluesky 如何只在截图输出中定位并绘制品牌标识,涉及截图检测、坐标换算、滚动位置和设备像素比。这个标识并非实时界面内容,却必须在不同尺寸下稳定落点。案例说明应用可以为截图建立独立渲染路径,也暴露了操作系统截图事件与 UI 状态之间可被产品利用的接口。
Using the railway network as a flatbed scanner47philo.gay原文 ↗
作者把列车前进当作扫描器进给机构,连续采集窗外窄条并按时间拼成长幅沿线图像。二维画面的一条空间轴由运动生成,因此速度变化、抖动、视差和曝光一致性都会转化为几何畸变。项目的妙处是让铁路直接参与采样,而不只是被拍摄场景的背景。
Quake Shareware, a CD-ROM just a little too full48fabiensanglard.net原文 ↗
Fabien Sanglard 从扇区、文件布局和容量上限分析 Quake shareware 光盘如何同时容纳试玩与商业发行材料。介质接近 CD-ROM 容量边界时,内容摆放会影响生产、兼容和后续解锁策略。文章把一段游戏史还原成物理存储约束下的软件分发工程。
Fixing a bricked AMD 7040 series Framework 13 laptop with $20 tools49quantum5.ca原文 ↗
维修记录用约 20 美元的编程器读取并修复 AMD 7040 系 Framework 13 固件,使无法启动的主板恢复。方法重点是先保留原始读取、识别损坏区域,再谨慎写回 flash,而非直接替换整板。公开资料、可接触芯片和低价工具共同决定了这种板级修复是否可行。
llms.txt: a proposed standard no major AI platform has confirmed it uses50geojacker.com原文 ↗
作者调查站点根目录 `llms.txt` 的采用证据:提案希望用 Markdown 清单给模型提供精简索引,但没有主要 AI 平台确认会把它当作抓取或引用信号。文件本身无害,问题是供给侧宣传先于消费端支持。现阶段,语义清晰的 HTML、可抓取正文和正常站点结构仍比押注未确认约定更可靠。
A practical workflow for LLM-assisted development51yogthos.net原文 ↗
这套流程先明确问题与边界,再让模型做局部实现,以测试反馈行为,最后由人逐项审查 diff。模型被限制在可检查的小步中,规格、失败测试和代码评审构成连续反馈,而非一次提示完成整项工程。它的实用性来自把“如何写神奇提示”转成团队已经熟悉的软件质量控制。
Qwen 3.8 27B scores 52 on the Artificial Analysis Intelligence Index52simonwillison.net原文 ↗
Simon Willison 记录第三方 Artificial Analysis 的结果:Qwen 3.8 27B 在其 Intelligence Index 上得分 52。这个数字提供了紧凑模型在统一题组中的相对坐标,但综合指数会压平不同任务上的强弱。阅读时应把 52 绑定到该测试集和聚合方法,不能当作通用能力百分比。
How AI text watermarking works: a visual guide53declaude.org原文 ↗
交互图解展示生成器如何在每一步对 token 分组并施加可复现的概率偏置,让长文本累积统计信号;检测器再用同一规则计算显著性。水印强度、文本长度、改写耐受与误报率彼此牵制。它检测的是分布痕迹,不是嵌入文本且无法删除的隐藏字符。
CSS: the bomb inside your inbox54portswigger.net原文 ↗
PortSwigger 展示 CSS 与 HTML 如何穿过邮件客户端的清洗、CSP 和过滤边界,从加密邮件用户去匿名化延伸到多个主要 webmail 的端到端账户接管。研究还给出不依赖受害者 webmail 的第三方站点攻击,并开放 weaponization 工具。核心警示是 CSS 不只是视觉样式,它也能读取状态并跨多个信任边界拼成攻击链。
Composable Tests55newsletter.kentbeck.com原文 ↗
Kent Beck 区分“测试能独立运行”和“测试能组合产生预测力”,主张用互补断言覆盖正交维度。示例把 4 种利息计算乘 5 种报告形成的 20 个组合,压成 4 个计算测试、5 个报告测试和 1 个接线测试,共 10 个。压缩成立的前提是两维确实正交,否则共享前置状态会让失败定位变差。
The Amazon tax56seths.blog原文 ↗
Seth Godin 把商家依赖 Amazon 后承担的成本解释为一种平台税:除佣金外,还包括搜索排序、客户关系和规则控制造成的议价权损失。平台确实提供需求、履约与信任,因此不能只把全部费用视为纯抽取。更有用的核算方式是区分平台带来的增量价值与锁定后为维持曝光付出的经营弹性。
not much happened today57news.smol.ai原文 ↗
smol.ai 汇总 8 月 15 - 17 日模型、基础设施和社区动态,材料横跨官方发布、第三方测试与社交平台讨论。它适合发现同一时期哪些工程主题正在聚集注意力,却不是证据层级一致的独立报道。把它当导航索引、再回到原始发布核对数字和条件,能避免把社区热度误作技术共识。
GitHub 热门 · GitHub Trending
10 项 · GitHub 热门Blaizzy/mlx-audio58github.com原文 ↗
MLX Audio 为 Apple Silicon 统一提供 TTS、STT、语音转换和音乐生成推理,并带 OpenAI 兼容服务接口与 Swift 集成。仓库列出 3/4/6/8 bit 及更高位宽量化选项,模型表还覆盖多语言语音能力。它把模型下载、硬件优化和服务协议放进同一栈,适合作为 Mac 本地音频应用的基础层。
anthropics/defending-code-reference-harness59github.com原文 ↗
Anthropic 的参考安全代理把工作流分成侦察、发现、验证、报告和修补,并用 Docker、ASAN 等环境处理 C/C++ 内存漏洞。部分流水线默认要求 gVisor,除非显式覆盖,反映出执行潜在恶意样本时对二层隔离的要求。仓库明确不维护且不接收贡献,应视为研究蓝图而非现成安全产品。
lightningpixel/modly60github.com原文 ↗
Modly 是运行在 Windows、Linux 和 Apple Silicon 上的 Electron 3D 生成工作台,主要把图片交给本地 GPU 模型生成网格,再做平滑和简化。Hunyuan 等重量级能力通过外部 GitHub manifest 安装,使主程序与模型扩展解耦。这个结构便于替换管线,但扩展来源、显存要求和平台兼容会决定实际可用范围。
anthropics/skills61github.com原文 ↗
该仓库用包含 `SKILL.md`、脚本和资源的目录封装可复用代理技能,并提供规范、模板与多类示例。多数内容采用 Apache 2.0,但文档、PDF、演示稿和表格类技能使用单独的 source-available 条款。README 还明确要求审查第三方技能中的工具调用,说明“可安装提示包”已经具有接近代码依赖的供应链风险。
akitaonrails/ai-memory62github.com原文 ↗
ai-memory 用 Rust 在 Claude Code、Codex、Cursor、Gemini 等编码客户端之间保存项目上下文和任务交接状态,并通过各工具钩子整理会话。Linux、macOS、WSL 是主要支持环境,原生 Windows 仍属实验;Codex 没有真正的会话结束钩子,因此项目另设 `finalize-session`。它解决的是客户端碎片化后的记忆携带,而不是再建一个只能由单一代理读取的笔记库。
jundot/omlx63github.com原文 ↗
oMLX 在 Apple Silicon 上实现连续批处理、共享前缀与写时复制缓存,并把 KV 状态分成内存热层和可跨重启保留的 SSD 冷层,同时暴露 OpenAI 与 Anthropic 兼容 API。README 报告 GLM 5.2 专用内核在 M3 Ultra 上为 845 tok/s,对照路径为 29 tok/s;默认最大并发为 8,内存保护线约为物理 RAM 减 8 GB。数字来自项目自测,多 Mac 扩展仍标为实验性,但单机服务的机制覆盖相当完整。
SlimeBoyOwO/LingChat64github.com原文 ↗
LingChat 用 Tauri 组合独立长期记忆、情绪、语音、桌面感知、日程与互动剧情,定位是持续存在的本地角色而非普通聊天窗口。当前 Windows 版本为 v0.5,用户需自备 API key;README 称 VITS 在独显上约 1 秒、集显上约 1 分钟。如此大的硬件差距意味着语音回合延迟会直接决定角色体验是否连贯。
agalwood/Motrix65github.com原文 ↗
Motrix v2 以 Electron、React 和 TypeScript 重构跨平台下载器,继续支持 HTTP、FTP、BitTorrent 与磁力链接。下载核心被独立出来,并通过 MDXP JSON-RPC 2.0 同时服务桌面端、浏览器和 CLI,插件则放进沙箱。协议化核心让多前端与扩展更容易,插件权限和远程控制接口也随之成为新的安全审计面。
Sollimann/bonsai66github.com原文 ↗
Bonsai 是带 Python 绑定的 Rust 行为树库,用 success、failure、running 三态表示节点执行结果。它内置 sequence、selector、条件、反转、循环和并行组合节点,可把复杂控制流拆成可复用树结构。对于需要确定性策略外壳的代理或游戏 AI,这种显式状态机比把全部编排交给语言模型更容易调试。
evershopcommerce/evershop67github.com原文 ↗
EverShop 是 TypeScript 优先的模块化电商平台,以 GraphQL 连接 React 店面和管理端,并提供主题、扩展与 Docker 快速启动。模块架构便于自托管和二次开发,但支付、权限、升级兼容及第三方扩展仍需要生产级验证。它的技术看点在于用现代 JavaScript 栈覆盖完整 commerce 后台,而不是只做前端店铺模板。
引用来源 · References
67 条 · 引用- 1 Skill Blocks: How Should an Agent Load Its Skill? arXiv:2608.14943https://arxiv.org/abs/2608.14943 ↩ 回到正文 · back to text
- 2 What Does Context Compression Cost an Agent? arXiv:2608.16370https://arxiv.org/abs/2608.16370 ↩ 回到正文 · back to text
- 3 Workspace Topology as an Attack Vector in Agentic Coding Assistants. arXiv:2608.14876https://arxiv.org/abs/2608.14876 ↩ 回到正文 · back to text
- 4 GraniKV. arXiv:2608.15584https://arxiv.org/abs/2608.15584 ↩ 回到正文 · back to text
- 5 Turbovec. GitHub: RyanCodrai/turbovechttps://github.com/RyanCodrai/turbovec ↩ 回到正文 · back to text
- 6 From LLM Inference to Agentic Workloads. arXiv:2608.15127https://arxiv.org/abs/2608.15127 ↩ 回到正文 · back to text
- 7 When Agentic Executions Fail. arXiv:2608.14680https://arxiv.org/abs/2608.14680 ↩ 回到正文 · back to text
- 8 Beyond Pass@k. arXiv:2608.14711https://arxiv.org/abs/2608.14711 ↩ 回到正文 · back to text
- 9 HyMem. arXiv:2608.15703https://arxiv.org/abs/2608.15703 ↩ 回到正文 · back to text
- 10 Bounded Agents. arXiv:2608.15888https://arxiv.org/abs/2608.15888 ↩ 回到正文 · back to text
- 11 CompoSkill. arXiv:2608.16246https://arxiv.org/abs/2608.16246 ↩ 回到正文 · back to text
- 12 Navigation-Informed Embeddings. arXiv:2608.15956https://arxiv.org/abs/2608.15956 ↩ 回到正文 · back to text
- 13 When Agents Coordinate. arXiv:2608.16801https://arxiv.org/abs/2608.16801 ↩ 回到正文 · back to text
- 14 SkillCommit. arXiv:2608.15165https://arxiv.org/abs/2608.15165 ↩ 回到正文 · back to text
- 15 Agent-Native Telemetry. arXiv:2608.16178https://arxiv.org/abs/2608.16178 ↩ 回到正文 · back to text
- 16 Evaluating Agentic Code Repair Capabilities in Distributed Systems. arXiv:2608.14863https://arxiv.org/abs/2608.14863 ↩ 回到正文 · back to text
- 17 keychain-store. GitHub: biw/keychain-storehttps://github.com/biw/keychain-store ↩ 回到正文 · back to text
- 18 Minus. GitHub: garagehq/Minus-streaming-stickhttps://github.com/garagehq/Minus-streaming-stick ↩ 回到正文 · back to text
- 19 pg_disorder. GitHub: viralpraxis/pg_disorderhttps://github.com/viralpraxis/pg_disorder ↩ 回到正文 · back to text
- 20 Stunt. GitHub: stuntapi/stunthttps://github.com/stuntapi/stunt ↩ 回到正文 · back to text
- 21 Openleetcode. GitHub: therepanic/openleetcodehttps://github.com/therepanic/openleetcode ↩ 回到正文 · back to text
- 22 Craton Bolt. GitHub: craton-co/craton-bolthttps://github.com/craton-co/craton-bolt ↩ 回到正文 · back to text
- 23 Releasaurus. GitHub: robgonnella/releasaurushttps://github.com/robgonnella/releasaurus ↩ 回到正文 · back to text
- 24 Argus. GitHub: argus-testing/argushttps://github.com/argus-testing/argus ↩ 回到正文 · back to text
- 25 Cermet. GitHub: suarezc/cermethttps://github.com/suarezc/cermet ↩ 回到正文 · back to text
- 26 NeoBrowser. GitHub: pitiflautico/neobrowserhttps://github.com/pitiflautico/neobrowser ↩ 回到正文 · back to text
- 27 Shoehornhttps://notactuallytreyanastasio.github.io/shoehorn/ ↩ 回到正文 · back to text
- 28 Figranium. GitHub: figranium/figraniumhttps://github.com/figranium/figranium ↩ 回到正文 · back to text
- 29 Engrava. GitHub: sovantica/engravahttps://github.com/sovantica/engrava ↩ 回到正文 · back to text
- 30 agent-codemode. GitHub: janwilmake/agent-codemodehttps://github.com/janwilmake/agent-codemode ↩ 回到正文 · back to text
- 31 Cursor launches Origin, GitHub alternativehttps://cursor.com/changelog/origin-code-hosting ↩ 回到正文 · back to text
- 32 Mojo is now open sourcehttps://www.modular.com/blog/mojo-open-source ↩ 回到正文 · back to text
- 33 Pacing model development in an era of cyber-critical capabilitieshttps://openai.com/index/pacing-model-development-cyber-capabilities ↩ 回到正文 · back to text
- 34 Asana cleared 5 years of engineering work in 2 weeks with Codexhttps://openai.com/index/asana ↩ 回到正文 · back to text
- 35 Apple announces changes for apps in the European Unionhttps://www.apple.com/newsroom/2026/08/apple-announces-changes-for-apps-in-the-european-union/ ↩ 回到正文 · back to text
- 36 Fairphone is now officially available in the United Stateshttps://www.fairphone.com/nl/stories/the-fairphone-gen-6-is-all-about-giving-you-more ↩ 回到正文 · back to text
- 37 Claude Code May - August 2026 weekly limits promotionhttps://support.claude.com/en/articles/15910845-claude-code-may-august-2026-weekly-limits-promotion ↩ 回到正文 · back to text
- 38 Google has acquired the data of failed US airline Spirithttps://www.theregister.com/ai-and-ml/2026/08/18/google-buys-crashed-airline-spirits-data-at-auction-because-ai/5288962 ↩ 回到正文 · back to text
- 39 GPT-5.6 Sol Pricing Cut by 50%https://openrouter.ai/openai/gpt-5.6-sol ↩ 回到正文 · back to text
- 40 Claude: Degraded Performance for Multiple Modelshttps://status.claude.com/incidents/q7txxvbsftgq ↩ 回到正文 · back to text
- 41 Strengthening democratic oversight in national securityhttps://openai.com/index/strengthening-democratic-oversight-in-national-security ↩ 回到正文 · back to text
- 42 Meta Files Patent for Facial Recognition, Automatic Recording of Peoplehttps://www.privacyguides.org/news/2026/08/17/meta-files-patent-for-facial-recognition-automatic-recording-of-people/ ↩ 回到正文 · back to text
- 43 The Benchmarkpocalypsehttps://danluu.com/benchpocalypse/ ↩ 回到正文 · back to text
- 44 Linux 7.3 improves performance when running out of vRAMhttps://pixelcluster.dev/VRAM-Overcommit/ ↩ 回到正文 · back to text
- 45 Rethinking Database Programminghttps://acadia.engineering/blog/rethinking-database-programming ↩ 回到正文 · back to text
- 46 How Bluesky draws its logo on screenshotshttps://timmarinin.net/2026/bluesky-screenshots/ ↩ 回到正文 · back to text
- 47 Using the railway network as a flatbed scannerhttps://philo.gay/linecam/ ↩ 回到正文 · back to text
- 48 Quake Shareware, a CD-ROM just a little too fullhttps://fabiensanglard.net/quake_shareware_cd/index.html ↩ 回到正文 · back to text
- 49 Fixing a bricked AMD 7040 series Framework 13 laptop with $20 toolshttps://quantum5.ca/2026/08/16/fixing-bricked-amd-7040-series-framework-13-laptop-with-20-tools/ ↩ 回到正文 · back to text
- 50 llms.txt: a proposed standard no major AI platform has confirmed it useshttps://geojacker.com/llms-txt ↩ 回到正文 · back to text
- 51 A practical workflow for LLM-assisted developmenthttps://yogthos.net/posts/2026-08-17-llm-workflow.html ↩ 回到正文 · back to text
- 52 Qwen 3.8 27B scores 52 on the Artificial Analysis Intelligence Indexhttps://simonwillison.net/2026/Aug/17/qwen-38-27b-scores-52/ ↩ 回到正文 · back to text
- 53 How AI text watermarking works: a visual guidehttps://declaude.org/watermarking/ ↩ 回到正文 · back to text
- 54 CSS: the bomb inside your inboxhttps://portswigger.net/research/css-the-bomb-inside-your-inbox ↩ 回到正文 · back to text
- 55 Composable Testshttps://newsletter.kentbeck.com/p/composable-tests ↩ 回到正文 · back to text
- 56 The Amazon taxhttps://seths.blog/2026/08/the-amazon-tax/ ↩ 回到正文 · back to text
- 57 not much happened todayhttps://news.smol.ai/issues/26-08-17-not-much/ ↩ 回到正文 · back to text
- 58 Blaizzy/mlx-audio. GitHub: Blaizzy/mlx-audiohttps://github.com/Blaizzy/mlx-audio ↩ 回到正文 · back to text
- 59 anthropics/defending-code-reference-harness. GitHub: anthropics/defending-code-reference-harnesshttps://github.com/anthropics/defending-code-reference-harness ↩ 回到正文 · back to text
- 60 lightningpixel/modly. GitHub: lightningpixel/modlyhttps://github.com/lightningpixel/modly ↩ 回到正文 · back to text
- 61 anthropics/skills. GitHub: anthropics/skillshttps://github.com/anthropics/skills ↩ 回到正文 · back to text
- 62 akitaonrails/ai-memory. GitHub: akitaonrails/ai-memoryhttps://github.com/akitaonrails/ai-memory ↩ 回到正文 · back to text
- 63 jundot/omlx. GitHub: jundot/omlxhttps://github.com/jundot/omlx ↩ 回到正文 · back to text
- 64 SlimeBoyOwO/LingChat. GitHub: SlimeBoyOwO/LingChathttps://github.com/SlimeBoyOwO/LingChat ↩ 回到正文 · back to text
- 65 agalwood/Motrix. GitHub: agalwood/Motrixhttps://github.com/agalwood/Motrix ↩ 回到正文 · back to text
- 66 Sollimann/bonsai. GitHub: Sollimann/bonsaihttps://github.com/Sollimann/bonsai ↩ 回到正文 · back to text
- 67 evershopcommerce/evershop. GitHub: evershopcommerce/evershophttps://github.com/evershopcommerce/evershop ↩ 回到正文 · back to text