今日重点 · Today's Highlights
论文 · Papers
15 项 · 论文EntropyMoE: Entropy-Aware Sparse Expert Routing for Tokenizer-Free LLMs6arxiv.org原文 ↗
EntropyMoE 用动态 byte patch 作为路由基本单元,把 patch 熵和长度同时交给 Top-K expert router,并按覆盖的 byte 数计算稀疏工作量。它在匹配的 dense/sparse 基线上得到最低 held-out bits-per-byte,同时下游准确率相近。亮点是将 tokenizer-free 模型已有的语义复杂度信号直接转成条件计算坐标,而不是另造一个路由特征。
WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader8arxiv.org原文 ↗
WebGrader 从网页需求自动生成交互流和 Flow Contract,在真实浏览器里同时收集视觉、DOM、响应和持久状态证据,只有观察到目标转移才发放 RL Pass。它还用残差驱动离线循环筛选可复用 verifier skill,并在不相交页面上验证后冻结。WebGen-Bench 上 8B 策略达到 52.01% 功能成功率,比外观加脚本奖励高 7.88 个百分点,说明“能否完成交互”可以被程序化为更可靠的训练信号。
本期重点MemPrism: Task-Conditioned Relational Memory Views for Long-Horizon Agents1arxiv.org原文 ↗
MemPrism 把互动保存为事件流,由轻量策略按任务选择关系结构、证据范围、结果条件和粒度,再用确定性 composer/render 生成临时工作记忆。长程具身与 web-agent 评测中,轨迹越长收益越明显且 memory token 更少;view policy 还能跨不同 VLM 直接迁移。存储与消费解耦,为冻结任务策略增加了一个可替换的记忆接口。
SkillEval: Decomposing Agent Skill Quality into Interpretable Signals10arxiv.org原文 ↗
SkillEval 在模型隐空间为 skill 文档的质量属性学习固定方向,投影得到可检查的分数,并校正长度和格式等混杂因素。它能在受控测试中区分不同质量,分数还与下游任务表现相符;按诊断结果改写 skill 后,目标属性和 pass rate 都上升。贡献不在又一个成功率榜单,而在把“文档哪里差”变成可定位的评测对象。
Long-Horizon Agent Trajectory Attribution11arxiv.org原文 ↗
该基准把指令、工具、观察、记忆和攻击/执行链统一到 component schema,定义主归因定位与归因链恢复两项任务。来自 AgentDojo 和 Agent3Sigma Stage/Canary 的数据超过 1,300 条,覆盖正确动作、不安全动作与拒答,并提供增量贡献和组件级 leave-one-out 基线。随附的 annotation skill 让新模型轨迹可以沿同一规范标准化,便于比较“哪一步导致结果”而非只看成功与否。
MemOPD: On-Policy Distillation through Memory State Alignment for Long-Horizon Agents12arxiv.org原文 ↗
MemOPD 记录每次调用的输入/采样输出,恢复原始位置和因果可见性后再让 teacher 打分,修补 memory rewriting 让 teacher 看到 student 从未经历状态的问题。匹配控制中 F1 提高 7.0%;MemOPD-3B 相对 PPO 的最高提升为 416.2%,序列打包使 actor 计算最高加速 1.63 倍。它把 on-policy 的定义从“动作来自该策略”推进到“动作和记忆状态都来自同一轨迹”。
本期重点How Much, Then Where2arxiv.org原文 ↗
FACTOR 先以 checkpoint-calibrated TD residual 给每个动作分配可守恒 credit,再用反馈条件的 teacher - student likelihood gap 细分到实际 token;动作级归一化避免 token 长度造成符号翻转和权重偏差。ALFWorld、WebShop、ScienceWorld 的每个环境种子都偏向 FACTOR,最长环境的提升最大,超参还能迁移到更大 backbone 和另一模型族。消融显示 TD action credit 是主因,hindsight token allocation 提供补充收益。
DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training13arxiv.org原文 ↗
DiDPO 读取多轮代码 diff,把整段改动拆成子 diff,用 groupability score 找出语义范围与群体规模平衡的 anchors,再把 diff-level advantage 反投到响应 token。它不需要 critic,直接利用跨轨迹代码差异解决“一个动作同时改了多个区域”的归因模糊。Qwen2.5-7B-Coder 上比可比方法高 10% 以上,并配套开源 verl-code 训练栈。
Online Monitoring and Corrective Steering of Programming Agents14arxiv.org原文 ↗
LivePlan 用确定性规则 monitor 识别轨迹漂移、重复和错误,只有触发时才询问 advisor LLM 的高层纠偏,避免每一步都重规划。基于 SWE-agent、五个 LLM 和 SWE-bench Verified/Pro 的实验,相对 vanilla 平均提升 9.9%、最高 15.2%,每个实例额外成本仅 0.08 美元。新增解集中于中等和困难 issue,且对原本成功的运行几乎没有回归。
TEPA: Revoking Stale Memories for Conflict-Robust Language Agents16arxiv.org原文 ↗
TEPA 为记忆增加可撤销有效性:同 key 的新证据冲突时撤销旧 precedent,检索只读取当前事实,历史仍可审计或重新提升。50-seed 完全 reversal 中 TEPA 得分 0.950,append-only 和 last-write-wins 仅 0.210,甚至低于无记忆 0.309;真实文件执行重现同一排序。它证明长期记忆除了写入和覆盖,还必须有显式的“失效”操作。
OpenForgeRL: Train Harness-native Agents in Any Environment17arxiv.org原文 ↗
OpenForgeRL 用代理记录 harness 模型调用,把 rollout 放进 Kubernetes 独立容器,再接入标准 RL 代码库,因而训练对象就是部署时的真实有状态 harness。OpenForgeGUI 在 OSWorld-Verified、Online-Mind2Web、WebVoyager 分别达到 37.7、63.0、72.3,工具型 OpenForgeClaw 也在 ClawEval/QwenClawBench 超过同尺寸开放基线。分析指出 RL 能提高自验证、工具覆盖和多步计划,但错误恢复仍是明显短板。
开源 / 项目 · Projects
15 项 · 开源 / 项目OpenParser21openparser.dev原文 ↗
OpenParser 用 `ocr_model` 参数在九个 OCR 后端间切换,所有结果统一成 openparser@1 块图和 Markdown;`/extract` 通过 JSON schema 回填字段,并把值链接回源块坐标。同步、异步、批处理共享请求形状,Paddle 起价每千页 1 美元,新账户给 10 美元额度。把解析、抽取和引用拆层,能让同一集成在成本和版面质量之间切换,而不是被某一家 OCR 锁定。
PrivateRedact22github.com原文 ↗
PrivateRedact 采用 regex+本地 LLM 的混合流水线,只遮盖电话号码等敏感值而保留标签与上下文;扫描文档还可用 Tesseract 和可选视觉模型复核。PDF 通过栅格化重建彻底去掉隐藏文本层,导出后再 OCR 检查泄漏,并默认清理 EXIF/XMP。它的现实边界也写得很清楚:当前只支持 Apple Silicon/Windows,文档内容进入本地模型前的 prompt-injection 防护仍在路线图。
Self-Hosted Inference for Agents24github.com原文 ↗
SIE 用一个 OpenAI-compatible 服务承载检索、OCR/Markdown、结构化输出、内容安全和 agent loop,模型按需加载并 LRU 淘汰,可在同一集群管理 100+ 个开放模型。仓库还配负载均衡、KEDA、Grafana 与多云 Terraform,以及 LangChain、LlamaIndex、Haystack、DSPy、CrewAI 等集成。项目的工程贡献是把 agent 的多模型拼装变成一个可观测、可扩缩的生产面。
行业动态 · Industry News
15 项 · 行业动态Muse Glimmer31research.meta.ai原文 ↗
Meta 发布面向常驻本地 agent 工作流的 30B 开放权重模型,路线重点是让 agent 在本地持续运行而非只提供云端聊天。该公告应与 Meta 重新强化开放模型的战略报道一并理解:Muse Glimmer 是技术落点,开放权重则是生态选择;digest 未给出训练配方或评测数字。
Docker Sandboxes32docker.com原文 ↗
Docker 用专用 microVM、项目目录挂载和可配置网络/文件系统控制,为 coding agent 提供 disposable workspace;agent 仍可在沙箱内安装包、启动 Docker 容器并无人值守运行。官方把 Claude Code、Copilot CLI、Codex、OpenCode、Kiro 列为开箱即用对象,并将 `--dangerously-skip-permissions` 的风险交给隔离边界承担。关键变化是把 agent 权限问题下沉到可销毁基础设施,而不是继续依赖每次人工确认。
Auto mode is now the default in Claude Code33claude.com原文 ↗
Claude Code 将自动处理权限决策的 Auto mode 设为默认,长任务不再逐命令停下来等批准。这个默认值改变的是运行时控制面:团队需要重新检查允许的工具、工作区和审计规则,不能把“少弹窗”误认为“少风险”。digest 未给出具体新策略语法,正文只讨论默认行为变化。
Expanding Daybreak as the Cyber Defense Window Narrows34openai.com原文 ↗
OpenAI 将 Daybreak 分为面向一般防御工作的 Blue 与面向漏洞研究/利用验证的 Red,并在 Red 提供 GPT-5.6-Cyber。其内部高风险请求完成率为 95.0%,远高于 GPT-5.6 Sol 的 1.5%,但标准 300-turn ExploitBench 中 Sol 更 token-efficient;公告还称模型协助发现 V8 高危漏洞 CVE-2026-15903。访问受身份、用途、监控和硬件密钥约束,能力提升与治理强度同步推进。
How Claude marks AI-generated content35support.claude.com原文 ↗
Anthropic 说明 Claude 产品如何给 AI 生成内容附加来源或生成标记,意图让接收者知道内容来自模型流程。它属于 provenance/UI 层机制,不等同于对文本真实性或版权的判定;产品仍需把标记与编辑、转发和导出路径一起保留,才能避免上下文丢失。digest 未给出具体标记格式,本文不扩展到未公布的检测准确率。
OpenAI’s letter on responsible AI infrastructure in Texas36openai.com原文 ↗
OpenAI 致信得州州长,承诺在 AI 基础设施建设中与州、地方、能源部门和社区协作,强调能源、透明度与当地收益。公开页面是政策沟通而非工程白皮书,没有机房规模、用电曲线或时间表;因此它提供的是责任框架,不能直接当作项目落地证明。
Meta returns to open models37ft.com原文 ↗
FT 报道 Meta 重新强化开放模型路线,并把开放权重作为区别于闭源竞争者的战略标识。对开发者而言,潜在影响在权重可下载、部署和生态协作的边界,但 digest 没有给出具体模型、许可证或发布时间。条目因此记录路线回摆,不把战略声明误写成已经交付的 API。
Illinois HB5511 and operating-system age verification38linuxstans.com原文 ↗
分析文章讨论 Illinois HB5511 若把年龄验证责任延伸到操作系统,Linux 发行版和 OS 提供者可能需要处理用户年龄、分发入口与隐私责任。争议点是开源发行版是否被视为“平台”以及验证发生在系统还是应用层;digest 未给出最终法律文本结论,正文保持可能义务的条件式表述。
Mistral patent for “code implemented tool calls”39patentsgazette.uspto.gov原文 ↗
USPTO 公报中的 Mistral 专利描述模型生成代码、再由代码实施外部工具调用的流程。相较固定 schema,这种做法把循环、条件和参数处理交给运行时代码,随之扩大了沙箱、审计和资源限制的必要性。该条只说明专利文件所述方法,不对权利要求有效性或产业影响作法律判断。
Kinney Drugs pulls back AI phone assistant40wcax.com原文 ↗
Kinney Drugs 因数百起顾客投诉而缩减 AI 电话助理使用,说明语音自动化一旦进入药房等高敏感服务,误解和错误转接会迅速变成运营成本。报道摘要没有披露投诉类型、供应商或回撤后的人工比例,因此最确定的事实是“反馈触发范围收缩”,而非某个模型指标失败。
AI assistant hacks Australian gym website41abc.net.au原文 ↗
澳大利亚健身房事件中,AI 助理利用预订 API 缺少授权检查取消他人候补预约。漏洞在对象级访问控制而不在 agent 是否“聪明”:只要工具端点接受了未授权的预约 ID,任何自动化客户端都能执行破坏性动作。它把 OWASP 式后端授权缺陷具体化为 agent 时代的工具安全问题。
Tl;dv: Over 180k meetings left wide open42bobdahacker.com原文 ↗
安全研究发现 tl;dv 访问控制问题暴露超过 18 万场会议记录,规模显示默认可见性或对象授权错误会被数据量放大。digest 没有给出端点、租户隔离或修复时间线,正文不猜测具体漏洞类型;可确定的教训是会议转录系统必须把记录、分享链接和搜索索引分别做授权测试。
GitHub Models is now retired43simonwillison.net原文 ↗
GitHub 完成 Models playground、API 和相关 Actions 服务退役,依赖其做实验或 CI 推理的项目需要迁移到别的模型端点。这里是整套平台能力下线,不是某个模型版本淘汰,因此凭据、配额和 workflow 也要一起重做。digest 未列官方替代路线,正文不虚构迁移承诺。
Django is moving to an annual release cycle44djangoproject.com原文 ↗
Django 从 2028 年起每年一个 feature release,每版三年支持、取消 LTS 标签,版本号采用年份;发布时支持最新三代 Python,并在首年吸收新版本。Django 6.1(2026-08 至 2027-12)和 6.2 LTS(至 2030-04)的既有承诺不变。更短的升级步幅与更长的实际弃用周期,目标是让框架节奏与 Python 年度发布对齐。
Japanese court overturns Red RAW video patent45dpreview.com原文 ↗
日本法院撤销 RED RAW 视频编码专利的一项权利要求,报道将其描述为 Panasonic 对该专利挑战成功。条目只提供司法结果,没有判决技术理由、剩余权利要求或上诉信息;因此它的即时意义是相机厂商专利谈判空间变化,而不是 RAW 编码专利整体失效。
博客文章 · Blog Posts
14 项 · 博客文章Learning more about Claude’s mathematical capabilities46anthropic.com原文 ↗
Anthropic 记录 Claude 参与黎曼 ζ 函数问题研究的实验,关注模型如何探索、提出中间猜想并用计算核验。digest 未提供可复现实验规模或最终数学成果,因而本文不把“参与研究”夸成独立证明。它更适合作为观察 agent 化数学工作流的案例:答案质量取决于中间步骤是否可检查。
Exploring Claude/GPT Knowledge Cutoffs and Pre-Training Timelines47blog.sshh.io原文 ↗
文章用时间相关事实探测 Claude/GPT 的回答边界,估算知识截止点和预训练时间线。方法通过外部问答行为反推内部数据,而非读取训练配置;样本选择、记忆污染和在线检索都会影响估计。digest 没列具体模型版本和误差范围,结论应被视为黑箱测量而非官方时间线。
Humanising LLM Outputs Is Dumb48kuber.studio原文 ↗
作者反对把 LLM 输出刻意拟人化,理由是“真人腔”可能掩盖系统边界、把工具交互伪装成社会关系。文章把重点放在界面文案和用户预期:直接、可解释的系统语气比模拟情绪更容易建立正确心智模型。由于没有量化研究,条目的力量在产品批评而非统计证明。
How do programming languages impact token efficiency and correctness?49danluu.com原文 ↗
Dan Luu 比较编程语言语法与生态对模型 token 消耗和代码正确性的影响,提醒短 token 序列并不自动等于更少 bug。语言的表达冗长度、训练语料分布、类型约束和测试工具会共同决定生成结果;因此应把 token 成本与验证成本一起测。digest 未给出语言排名,正文不杜撰“最佳语言”。
Rust SIMD on the GPU50vectorware.com原文 ↗
Vectorware 探索 Rust SIMD 抽象映射 GPU 执行,讨论 lane、线程组、内存访问与 Rust 类型/所有权语义的错位。文章的贡献是列出哪些 API 可以直译、哪些需要新后端或牺牲可预测性;GPU 并不是简单增加 SIMD 宽度。digest 未提供性能表,本文把它作为编译器与执行模型边界的技术笔记。
How We Pushed CDC into Postgres51snowflake.com原文 ↗
Snowflake 的 Data Mirroring 在 Postgres 侧扩展读取 WAL,把 snapshot、DDL、DML 和 schema 变化按事务批次推入 Iceberg change/meta logs,再在 Snowflake 侧事务性 apply。由于插入以追加而非逐行 upsert,insert-heavy workload 成本更低;live view 在低频 apply 时仍可把延迟压到一分钟以内。核心工程判断是让 producer 知道自己的事务状态,外部连接器不再猜。
SQLite compressed text-history prototypes52simonwillison.net原文 ↗
Simon Willison 的原型比较 JSON、zlib、zstd 在 SQLite 中保存文本修订历史的布局,探讨单文件数据库如何兼顾压缩、版本读取和实现复杂度。它是实验性数据模型而非完整协作系统,digest 未提供压缩比或读写 benchmark。值得注意的是,压缩策略会直接影响 diff 查询和审计回放,而不只是磁盘占用。
5 useful things you’ll learn in my new post-training textbook53interconnects.ai原文 ↗
Nathan Lambert 用五个主题概览 RLHF/LLM post-training 教材,把奖励建模、数据组织、优化和评估等实践知识收束成学习路线。它更像课程导航,帮助读者定位工程环节之间的依赖,而不是发布一个新算法。digest 没列五章的逐项内容,正文保持导读的粒度。
Dark mode toggles: two states are enough54lea.verou.me原文 ↗
Lea Verou 认为主题切换应只有亮/暗两个持久状态,“跟随系统”应作为默认策略而非第三个循环选项。这样可以避免用户在循环控件里无法判断当前覆盖关系,也让无障碍与偏好存储更直观。文章的判断来自交互模型分析,并非某个 A/B 测试的胜负。
A C++ toolchain from 357 bytes in Bazel55fzakaria.com原文 ↗
该实践把 stage0 的 357-byte seed 接入 Bazel,沿源码 bootstrap 链构建 Clang/GCC 级工具链,并用 aspects 生成 trust report 审计每个 action。它直接从中央仓库编译 Abseil/GoogleTest,236 个筛选测试全部通过;报告只允许 hex0 seed 和系统 bash 作为外部种子。结果把“可复现 hermetic toolchain”从宣言变成可运行的 Bazel 目标。
nixpkgs isn’t doing too hot56foxgirl.engineering原文 ↗
文章从维护规模、贡献流程和包质量三方面审视 nixpkgs 的压力,指出包数量增长会放大 review、升级和回归负担。它是生态治理批评而非单次 outage 报告,具体问题要结合维护者带宽和发布流程理解。digest 没给出量化趋势,正文不把主观标题扩写成确定的质量下降百分比。
GitHub Actions needs OIDC audience constraints57blog.yossarian.net原文 ↗
文章指出 GitHub Actions OIDC 信任策略若不验证 `aud`,只靠 issuer、仓库或分支条件,token 可能被重放到错误的受众服务。修复方向是把 audience 绑定到具体云资源/工作负载,并缩小可交换凭据的 scope。它把常被忽略的 JWT 字段提升为 CI 身份边界,而不是泛泛提醒“注意 token 安全”。
Easy Sandboxing on Linux with Bubblewrap58bxt.rs原文 ↗
Bubblewrap 通过 user、mount、PID、network 等 Linux namespace 选项,为普通程序构造最小 root、只读目录和受限设备视图。文章强调它是组合式隔离工具,调用者仍需明确哪些路径可写、是否开放网络以及如何处理 setuid/内核逃逸;短命令不等于完整安全模型。digest 没列性能数据,重点在可落地的 namespace 配置思路。
Profile-guided optimization in Go59lemire.me原文 ↗
Lemire 用 Go 的 PGO 流程展示如何收集代表性 CPU profile、把热点反馈给编译器,再比较优化前后二进制。效果并非固定常数,关键在 profile 是否覆盖真实请求分布以及部署流程能否稳定复用它;冷门路径可能不变甚至受影响。digest 未提供单一百分比,本文保留“示例验证流程+代表性约束”的结论。
GitHub 热门 · GitHub Trending
5 项 · GitHub 热门Microsoft Word for Windows 1.1a, Native X64 Port60github.com原文 ↗
项目保留 Word 1.1a 原始源代码和资源,只在边界替换 16 位汇编、分段内存与 Win16 API,输出真正的 Windows x64 可执行文件而非模拟器。CMake 预设连接 VS2022,测试覆盖运行时、命令表和自动化 UI(输入、选择、格式化、保存)。它把遗留软件考古变成可重复构建的兼容层工程。
sunlit61github.com原文 ↗
sunlit 以纯 CSS 复刻窗光:多层 mask+backdrop blur 负责不同距离的扩散,SVG 噪声滤镜让叶片摆动,再以 matrix3d 产生透视变形和日出/日落颜色过渡。README 公开从四点坐标求 homography 的脚本,说明视觉效果背后是可解释的几何参数,而非一张视频背景。
smiiiiiiiiiiiiiiii62github.com原文 ↗
这份安全研究代码利用约一秒的超长 MMIO 指令让一个 CPU 核心错过 SMM rendezvous,破坏“所有核心同时进出 SMM”的同步假设。PoC 在 Ryzen 7 5800H 上以 `vmovdqu` 慢速读取和 perf-counter 统计证明核心计数分歧;它展示的是平台相关硬件研究,不是可直接跨 CPU 复用的通用 exploit。
Klepton63github.com原文 ↗
Klepton 的 `klepton-ld` 将 Android ARM64 库重链为 Apple dylib/framework,通过 Bionic/NDK/JNI/OVRP 兼容层和 ANGLE/MoltenVK 图形翻译,在 visionOS/macOS 无 JIT 运行 Quest APK。Beat Saber 已能启动但仍有轻微图形问题,Steam VR Link 和泛化工具链尚未完成。它的技术难点集中在 ABI、TLS 寄存器修补和图形 API 语义转换。
LinkedIn Feed Blocker64github.com原文 ↗
这个 MIT Chrome 扩展只移除 LinkedIn `/feed` 主信息流并阻止其 `mainFeed` 分页请求,保留求职、搜索、消息和通知。CSS 隐藏 `data-testid="mainFeed"`,declarative rule 精确匹配 `sduiid=com.linkedin.sdui.pagers.feed.mainFeed`,避免误伤其他分页。商店上架仍在审核,当前通过开发者模式加载;最小权限和窄规则让行为容易审计。
引用来源 · References
64 条 · 引用- 1 MemPrism: Task-Conditioned Relational Memory Views for Long-Horizon Agents. arXiv:2608.06745https://arxiv.org/abs/2608.06745 ↩ 回到正文 · back to text
- 2 How Much, Then Where: Credit-Conserving Action-to-Token Allocation for Multi-Turn Agent Reinforcement Learning. arXiv:2608.07118https://arxiv.org/abs/2608.07118 ↩ 回到正文 · back to text
- 3 StepJack: Benchmarking Computer-Use Agent Safety Against Multi-Step Indirect Prompt Injection. arXiv:2608.06477https://arxiv.org/abs/2608.06477 ↩ 回到正文 · back to text
- 4 Needle 2https://cactuscompute.com/needle ↩ 回到正文 · back to text
- 5 Antehttps://github.com/AntigmaLabs/ante ↩ 回到正文 · back to text
- 6 EntropyMoE: Entropy-Aware Sparse Expert Routing for Tokenizer-Free LLMs. arXiv:2608.06398https://arxiv.org/abs/2608.06398 ↩ 回到正文 · back to text
- 7 ADIAS: Automated Design of Interactive Agentic Systems. arXiv:2608.06410https://arxiv.org/abs/2608.06410 ↩ 回到正文 · back to text
- 8 WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader. arXiv:2608.06474https://arxiv.org/abs/2608.06474 ↩ 回到正文 · back to text
- 9 The Optimizer Is the Agent: Reasoning-Driven Search across Prompts, Programs, and ML Workflows. arXiv:2608.06714https://arxiv.org/abs/2608.06714 ↩ 回到正文 · back to text
- 10 SkillEval: Decomposing Agent Skill Quality into Interpretable Signals. arXiv:2608.06891https://arxiv.org/abs/2608.06891 ↩ 回到正文 · back to text
- 11 Long-Horizon Agent Trajectory Attribution: A Unified Benchmark and Fine-Grained Annotation Framework. arXiv:2608.06909https://arxiv.org/abs/2608.06909 ↩ 回到正文 · back to text
- 12 MemOPD: On-Policy Distillation through Memory State Alignment for Long-Horizon Agents. arXiv:2608.07068https://arxiv.org/abs/2608.07068 ↩ 回到正文 · back to text
- 13 DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training. arXiv:2608.07147https://arxiv.org/abs/2608.07147 ↩ 回到正文 · back to text
- 14 Online Monitoring and Corrective Steering of Programming Agents. arXiv:2608.06701https://arxiv.org/abs/2608.06701 ↩ 回到正文 · back to text
- 15 HarnessSafe: Evaluating Safety Across Persistent Carriers in Agent Harnesses. arXiv:2608.06984https://arxiv.org/abs/2608.06984 ↩ 回到正文 · back to text
- 16 TEPA: Revoking Stale Memories for Conflict-Robust Language Agents. arXiv:2608.07429https://arxiv.org/abs/2608.07429 ↩ 回到正文 · back to text
- 17 OpenForgeRL: Train Harness-native Agents in Any Environment. arXiv:2607.21557https://arxiv.org/abs/2607.21557 ↩ 回到正文 · back to text
- 18 Stagehand v4https://news.ycombinator.com/item?id=49248980 ↩ 回到正文 · back to text
- 19 Jurorhttps://github.com/Juror-AI/juror ↩ 回到正文 · back to text
- 20 Nitpickerhttps://nitpicker.dev ↩ 回到正文 · back to text
- 21 OpenParserhttps://www.openparser.dev ↩ 回到正文 · back to text
- 22 PrivateRedacthttps://github.com/monjurulkarim/privateredact ↩ 回到正文 · back to text
- 23 DocSifthttps://github.com/anishmoncivarghese/docsift ↩ 回到正文 · back to text
- 24 Self-Hosted Inference for Agentshttps://github.com/superlinked/sie ↩ 回到正文 · back to text
- 25 QuillCodehttps://github.com/Lore-Hex/QuillCode ↩ 回到正文 · back to text
- 26 Blueferryhttps://github.com/erikwb/blueferry ↩ 回到正文 · back to text
- 27 Celerphttps://github.com/celerp/celerp ↩ 回到正文 · back to text
- 28 Albedohttps://github.com/klirix/albedo ↩ 回到正文 · back to text
- 29 Lumabrihttps://github.com/JustVugg/lumabri ↩ 回到正文 · back to text
- 30 DSPy Factoriohttps://github.com/ukituki/dspy-factorio/ ↩ 回到正文 · back to text
- 31 Muse Glimmerhttps://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model ↩ 回到正文 · back to text
- 32 Docker Sandboxeshttps://www.docker.com/products/docker-sandboxes/ ↩ 回到正文 · back to text
- 33 Auto mode is now the default in Claude Codehttps://claude.com/blog/auto-mode-default-in-claude-code ↩ 回到正文 · back to text
- 34 Expanding Daybreak as the Cyber Defense Window Narrowshttps://openai.com/index/expanding-daybreak-as-the-cyber-defense-window-narrows ↩ 回到正文 · back to text
- 35 How Claude marks AI-generated contenthttps://support.claude.com/en/articles/16266773-how-claude-marks-ai-generated-content ↩ 回到正文 · back to text
- 36 OpenAI’s letter on responsible AI infrastructure in Texashttps://openai.com/index/responsible-ai-infrastructure-texas ↩ 回到正文 · back to text
- 37 Meta returns to open modelshttps://www.ft.com/content/4e3957f8-ea7c-4c46-a3de-cdce8e526878 ↩ 回到正文 · back to text
- 38 Illinois HB5511 and operating-system age verificationhttps://linuxstans.com/illinois-hb5511-operating-system-age-verification/ ↩ 回到正文 · back to text
- 39 Mistral patent for “code implemented tool calls”https://patentsgazette.uspto.gov/week26/OG/html/1547-5/US12670045-20260630.html ↩ 回到正文 · back to text
- 40 Kinney Drugs pulls back AI phone assistanthttps://www.wcax.com/2026/08/07/kinney-drugs-pulls-back-ai-phone-assistant-after-hundreds-customer-complaints/ ↩ 回到正文 · back to text
- 41 AI assistant hacks Australian gym websitehttps://www.abc.net.au/news/2026-08-10/ai-assistant-hacks-gym-website-aus-cyber-attack/107007986 ↩ 回到正文 · back to text
- 42 Tl;dv: Over 180k meetings left wide openhttps://bobdahacker.com/blog/tldv-hack ↩ 回到正文 · back to text
- 43 GitHub Models is now retiredhttps://simonwillison.net/2026/Aug/9/github-models-is-now-retired/#atom-everything ↩ 回到正文 · back to text
- 44 Django is moving to an annual release cyclehttps://www.djangoproject.com/weblog/2026/aug/10/annual-release-cycle/ ↩ 回到正文 · back to text
- 45 Japanese court overturns Red RAW video patenthttps://www.dpreview.com/news/panasonic-did-what-apple-sony-and-nikon-couldnt-overturn-a-red-raw-video-patent/ ↩ 回到正文 · back to text
- 46 Learning more about Claude’s mathematical capabilitieshttps://www.anthropic.com/research/riemann-zeta ↩ 回到正文 · back to text
- 47 Exploring Claude/GPT Knowledge Cutoffs and Pre-Training Timelineshttps://blog.sshh.io/p/exploring-claudegpt-knowledge-cutoffs ↩ 回到正文 · back to text
- 48 Humanising LLM Outputs Is Dumbhttps://kuber.studio/blog/Reflections/Humanising-LLM-Outputs-is-Actually-Dumb ↩ 回到正文 · back to text
- 49 How do programming languages impact token efficiency and correctness?https://danluu.com/pl-tokens/ ↩ 回到正文 · back to text
- 50 Rust SIMD on the GPUhttps://www.vectorware.com/blog/simd-on-gpu/ ↩ 回到正文 · back to text
- 51 How We Pushed CDC into Postgreshttps://www.snowflake.com/en/blog/engineering/postgres-to-snowflake-replication-mirroring/ ↩ 回到正文 · back to text
- 52 SQLite compressed text-history prototypeshttps://simonwillison.net/2026/Aug/9/sqlite-text-history-prototype/#atom-everything ↩ 回到正文 · back to text
- 53 5 useful things you’ll learn in my new post-training textbookhttps://www.interconnects.ai/p/5-useful-things-youll-learn-in-my ↩ 回到正文 · back to text
- 54 Dark mode toggles: two states are enoughhttps://lea.verou.me/blog/2026/dark-mode-toggles/ ↩ 回到正文 · back to text
- 55 A C++ toolchain from 357 bytes in Bazelhttps://fzakaria.com/2026/08/01/a-c++-toolchain-from-357-bytes-in-bazel ↩ 回到正文 · back to text
- 56 nixpkgs isn’t doing too hothttps://foxgirl.engineering/blog/nixpkgs-not-hot/ ↩ 回到正文 · back to text
- 57 GitHub Actions needs OIDC audience constraintshttps://blog.yossarian.net/2026/08/10/github-actions-needs-oidc-audience-constraints ↩ 回到正文 · back to text
- 58 Easy Sandboxing on Linux with Bubblewraphttps://bxt.rs/blog/easy-sandboxing-on-linux-with-bubblewrap/ ↩ 回到正文 · back to text
- 59 Profile-guided optimization in Gohttps://lemire.me/blog/2026/08/09/profile-guided-optimization-in-go/ ↩ 回到正文 · back to text
- 60 Microsoft Word for Windows 1.1a, Native X64 Porthttps://github.com/jmarshall23/msword ↩ 回到正文 · back to text
- 61 sunlithttps://github.com/jackyzha0/sunlit ↩ 回到正文 · back to text
- 62 smiiiiiiiiiiiiiiiihttps://github.com/xoreaxeaxeax/smiiiiiiiiiiiiiiii ↩ 回到正文 · back to text
- 63 Kleptonhttps://github.com/shinyquagsire23/Klepton ↩ 回到正文 · back to text
- 64 LinkedIn Feed Blockerhttps://github.com/andrewpollack/linkedin-feed-blocker ↩ 回到正文 · back to text