每日 Harness 开源 · Source
主题 · All topics

运行时与基础设施Harness Runtime & Infra

本主题共 340 条 · 最早 2026-05-29 · 最新 2026-09-06

视图 · View

2026 年 9 月5

  • MobileCode - OpenCode with Built-In iOS and Android Previews

    MobileCode fork OpenCode,在检测到 Xcode/Gradle/Expo 项目后自动运行 `serve-sim` 或 `serve-avd`,把模拟器实时画面和 agent 会话并排显示。Run 控件直接走 `xcodebuild`/`simctl` 或 Gradle/`adb`,状态从 Building 到 Running,失败时把首个编译错误放到设备面板;同时保留 Ope…

    Project2026-09-06github.com原文 ↗
    –
  • Lakr233/vphone-cli

    vphone-cli 以 Apple Virtualization.framework 启动虚拟 iPhone,`vm create` 把 IPSW 下载、补丁、DFU restore、CFW 安装和首次启动串成一条命令。项目要求 Apple Silicon/macOS 15+ 并允许 5 种补丁级别,host control socket 可做截图、触控、滑动和剪贴板自动化;它更接近移动系统研究…

    Trending2026-09-06github.com原文 ↗
    –
  • Ephemerals.dev - Disposable cloud dev environments for agents

    Ephemerals 给每个分支一台独立 EC2,Claude Code 在 tmux 中运行,浏览器终端、SSH 和每端口 preview 都走实例主动建立的 SSM 通道,因此没有入站端口。机器按 2–16 vCPU 选择,PR 合并时连同 secrets 一起回收;agent 可在用户断网时继续跑,事件推送让 diff 不靠轮询刷新。收费是每席位每月 10 美元加按秒计的机器时间,Codex…

    Project2026-09-06ephemerals.dev原文 ↗
    –
  • Ditch; Build multiple products at once

    Ditch Community Edition 用本地 `ditchd` runtime 把多个项目、Codex 会话、状态、历史、文件编辑和终端绑定在同一个 macOS 工作区。它不替换 Codex,而是让 session 永远附着于对应项目;无需账号,状态留在本机,源码采用 AGPL-3.0-only。通知能显示会话运行/等待/完成,用户可从项目切换回旧上下文,当前边界是 macOS + Co…

    Project2026-09-06theditch.dev原文 ↗
    –
  • AI handles incidents, engineers lose touch with their systems

    文章把生产事故自动化的副作用落在“接触减少”上:当 agent 负责告警归因、执行 runbook 和恢复动作,工程师可能逐渐失去对运行时状态、失败模式和系统边界的直觉。问题不是要不要自动化,而是自动化是否留下可观察轨迹、复盘材料和人工接管点;否则 MTTR 变短的同时,组织面对新型故障的学习能力会变弱。

    Blog2026-09-06sylvainkalache.com原文 ↗
    –

2026 年 8 月80

  • open-slide

    open-slide 为 agent 提供固定 1920×1080 React 画布,运行时负责缩放、导航、热更新和 presenter mode。浏览器 inspector 把点击评论写回源码的 `@slide-comment`,再由 `/apply-comments` 批量实施;资产管理、HTML/PDF 导出和静态部署让生成 deck 能走完交付链。

    Trending2026-08-28github.com原文 ↗
    –
  • archify

    Archify 让 agent 先产出 typed JSON IR,再由 Node.js 渲染/校验器确定性编译 HTML/SVG,支持五类图和四种预设。它还能比较两个已验证快照的 Before/Delta/After,列出增删改移和重路由事实,把架构图变成可审阅的版本化数据。

    Trending2026-08-28github.com原文 ↗
    –
  • Z

    Z 面向 z.ai GLM 模型做精简 agent harness,仓库把命令行入口、harness、插件和测试拆开,并提供 token 展示与 Claude Code hooks。透明的运行轨迹让用户能看到上下文和消耗,最小化实现则便于把它当作可审计的实验壳,而不是黑盒工作台。

    Project2026-08-28github.com原文 ↗
    –
  • The Harness Is the Thing

    文章把 agent 的执行 harness 拆成工具调用、状态持久化、权限边界和失败处理,主张这些部分共同决定模型实际行为。相同模型换一套 harness 可能呈现不同可靠性与风险,因此评估 agent 时不能只测裸模型推理。

    Blog2026-08-28scott-fryxell.github.io原文 ↗
    –
  • Simthesizer: An Agent-Driven Simulation Framework for LLM Serving Systems

    Simthesizer 针对人工维护模拟器跟不上 serving 机制变化,令 agent 生成配置、运行系统级模拟并根据结果继续探索。它把新型 agentic 请求和分离式 serving 从“无法表达的脚本特例”变成可搜索的实验变量,贡献在实验生产管线而不是单一调度算法。

    Paper2026-08-28arxiv.org原文 ↗
    –
  • AgentCloud

    AgentCloud 以 MCP 为核心提供 iOS 模拟器云,把 coding agent 的构建、安装和测试接到远程设备生命周期。digest 公开的重点是这条闭环,条目没有披露设备规模或并发指标;其设计方向是让移动端验证成为可编排工具调用,而非人工操作模拟器窗口。

    Project2026-08-28始 2026-06-07news.ycombinator.com原文 ↗
    –
  • openclaw

    openclaw 是运行在自有设备上的个人助手,Gateway 统一会话、工具、事件和渠道,可接 WhatsApp、Telegram、Slack、Discord、Signal、iMessage,并提供 CLI、TUI、Web UI 与伴随设备能力。工具默认直接在宿主机执行,README 明示入站消息属于不可信输入,远程暴露与多用户部署需要另加 sandbox 和访问控制。广泛渠道集成解释了它的实用…

    Trending2026-08-26github.com原文 ↗
    –
  • agentcore-cli

    AWS 的 CLI 用交互终端和声明式 JSON 覆盖 AgentCore 项目创建、本地开发、部署与调用,兼容 Strands、LangGraph、Google ADK、OpenAI Agents。Harness 能把运行时、模型、工具、技能、记忆和可观测性装入一份配置,命令面还包括 trace、在线评测、A/B、知识库、Cedar 策略和支付。它显著缩短 AWS 托管代理从原型到运维的路径,代…

    Trending2026-08-26github.com原文 ↗
    –
  • agent.md

    Fabien Sanglard 将多次纠正编码代理形成的约束固化为 `agent.md`,涵盖少嵌套、常量化、早返回、分层、最小改动、先测试和提交纪律。加入规则后,原本“能跑但松散”的代码在风格上显著稳定;长会话仍会发生上下文稀释,因此作者按特性开新会话或重新加载规则。它适合承担持续的局部工程规范,架构取舍与设计正确性仍由人验证。

    Blog2026-08-26fabiensanglard.net原文 ↗
    –
  • Unbox-AI

    Unbox-AI 把网关、OpenCode 和 AI SDK DevTools 轨迹画成 token treemap 与延迟 waterfall,展示首 token 时间、生成量、成本和重复消息。其典型 16 轮轨迹里,约 90% 输入花在系统提示和工具定义上,代理可用有上限的 CLI 输出自行找热点。由于 token 归因按字符比例估算、跨框架又没有统一 trace 标准,它更适合优化上下文结构…

    Project2026-08-26github.com原文 ↗
    –
  • Prime Agent: Continual Harnesses for Persistent Reasoning

    Prime Agent 以持久 IPython 递归语言模型为底座,让历史、记忆、技能、提示和子代理规格随任务继续演化,并支持代理直连通信与守护进程界面。其 RHAE 在 ARC-AGI-3 的 Best@1 从 30% 跃至 95.5%,在编码、内核、模拟器与 nanoGPT 任务上也达到或超过专用 harness。论文的实质贡献是把脚手架本身变成有状态、可积累的能力层,但持久状态也会带来污染和…

    Paper2026-08-26arxiv.org原文 ↗
    –
  • Orbit

    Orbit 为 Claude、Codex、OpenCode、Qoder 创建跨仓库 worktree 工作区,直接暴露完整源码与 Git 历史,不运行 RAG、索引服务或后台 daemon。渐进上下文先用约 50 token 描述一个仓库,再以约 200 token 加细节,必要时挂载全文;`orbit jot` 负责沉淀发现。对多仓改动而言,这种设计保留真实版本语义,也避免复制仓库和预索引带来的…

    Project2026-08-26github.com原文 ↗
    –
  • MulmoTerminal

    MulmoTerminal 以 PTY、WebSocket 和 xterm 在浏览器网格里展示真实终端,用颜色标记 Claude、Codex 会话状态,并依靠 tmux 在服务器重启后续存进程。Git worktree 隔离、手机通知、费用与上下文观察被放到同一界面,安装要求 Node.js 22.9 以上。它解决的是多代理会话的可见性和操作密度;Windows 没有原生 tmux,因此不属于直接…

    Project2026-08-26github.com原文 ↗
    –
  • AutoSaddler: Learning to Improve Agent Harnesses from Failure Traces

    AutoSaddler 从小批量失败轨迹离线定位 harness 缺陷,把工具、控制流和配置变更写成结构化代码补丁,再用验证集挑选可泛化版本。GAIA2、SWE-Bench Pro、Terminal-Bench 2 分别提高 9.0、9.6、10.0 个百分点;消融显示深层调试、定向修改和泛化选择都贡献明显。它把代理优化从反复润色提示词推进到可测试的运行系统修改,尤其适合模型暂时不能重训的场景。

    Paper2026-08-26arxiv.org原文 ↗
    –
  • AgentGrid

    AgentGrid 用可持久化无限画布承载代理会话、笔记、终端与开发工具,状态写入 `.agent-grid`,同一空间也可被代理读取。项目支持九种 harness、可视化主从委派、供应商用量和跨设备访问,2.8.13 起笔记使用 Markdown 后端。它没有提出新推理算法,而是把并发工作中的所有权、上下文位置和执行现场做成了可操作界面。

    Project2026-08-26agentgrid.sh原文 ↗
    –
  • pipecat-ai/pipecat

    Pipecat 用 Python 管线组织实时语音与多模态 Agent,将语音活动检测、STT、LLM、TTS 和 WebRTC/WebSocket 传输放进同一流式处理模型。

    Trending2026-08-22github.com原文 ↗
    –
  • magnitudedev/magnitude

    Magnitude 把硬件探测、模型推荐与下载、本地推理服务和编码 Agent 合并成一个 CLI,无需用户另外配置 Ollama。

    Trending2026-08-22github.com原文 ↗
    –
  • apache/maka

    Maka 把模型消息、工具调用、结果、权限决定和终止事实写入只追加的 Runtime Event Log,再让桌面端、TUI、CLI 和评测器从同一记录投影状态。

    Trending2026-08-22github.com原文 ↗
    –
  • agent-substrate/substrate

    Agent Substrate 是 Kubernetes 上的大规模有状态 Agent 运行时,把大量间歇空闲 actor 动态映射到较少的就绪 worker,并统一处理创建、挂起、恢复、路由与快照。

    Trending2026-08-22github.com原文 ↗
    –
  • Stop Making TUIs

    Simon Willison 讨论一个新的个人工具取舍:编码 Agent 已把制作原生 GUI 的成本压低,不必再因实现便宜而默认选择 TUI。

    Blog2026-08-22simonwillison.net原文 ↗
    –
  • Seed

    Seed 把 Harness 压缩为一个调用模型的循环,唯一工具是执行 shell,系统提示来自 `self/SELF.md`;记忆、Skill 和约定都必须由 Agent 自己写进 `self/`。

    Project2026-08-22github.com原文 ↗
    –
  • Proliferate

    Proliferate 是 AGPL-3.0 的开源 AI IDE,在同一控制面运行 Claude Code、Codex、OpenCode、Cursor、Grok 等原生 Harness。

    Project2026-08-22github.com原文 ↗
    –
  • From Agent Behaviour to Agent-Friendly Documentation

    研究把 SWE-chat 的 557 个会话、94,813 个事件与 AIDev 的 33,097 个 PR 连起来,观察编码代理实际查阅和修改什么文档。

    Paper2026-08-22arxiv.org原文 ↗
    –
  • Codex on AWS Bedrock bug causing 10x charges

    Codex issue #37674 报告原生 Bedrock provider 无法为 GPT-5.6 Sol 设置显式提示缓存断点,并给出异常 cache-write 用量。

    News2026-08-22github.com原文 ↗
    –
  • Building an almost fully self-hosted, sandboxed, agentic software factory

    文章把本地模型、编码 Agent 和隔离执行环境组织成一条几乎完全自托管的软件生产线,让规划、实现和运行验证尽量留在自有基础设施。

    Blog2026-08-22blog.jakesaunders.dev原文 ↗
    –
  • AgentSight

    AgentSight 在 Linux 内核层用 eBPF 捕获 LLM API、token、进程、文件与 TLS 流量,无需给现有 Agent 加埋点,仪表盘可还原会话并定位 SSE 截断和上下文溢出。

    Project2026-08-22github.com原文 ↗
    –
  • A week of using Codex more than Claude

    作者记录一周内将主要编码工作从 Claude 转向 Codex 的连续体验,比较对象是任务推进、工具选择和真实项目里的摩擦,而非几轮孤立提示。

    Blog2026-08-22allaboutcoding.ghinda.com原文 ↗
    –
  • anthropics/defending-code-reference-harness

    Anthropic 的参考安全代理把工作流分成侦察、发现、验证、报告和修补,并用 Docker、ASAN 等环境处理 C/C++ 内存漏洞。部分流水线默认要求 gVisor,除非显式覆盖,反映出执行潜在恶意样本时对二层隔离的要求。仓库明确不维护且不接收贡献,应视为研究蓝图而非现成安全产品。

    Trending2026-08-19github.com原文 ↗
    –
  • When Agentic Executions Fail

    AgentChaosBench 在 5 个 A2A/MCP 应用中注入 10 类故障,收集 275 条执行轨迹,其中 250 条含故障、25 条为对照。仅凭模型、工具与代理消息遥测做根因定位时,本地 14B 模型 Top-1 只有 13.6%–19.2%,DeepSeek-v4-pro 也仅 24.8%;同时预测故障类型和位置的最好成绩为 22%。这组低上限说明可观测数据虽丰富,跨层因果归因仍远未…

    Paper2026-08-19arxiv.org原文 ↗
    –
  • From LLM Inference to Agentic Workloads

    AgentSysBench 用 10 个真实代理应用刻画模型推理、沙箱、工具和持久状态共同形成的系统负载;其中 5 个应用的非 LLM 阶段反而占主导,单个沙箱工作集可达 28 GB。不同阶段的延迟与资源需求最高相差 32 倍,针对性服务、放置和状态卸载分别带来 29%–40% 延迟下降、4.5 倍吞吐提升和 4.6 倍内存缩减。论文的系统贡献是证明“只优化 token 生成”无法解释也无法解决代…

    Paper2026-08-19arxiv.org原文 ↗
    –
  • Cursor launches Origin, GitHub alternative

    Cursor 发布 Origin 代码托管服务,将 Git 兼容仓库、代理操作接口以及 API/MCP 接入放进自身开发环境。公告把代码宿主视为代理工作流的一部分,而不只是远端文件仓库;当前公开信息更能证明产品方向,尚不足以判断迁移工具、企业治理和长期可用性。

    News2026-08-19cursor.com原文 ↗
    –
  • Agent-Native Telemetry

    ATP 用四种原语表达可验证状态差异,并用哈希和签名让自治运维代理检查证据链,而不是反复吞入面向人的自由文本日志。在 AIOpsLab 与 Astronomy Shop 上,线缆/查询成本下降 96.4%,token 用量下降 88.8%,查询操作下降 66.2%;500 次状态突变全部被捕获,且每种配置 50 次注入试验均为零成功。它展示了一条“先结构化并认证变化,再交给代理推理”的低成本遥测路…

    Paper2026-08-19arxiv.org原文 ↗
    –
  • Engineering Reliable Coding Agents: Evaluating and Operating the System Around the Model

    这部 314 页专著把可靠编码代理定义为模型、环境、验证、权限、回滚和运营共同组成的系统。

    Paper2026-08-18arxiv.org原文 ↗
    –
  • Agentic Transaction: Towards ACID-Compliant Agent Systems

    论文把数据库 ACID 重写成代理任务的语义原子性、一致性、隔离性与持久性。

    Paper2026-08-18arxiv.org原文 ↗
    –
  • AgentRewind: Recoverable Execution for Long-Horizon LLM Agents

    AgentRewind 同步保存代理上下文和受控环境状态,使长任务失败后能回到一个真正一致的早期检查点。

    Paper2026-08-18arxiv.org原文 ↗
    –
  • 0xSero/ai-data-extraction

    这个脚本集从 Claude、Codex、Cursor、Trae、Windsurf、Continue、Gemini、OpenCode 等本地目录提取代理会话。

    Trending2026-08-18github.com原文 ↗
    –
  • Waku

    Waku 是以 Rust 和 GPUI 构建的原生 coding agent 客户端,把会话、代码操作与桌面交互集中到一个应用。选择原生 Rust UI,意在绕开终端和浏览器壳层的限制,换取较低运行开销及更紧密的系统集成。项目值得关注的是 agent 前端开始探索专用桌面工作台,而不仅是给聊天框再套一层界面。

    Project2026-08-17waku.sh原文 ↗
    –
  • Agent6

    Agent6 把模型命令放入由 Landlock、seccomp、用户命名空间和 `pivot_root` 组成的 Linux jail,再用可编辑、可恢复、可重放的声明式状态机组织任务。计划持久化为 DAG,验证门绑定单次运行,并提供美元或 token 硬预算以及多模型并行比较。项目只有 8 个运行依赖,但完整沙箱只覆盖 Linux x86_64/aarch64,这一平台限制比“Python 3…

    Project2026-08-17github.com原文 ↗
    –
  • jlcodes99/cockpit-tools

    cockpit-tools 用桌面界面管理 AI IDE 与编码助手的多个账号、实例、配额重置和唤醒任务。README 列出 16 个平台和 18 种界面语言,目标是让频繁切换服务与并行会话的状态集中可见。它解决的是账户运营和工具启动层的问题;由于涉及多套本地凭据,存储方式、更新来源与权限范围应成为采用前的首要审查项。

    Trending2026-08-16github.com原文 ↗
    –
  • Kvcachescope

    Kvcachescope 钩住 vLLM、SGLang 的 PagedAttention 分配器,记录请求块表、虚拟 token、引用计数以及前缀缓存的 radix tree。`nvidia-smi` 只能报告显存占用,这个工具则能指出状态分歧、未释放引用和僵尸块,并以 10 Hz WebSocket 更新界面。它还提供“零僵尸块”的 CI 断言和 Perfetto 导出,使 KV cache 问…

    Project2026-08-16github.com原文 ↗
    –
  • holaboss-ai/holaOS

    holaOS 把多个 coding agent、浏览器、文件、外部工具和共享记忆放进 local-first 工作区,状态以用户可读、可编辑的文件保存。README 列出 50 多项集成、MCP 与真实文档输出,并允许不同 agent 读写同一项目上下文;自托管代码使用修改版 Apache 许可。它的产品假设是上下文应成为可拥有的工作区资产,而不是被锁在某个聊天线程里。

    Trending2026-08-15github.com原文 ↗
    –
  • Memcode

    Memcode 把 coding agent 打包成一个 Go 二进制 TUI,并把子系统知识、会话历史、失败和偏好写入可版本控制的 `.memcode` 仓库。客户端负责模型路由与回退,可接 OpenAI 兼容或原生 provider,还能经 Telegram、Discord、Slack、GitHub、WhatsApp 等 gateway 收发任务。项目目前规模很小,阅读时约 14 stars,…

    Project2026-08-15github.com原文 ↗
    –
  • danielmiessler/LifeOS

    LifeOS 是个人 AI harness,把用户的目标、关系、偏好、历史决定、skills 和 routing 持久化,用 Current State 到 Ideal State 的 hill-climbing 作为统一任务模型。当前以一个自包含 skill 分发,TypeScript/Bash 工具、hooks、context files、memory 和知识归档共同构成系统;README 还…

    Trending2026-08-12始 2026-07-02github.com原文 ↗
    –
  • What I learned by putting GitHub Copilot behind a MitM proxy

    作者把 VS Code/Copilot 流量置于 mitmproxy 后,观察模型与 capability discovery、请求路由、ghost completion 注入的上下文,以及近期编辑如何牵引当前文件之外的内容。调查还追到 Chronicle 的 SQLite session store,其中保存 prompts/responses,并可被模型通过工具调用查询历史。这类抓包比隐私政策…

    Blog2026-08-12lighthousenewsletter.com原文 ↗
    –
  • The Scaffolding Matters More Than the Interface

    研究把任务固定为私有 Git 仓库上的六次操作,在七种 scaffold、五个模型上比较 MCP 与 CLI,并检查仓库最终状态而非相信 agent 自报。两个完全不支持 MCP 的 scaffold 仍完成所有运行,其纯 CLI 成本比五个 MCP-capable scaffold 低 5–28 倍;小型 27B 本地模型跨 scaffold 的成本更相差 139 倍。13 个严格配对的 MCP…

    Paper2026-08-12arxiv.org原文 ↗
    –
  • Chopi

    Chopi 让 macOS agent 继续使用宿主机真实工具,但以 Seatbelt 锁文件系统、Smokescreen CONNECT proxy 锁域名、Caddy relay 锁 GitHub 仓库,绕开容器/VM 带来的环境差异。它只接受 Git worktree 根作为工作区,`.git` 的 objects、refs、index 等数据路径可写,config 与 hooks 保持只读…

    Project2026-08-12github.com原文 ↗
    –
  • Self-Hosted Inference for Agents

    SIE 用一个 OpenAI-compatible 服务承载检索、OCR/Markdown、结构化输出、内容安全和 agent loop,模型按需加载并 LRU 淘汰,可在同一集群管理 100+ 个开放模型。仓库还配负载均衡、KEDA、Grafana 与多云 Terraform,以及 LangChain、LlamaIndex、Haystack、DSPy、CrewAI 等集成。项目的工程贡献是把 a…

    Project2026-08-11github.com原文 ↗
    –
  • QuillCode

    Quill Cowork 以原生 SwiftUI 应用承载 project-aware chat、文件/Git/worktree、Computer Use、插件、自动化和集成终端,桌面与 agent runtime 都不依赖 Electron。它内置任务额度、模型配置和可见的审批边界;更新器核验 SHA-256、签名与 commit manifest,失败时原子回滚到旧版本。当前构建面向 macO…

    Project2026-08-11github.com原文 ↗
    –
  • OpenForgeRL: Train Harness-native Agents in Any Environment

    OpenForgeRL 用代理记录 harness 模型调用,把 rollout 放进 Kubernetes 独立容器,再接入标准 RL 代码库,因而训练对象就是部署时的真实有状态 harness。OpenForgeGUI 在 OSWorld-Verified、Online-Mind2Web、WebVoyager 分别达到 37.7、63.0、72.3,工具型 OpenForgeClaw 也在 C…

    Paper2026-08-11arxiv.org原文 ↗
    –
  • Nitpicker

    Nitpicker 提供开源 AI PR reviewer,可放进 GitHub Actions、AWS Lambda 或 Cloudflare Workers。多运行时部署让团队能按已有 CI、云函数或边缘平台选择执行位置,也把审查任务拆成适合短生命周期函数的形态。digest 没披露模型、评测集和评论策略,因此本文只将其视作部署面明确的 reviewer 项目,不比较未经给出的质量数字。

    Project2026-08-11nitpicker.dev原文 ↗
    –
  • Juror

    Juror 把代码审查 agent 封装成 GitHub Action,自托管运行在项目自己的 workflow 中,仓库同时提供 `src`、benchmarks、测试和 `.juror.yml` 配置。定位是 Greptile 的低成本替代,重点在不把私有代码交给外部审查 SaaS;目前约 38 次提交、6 个 issue,成熟度与审查准确率仍需持续验证。它值得观察的是 CI 原生的部署边界,…

    Project2026-08-11github.com原文 ↗
    –
  • Docker Sandboxes

    Docker 用专用 microVM、项目目录挂载和可配置网络/文件系统控制,为 coding agent 提供 disposable workspace;agent 仍可在沙箱内安装包、启动 Docker 容器并无人值守运行。官方把 Claude Code、Copilot CLI、Codex、OpenCode、Kiro 列为开箱即用对象,并将 `--dangerously-skip-permis…

    News2026-08-11docker.com原文 ↗
    –
  • Ante

    Ante 的核心 harness 目前以预构建二进制交付,仓库开放协议、Rust SDK、文档和 Harbor eval pipeline,并明确披露 telemetry 可用 `ANTE_TELEMETRY=off` 关闭。单进程内置 grep/git 与 llama.cpp,支持本地 GGUF 无网推理;公开 Terminal-Bench 2.1 最新整跑 82.7%。它把“轻量、可离线、可复…

    Project2026-08-11github.com原文 ↗
    –
  • rivet-dev/rivet

    Rivet Actors 把 agent、会话、用户或协作文档放进长驻轻量进程,状态驻内存并自动持久化,内置 WebSocket、可重试 workflow、持久队列、定时器和 cron,空闲时休眠。README 报告约 20ms 冷启动和每实例约 0.6KB 内存,后者按 Linux x86、Node.js 24 启动 10,000 个 actor 的 RSS 增量计算;自托管可用单个 Rust…

    Trending2026-08-10github.com原文 ↗
    –
  • livekit/agents

    LiveKit Agents 把实时语音或多模态 agent 建模成服务端可编程参与者,可混合 STT、LLM、TTS 和端到端 realtime API。框架复用 WebRTC 客户端与电话接入,内置调度、dispatch、RPC/数据通道、流式传输、transformer 语义轮次检测、MCP 接入和测试 judge;Python 是主实现,JS/TS 另有 SDK。它把最难的双向媒体传输、打…

    Trending2026-08-10始 2026-06-20github.com原文 ↗
    –
  • Preloop

    Rust 实现的 GitHub Actions 兼容运行器,可在本地或自托管的隔离 microVM 中执行工作流。

    Project2026-08-10preloop.dev原文 ↗
    –
  • OpenChamber

    OpenChamber 围绕 OpenCode SDK 提供可视化 agent 工作区,将项目、worktree、会话、代码 diff 和终端放进同一界面。客户端覆盖 macOS、Windows、Linux、浏览器/PWA、移动端 beta 与 VS Code,并能通过本地、远程或隧道连接并行运行多模型 agent。Web UI 可设密码,项目、会话和代码默认留在用户基础设施内,这使它更接近跨环境…

    Project2026-08-10openchamber.dev原文 ↗
    –
  • Machines at Play

    面向编码 agent 的开源 Rust 多人 3D 游戏引擎,通过 CLI 构建并部署可运行游戏。

    Project2026-08-10machinesatplay.com原文 ↗
    –
  • KunAgent/Kun

    Kun 以本地共享 runtime 同时驱动桌面 GUI、终端 TUI、后台任务和 `kun serve` 移动入口,线程、计划、审批、模型与记录因此能跨界面延续。除直接执行外,它还提供实验性的 Agent Graph;子节点权限受父节点约束,产出必须经过实际验证和 lead 接受。会话与日志默认保留在本机,但云模型调用仍会把提示发送给相应供应商,这个边界比笼统的“local-first”标签更重…

    Trending2026-08-10github.com原文 ↗
    –
  • Human vs. AI

    这个 Clojure CLI/库从版本历史和 diff 重建逐行编辑来源,不在源文件里植入标记。它把连续归属整理成 ranges/islands,并处理行合并、拆分和内容稀释;评分以 1 代表人类、0 代表 agent,混合行保留小数比例。与文风分类器不同,它回答的是“这行怎样演化而来”,可审计性取决于真实变更历史而非模型猜测。

    Project2026-08-10github.com原文 ↗
    –
  • open-mercato/open-mercato

    Open Mercato 是 TypeScript 业务应用框架,以架构规范和工程约定组织 CRM/ERP 模块,内置多租户、RBAC、事件流、定价与销售等领域能力。仓库还为代理提供表格、表单、功能和测试技能,要求按规范先定义再实现。它把 AI 编码放进有边界的业务骨架中,检验重点应是生成模块能否遵守租户隔离和领域规则,而不只是页面产出速度。

    Trending2026-08-09github.com原文 ↗
    –
  • PrimeIntellect-ai/prime-agent

    Prime Agent 面向长时编码与研究任务,用 RLM 把提示和上下文作为变量放进持久 IPython,并允许把子代理当函数调用;Continual Harness 则保存 prompt、memory、skill 与子代理规格。它还提供守护会话、心跳、日程和带预算的自主目标,`/refine` 以小步证据更新配置并保留回滚。README 明确警告进程继承用户权限且不是安全沙箱,因此持续性能力与…

    Trending2026-08-09github.com原文 ↗
    –
  • Kitesurf

    Cloudflare 的 Kitesurf 用 Rust、Dioxus 与 Blitz 实现面向 AI 代理的无头浏览器,把 JavaScript 放在 V8 isolate 中执行,可一次性输出 HTML、正文、PDF 或截图。它刻意不追求 Chromium 的完整兼容和像素级复刻,而是服务短生命周期、隔离、无状态的突发任务。这个取舍有望显著降低代理浏览的启动与资源成本,也意味着复杂站点兼容性必…

    News2026-08-09始 2026-08-08blog.cloudflare.com原文 ↗
    –
  • Zaivern Code

    Zaivern Code 用 Rust 把 Claude Code、Codex、Gemini 等 AI CLI 进程组织成平铺操作台,支持广播输入、审批、通知、移动端遥控和编辑器联动,而不试图再造模型或代理协议。

    Project2026-08-08github.com原文 ↗
    –
  • TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories

    TRAJDEBUG 先多粒度压缩长历史,再以证据识别错误,并跟踪它后来是否被解决、是否影响终局,由此回溯最早的关键失败,而不是把最后一次异常当根因。

    Paper2026-08-08arxiv.org原文 ↗
    –
  • SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents

    SearchAuditor 面向长轨迹的失败归因,要求找出关键步骤、根因、可执行修复和评分依据,再用多视角证据裁决相互冲突的诊断。

    Paper2026-08-08arxiv.org原文 ↗
    –
  • Mirafold

    Mirafold 为 Codex、Claude Code 和 Gemini CLI 生成浏览器端界面,把 CLI agent 的输入、输出与操作包装成可交互 UI,底层执行能力仍来自原工具。

    Project2026-08-08mirafold.com原文 ↗
    –
  • MCP Debug Proxy

    MCP Debug Proxy 位于客户端、服务器与 OAuth 端点之间,捕获请求、响应、握手和授权跳转,并以会话视图还原协议流。

    Project2026-08-08github.com原文 ↗
    –
  • Embabel Agent

    Embabel Agent 用 Java/Kotlin 把 agent 交互拆成可复用 action、goal 与规划步骤,并提供状态、重试、测试和 guardrail,让 LLM 调用能够嵌入 JVM 应用的领域对象与服务。

    Trending2026-08-08github.com原文 ↗
    –
  • DwarfStar / ds4

    ds4 针对 DeepSeek V4 Flash、GLM-5.2 等高内存 MoE 模型,把模型加载、量化、KV cache、提示格式、工具调用、服务器和 coding agent 写进同一原生栈。

    Trending2026-08-08github.com原文 ↗
    –
  • Zed DeltaDB

    DeltaDB 为 Zed 记录提交之间的每个编辑操作,赋予变化稳定 ID,并把修改与触发它的对话相连。

    News2026-08-07zed.dev原文 ↗
    –
  • Popcorn

    Popcorn 是把浏览器实例放进可信执行环境(TEE)的开源浏览器云,为远程浏览与自动化提供硬件隔离边界。

    Project2026-08-07blog.reclaimprotocol.org原文 ↗
    –
  • Muse Code and Muse Spark 1.2

    Meta 同时发布编码代理 Muse Code 和强化代码生成、调试、代码库理解的 Muse Spark 1.2,把产品层执行循环与专门模型放进同一套方案。

    News2026-08-07research.meta.ai原文 ↗
    –
  • Architectural Implications of Agentic AI Workflows

    作者从 Azure 生产轨迹和开源负载观察到,代理请求会在 LLM、工具与编排阶段间频繁跨越 CPU/GPU,CPU 平均空闲却伴随尖峰,模型组合又会改变 GPU 压力。

    Paper2026-08-07arxiv.org原文 ↗
    –
  • mpfaffenberger/code_puppy

    Code Puppy 是可通过 `uvx` 启动的终端编码代理,支持多模型、并行代理和 MCP,并能从 models.dev 浏览 65 家以上提供商、超过 1,000 种模型。可选 DBOS 持久执行会检查点化代理输入、模型响应、MCP 与工具调用,使长任务能在崩溃后恢复。其工程特色是把模型路由、规则文件和恢复机制放进独立 CLI,而非绑定某个商业 IDE。

    Trending2026-08-06github.com原文 ↗
    –
  • cloudflare/computer

    Cloudflare Computer 以 Durable Object 内的 SQLite 作为虚拟文件系统权威状态,再用统一 `workspace.runtime` 接容器 FUSE、Dynamic Worker 中的 just-bash 和 JavaScript 三种执行后端。容器通过 capnweb RPC 同步修改,isolate 则直接走 Workers RPC,不维护第二份存储。项目…

    Trending2026-08-06github.com原文 ↗
    –
  • Pi's Minimalism Is Its Advantage

    文章分析简化代理框架如何通过小型工具集和可修改循环支持自动研究任务。

    Blog2026-08-06earendil.com原文 ↗
    –
  • LLM 0.32

    Simon Willison 介绍新增推理轨迹、服务端工具、Responses API 和内容寻址日志的 LLM 0.32。

    Blog2026-08-06simonwillison.net原文 ↗
    –
  • Cloudflare OS

    Cloudflare 发布面向代理、应用和协作任务的开放平台及运行时组件。

    News2026-08-06blog.cloudflare.com原文 ↗
    –
  • CUADebug

    CUADebug 对 204 条计算机使用代理失败轨迹建立分层诊断,其中推理/控制错误 110 条、感知 36 条、grounding 25 条、外部故障 13 条、不可行任务 20 条。加入错误子型和出错步骤后诊断准确率从 11.2% 升至 19.6%;单次重执行修复率约 28.47%,作者方法为 29.90%,而只给历史的方案仅 13.89%。持续修复把成功率从 12.2% 拉到 25.86%…

    Paper2026-08-06arxiv.org原文 ↗
    –

2026 年 7 月94

  • citrolabs/ego-lite

    Ego Lite 把普通用户标签页与 Agent 自动化任务隔离到不同浏览空间,减少自动点击、导航和凭据访问对日常浏览的干扰。它以浏览器容器化思路划分状态,而不是让 Agent 直接接管主会话。隔离能降低误操作半径,但如果两个空间共享下载目录、扩展或系统密钥,仍需继续收紧边界。

    Trending2026-07-25github.com原文 ↗
    –
  • agegr/pi-web

    pi-web 为 Pi 编码 Agent 提供本地 Web 界面,可浏览历史会话、实时聊天、切换模型并管理技能。前端把命令行 Agent 的状态与配置暴露成可远程访问的工作台,方便长任务观察和多设备使用。部署时应把认证与网络监听配置视为核心功能,因为界面可能直接拥有代码执行能力。

    Trending2026-07-25github.com原文 ↗
    –
  • AgentCgroup: Understanding and Controlling OS Resources of AI Agents

    AgentCgroup 通过观测沙箱化编码 Agent 的 CPU、内存、进程树和 I/O 波动,研究自主任务如何在操作系统层面形成突发资源需求。系统借鉴 cgroup 的隔离与配额机制,为多租户 Agent 提供按会话控制、动态限额和异常终止能力。它把 Agent 可靠性问题落到传统资源治理层,尤其适用于同机并发运行大量工具型任务的环境。

    Paper2026-07-25arxiv.org原文 ↗
    –
  • Rendi

    Rendi 是基于 Trigger.dev 的 agent harness,把长时后台任务、浏览器自动化和邮件工具放进托管作业系统,无需为每个 agent 单独维护虚拟机。它借助队列、重试和持久执行处理超出一次请求生命周期的工作;路线的优势是复用成熟任务基础设施,代价是安全隔离依赖平台与工具权限设计。

    Project2026-07-24github.com原文 ↗
    –
  • Pullrun

    Pullrun 让同一个 OCI 镜像既能由普通容器运行时启动,也能被转换并放进 Firecracker microVM,减少为两种隔离级别维护两套制品。项目处理镜像拉取、rootfs 和 microVM 启动编排,使开发环境与更强隔离的生产执行共享 artifact;这对运行不可信作业或 agent 工具尤其有吸引力。

    Trending2026-07-24始 2026-07-16github.com原文 ↗
    –
  • LLM Budget Cap

    LLM Budget Cap 是一个 Python 包,用 Redis Lua 脚本原子地预留、结算和释放 LLM 调用预算,解决多 worker 并发时“各自检查都未超额、合计却穿透上限”的竞态。README 提供同步与异步客户端,并支持按美元或 token 设日/月共享额度;它把预算控制做成基础设施原语,而不是应用层粗略计数。

    Project2026-07-24github.com原文 ↗
    –
  • Fleet

    Fleet 用 Telegram topic 映射独立的 Claude Code 或 Codex 会话,让用户从手机发送指令、接收输出,并保持每项任务的上下文隔离。项目把即时通讯当作远程控制面,而不是新建一套聊天 UI;它适合异步监督,但权限、日志脱敏和误触发边界需要部署者认真配置。

    Project2026-07-24github.com原文 ↗
    –
  • AgentTrails: Towards Trust and Reuse for Agentic Tasks

    AgentTrails 把按时间排列的 agent 日志转换为数据流图,显式记录动作消费了哪些输入、产生了哪些中间产物,以及后续结论依赖什么。这样既能追溯错误来源,也能复用已验证的子任务结果,而无需重放整段轨迹;其核心贡献是让 provenance 成为 agent 工作产品的一部分。

    Paper2026-07-24arxiv.org原文 ↗
    –
  • AgentPulse

    AgentPulse 用统一事件模型观测多 agent 系统,把消息、工具调用、状态变化和输出质量沿时间线对齐,再比较不同运行之间的行为漂移。它强调从轨迹群体中发现协作模式变化,而非只看单次 trace;适合定位模型升级、提示词修改或工具变更后出现的系统性偏移。

    Project2026-07-24prove-ai.github.io原文 ↗
    –
  • AgentDebugX

    AgentDebugX 是一套面向 agent 轨迹的开源调试框架,把事件采集、故障定位、责任归因和恢复建议串成统一流程。它把一次失败关联到模型决策、工具返回、环境状态与前序依赖,而不是只展示聊天日志;论文用多类 agent 故障案例说明结构化 provenance 能缩短排查路径,尤其适合长任务和多组件系统。

    Paper2026-07-24arxiv.org原文 ↗
    –
  • Superserve

    Superserve 用 Firecracker microVM 承载长时间运行的 AI agent,为每个任务提供隔离文件系统、进程和网络边界。产品定位覆盖按需创建、暂停与恢复执行环境,让代理可以跨小时或跨天保留工作状态。相比普通容器,microVM 提供更强隔离,但启动、镜像分发和状态持久化是平台需要解决的核心成本。

    Project2026-07-23superserve.ai原文 ↗
    –
  • MoonshotAI/kimi-code

    Kimi Code 是终端编程代理,可读取仓库、编辑文件、运行命令并在任务中维护上下文。项目支持多模型后端和工具调用,工作方式接近可脚本化的 coding agent,而非单纯补全插件。开源实现便于审计提示词与执行边界,也让团队能按自身审批和沙箱策略改造。

    Trending2026-07-23github.com原文 ↗
    –
  • Introducing OpenAI Presence

    OpenAI 发布 Presence,提供部署企业语音和聊天智能体所需的渠道接入、会话运行与运营工具。产品把实时模型能力包装成面向客服和业务流程的托管平台,减少团队自行拼装电话、消息和 agent runtime 的工作。它也使可观测性、人工接管和合规记录成为平台竞争的一部分。

    News2026-07-23openai.com原文 ↗
    –
  • Deterministic Replay for AI Agent Systems

    作者提出基于 event sourcing 的智能体重放架构,把模型 token、随机性、外部 API 返回值、工具结果与运行时状态变化全部记录为事件。论文在 GPT-5、Claude 4.5、Gemini 2.5 Pro 和 Grok 4 上报告 100% 重放准确率,额外延迟低于 0.1%。它把智能体调试从“尽量复现”推进到可审计的执行记录,但代价是必须完整捕获边界外的非确定性。

    Paper2026-07-23arxiv.org原文 ↗
    –
  • microsoft/AI-Engineering-Coach

    AI Engineering Coach 把多个编码助手的本地会话日志汇总成使用指标与工程实践报告,目标是回答团队“代理具体怎样被用、哪些习惯有效”,而不只是统计席位。跨工具分析有助于发现任务拆分、测试验证和反复返工模式,本地运行也减少代码与提示内容外传。它最大的分析风险是可观测行为不等于业务结果,报告应与缺陷率、交付周期和 review 质量结合,避免奖励高消息量或高 token 消耗。

    Trending2026-07-22github.com原文 ↗
    –
  • langchain-ai/open-swe

    Open SWE 面向“提交任务后后台运行”的组织级编码代理,而不是只在开发者终端里同步对话。框架把仓库上下文、执行沙箱、权限边界和异步结果串联起来,便于团队按内部流程定制 agent。它解决的是控制面和工作流骨架,不会自动替代代码所有权、密钥治理与 merge policy;这些组织约束是否被正确建模,决定系统能否安全扩大并发。

    Trending2026-07-22github.com原文 ↗
    –
  • Serve-avd

    Serve-avd 把 Android 模拟器变成可远程操作的浏览器目标:`adb screenrecord` 产生 H.264 流,WebCodecs 解码,旧环境回退到 MJPEG,输入控制经 WebSocket 回传。它无需 root、应用插件或 instrumentation,就能提供点击、拖动、键盘、导航键、旋转与截图,特别适合让代理或远程 CI 观察移动应用。代价是视频流和 adb 注…

    Project2026-07-22github.com原文 ↗
    –
  • QwenLM/qwen-code

    Qwen Code 正从单代理 CLI 扩展为完整执行平台:自动记忆保存长期上下文,skills 封装重复流程,子代理和 agent teams 处理并行分工,MCP 连接外部工具。功能面覆盖很广,也使安全模型更复杂,因为记忆、团队消息和第三方工具会形成多条数据与权限路径。值得观察的是它能否给每个代理和技能提供细粒度授权,而不是只在顶层做一次全局确认。

    Trending2026-07-22github.com原文 ↗
    –
  • MoonshotAI/kimi-cli

    该仓库已把定位更新为 Kimi Code CLI,说明 Moonshot 正在把原有 kimi-cli 收敛为新一代终端代理。它承担代码检索、修改、命令执行与多轮任务编排,也是 Kimi 模型工具调用能力的官方参考实现。处于迁移期的项目最需要关注配置和扩展接口是否稳定;如果名称变化伴随会话或插件格式重做,生态迁移成本可能高于模型替换本身。

    Trending2026-07-22始 2026-07-20github.com原文 ↗
    –
  • Byre

    Byre 用一个本地容器包住项目目录,让代理保留编译器、编辑器和常用工具,同时默认接触不到主机其余文件。`byre develop` 可作用于项目、worktree 或 scratch 目录,单二进制覆盖 Linux 与 macOS,目标是在“能正常开发”和“最小主机权限”之间取得实用平衡。它比云沙箱更便于本地迭代,不过边界强度最终取决于容器运行时、挂载和显式放行的能力。

    Project2026-07-22github.com原文 ↗
    –
  • earendil-works/pi

    Pi 是 AI agent harness 项目,包含自扩展 coding agent CLI、agent runtime 和 unified multi-provider LLM API。README 列出的核心包包括 `pi-coding-agent`、`pi-agent-core` 和 `pi-ai`,后者覆盖 OpenAI、Anthropic、Google 等 provider。它与本期多…

    Trending2026-07-21github.com原文 ↗
    –
  • anthropics/cwc-workshops

    anthropics/cwc-workshops 是 Anthropic Code with Claude workshop 材料仓库。目录包括 agent-battle、agent-decomposition、agents-that-remember、eval-driven-agent-development、how-we-claude-code、production-ready-agent、r…

    Trending2026-07-21github.com原文 ↗
    –
  • Spoold - Durable curl without a database or broker

    spoold 是本地 daemon 版 durable curl:提交端把 HTTP delivery 写入磁盘 journal 后即可返回,投递、重试和恢复由后台进程负责。它的 reliability boundary 是一个自包含 daemon 加 owner-only journal,不依赖 PostgreSQL、Redis、Kafka、云账户或语言 SDK。README 列出 append…

    Project2026-07-21github.com原文 ↗
    –
  • Codex Micro on Your Phone

    这个项目把手机浏览器做成 Codex desktop 的本地控制器,明确声明非 OpenAI 或 Work Louder 官方。Native Shim 方案会让 Codex 看到一个合成的 Codex Micro,走原生硬件 channel 来处理 task-key colors、knob、joystick、MIC 和 command keys;Standard Bridge 则不模拟硬件,靠本地…

    Project2026-07-21github.com原文 ↗
    –
  • Codex Harness for Java Unit Testing

    JAIPilot CLI 是 Java-only 本地测试生成 harness,测试生成来自用户已经安装并登录的 Codex,不依赖自定义 hosted backend。它优先用 repo 的 Maven/Gradle wrapper,coverage-sensitive 命令直接跑 clean full suite,避免把 focused test 的旧 JaCoCo 报告当作目标选择依据。功能…

    Project2026-07-21github.com原文 ↗
    –
  • AstrBotDevs/AstrBot

    AstrBot 是集成 IM 平台、LLMs、plugins 和 AI features 的开源 AI agent assistant 框架。仓库结构包含多语言 README、Docker/compose 和 Python 入口,说明目标用户不只是单一聊天机器人部署者。它在 trending 中的意义是把“多平台 IM + LLM + plugin”继续向通用 agent assistant 收敛…

    Trending2026-07-21github.com原文 ↗
    –
  • openinterpreter/openinterpreter

    openinterpreter/openinterpreter 当前 README 标题为 “A coding agent for open models like Kimi K3”。仓库仍有很高历史关注度,页面显示约 66.8k stars 与 5.7k forks;相关文档说明可通过 Kimi provider 自动选择 `kimi-code` harness,也可用 Moonshot Pla…

    Trending2026-07-20始 2026-06-18github.com原文 ↗
    –
  • openai/codex

    openai/codex 是 OpenAI 的本地终端 coding agent,README 写明 Codex CLI runs locally on your computer。安装路径包括官方脚本、npm、Homebrew 和 release binary;认证可用 ChatGPT Plus/Pro/Business/Edu/Enterprise,也可配置 API key。仓库页面显示约 9…

    Trending2026-07-20github.com原文 ↗
    –
  • Shikigami, run AI coding agents in parallel, each in a Git worktree

    Shikigami 是 macOS/Linux 上的并行 coding agent 桌面工具,让 Claude 或 Codex agent 各自在独立 Git worktree 中运行。首页显示 beta 0.30.0、免费使用,并提供 Apple Silicon、Intel macOS 与 Linux AppImage;编辑器里可以查看 diffs、git、数据库和 Docker 工具。sess…

    Project2026-07-20shikigami.dev原文 ↗
    –
  • Deepsec

    deepsec 是 Vercel Labs 的 agent-powered 漏洞扫描 harness,面向大型现有代码库的按需安全审查。README 的流程是 `npx deepsec init`、安装、由 coding agent bootstrap 项目信息,然后 `scan`、`process`、可选 `revalidate` 和 `export`;它先用 matcher 找候选点,再由 a…

    Project2026-07-20github.com原文 ↗
    –
  • Claude Code uses Bun written in Rust now

    Simon Willison 检查 Claude Code 安装包,记录它现在使用 Rust 版 Bun 的证据。条目的关键点不是“Claude Code 用了 Bun”这么简单,而是 Anthropic 的 CLI 交付链里出现了更底层的 runtime/打包变化:一个看起来像 JavaScript/Node 工具的安装物,实际运行时材料已经转向 Bun written in Rust。对开发工…

    Blog2026-07-20simonwillison.net原文 ↗
    –
  • Chalie - AI peer not employee

    Chalie 把自己定位成本机运行的个人 AI companion,而不是远端 SaaS agent;它使用单个 SQLite 文件、静态加密凭据、零遥测,并把敏感动作放进 Allow / Ask / Deny 权限模型。当前能力面很宽,包括长期记忆、目标识别、后台研究、图片和截图索引、真实浏览器操作、双向 MCP、IMAP/CalDAV/CardDAV、受控 shell 与沙盒 Python。R…

    Project2026-07-20github.com原文 ↗
    –
  • Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable

    论文指出现代 agent 的能力同时依赖 foundation model 和 harness,后者负责构造提示、管理状态、调用工具并协调执行。随着模型、API、环境和需求变化,harness 必须持续修改;文章因此提出围绕 readable、navigable、editable 的维护框架。它把 agent 工程中常被当成脚本胶水的部分提升为可分析的软件系统。

    Paper2026-07-17arxiv.org原文 ↗
    –
  • TRACE: An Operational Reasoning Schema for Auditable Agentic Commitments

    TRACE 定义了 typed、versioned schema,用来记录 agentic commitment 和相关推理证据。论文关心的是可审计性:承诺从哪里来、基于哪些证据、经历了哪些版本变化,都应以结构化方式保存。它为高风险 agent 系统提供了一种日志设计思路,区别于事后让模型生成自然语言解释。

    Paper2026-07-16arxiv.org原文 ↗
    –
  • Production-grade LangGraph template

    langgraph-agent-stack 是一个用于搭建 LangGraph agent 服务的项目模板。它把 graph 定义、API 服务、配置和部署骨架放进同一仓库,解决从 demo notebook 到可运行服务之间的工程空白。项目的价值在目录结构和默认约定:它展示了 LangGraph 应用如何被打包成长期维护的后端服务。

    Project2026-07-16github.com原文 ↗
    –
  • PalmClaw: A Native On-Device Agent Framework for Mobile Phones

    PalmClaw 描述了一个运行在手机端的 native agent 框架,支持本地工具调用和多步任务执行。论文把 agent 执行环境从浏览器或云端沙箱移到移动设备,因而必须面对权限、设备状态、应用切换和用户交互等约束。它的意义在于为 mobile agent 提供系统框架,而不仅是把屏幕截图交给模型理解。

    Paper2026-07-16arxiv.org原文 ↗
    –
  • LoopGain

    LoopGain 用控制理论和信号检测思路监控 agent loop。它把 agent 轨迹视为可观察信号,识别重复尝试、无效动作和收敛不成,而不是等待外层超时。对调试多步工具调用而言,这类运行时诊断比事后看完整日志更容易定位失控模式。

    Project2026-07-16github.com原文 ↗
    –
  • Grepathy

    Grepathy 把 Claude Code transcript 整理成本地 markdown commit log。它关注的是 AI 编程的过程证据:最终 diff 之外,哪些提示、回答和选择导致了提交。用 markdown 保存意味着这些记录可搜索、可审阅,也能被纳入项目文档或代码评审背景材料。

    Project2026-07-16github.com原文 ↗
    –
  • katanemo/plano

    Plano 是面向 agentic apps 的 AI-native proxy 和 data plane。项目摘要覆盖 orchestration、safety、observability 和 LLM routing,说明它把模型调用链路上的策略、监控和安全控制集中到一层。随着 agent 应用增多,这类 data plane 的价值在于让路由和治理不再散落在每个业务服务里。

    Trending2026-07-15github.com原文 ↗
    –
  • Kmux

    Kmux 是面向 AI coding agents 的并行 terminal workspace。它把多个 agent 会话放进可管理的终端工作区,便于同时跑不同实现路线、查看输出和比较结果。这个项目反映了一个新工作流:开发者不只是和一个 agent 对话,而是在调度多个并发候选实现。

    Project2026-07-15github.com原文 ↗
    –
  • AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP

    AgentCheck 是一个基于 MCP 的 workbench,用于复现 agent 故障、注入干预并验证缓解措施。它把工具返回异常、状态污染和代理决策错误做成可重复轨迹,避免排查只停留在一次性日志阅读。它的看点是把 MCP 生态里的 agent 调试过程工具化:先复现,再介入,最后用同一场景确认修复有效。

    Paper2026-07-15arxiv.org原文 ↗
    –
  • Mindwalk

    Mindwalk 把 Claude Code、Codex 等 coding-agent 会话日志回放到代码库的 3D 地图上,展示 agent 搜索、读取和编辑过的文件路径。它处理的是代理开发中常见但难观察的问题:模型究竟看了哪些上下文、绕了哪些路、改动集中在哪里。相比线性日志,这种空间化视图更容易发现无效探索、遗漏区域和高风险修改簇。

    Project2026-07-13github.com原文 ↗
    –
  • FoundationAgents/OpenManus

    OpenManus 是开源通用 agent 框架,定位为可复现 Manus 类工作流的实现。它关注规划、工具执行、多步反馈和通用任务自动化,让研究者能在开放代码上观察 agent 系统结构。相比封闭演示,开源框架更利于定位失败模式和比较不同 orchestration 策略。

    Trending2026-07-13github.com原文 ↗
    –
  • An Agent in 100 Lines of Lisp

    文章用约 100 行 Lisp 展示一个简化 agent 的实现。这个例子把模型调用、工具选择、循环状态和观察结果压缩到最小结构,便于看清 agent 的基本控制流。它不是产品级框架,但能帮助读者把复杂代理系统还原成几个可检查的组成部件。

    Blog2026-07-13thebeach.dev原文 ↗
    –
  • Agent-run

    Agent-run 在隔离沙箱中运行 coding agent,给模型执行命令和改写代码设置更清晰的环境边界。它面向的是代理真正落地时的工程问题:依赖安装、文件修改、外部命令和潜在副作用都需要可控空间。与单纯 prompt 约束相比,沙箱提供的是运行时层面的风险收敛。

    Project2026-07-13github.com原文 ↗
    –
  • Agent Harness Engineering

    Addy Osmani 讨论 coding agent 的 harness、上下文、验证和反馈回路设计。文章把 agent 成败从模型能力转移到周围工程系统:如何给上下文、如何执行、如何测试、如何把失败反馈回循环。这个角度解释了为什么同一个模型在不同开发环境中的可靠性会差很多。

    Blog2026-07-13addyosmani.com原文 ↗
    –
  • steipete/CodexBar

    CodexBar 是 macOS 菜单栏应用,用来显示 Codex、Claude Code 等 AI 编码工具的用量与重置窗口。它把多个 agent 工具的配额状态集中到系统菜单栏,避免开发者在网页、CLI 和不同账户之间来回查。这个小工具反映了一个新需求:AI 编码工具已经变成需要监控额度的日常基础设施。

    Trending2026-07-11始 2026-07-07github.com原文 ↗
    –
  • stanfordnlp/dspy

    DSPy 是用模块化程序方式构建和优化语言模型系统的 Python 框架。它通过 signatures、modules 和 optimizers 描述 LM pipeline,并把 prompt/示例/参数选择交给可评测的优化流程。与手写 prompt 相比,DSPy 的核心价值是让 RAG、分类和 agent 系统进入可编译、可迭代的工程循环。

    Trending2026-07-11github.com原文 ↗
    –
  • modelcontextprotocol/inspector

    MCP Inspector 是 MCP server 的可视化测试与调试工具。它能检查 server 暴露的 tools、resources、prompts,并在界面里发起调用,帮助开发者定位协议实现问题。随着 MCP server 数量增加,这类 inspector 会成为协议生态的基础调试层。

    Trending2026-07-11github.com原文 ↗
    –
  • anthropics/claude-cookbooks

    claude-cookbooks 是 Anthropic 的 Claude API notebooks 与 recipe 集合。仓库用可运行示例覆盖提示、工具调用、结构化输出、RAG 和 agent 流程等常见模式。它适合当作 API 使用手册之外的工程样例库,因为开发者通常需要从最小 recipe 迁移到真实应用。

    Trending2026-07-11github.com原文 ↗
    –
  • Workflow as Knowledge

    这篇是偏概念模型的论文,把 LLM 工作流本身视为可持久化知识对象。它强调符号形式、对象身份和 live-image 思路,也就是流程、状态和执行上下文应当能被保存、传递、重新激活。文章适合与 agent runtime、notebook 和知识管理系统放在一起看,因为它讨论的是工作流如何成为可引用的长期资产。

    Paper2026-07-11arxiv.org原文 ↗
    –
  • Who Broke the System?

    论文研究多 agent LLM 系统中的失败定位,问题是复杂轨迹崩溃后如何找出责任 agent 与关键阶段。它把分析粒度从最终答案扩展到跨角色、跨回合的不可恢复错误识别。对于越来越长的 agent pipeline,这类归因方法比单纯看日志更接近工程调试需求。

    Paper2026-07-11arxiv.org原文 ↗
    –
  • SMetric

    SMetric 研究 agentic LLM serving 的 GPU 调度,指出多轮 agent session 不能只按单次请求或 token 吞吐来衡量。论文提出 session-level 的均衡调度指标与方法,面向的是一个用户任务内连续多次模型调用带来的尾延迟和公平性问题。它把 serving 讨论从“每秒多少 token”拉回到“一个 agent 任务什么时候真正完成”。

    Paper2026-07-11arxiv.org原文 ↗
    –
  • R3

    R3 是本地代码和文档审查工具,用 Web UI 组织人类与 AI agent 的反馈。它把 review 对象、评论、AI 建议和本地上下文放到同一界面,目标不是替代 PR,而是提供更细粒度的离线/本地审查工作台。项目看点在协作界面:AI review 要真正有用,必须被纳入人类可追踪的反馈结构。

    Project2026-07-11github.com原文 ↗
    –
  • Local Motion

    Local Motion 是 Cursor 与 VS Code 插件,用于配置和连接本地 LLM 编码模型。它把本地模型 endpoint、编辑器接入和模型选择组织成开发者可操作的 UI,减少手工改配置的成本。技术意义在于本地 coding model 不再只是命令行 demo,而能进入日常 IDE 工作流。

    Project2026-07-11github.com原文 ↗
    –
  • From Prompts to Contracts

    论文提出 harness engineering,用可执行监督层把企业 LLM 应用从 prompt 原型整理为生产系统。harness 负责模型 I/O、grounding、验证、工具调用和评估,文中用 contextual contracts、traceable inference steps、behavioral invariants 描述这些边界。它把“提示词写得更好”转成“应用行为可复现…

    Paper2026-07-11arxiv.org原文 ↗
    –
  • lessweb/deepcode-cli

    deepcode-cli 是为 deepseek-v4 优化的终端 AI 编码助手,支持深度思考、推理强度控制、Agent Skills 和 MCP 集成。README 给出 `npm install -g @vegamo/deepcode-cli` 的安装路径,并通过 `~/.deepcode/settings.json` 配置 `MODEL`、`BASE_URL`、`API_KEY` 等环境。…

    Trending2026-07-09github.com原文 ↗
    –
  • TencentCloud/CubeSandbox

    CubeSandbox 是 TencentCloud 开源的 AI agent sandbox service,底层基于 RustVMM 和 KVM,强调 hardware-isolated、E2B-compatible 和高并发。README 称它支持单节点和多节点部署,可在 60ms 内创建 fully serviceable sandbox,单实例内存 overhead 小于 5MB;Git…

    Trending2026-07-09始 2026-07-03github.com原文 ↗
    –
  • Tarit - Self-host sandbox cloud and hypervisor for AI agents

    Tarit 是面向 AI agent 和 RL environment 的 microVM sandbox cloud,底层是 rust-vmm/KVM,仓库分成 `vmm/` 和 orchestrator `orch/` 两层。`taritd` 负责 multi-node placement、warm pools、networking、snapshots、SSH/PTY access、per-k…

    Project2026-07-09github.com原文 ↗
    –
  • Kastor - Terraform-style specs for AI agents

    Kastor 把 agent 定义从框架代码或平台 UI 里抽出来,变成 `.agent`、`.tool`、`.prompt` 与 `kastor.hcl` 这类 HCL typed spec。`kastor build` 可以生成 LangGraph runnable project;`kastor plan/apply/destroy` 则用 state、three-way diffs 和 d…

    Project2026-07-09github.com原文 ↗
    –
  • Fortress - a stealth Chromium so your agents stop getting blocked

    Fortress 是一个 Chromium fork,目标是让 scraper 和 browser agent 通过 CDP 连接后减少自动化指纹被拦截。它不是在页面层注入 JavaScript stealth patch,而是在 Chromium C++ 内部修正 canvas、WebGL、audio、fonts、navigator 等约 30 个 detector surface;README…

    Project2026-07-09github.com原文 ↗
    –
  • huggingface/speech-to-speech

    Hugging Face 的 speech-to-speech 是模块化本地 voice-agent pipeline,组件包括 VAD、STT、LLM、TTS,并提供 OpenAI Realtime 兼容 WebSocket API。它把实时语音 agent 拆成可替换模块,方便开发者在本地组合不同模型。兼容 Realtime API 是一个实际工程点:现有客户端可以较低成本迁移或对比实现。

    Trending2026-07-08github.com原文 ↗
    –
  • Rowboat

    Rowboat 是本地优先的 AI 工作区,定位为 Claude Desktop 替代品,但重点在可构建的自定义操作界面。项目把聊天、工具调用、状态和小型 UI 放在同一工作区里,支持围绕重复任务搭建自己的 agent surface。它体现了一个趋势:桌面 AI 客户端正在从单一 chat box 变成可配置工作台。

    Project2026-07-08github.com原文 ↗
    –
  • CLRK, an open-source agent runtime with gVisor and MitM guardrails

    CLRK 是框架无关的 agent runtime,重点是把执行隔离、网络策略和观测能力从上层 agent 框架中抽出来。README 中最具体的组合是 gVisor 沙箱加中间人式网络 guardrail,可以在 agent 跑代码、访问网页或调用工具时施加边界。它的看点不是再做一个 agent SDK,而是补 runtime 层的安全和治理空缺。

    Project2026-07-08github.com原文 ↗
    –
  • hesreallyhim/awesome-claude-code

    这个 repo 是 Claude Code 资源集合,覆盖官方文档、学习材料、runtime/integration、remote control、status lines、skills、memory、observability、linting 等类别。README 显示约 48.7k stars,并说明当前迭代会优先收录新推荐资源,再逐步迁回旧资源。它的价值不在单个工具,而在把 Claude C…

    Trending2026-07-07github.com原文 ↗
    –
  • google-antigravity/antigravity-sdk-python

    Google Antigravity SDK 是构建 Antigravity/Gemini agents 的 Python SDK,抽象 agentic loop 和状态基础设施。README 说明 `Agent` 类处理 runtime binary discovery、tool wiring、hook registration 和 policy defaults;高级层提供 stateful…

    Trending2026-07-07github.com原文 ↗
    –
  • Record, replay, and improve AI agents in production

    Kitaru 作为 agent runtime 放在模型/harness 与组织平台之间,记录每个 run 的 model call、tool call、decision 和 checkpoint。它允许从任意 checkpoint replay,并覆盖模型、参数或工具输出,直接比较“如果换个模型会怎样”。README 还提到 `kitaru.wait()` 可暂停释放 compute,`flow…

    Project2026-07-07github.com原文 ↗
    –
  • Building Agents That Don't Break Themselves

    Fly.io 文章给 agent 工程一个清晰拆分:agent loop 可以长期存在并保留记忆,但执行 shell 命令的地方应该是可丢弃 sandbox。文中两个例子都用 Sprite,把每个 session 或 task 的命令放进隔离环境;危险命令不再靠“确认提示”防主机,而是靠主机不在攻击面里。最具体的演示是 agent 错删应用目录和 git/python 后,用 checkpoint…

    Blog2026-07-07fly.io原文 ↗
    –
  • google/adk-python

    google/adk-python 是 Google 的 Python Agent Development Kit,用于构建、评估和部署 AI agents。它覆盖 agent 定义、工具集成、运行时、评估与部署,不只是一个聊天示例。这个仓库的技术看点在于把 agent 工程常见的几段生命周期纳入 SDK,使开发者能用 Python 组织行为、接工具、测效果并接入部署路径。

    Trending2026-07-06github.com原文 ↗
    –
  • crynta/terax-ai

    terax-ai 是用 Tauri、Rust 和 React 构建的轻量 terminal-first AI-native dev workspace。它把终端作为主要交互面,同时用桌面壳和前端界面承载 AI 编程工作流。Tauri 提供较小本地应用外壳,Rust 负责系统侧集成,React 管理工作区 UI,这种组合适合探索介于 CLI 和 IDE 之间的 agent 开发环境。

    Trending2026-07-06github.com原文 ↗
    –
  • Tinysandbox

    Tinysandbox 用 QuickJS WASM isolates 运行 JavaScript,README 给出的单个 sandbox 内存量级约为 17.5MB,并支持虚拟文件系统、checkpoint、restore、stdout 流式输出和受控 IO。它面向高并发 agent fanout,不走完整容器路线,而是用更小的 isolate 承载短生命周期代码执行。具体可取之处在于 che…

    Project2026-07-06github.com原文 ↗
    –
  • The Log is the Agent

    这篇论文把 agent 的状态、推理、工具调用和外部副作用都表示为追加事件,agent 本身则是从事件日志到事件日志的纯函数。作者把 event sourcing、continuation-passing style、确定性生成器和可组合状态变换组合起来,使同一条执行轨迹可以被重放、审计、分支和局部改写。它值得看的一点是,论文不是给 agent 再加一个观测层,而是把“日志”提升成了系统语义本身,…

    Paper2026-07-06arxiv.org原文 ↗
    –
  • llm-coding-agent 0.1a0

    Simon Willison 发布基于 `llm` Python 库的实验性 coding agent。这个版本把模型调用、文件编辑、命令执行和循环控制做成较小实现,便于理解 coding agent 的基本组成。它的价值在教育和实验:先看清最小闭环,再评估商业工具里复杂策略到底增加了什么。

    Blog2026-07-04simonwillison.net原文 ↗
    –
  • Rethinking Complexity Metrics for LLM-Integrated Applications: Beyond Source Code

    HECATE 认为 LLM 应用复杂度不能只看源代码,还要把 prompt、上下文拼装、模型调用和非确定性行为纳入度量。论文的具体转向是从传统 code complexity 扩展到 prompt-layer behavior,这覆盖了 RAG、agent 和多阶段 LLM workflow 中最容易被静态分析漏掉的部分。它值得一读,因为 LLM 应用的维护成本往往藏在 prompt 与运行时交互…

    Paper2026-07-04arxiv.org原文 ↗
    –
  • Mcpsnoop

    Mcpsnoop 是一个 MCP 透明代理和实时 TUI,插在 agent 与 MCP server 之间显示请求、响应和工具调用。关键设计是代理层观察协议消息,因此不需要改造每个 server 才能调试。它适合 MCP 工具链开发者,因为很多 agent 失败不是模型回答错,而是工具参数、返回结构或协议状态在中间出了问题。

    Project2026-07-04github.com原文 ↗
    –
  • Hmbown/CodeWhale

    CodeWhale 是 Rust 编写的终端 coding agent harness,面向多模型和开源模型工作流。它把模型选择、命令行交互、工具调用和执行循环放在本地终端里。这个项目的看点是为不同模型提供统一运行壳,降低实验开源 coding agent 时对单一供应商工具的依赖。

    Trending2026-07-04github.com原文 ↗
    –
  • open-webui/open-webui

    Open WebUI 是自托管 AI 平台,支持 Ollama 和 OpenAI-compatible APIs,并设计为可离线运行。README 强调 extensible、feature-rich、user-friendly,还内置 RAG inference engine。它的定位已经超出“本地聊天 UI”:更接近一个把多 runner、RAG、权限、插件和部署体验统一起来的开源 AI 操作…

    Trending2026-07-03github.com原文 ↗
    –
  • not much happened today

    smol.ai 的 2026-07-01 日报称当天相对安静,但仍汇总了 coding models、agent harnesses 和 Fable 5 re-launch 等社区动态。RSS 描述显示它检查了 12 个 subreddits、544 个 Twitter 源且没有更多 Discord 输入。这样的 issue 价值在于保留社区噪声水平本身:有时“没发生大事”也能帮助判断模型发布、b…

    Blog2026-07-03news.smol.ai原文 ↗
    –
  • ZCode - Harness for GLM-5.2

    ZCode 页面把自己定义为 GLM-5.2 的 official harness,用于把 AI agents 与现有工具结合起来完成 plan、code、review、deploy。页面示例展示 Goals、长任务、bot control、多 agent collaboration 和 GLM-5.2 深度优化;下载项覆盖 macOS、Windows 和 Linux,页面版本号显示 3.2.3。…

    News2026-07-03zcode.z.ai原文 ↗
    –
  • SWE-Doctor: Guiding Software Engineering Agents with Runtime Diagnosis from Multi-Faceted Bug Reproduction Tests

    SWE-Doctor 先指出一个反直觉现象:直接用高级 BRT generator 指导 patch generation 不一定有效,fail-to-fail BRT 会误导 agent,fail-to-pass BRT 也可能只覆盖 issue 的一个表现。它改为生成多面向 BRT,执行并调试这些测试,形成 runtime-grounded diagnosis records,再结合 BRT…

    Paper2026-07-03arxiv.org原文 ↗
    –
  • RedPlanetHQ/core

    RedPlanetHQ/core 把自己称为 Personal AI OS:一个 always-on、always watching、可命名和塑形、能连接个人工具的自托管 AI 层。仓库结构包含 apps、integrations、packages、hosting、plugin 等目录,说明它不是单个聊天前端。它和 Matrix OS 一样体现出一个趋势:个人 AI 产品正在从 session-b…

    Trending2026-07-03github.com原文 ↗
    –
  • Matrix, an open-source cloud computer for coding agents

    Matrix OS 把 Claude、Codex、Cursor、OpenCode、Pi、Gemini CLI 等 coding agents 放到一台持久运行的私有云电脑里,提供终端、repo、preview、文件和 workflow。页面把 Symphony 定义为 orchestration layer:并行 sessions、task queues、terminal runs、preview…

    Project2026-07-03matrix-os.com原文 ↗
    –
  • Managed Autonomy at Runtime: Gear-Based Safety and Governance for Single- and Multi-Agent Cyber-Physical Systems

    论文设计了五档 execution gears、utility-gated dispatch 和 event-driven fallback,把 LLM 软件 agent 与机器人 CPS 的自治控制放在统一运行时里处理。多 agent 场景中,它把 runtime evidence 映射到 SMART lifecycle 的四个治理状态,并用 consensus gating、swarm-lev…

    Paper2026-07-03arxiv.org原文 ↗
    –
  • Flashtype - Markdown editor for Claude and Codex with in-line diffs

    Flashtype 是 macOS 上的开源 Markdown 编辑器,打开本地文件夹和普通 `.md` 文件,内置 Claude Code 与 Codex。编辑区是 live rich text,而 agent 修改会直接落到同一文件,再以 inline diff 展示,用户可接受或拒绝。页面还提到 version history 由 Lix 提供 checkpoint;它真正解决的是写作/文档…

    Project2026-07-03flashtype.com原文 ↗
    –
  • Fastest Enterprise AI Gateway

    Bifrost 是 MaximHQ 的 AI gateway,用单一 OpenAI-compatible API 统一 23+ providers,包括 OpenAI、Anthropic、AWS Bedrock、Google Vertex、Azure、Groq、Ollama 等。README 标称它比 LiteLLM 快 50 倍,在 5k RPS 下开销低于 100 微秒,并带自动 fallba…

    Project2026-07-03github.com原文 ↗
    –
  • Demolab - an opinionated agent-driven computational lab notebook

    Demolab 把计算实验写成小 Python 程序后,自动运行、捕获输出、绑定 exact code version,并发布包含 figures、parameters、headline numbers 和 typeset math 的静态页面。README 特别说明 notebook 不是 Jupyter,而是一段 runner script 加一页 prose;entry 是可发布 write…

    Project2026-07-03github.com原文 ↗
    –
  • Bayesian Uncertainty Propagation for Agentic RAG Pipelines

    这篇把 Agentic RAG 的 planner、evaluator、generator 阶段都变成不确定性信号源,再通过 Bayesian Network 汇总系统级失败风险和节点级故障指示。实验用 StrategyQA、HotpotQA、GPT-3.5-Turbo、GPT-4.1-Nano,并以 AUROC、AUARC、ECE、Brier Score 衡量 discrimination、se…

    Paper2026-07-03arxiv.org原文 ↗
    –
  • siteboon/claudecodeui

    CloudCLI / Claude Code UI 给 Claude Code、Cursor CLI、Codex 和 Gemini CLI 提供桌面与移动端 Web UI。功能包括 project/session 管理、chat、集成 shell、文件树与 live editing、Git staging/commit、browser use、插件系统和可选 TaskMaster AI;自托管可用…

    Trending2026-07-02github.com原文 ↗
    –
  • google/agents-cli

    google/agents-cli 是面向 coding assistant 的 Google Cloud agent 开发工具包,而不是新的 coding agent。README 写明它通过 CLI commands 和 skills 帮 agent 完成 scaffold、eval generate/grade、deploy、publish gemini-enterprise 和 obser…

    Trending2026-07-02github.com原文 ↗
    –
  • bb

    bb 是一个 agentic IDE,桌面 app、Web app、CLI 和 HTTP API 都可驱动同一套工作线程。它让多个 coding agent 在 thread 中运行,用户能实时跟随、随时 steer 或把工作交给另一个 agent;README 明确说 bb 使用用户已经认证过的 provider CLI。当前桌面包主推 macOS Apple Silicon,其他平台可用 `n…

    Project2026-07-02github.com原文 ↗
    –
  • ZCode

    ZCode 是智谱推出的 Claude Code 风格编程代理产品页,当前 digest 能确认的是其定位:围绕代码理解、编辑和开发工作流包装成 agentic coding 工具。它不是一个开源 repo 条目,因此可读信息少于 README 型项目;但它反映国内模型厂商正在把 coding agent 从模型能力展示推进到面向开发者的独立产品入口。

    Project2026-07-02zcode.z.ai原文 ↗
    –
  • Z-Jail

    Z-Jail 是约 130 KiB 的 C99 Linux sandbox,用 namespaces、pivot_root、capability dropping、NO_NEW_PRIVS、seccomp-BPF、audit JSON 和 BLAKE2b hashing 叠出多层隔离。README 的 syscall whitelist-v1 只有 15 个 syscall,且强调无外部依赖、单…

    Project2026-07-02github.com原文 ↗
    –
  • TraceLab: Characterizing Coding Agent Workloads for LLM Serving

    TraceLab 收集并发布真实 coding-agent serving trace,而不是用合成 benchmark 估算负载。数据约含 4,300 个 Claude Code 和 Codex 会话、350,000 个 LLM steps、430,000 次 tool calls,来自日常使用。分析显示 coding-agent workload 有长自治循环、长上下文短输出、重尾工具调用,以…

    Paper2026-07-02arxiv.org原文 ↗
    –
  • TakoVM

    TakoVM 是给 agents 执行代码的自托管 runtime,组合 ephemeral Docker workspace、job queue、execution history、retry、replay/fork debugging 和 REST/Python SDK。安全层面,README 写明每个 job 单独 container,默认无网络,可选 gVisor、default-deny…

    Project2026-07-02github.com原文 ↗
    –

2026 年 6 月141

  • rivet-dev/agentos

    AgentOS 是用于在隔离 Linux VM 中运行 coding agents 的轻量 agent 操作系统,仓库描述称其是 sandboxes 的更快、更轻、更便宜替代,并内置 agent orchestration。它把 agent execution environment 当作核心产品,而不是附属脚本。这个方向的关键在于并行任务、可丢弃环境、文件系统隔离和安全执行;coding age…

    Trending2026-06-29github.com原文 ↗
    –
  • anomalyco/opencode

    opencode 是一个开源 AI coding agent,仓库描述直接写着 “The open source coding agent”。作为 Trending 条目,它代表开发者对可审计、可自托管 coding agent 的持续需求。与封闭 IDE 插件相比,开源 agent 的价值在可改工具协议、权限模型、上下文策略和执行环境;这也是 coding agent 基础设施化后的自然分支。

    Trending2026-06-29github.com原文 ↗
    –
  • Claude-CLI

    claude-cli 是一个 shell wrapper,把 Claude Code 放进 Docker 容器运行,同时保留宿主机上的 Claude 配置和会话。README 支持 no-dir、current-dir、single-dir、multi-dir 模式;多目录模式会 mount 多个目录并把第一个设为容器工作目录,适合跨仓库任务。配置持久化通过 bind-mount `~/.clau…

    Project2026-06-29github.com原文 ↗
    –
  • Using Local Coding Agents

    Sebastian Raschka 写了一篇本地 coding agent 教程,目标是用 open-source tools 和 open-weight LLMs 搭起可运行栈。原始摘要说明文章源于读者反复询问他的 local agent stack,图示里包括本地模型托管的 inference engine 和 coding agent harness。它的实用性在于把“本地 agent”从概…

    Blog2026-06-28magazine.sebastianraschka.com原文 ↗
    –
  • EKKOLearnAI/hermes-studio

    EKKOLearnAI/hermes-studio 把 Hermes Agent 做成桌面应用、本地运行时和 Web console 的组合。README 提到它可用于 chat with agents、manage models and profiles、connect platform channels、automate jobs、inspect files、run coding agents…

    Trending2026-06-28github.com原文 ↗
    –
  • BuilderIO/agent-native

    BuilderIO/agent-native 是一个构建 agent-native apps 的框架,强调 agent 应该在真实产品内部行动,而不是只待在聊天窗口旁边。README 列出的 primitives 包括 shared actions、SQL-backed state、identity、tools、skills、jobs、observability 和 UI surfaces。它代表…

    Trending2026-06-28始 2026-06-21github.com原文 ↗
    –
  • Adrafinil

    Adrafinil 是一个 macOS 工具,把“保持唤醒”限定在 AI coding agent 正在跑任务的窗口内。它处理的是一个很具体的移动办公痛点:合盖会让 Mac 睡眠并中断 agent,但全局常亮工具又容易忘记关闭。这个项目的看点不是复杂算法,而是把电源管理和 agent 工作状态绑定成一个更窄的自动化条件。

    Project2026-06-28github.com原文 ↗
    –
  • receptron/mulmoclaude

    MulmoClaude 是本地运行的 AI-native application platform,用 Claude Code 作为 universal controller,把 accounting、wiki、SEC filings reader 等能力放到 plugin registry。README 描述自然语言可以召唤 markdown、charts、forms、wikis、spreads…

    Trending2026-06-27github.com原文 ↗
    –
  • hoangsonww/Claude-Code-Agent-Monitor

    Claude-Code-Agent-Monitor 是 Claude Code 实时监控 dashboard,用 SQLite3、Node.js、Express、React、Vite、TailwindCSS 和 WebSockets 构建。仓库描述列出 session、agent activity、tool usage、subagent orchestration、live analytics、K…

    Trending2026-06-27github.com原文 ↗
    –
  • ZeroGate - API gateway to scale cloud GPUs to zero when idle

    ZeroGate 是事件驱动的 GPU orchestration fabric,位于 application gateway 与底层硬件提供商之间,处理 vLLM 多租户推理的排队、扩容、闲置回收和计费记录。README 描述 Redis distributed locks、Kafka gateway、PostgreSQL billing ledger、本地 mock mode、simulato…

    Project2026-06-27github.com原文 ↗
    –
  • TBD, a Mac-native CLI-forward coding agent multiplexer

    TBD 是 macOS 原生 SwiftUI 应用,用于管理 git worktrees、embedded terminals 和多 Claude Code sessions。架构上有 tbdd daemon 管 SQLite/GRDB、tmux、git 状态,tbd CLI 做脚本入口,TBDApp 用 SwiftTerm 做 GUI,并通过 Unix socket 上的 JSON RPC 通讯…

    Project2026-06-27github.com原文 ↗
    –
  • Smart model routing directly in Claude, Codex and Cursor

    workweave/router 是 Anthropic、OpenAI、Gemini 兼容的本地/自托管 proxy,用 on-box embedder 和 cluster scorer 为每个请求选模型。README 声称路由延迟小于 50ms,并支持 streaming、tools、vision、OpenRouter OSS 模型、BYOK 本地加密和 OTLP traces;安装路径从 `n…

    Project2026-06-27github.com原文 ↗
    –
  • Shotlist - Make your AI agent prove its work with real screenshots

    Shotlist 用 `.shotlist.yaml` 把截图流程提交到仓库,让 Web 页面、真实 Terminal 窗口、渲染 CLI 输出和持久 session 都能一键重拍。README 说明 `shotlist run` 会生成 PNG、index.html proof report 与 manifest.json,`shotlist check` 可在 CI 中发现截图漂移,Claud…

    Project2026-06-27github.com原文 ↗
    –
  • Mantis, A self-hosted LLM gateway

    Mantis 给小团队提供一个自托管 LLM gateway,把 provider-specific logic 收敛到单一 chat-completions API 后面。README 列出 configurable routing、fallback chains、retries、timeouts、cooldowns、exact/semantic caching、AWS Bedrock guar…

    Project2026-06-27github.com原文 ↗
    –
  • Jargo - a Golang port of Pipecat for conversational-AI apps

    jargo 是 Go 版实时语音 agent 框架,走 WebRTC-native、audio-first 路线。README 说明它实现 STT -> LLM -> TTS streaming pipeline,支持 turn-taking、barge-in、Silero VAD、Smart Turn v3、RTVI data channel、Pion WebRTC 与 pluggable se…

    Project2026-06-27github.com原文 ↗
    –
  • heygen-com/hyperframes

    HyperFrames 是用 HTML、CSS、媒体资源和 seekable animations 渲染确定性 MP4 视频的开源框架。README 强调 Write HTML. Render video. Built for agents,支持本地 CLI、AI coding agent skills,也可作为托管 authoring workflow 的渲染核心。它把视频生成从时间线编辑器转成…

    Trending2026-06-24github.com原文 ↗
    –
  • Build real agentic apps using CUGA

    IBM Research 在 Hugging Face 博客展示用 CUGA harness 构建 agentic apps,标题提到 two dozen working examples 和 lightweight harness。它把 agentic app 从单个演示推进到一组可运行样例,覆盖工具调用、环境交互和应用流程。这个角度适合检验 agent 框架是否能支撑真实应用组合,而不是只在单…

    Blog2026-06-24huggingface.co原文 ↗
    –
  • modem-dev/hunk

    Hunk 是面向 agent 生成 changeset 的 review-first 终端 diff viewer,基于 OpenTUI 和 Pierre diffs。它不负责生成代码,而是优化人类审查 agent diff 的界面和顺序。随着 coding agent 产出更多批量变更,review 工具会从“看 git diff”演进为“理解 agent 做了什么、哪些 hunks 需要拦截”…

    Trending2026-06-23github.com原文 ↗
    –
  • bytedance/deer-flow

    DeerFlow 2.0 是 ByteDance 开源的 long-horizon SuperAgent harness,README 称它用 sub-agents、memory、sandboxes 和 extensible skills 编排研究、编码和创作任务。项目支持模型配置、MCP、sandbox、IM channels、LangSmith/Langfuse tracing,并给出本地评估…

    Trending2026-06-23github.com原文 ↗
    –
  • The text in Claude Code’s “Extended Thinking” output

    Patrick McCanna 分析 Claude Code “Extended Thinking” 输出文本的性质。文章关注这些可见文字是否等同于模型真实内部推理,还是更接近产品化后的解释层。这个问题会影响用户如何审计 agent 行为、定位错误,以及判断“思考过程”在工程上能承担多少证据价值。

    Blog2026-06-23patrickmccanna.net原文 ↗
    –
  • Temporary Cloudflare Accounts for AI agents

    Simon Willison 记录 Cloudflare Workers 的临时账号部署能力及其实际用途。核心点是给 AI agents 可撤销、生命周期有限的部署身份,而不是把长期账户或高权限 token 交给 agent。这样的账户模型把权限边界嵌入平台流程,适合自动化部署、演示环境和短期实验。

    Blog2026-06-23simonwillison.net原文 ↗
    –
  • Sturnus

    Sturnus 是 OpenAI-compatible LLM proxy,按 provider 延迟把请求路由到最快后端。它解决的是多模型供应商接入后的运行时选择问题:客户端保持 OpenAI API 形状,代理层根据实时表现做路由。相比静态 fallback,延迟感知代理更贴近生产环境里对尾延迟和可用性的要求。

    Project2026-06-23github.com原文 ↗
    –
  • Picot

    Picot 是 Pi coding agent 的本地桌面 GUI,打包已知可用的 `pi` runtime,避免另装 CLI 和版本漂移。README 列出聊天、流式输出、图片附件、inline diff、tool-call cards、多 session、多 agent、历史搜索、LAN/mobile 访问、包管理、成本 dashboard、模型选择和 context compaction。它…

    Project2026-06-23github.com原文 ↗
    –
  • Oak

    Oak 是面向 agents 的版本控制系统,支持虚拟挂载和并行任务工作区。它关注的是 agent 同时探索代码、隔离文件变更和管理任务上下文时的状态问题,而不是传统人类分支协作。这个项目代表了 coding agents 需要的新型开发基础设施:工作区要比单一 git checkout 更可组合。

    Project2026-06-23oak.space原文 ↗
    –
  • AI-Gateway

    AI-Gateway 是 OpenAI/Groq 兼容的反向代理,通过语义缓存减少 LLM API 调用。README 写出四级匹配:exact、template、semantic、word overlap,并支持 Redis + in-memory fallback、多租户 cache、100 个并发相同请求去重、rate limiting、circuit breaker 和 cost trac…

    Project2026-06-23github.com原文 ↗
    –
  • jcode

    jcode 是 coding agent harness,README 的核心定位是 multi-session workflows、high customizability 和 performance。仓库采用 Rust,提供 macOS/Linux 安装脚本,并把资源效率作为显性目标,尤其服务于同时跑多个 agent session 的场景。它值得关注在于 coding agent 工具链开始…

    Trending2026-06-22始 2026-06-21github.com原文 ↗
    –
  • Temporary Cloudflare Accounts for AI Agents

    Cloudflare 把 agent 部署里的账号注册和 OAuth 摩擦降成一个短生命周期账号机制:`wrangler deploy --temporary` 会创建临时 Cloudflare account、给 Wrangler 一个 API token,并返回可交给人的 claim URL。文章给出的硬边界是部署默认存活 60 分钟,期间用户可以认领为永久账号,否则自动过期。这个发布反映出平…

    News2026-06-22始 2026-06-21blog.cloudflare.com原文 ↗
    –
  • Pulse

    Pulse 把 Claude Code 的本地 session 文件变成监控和控制面板:token 花费、context fill、项目维度成本、全文搜索和 session recovery 都在本机完成。README 里比较实用的细节是手机审批路径,ntfy 通知能直接带 `Allow`、`Allow all`、`Deny` 按钮,不需要暴露端口;同 Wi-Fi 的 `/phone` 页面还能暂…

    Project2026-06-22github.com原文 ↗
    –
  • Flue

    Flue 是 TypeScript agent harness,而不是只包一层模型 SDK:README 示例里 `defineAgent` 同时声明 model、tools、skills、sandbox 和 instructions,再用 route 把 agent 暴露成 HTTP 端点。它把 virtual/local/remote container sandbox 作为 agent 定义…

    Project2026-06-22始 2026-06-07github.com原文 ↗
    –
  • Persona.js

    Persona.js 是一个纯 Vanilla JS agent widget,重点不是绑定某个模型 SDK,而是把前端 agent 面板、SSE streaming、WebMCP page tools 和样式隔离组合起来。页面列出的适配路径覆盖 bare script、AI SDK + WebMCP、OpenAI Agents、LangGraph.js、Hono、Express、SvelteKi…

    Project2026-06-21persona-chat.dev原文 ↗
    –
  • Cordium

    Cordium 把 sandbox 和基础设施访问控制放到同一个平台里:Workspace 是 Kubernetes 上的 rootless container sandbox,可用于远程开发、agent task 和 CI/CD workload。README 反复强调的差异点是 secretless access,借 Octelium ZTNA 让 sandbox 内部按身份和策略访问 SSH…

    Project2026-06-21始 2026-06-01github.com原文 ↗
    –
  • slash-agent - Native LLM copilot for your terminal

    slash-agent 把 LLM copilot 放进终端工作流,目标是让命令行里的提问、修改和执行更自然地衔接。它的项目定位不是通用聊天应用,而是 native terminal copilot,因此交互边界会更接近 shell、文件和开发命令。对开发者工具来说,这种形态的关键在于低摩擦地把模型建议变成可执行操作。

    Project2026-06-20github.com原文 ↗
    –
  • kenn-io/agentsview

    agentsview 是本地优先的编码代理会话搜索、统计和 token 使用分析工具。它把 Claude Code、Codex 这类工具产生的历史记录变成可检索和可度量的数据,而不是只留在各自客户端里。这个项目和 Gora、summer 一起说明:代理使用进入常态后,围绕历史、成本和行为分析的周边工具会快速增多。

    Trending2026-06-20github.com原文 ↗
    –
  • Wyolet Relay - high throughput, open source LLM router

    Wyolet Relay 是一个开源 LLM 请求路由器,定位在高吞吐转发。它位于应用和模型提供商之间,承担请求分发、路由和可能的策略控制。随着应用同时接入多个模型后端,这类 relay 的价值在于把模型选择、限流和故障切换从业务代码中抽离出来。

    Project2026-06-20github.com原文 ↗
    –
  • TabbyML/tabby

    Tabby 是可自托管的开源 AI 编码助手,定位为 GitHub Copilot 的 open-source、on-premises alternative。README 列出的关键特性包括 self-contained、无需 DBMS 或 cloud service,并提供 OpenAPI interface 方便接入 Cloud IDE 等既有基础设施。自托管路线的关键价值在数据控制、部署可…

    Trending2026-06-20github.com原文 ↗
    –
  • Multiplayer Usage Tracking for Claude Code, Codex and OpenCode

    summer 是一个本地 dashboard,用来在团队里追踪 Claude Code、Codex 和 OpenCode 的使用量。作者描述的工作流包括本地起 dashboard、用 useautumn.com 存储和管理 usage、并可 backfill historical usage。随着 coding agent 进入团队流程,使用量统计会从个人好奇心变成预算、容量和合规管理的一部分。

    Project2026-06-20github.com原文 ↗
    –
  • Kilo-Org/kilocode

    kilocode 是一个开源 agentic engineering 平台,面向 AI 辅助构建和迭代软件。它的定位比单个代码补全插件更宽,覆盖从任务理解到代码修改的工程循环。趋势意义在于 agentic engineering 正在成为一个产品类别:开发者要的不只是回答,而是能进入仓库、执行步骤并留下可验证变更的系统。

    Trending2026-06-20github.com原文 ↗
    –
  • BeamWeaver - LangChain/DeepAgents-style agents and workflows for Elixir

    BeamWeaver 把 LangChain、LangGraph 和 DeepAgents 风格的代理工作流带到 Elixir/OTP 生态。作者列出的能力包括 agents and tool calling、graph workflows、checkpoints and resumable execution、memory stores、retries 和 fallbacks。它给代理框架提供了…

    Project2026-06-20github.com原文 ↗
    –
  • openobserve/openobserve

    OpenObserve 覆盖 logs、metrics、traces、frontend monitoring 和 LLM observability。digest 显示它把传统 observability 与模型调用观测放到同一平台。这个组合反映一个现实趋势:LLM 请求、token、延迟、错误和成本已经成为生产系统遥测的一部分。

    Trending2026-06-19github.com原文 ↗
    –
  • continuedev/continue

    Continue 是开源 coding agent,支持 CLI、VS Code 和 JetBrains 插件。多入口形态意味着它可以覆盖终端批处理、编辑器交互和 IDE 内上下文。它代表 coding assistant 从“补全插件”演进到跨工具链 agent 的方向。

    Trending2026-06-19github.com原文 ↗
    –
  • bytedance/UI-TARS-desktop

    UI-TARS-desktop 是开源多模态 agent stack,连接 GUI agent、视觉模型和桌面/浏览器执行环境。digest 显示它偏完整工程栈,而不是单点 UI automation 工具。它适合观察 computer-use agent 如何从 benchmark demo 走向可安装、可运行的桌面系统。

    Trending2026-06-19github.com原文 ↗
    –
  • Rootsign - tamper-evident audit logs for LangChain/CrewAI agents

    RootSign 为生产 agent 工具调用建立防篡改 hash chain,每个 action 记录包含前一条 action 的 SHA-256 hash。`rootsign verify` 可以检测记录被改动的位置,exit code 也可用于自动化审计流程。v0.1.1 已有 LangGraph、CrewAI 集成、PII redaction、人类审批 checkpoint 和可选 dec…

    Project2026-06-19始 2026-06-18github.com原文 ↗
    –
  • Open-source back end for multi-user AI agents with shared memory

    Lobu 是 OpenClaw 的多租户 gateway,给 Slack、Telegram、WhatsApp、Discord、Teams、Google Chat 和 REST API 提供 agent 接入。README 称它只重写约 40K LOC gateway 层,保持 OpenClaw Pi harness 在 worker 内部运行,并为每个用户或 channel 分配隔离虚拟文件系统与…

    Project2026-06-19github.com原文 ↗
    –
  • OSymandias - Open-source runtime for multi-agent AI systems

    OSymandias 是 Python library 和 CLI,一条 `osy serve` 启动多代理 runtime,内部管理 PostgreSQL、Redis、RabbitMQ、Qdrant 和 Celery workers。它用 `@osy.tool`、`@osy.agent` 装饰器从类型提示推断 schema,并提供 job、task、agent instance、tool cal…

    Project2026-06-19github.com原文 ↗
    –
  • How we run Firecracker VMs inside EC2 and start browsers in less than 1s

    Browser-use 解释其在 EC2 内运行 Firecracker VM 并快速启动浏览器沙箱的架构。digest 的关键数字是浏览器启动低于 1 秒,问题域是 agent 浏览器执行环境的隔离、冷启动和吞吐。它对浏览器 agent 基础设施很具体,因为浏览器会话既重又危险,沙箱成本直接影响产品可用性。

    Blog2026-06-19browser-use.com原文 ↗
    –
  • Externalizing Research Synthesis and Validation in AI Scientists through a Research Harness

    Xcientist 把文献证据、idea state、实现计划、ablation 记录和 repair trace 都存成持久研究 artifact,使 AI scientist 的推理链可检查。论文提出 claim drift 作为自动科研失败模式:最终可运行 artifact 不再支撑原本机制声明。实验跨 memory system、交通预测和 physics-informed neural…

    Paper2026-06-19arxiv.org原文 ↗
    –
  • Vpod

    Vpod 在 WebAssembly 里运行 RV64GC RISC-V 虚拟机,用 snapshot 方式给不可信进程启动一个轻量 Linux 环境;README 明确写到启动目标是 under a second。它通过 WASI 0.2 与宿主通信,文件系统、网络和 stdio 都受控暴露,而 CPU 寄存器、内存和文件系统状态留在 WASM sandbox 内。项目同时提供 CLI 和 Py…

    Project2026-06-18github.com原文 ↗
    –
  • Verified Detection and Prevention of Concurrency Anomalies in Multi-Agent Large Language Model Systems

    这篇论文把多 Agent LLM 系统共享 memory store、vector index、tool registry 的过程建成 read-generate-write 操作,并用 TLA+ 给出 stale-generation、phantom-tool、causal-cascade、tool-effect reordering 四类并发异常的可执行规格。它的技术硬度在于 274 个 Ve…

    Paper2026-06-18arxiv.org原文 ↗
    –
  • Relaymux

    Relaymux 的设计很窄:Telegram 是 remote control,tmux 是 agent workspace,避免把本地 CLI Agent 包进不可见 orchestration 黑盒。README 写明它启动 agent 时会打开本机可见的 tmux window,用户可以 attach、watch、interrupt、debug;每个 agent run 在默认 `agen…

    Project2026-06-18github.com原文 ↗
    –
  • Mira

    Mira 是自托管 AI code reviewer:diff、embedding、index、review history 和 vulnerability data 存在用户自己的 SQLite 或 Postgres 中,LLM 可经 OpenRouter、Bedrock 或 OpenAI-compatible endpoint 接入。README 的功能面很宽,包括 full-repo cod…

    Project2026-06-18github.com原文 ↗
    –
  • Making budget models punch above their weight with a smart Rust harness

    这篇文章讨论用 smart Rust harness 让 budget models 在编码任务上 punch above their weight。关键变量是 harness,而不是模型本身:工具循环、上下文组织、验证反馈和执行隔离会决定小模型能否稳定完成任务。它和本期多篇论文形成同一条线:Agent 性能越来越取决于工具循环、上下文裁剪、验证策略和执行环境,小模型只要被合适地约束和供给反馈,也…

    Blog2026-06-18yogthos.net原文 ↗
    –
  • Agentspace

    Agentspace 把长时间运行的 Codex 或 Claude Code 任务放进 Docker:每个 task 拥有独立 volume、throwaway container 和 `agent/<repo>/<task>` 分支,用户可 detach/attach,就像 multiplexer,但工作区天然隔离。`spawn` 从当前 repo 推断 origin 和 base branch…

    Project2026-06-18github.com原文 ↗
    –
  • trycua/cua

    cua 是 computer-use agents 的基础设施仓库,覆盖 agent-ready sandboxes、background desktop drivers、benchmarks 和 macOS/Linux VM 管理。README 展示同一 API 可控制 Linux、macOS、Windows、Android 或自带镜像,agent 能执行 shell、截图、点击、输入和移动手势…

    Trending2026-06-17github.com原文 ↗
    –
  • Running local models is good now

    Vicki Boykis 的判断来自实际本地开发使用,而不是单个 leaderboard。她在 2022 M2 Mac、64GB RAM、1TB storage 上试过 Mistral 7B、Gemma、OpenAI OSS-20B、Qwen 3 MoE 等模型和 llama.cpp、Ollama、LM Studio 等栈,认为 Gemma 4 近期让本地 agentic coding 达到约 7…

    Blog2026-06-17vickiboykis.com原文 ↗
    –
  • PromptShark

    PromptShark 是 AI agent 的本地 proxy/debugger,只需改 OpenAI SDK base_url 即可让每个 API call 流经代理。它记录 request/response、prompt/completion token、成本、TTFT,并通过 C++ loop detector 识别重复 tool call,默认阈值是 3 次连续相同调用。Time-tra…

    Project2026-06-17github.com原文 ↗
    –
  • PhoneHarness: Harnessing Phone-Use Agents through Mixed GUI, CLI, and Tool Actions

    PhoneHarness 认为真实手机任务不只是 screen tapping,还需要在 GUI、device-side commands 和 host-side tools 之间路由。它提供混合动作执行 harness,使用 deterministic action routing、bounded GUI delegation 和可审计 traces,评分关注可观察副作用是否发生。annotat…

    Paper2026-06-17arxiv.org原文 ↗
    –
  • My Homelab AI Dev Platform

    这篇 homelab 文章把 OpenCode Web UI 放进 GitOps 运维链路。作者在 TrueNAS host 上建 VM,把 OpenCode webserver 做成 systemd unit,并给它专用 Git 用户:可以 clone 和 push feature branches,但不能直接推 deploy branch。实际工作流是 OpenCode 改 compose/H…

    Blog2026-06-17rsgm.dev原文 ↗
    –
  • Agent Harness Lab

    Agent Harness Lab 是比较 agent framework 的 Next.js workbench,而不是又一个单一 agent demo。它把 Graphlit 作为共享 context layer,让 Graphlit、OpenAI Agents SDK、Vercel AI SDK、LangGraph、Mastra、Claude Agent SDK 和 Google ADK 并…

    Project2026-06-17github.com原文 ↗
    –
  • vercel/ai

    Vercel AI SDK 是 TypeScript AI toolkit,用于构建 AI-powered applications 和 agents。它的现实价值在于把 streaming UI、model adapters、tool calling、structured output 和前端框架集成放进一个开发者熟悉的栈。它值得关注是因为很多 AI 产品的差异并不只在模型,而在交互延迟、流式渲…

    Trending2026-06-15github.com原文 ↗
    –
  • andrewyng/aisuite

    aisuite 提供跨 OpenAI、Anthropic、Google、Mistral、Hugging Face、AWS、Cohere、Ollama、OpenRouter 等 provider 的统一 Chat Completions API。README 还把工具调用、`max_turns` 循环、Agents API、文件/git/shell toolkits 和 MCP 接入放在同一层,并附…

    Trending2026-06-15github.com原文 ↗
    –
  • Manim-Studio

    Manim-Studio 走的是 prompt → OpenAI 写 Manim scene → InstaVM 渲染 → MP4 的路线。README 中架构由长驻 FastAPI app、SQLite job store、`/api/jobs` 与 `/poll` 长轮询接口、短生命周期渲染 VM 组成,渲染基础镜像包含 `manim==0.20.1`、cairo、pango 和 ffmpeg…

    Project2026-06-15github.com原文 ↗
    –
  • Bastion

    Bastion 面向后台 coding agents 提供隔离 Linux VM,定位在 agent 执行环境而不是代码生成模型本身。digest 给出的关键事实是它把长期运行的编码任务放入独立虚拟机,减少 agent 与开发者主机共享文件系统、凭据和进程空间的风险。它的价值在于把“让 agent 干活”拆成模型能力与运行隔离两层来处理。

    Project2026-06-15bastion.computer原文 ↗
    –
  • Afterburner

    Afterburner 把 JavaScript/TypeScript 包装成 `.afb` 包:`afb.toml` 描述包,`manifold.json` 声明能力,源码在 sandbox 内执行。`burn` CLI 能 scaffold、run、test、package、publish,也能通过 agent hook 把 AI 写出的 `node app.js`、`npm test`、`n…

    Project2026-06-15github.com原文 ↗
    –
  • superradcompany/microsandbox

    Microsandbox 为 untrusted workloads 提供 fast local microVMs,README 明确列出 AI agents、user code、plugins、CI jobs、dev environments、scrapers 和 automation 等场景。它试图填补进程级隔离和远程沙箱之间的空档:本地启动、延迟低,但边界比普通子进程和容器更硬。随着 age…

    Trending2026-06-12github.com原文 ↗
    –
  • pydantic/monty

    Monty 是 Pydantic 团队用 Rust 写的最小安全 Python 解释器,目标是执行 LLM 生成的 Python 工具代码,而不启动完整容器。它通过外部函数控制文件系统、网络和环境变量访问,支持 typechecking、资源限制、stdout/stderr 收集、async/sync host calls,以及在外部函数调用点 snapshot 成 bytes 后 resume。…

    Trending2026-06-12github.com原文 ↗
    –
  • junhoyeo/tokscale

    Tokscale 是跟踪 AI coding agent token usage 和成本的 CLI/TUI 与 dashboard。README 列出支持 OpenCode、Claude Code、OpenClaw、Pi、Codex、Gemini、Cursor、AmpCode、Factory Droid、Kimi 等,并在 v2 中加入 native Rust TUI、跨平台支持、global l…

    Trending2026-06-12github.com原文 ↗
    –
  • comet-ml/opik

    Opik 是开源 LLM 应用观测、评测和调试平台,覆盖 RAG systems 与 agentic workflows。仓库描述强调 comprehensive tracing、automated evaluations 和 production-ready dashboards,这些能力对应 LLM 应用里最难排查的部分:检索输入、prompt、工具调用、中间输出和评测结果之间的因果链。它与…

    Trending2026-06-12github.com原文 ↗
    –
  • coleam00/Archon

    Archon 定位为 open-source harness builder for AI coding,目标是让 AI coding deterministic and repeatable。它用 YAML workflow 定义 agent 流程,这意味着计划、步骤、工具和验证逻辑可以版本化,而不是散落在一次性 prompt 和聊天历史中。仓库包含 Docker、compose、AGENTS/…

    Trending2026-06-12github.com原文 ↗
    –
  • OpenAI to acquire Ona

    OpenAI 宣布计划收购 Ona,交易仍需常规 closing conditions 和监管批准,closing 前双方仍独立运营。OpenAI 表示 Ona 团队将在完成后加入 Codex 团队,推进 secure、persistent enterprise execution capabilities,帮助 Codex 更安全地进入生产工作流。公告列举的目标场景包括运行测试、修复 issue…

    News2026-06-12openai.com原文 ↗
    –
  • Flightdeck

    Flightdeck 是自托管的 AI agent observability 和 control plane,面向 production agents 与 coding agents。它把 LLM calls、MCP events、tool calls 流式送入 dashboard,提供 per-agent timeline、fleet-wide feed、events search、run i…

    Project2026-06-12github.com原文 ↗
    –
  • Building agents without harness engineering

    Rajit Khanna 讨论的是一个反主流判断:与其继续扩大 agent harness,不如减少外部编排,把更多能力压到模型和工具接口本身。文章关注 harness engineering 的复杂度,包括计划、状态、重试、工具调用和外部控制逻辑如何越堆越厚。它值得放进今天的语境,是因为同一份日报里有 Archon、Claw-SWE-Bench、Flightdeck、Remuda 等大量 har…

    Blog2026-06-12rajitkhanna.com原文 ↗
    –
  • Boo

    Boo 是用 Zig 写、基于 libghostty-vt 的 screen 风格终端复用器。它把 session 输出交给 Ghostty 终端仿真核心解析,因此能保存屏幕内容、样式、光标、scrollback 和 terminal modes;`peek` 返回的是重建后的屏幕状态,不是原始字节日志。README 还给出 agent-friendly automation loop:`new…

    Project2026-06-12github.com原文 ↗
    –
  • langchain-ai/deepagents

    LangChain Deep Agents 是 batteries-included agent harness,基于 LangGraph,把长程多步任务常用能力打包成默认结构。README 列出 sub-agents、filesystem、context management、shell access、persistent memory、human-in-the-loop、skills、MCP/…

    Trending2026-06-10github.com原文 ↗
    –
  • hyperlight-dev/hyperlight

    Hyperlight 是可嵌入应用的轻量 VMM,用 microVM 低延迟运行不可信代码,也是 CNCF sandbox 项目。README 写明它适合毫秒级创建/销毁 sandbox、微秒级 guest function calls、FaaS 和 snapshot/restore,但不适合通用虚拟化或需要完整 Linux syscalls、网络、文件系统的工作负载。它是 agent 代码执行隔…

    Trending2026-06-10github.com原文 ↗
    –
  • danny-avila/LibreChat

    LibreChat 是可自托管的多模型 ChatGPT-like 平台。README 描述它聚合主流 AI providers,并提供 agents、MCP、Artifacts、Code Interpreter、自定义 actions、conversation search 和企业级多用户认证。它的持续流行说明很多团队仍需要可控、可审计、可换供应商的聊天基础设施。

    Trending2026-06-10github.com原文 ↗
    –
  • Setting a custom price for a model in AgentsView

    Simon Willison 记录如何在 AgentsView 中为新模型手动配置价格,以分析本地 coding agent 的 token 成本。这个小功能的含义大于配置本身:agent 工作越来越长,模型价格变化越来越快,成本观察必须跟上模型切换和会话级调试。它把“这个任务花了多少钱”从账单月底问题变成工程过程中的即时反馈。

    Blog2026-06-10simonwillison.net原文 ↗
    –
  • RiddleRun

    RiddleRun 是 Docker-first 的 agentic E2E 浏览器测试工具,测试用 JSON 描述自然语言步骤和期望结果。CLI 通过 browser-use agent 执行网页任务,支持按 test-id/tag 运行、输出 JSON artifacts、录制视频,并提供 FastAPI 后端与 Next.js Web UI;这让“让代理像用户一样测网页”具备了可批量运行的形…

    Project2026-06-10github.com原文 ↗
    –
  • OpenYabby

    OpenYabby 是 Mac 上的开源语音驱动多代理系统:唤醒后描述任务,系统会规划、委派、执行、审查并汇报。README 显示它整合 OpenAI Realtime API、Claude Code/Codex/Aider/Goose/Cline/Continue 等 CLI runners、Mem0 + Qdrant 持久记忆、PostgreSQL/Redis、37 个 connectors…

    Project2026-06-10github.com原文 ↗
    –
  • AgentHarness

    AgentHarness 是 Apodex-1.0 的开源 deep-research benchmark harness,用于复现标准 ReAct 设置下的公开结果。仓库包含 benchmark、workflow、plugins 和脚本,重点在可重复评测 verification-centric deep research 模型,而不是包装一个新的研究助手 UI。

    Project2026-06-10github.com原文 ↗
    –
  • AgentGraphed

    AgentGraphed 是本地 Claude Code 与 Codex CLI 会话分析仪表盘。它读取 ~/.claude/projects/ 和 ~/.codex/sessions/ JSONL 日志,建立本地 SQLite 索引,并用 npx agentgraphed 启动 localhost:3737;README 示例显示一次首扫可发现 142 个 Claude、8 个 Codex se…

    Project2026-06-10github.com原文 ↗
    –
  • Agent-pd

    Agent-pd 是面向 Claude Code subagents 的零 token audit log 工具,目标是在不占用模型上下文的情况下记录代理行为。它解决的是异常执行后的可追溯性:当 subagent 访问文件、运行命令或推进任务时,外部日志能帮助维护者复盘,而不是依赖模型自己记得做过什么。

    Project2026-06-10github.com原文 ↗
    –
  • nesquena/hermes-webui

    Hermes WebUI 是 Hermes Agent 的 Web/手机界面。README 列出文件树展开折叠、breadcrumb、文本/代码/Markdown/图片预览、`workspace://` 链接、文件编辑/新建/删除/重命名、二进制下载、Git branch 和 dirty count badge。它补的是 agent 操作体验层,让用户不必只通过终端和消息平台管理 Hermes。

    Trending2026-06-08始 2026-06-01github.com原文 ↗
    –
  • microsoft/mxc

    Microsoft eXecution Container 是用于运行不可信代码、模型输出、插件和工具的跨平台沙箱系统。README 说它支持 Windows、Linux、macOS,并把 OS-native process sandbox 到 full VM 的 containment backend 放在统一 JSON schema 和 TypeScript SDK 后。仓库当前是 early…

    Trending2026-06-08始 2026-06-06github.com原文 ↗
    –
  • firecracker-microvm/firecracker

    Firecracker 是轻量 microVM 技术,用于 serverless 和多租户容器工作负载。仓库描述强调 secure and fast microVMs,它的核心是在 VM 隔离强度和容器级资源效率之间取折中。随着 AI tool execution 和 untrusted code sandbox 需求上升,Firecracker 仍是隔离设计的基准参考。

    Trending2026-06-08github.com原文 ↗
    –
  • Tokenomics: Quantifying Where Tokens Are Used in Agentic Software Engineering

    论文分析 LLM 多智能体软件工程系统在 SDLC 各阶段的 token 消耗,而不是只看一次代码生成的开销。作者用 ChatDev 在 GPT-5 reasoning model 上执行 30 个软件开发任务,把内部阶段映射到设计、编码、补全、代码评审、测试和文档;初步结果显示迭代式 Code Review 平均占 59.4% token,输入 token 平均占 53.9%。这使 agenti…

    Paper2026-06-08arxiv.org原文 ↗
    –
  • Thoughts on starting new projects with LLM agents

    Eli Bendersky 记录用 LLM agents 启动新项目时的经验。digest 指出 agent 擅长从空仓库快速搭起可运行原型,但架构边界、依赖选择和验证闭环仍要由人把关。它适合和 OpenAI harness 文章一起读:一个看个人项目 bootstrap,一个看团队级 agent 工程化。

    Blog2026-06-08eli.thegreenplace.net原文 ↗
    –
  • TakoVM

    TakoVM 用 Docker 容器运行不可信 Python,并可叠加 gVisor sandboxing。项目内建 job queue、worker pool、执行历史、重试、idempotency_key、rerun/fork API 和默认无网络策略;安装路径是 `pip install "tako-vm[server]"` 后启动 server,再用 HTTP POST 提交代码。它把“安…

    Project2026-06-08github.com原文 ↗
    –
  • Shubhamsaboo/awesome-llm-apps

    awesome-llm-apps 收集 100+ 可运行 AI Agent、RAG、voice agent 和 LLM app 示例。仓库描述强调 clone、customize、ship,说明它定位为应用模板索引。它适合快速比较不同 agent 框架、检索方案和产品 UI,而不是学习某个单一底层库。

    Trending2026-06-08github.com原文 ↗
    –
  • Nightwatch

    Nightwatch/ninoxAI 是本地优先、只读的 AI SRE 层,用来把告警风暴归并为 incident 并辅助 RCA。README 说明它可读取 Checkmk、Prometheus、Icinga2、Zabbix、Docker、Kubernetes、AWS、Grafana、GitHub、Git 和主机信息,agent 的能力表被限制为 read-only。它的边界设计清晰:模型形成…

    Project2026-06-08github.com原文 ↗
    –
  • Kyushu

    Kyushu 是面向 JavaScript workers 的自托管 WASM sandbox。公开介绍把它拆成 worker 和 runner 两部分,目标是在容器、microVM 之外提供更轻量的隔离执行层。它值得看的是运行边界:把 Web worker 形态的代码放进 WASM 沙箱,适合函数级、插件式或多租户脚本执行。

    Project2026-06-08kyushu.dev原文 ↗
    –
  • I design with Claude more than Figma now

    Jane Street 设计师 Edwin Morris 描述自己从 Figma/docs 转向 Claude Code 原型。文章给出的具体工作流是先写问题和方案,再让 Claude 在真实代码库里做出可运行功能,并把原型推到开发环境给用户试;过去 2 个月 Figma 使用场景明显下降,部分原型达到 2000+ 行 diff。团队目前把这些原型称为 living proposal docs,强…

    Blog2026-06-08blog.janestreet.com原文 ↗
    –
  • Harness engineering: Leveraging Codex in an agent-first world

    OpenAI 文章总结一个“0 手写代码”内部产品实验。团队称 5 个月内由 Codex 生成约百万行代码、合并约 1500 个 PR,最初 3 名工程师平均每人每天 3.5 个 PR;产品已有内部日常用户和外部 alpha testers。文章真正有用的部分是 harness:让每个 worktree 可启动 app、暴露 Chrome DevTools、DOM snapshots、screen…

    Blog2026-06-08openai.com原文 ↗
    –
  • Anthropic, please ship an official Claude Desktop for Linux

    Claude Code issue #65697 请求 Anthropic 发布官方 Claude Desktop Linux build,理由不是单纯桌面客户端缺席,而是插件测试、desktop extensions、computer use、dictation 和 Cowork 都依赖桌面端。issue 指出 Claude Code CLI 虽然原生支持 Linux,但不能替代 Desktop…

    News2026-06-08github.com原文 ↗
    –
  • plannotator

    plannotator 用浏览器可视化审阅 coding agent 的 plans 和 code diffs,并把结构化反馈发回 agent。它把“先看计划再允许改代码”的控制点做成 UI,而不是让用户在长日志里找风险。这个方向对团队采用 coding agent 很实际,因为审查对象从最终 diff 前移到了执行意图。

    Trending2026-06-07github.com原文 ↗
    –
  • openai/plugins

    openai/plugins 是 Codex plugin 示例集合,包含 manifest、skills、MCP、hooks 等结构。它的实用性在于给插件作者一组最小可运行骨架,减少从空目录摸索 manifest 规则。对想扩展 Codex 的开发者,这比零散文档更容易上手。

    Trending2026-06-07github.com原文 ↗
    –
  • microsoft/agent-framework

    Microsoft Agent Framework 支持用 Python 和 .NET 构建、编排、部署 AI agents 与 multi-agent workflows。它覆盖企业常见的跨语言栈,并天然靠近 Microsoft 云和开发工具生态。对于组织内部 agent 平台,官方框架的治理、部署和兼容承诺可能比单点功能更重要。

    Trending2026-06-07github.com原文 ↗
    –
  • micropython-wasm 0.1a2

    micropython-wasm 0.1a2 给这个 WASM MicroPython 包加入 CLI。这个小版本让沙箱不只作为库被嵌入,也能在命令行直接试运行和复现实验。对安全工具而言,CLI 常常是最短的验证路径。

    Blog2026-06-07simonwillison.net原文 ↗
    –
  • Sidekick

    zot-sidekick 是 macOS menu bar app,用于从系统任意位置快速启动和管理 zot coding agent。项目的技术含量不在模型能力,而在把 agent 常驻化、桌面化。对频繁使用 zot 的开发者,少一次终端定位和命令输入就是实际工作流收益。

    Project2026-06-07github.com原文 ↗
    –
  • Running Python code in a sandbox with MicroPython and WASM

    Simon Willison 用 MicroPython、WebAssembly 和 wasmtime 做 Python 执行沙箱,并把它用于 Datasette Agent 的代码执行插件。实现细节包括持久 interpreter state、host function 队列、可选择暴露的宿主函数,以及约 362KB 的 WASM blob。文章的价值在于把“让 agent 跑代码”拆成内存、C…

    Blog2026-06-07simonwillison.net原文 ↗
    –
  • Open Code Review

    Open Code Review 是一个 AI-powered code review CLI 工具。它把 review 放在命令行而不是托管平台评论区,适合本地预审、提交前检查或 CI 前的快速反馈。真正的判断点会是它能否给出可定位、可执行的问题,而不是泛泛解释 diff。

    Project2026-06-07shaping.systems原文 ↗
    –
  • Nanocode CLI

    Nanocode 是轻量 terminal-based AI coding assistant。项目定位避开大型 IDE 插件和复杂 orchestrator,偏向在命令行内快速提问、编辑和生成代码。它的吸引力取决于启动速度、上下文选择和 diff 控制是否足够顺手。

    Project2026-06-07github.com原文 ↗
    –
  • Jeju

    Jeju 是 local-first agent harness,让开发者用配置定义 agent 行为、设置严格边界并检查每个 effect。README 还强调用 evaluation evidence 改进 agent,这使它更接近可审计运行环境。它适合把一次性 agent prompt 变成可复跑、可比较的工程流程。

    Project2026-06-07github.com原文 ↗
    –
  • CopilotKit

    CopilotKit 定位为 agents 与 generative UI 的前端栈,覆盖 React、Angular、Mobile、Slack 等入口,并维护 AG-UI Protocol。它解决的是 agent 应用的 UI 层协议、共享状态和 human-in-the-loop workflow。随着 agent 从聊天框进入产品界面,这类前端基础设施会变得比 prompt 示例更关键。

    Trending2026-06-07github.com原文 ↗
    –
  • CCC

    Claude Command Center 是 local-first dashboard,用一个浏览器标签页并排管理 Claude Code、Codex、Gemini CLI 等 session。README 标题强调 spawn、resume、review,说明它把 agent 当作可并行调度的本地进程组。它适合多模型、多项目并行时减少终端窗口和上下文切换。

    Project2026-06-07github.com原文 ↗
    –
  • Akmon

    Akmon 给 AI agent session 加上 tamper-evident evidence 与离线验证层。README 强调只用 openssl 即可验证,不依赖云服务或平台锁定。它针对的是 agent 审计的证据链问题:事后证明某个动作、输出或轨迹没有被改写。

    Project2026-06-07github.com原文 ↗
    –
  • graykode/abtop

    abtop 把 btop 风格监控带到 AI coding agents:它展示 token usage、context window utilization、rate limits、child processes、open ports 和 git stats。随着 agent 长时间运行,监控对象从 CPU/内存扩展到上下文窗口、成本、子进程和端口占用,这是很实际的运维层补齐。

    Trending2026-06-05github.com原文 ↗
    –
  • datawhalechina/hello-agents

    Hello-Agents 是 Datawhale 的中文 agent 教程,定位为从原理到实践的系统学习材料。它面向“真正的 AI Native Agent”构建,而不是只讲 prompt;在中文生态中,这类开源教程能降低 agent 架构、工具调用和多智能体实践的入门成本。

    Trending2026-06-05github.com原文 ↗
    –
  • anthropics/claude-code

    Claude Code 是 Anthropic 的终端内 agentic coding tool:它读取代码库、编辑文件、执行命令,并通过自然语言处理 git workflow。与 autocomplete 不同,它是完整开发任务执行器,因此权限、沙箱、日志和 review 流程都成了产品核心,而不只是模型能力展示。

    Trending2026-06-05始 2026-05-30github.com原文 ↗
    –
  • aaif-goose/goose

    Goose 是 AAIF 下的开源 AI agent,提供 Desktop、CLI 和 API 形态。官方文档称它可自动化软件开发任务,并通过工具/扩展连接本地工作流;在 agent 标准化背景下,Goose 的意义还包括把 Block 原项目迁入 Linux Foundation 生态。

    Trending2026-06-05github.com原文 ↗
    –
  • The ways we contain Claude across products

    Anthropic 这篇工程文把 agent 安全从“模型拒绝”拉回环境边界:gVisor 容器、devcontainer、VM、文件系统和 egress 控制才是限制 blast radius 的硬约束。文中给出两个有用数字:用户会批准约 93% 的 Claude Code 权限提示,而 Claude Code auto mode 在执行前能捕获约 83% 的 overeager behavio…

    News2026-06-05anthropic.com原文 ↗
    –
  • Lookspan

    Lookspan 做 local-first agent observability,目标是查看 AI agent 的运行轨迹,而不是托管到第三方监控平台。这个方向的实用性在于 agent 失败通常发生在中间步骤:有本地 trace 浏览、事件序列和上下文记录,才能复盘工具调用链。

    Project2026-06-05github.com原文 ↗
    –
  • Boxes.dev

    Boxes.dev 把每个 Codex 或 Claude Code 线程放到一台独立云 VM 中,而不是只给一个 worktree。项目页强调 fork 已有开发环境、保留服务/端口/数据库状态、支持移动端接管和定时任务;它解决的是并行 agent 的隔离、持久运行和远程控制问题。

    Project2026-06-05boxes.dev原文 ↗
    –
  • AgentKitten

    AgentKitten 是面向 Apple 平台的 Swift agent 框架,设计目标是 provider-agnostic:同一套 agent 代码可接不同模型供应商。Swift Package Index 显示它有 7 个 library、1 个 macro、Apache 2.0 许可,并通过 Swift 并发相关的数据竞争检查;这使它更像原生应用侧 agent SDK,而不是 Web 后…

    Project2026-06-05github.com原文 ↗
    –
  • Agent libOS: A Library-OS-Inspired Runtime for Long-Running, Capability-Controlled LLM Agents

    Agent libOS 将 LLM agent 的长期执行抽象成 library OS:运行时负责状态持久化、能力授权、恢复、审计和副作用边界。它的贡献不在单个模型能力,而在把权限和执行生命周期放到 runtime 里讨论,适合那些会跨天运行、写文件、调 API、积累状态的 agent。

    Paper2026-06-05始 2026-06-04arxiv.org原文 ↗
    –
  • nanocoai/nanoclaw

    NanoClaw 是轻量 OpenClaw 替代项目,把 agents 跑在容器里并连接 WhatsApp、Telegram、Discord、Slack、Teams、iMessage、Matrix、Google Chat、Webex、Linear、GitHub、WeChat 和 email。README 摘要称它基于 Anthropic Claude Agent SDK,凭证不进入容器,而是通过…

    Trending2026-06-04github.com原文 ↗
    –
  • micropython-wasm 0.1a1

    micropython-wasm 0.1a1 是 Simon Willison 为 sandbox 实验推进的 alpha 更新,digest 指出它修复了先前限制。MicroPython + WASM 的组合使浏览器或受限 runtime 中运行 Python 片段更可控。它与 datasette-agent-micropython 一起构成了 agent 安全执行小工具链。

    Blog2026-06-04simonwillison.net原文 ↗
    –
  • datasette-agent-micropython 0.1a0

    Simon Willison 发布 Datasette Agent 的 MicroPython sandbox alpha,用 WASM 执行 Python 代码。这个方向把 agent 可运行代码限制在更小、更可控的解释器环境里,适合数据分析和插件实验。它的关键不是性能,而是用 WASM sandbox 给 agent 代码执行提供边界。

    Blog2026-06-04simonwillison.net原文 ↗
    –
  • Viewport

    Viewport 是本地 AI agent 监控界面,用于观察 agent 运行状态和活动。digest 没给出更细的实现细节,项目定位接近 agent session dashboard:把原本散在终端、日志和工具输出里的状态集中起来。对于多 agent 或长任务,关键不是再加一个模型,而是让人能及时看到当前步骤、阻塞点和输出。它可以归入 agent observability 的轻量工具层。

    Project2026-06-04github.com原文 ↗
    –
  • Self-hosted dev sandboxes with preview URLs

    该项目提供自托管开发沙箱:每个沙箱是带 shell、Node、Python、git 和常用工具的 Docker 容器,并自动获得 HTTPS preview URL。公开说明强调它不依赖 Kubernetes,而是 Go control plane、SQLite state 和 Traefik 路由;沙箱 idle 时停止,下一次 HTTP 请求唤醒,workspace 可跨停止和重启持久化。安全…

    Project2026-06-04github.com原文 ↗
    –
  • Paseo

    Paseo 是 coding agent interface,支持从手机、桌面和 CLI 管理 Claude Code、Codex、Copilot、OpenCode 和 Pi agents。README 摘要显示它运行本地 daemon,负责 agent process orchestration、WebSocket API 和 MCP server;CLI 可安装为 @getpaseo/cli。…

    Project2026-06-04github.com原文 ↗
    –
  • NVIDIA/OpenShell

    OpenShell 是 NVIDIA 面向 autonomous AI agents 的安全、私有 runtime。README 摘要称它通过 sandboxed execution environments 保护数据、凭证和基础设施,并用 declarative YAML policies 阻止未授权文件访问、数据外泄和 uncontrolled network activity。NVIDIA…

    Trending2026-06-04github.com原文 ↗
    –
  • Microsoft Build: MAI-Thinking-1 and MAI Family models, Surface RTX Spark Dev Box, and OpenClaw in Windows

    smol.ai 汇总 Microsoft Build 上 MAI-Thinking-1、MAI family models、Surface RTX Spark Dev Box 和 Windows agent 生态发布。它把模型、开发硬件和 OpenClaw/Windows agent 集成放在同一脉络里,说明 Microsoft 的路线不只是发布模型,而是补齐本地开发、agent runtime…

    Blog2026-06-04news.smol.ai原文 ↗
    –
  • LiteHarness

    LiteHarness 用单一 SDK 调用 Claude Agent、OpenAI Agent、Pi AI 等 coding-agent harnesses。相邻 LiteLLM Agent Platform 文档显示该生态关注让 coding agents 在隔离沙箱中运行,并通过 vault/proxy 避免真实密钥暴露给 agent。LiteHarness 的意义在于把不同 harness…

    Project2026-06-04github.com原文 ↗
    –
  • zeroclaw-labs/zeroclaw

    Rust 写的本地 personal AI assistant runtime。

    Trending2026-06-03github.com原文 ↗
    –
  • can1357/oh-my-pi

    终端 AI coding agent,集成编辑、LSP、浏览器、子 agent 和多 provider。

    Trending2026-06-03github.com原文 ↗
    –
  • Parley

    本地 TUI 代码审查工具,支持与 Codex、Claude、OpenCode 等 agent harness 协作。

    Project2026-06-03parley.cloudflavor.io原文 ↗
    –
  • Jabsco

    通过 RDP 管理远程桌面和测试 VM 的 agent harness。

    Project2026-06-03github.com原文 ↗
    –
  • Holo3.1: Fast & Local Computer Use Agents

    Hugging Face 博客介绍 Holo3.1,本地运行的 computer-use agent 系列,强调速度、本地部署和桌面/浏览器操作能力。它把 computer-use agent 放在低延迟与隐私需求中,而不是完全依赖远程托管模型。值得看的是,本地 agent 若能保持可用性,会改变 GUI 自动化的部署边界。

    Blog2026-06-03huggingface.co原文 ↗
    –
  • Clor

    面向 coding agent 的运行与托管平台,围绕 agent 执行环境和安全模型构建。

    Project2026-06-03clor.com原文 ↗
    –
  • AlexsJones/llmfit

    根据本地硬件评估可运行 LLM 模型与 provider 的命令行工具。

    Trending2026-06-03github.com原文 ↗
    –
  • mattpocock/sandcastle

    Sandcastle 是 TypeScript library,用 `sandcastle.run()` 编排 AI coding agents 在 isolated sandboxes 中工作。它 provider-agnostic,内置 Docker、Podman、Vercel Firecracker microVMs,也可自定义 provider;负责 branch strategy、运行…

    Trending2026-06-02始 2026-06-01github.com原文 ↗
    –
  • iii-hq/iii

    iii 是用于实时组合、扩展和观测后端服务的开发框架。README 的核心模型是 Worker、Function、Trigger:API 服务、数据 pipeline、Rust microservice 或 agent capability 都注册为 worker,系统负责路由、序列化、触发和 catalog 通知。它把 agent 添加能力、发现函数、调用工具和追踪执行统一到开发者也使用的运行时…

    Trending2026-06-02github.com原文 ↗
    –
  • golemcloud/golem

    Golem 是用 WebAssembly components 构建 distributed applications 和 agents 的平台。README 称其服务可在分布式 cloud environment 运行 Wasm components,并支持 Rust、TypeScript、Scala、MoonBit;项目定位为 agent-native platform,强调 never lo…

    Trending2026-06-02始 2026-06-01github.com原文 ↗
    –
  • Vmette

    vmette 是 macOS 本地 Linux microVM sandbox,基于 Apple Virtualization.framework,为不可信本地 AI agents 提供硬件隔离边界。它默认无 host filesystem、无网络,只有显式共享目录和开启 egress 才可访问;每次运行 fresh guest,约 1 秒启动,并提供 CLI、Rust/C ABI、daemon…

    Project2026-06-02github.com原文 ↗
    –
  • TraceGraph: Shared Decision Landscapes for Diagnosing and Improving Agent Trajectories

    TraceGraph 把多模型 agent rollout 池化成任务级行动-观察图,再标出 productive cores、trap regions,并用 Access、Trap exposure、Repair 描述轨迹。它在五个 benchmark split 上显示单一 pass rate 隐藏了模型如何进入陷阱和如何修复。SWE-bench 上 trap-aware recovery 在…

    Paper2026-06-02始 2026-06-01arxiv.org原文 ↗
    –
  • Ministry of Everything

    Ministry of Everything 是 CLI-first agent harness,让单个操作者用 durable markdown documents 驱动 Claude Code 或 Codex。每个阶段产出 canvas,后续阶段可读而无需重放整个 chat;所有 turn 提交到个人 Git journal,可 resume、revert、audit 和 reuse。它没有后…

    Project2026-06-02github.com原文 ↗
    –
  • From Model Scaling to System Scaling: Scaling the Harness in Agentic AI

    论文主张把 foundation model 外围的 harness 作为 agentic AI 的一等扩展对象,而不是只比较模型权重。它关注上下文构造、工具调用、执行编排、验证与记忆等系统层能力,强调长任务表现常由 harness 决定。价值在于把 agent 评估从“模型分数”推向“模型加执行层”的可复现实验。

    Paper2026-06-02arxiv.org原文 ↗
    –
  • Dataroom

    Dataroom 是面向低预算 GPU 与 Raspberry Pi 的自托管研究 harness。它把研究运行、资源约束和自托管部署放在同一个项目里,目标不是云端大规模训练,而是让小设备也能承担可重复实验工作流。它的价值在于把“研究 harness”从高配服务器迁移到边缘和个人预算环境。

    Project2026-06-02github.com原文 ↗
    –
  • pydantic-monty investigation

    Simon Willison 记录对 Rust 实现 Python sandbox Monty 的调查。digest 指向的关键是 sandbox 的真实边界,而不是“Rust 写的所以安全”这类标签。它值得看作安全阅读样本:把 sandbox 的承诺拆成可执行行为、逃逸面、依赖假设和实际可用范围。

    Blog2026-06-01simonwillison.net原文 ↗
    –
  • Ralphy

    Ralphy 把 Claude Code 包进自主任务队列:先用 plan mode 读代码与研究,写 `plan.md`,再执行、测试、提交并推送到 `ralphy/task-` 分支。它有并发 scheduler、kanban dashboard、worktree isolation、Claude usage-limit backoff、circuit breaker、token cap 和…

    Project2026-06-01github.com原文 ↗
    –
  • Agentpack

    Agentpack 给 Claude Code、Codex、OpenCode 等 coding agent 提供隔离配置层。digest 信息指向的核心问题是:agent CLI 越多,全局配置、项目上下文和工具权限越容易互相污染。这个项目值得看作 agent tooling 的“环境管理”层,把一次性本地配置推进到按项目、按任务可复现的运行单元。

    Project2026-06-01nexo.sh原文 ↗
    –

2026 年 5 月20

  • galilai-group/stable-worldmodel

    stable-worldmodel 给 world model 研究提供从数据采集到 MPC 评估的统一接口。README 的数据格式 benchmark 显示本地 LanceDB 无缓存 4814.8 samples/s,本地 HDF5 无缓存 1416.1 samples/s,video 1330.6 samples/s;存储上 HDF5 43.12GB、LanceDB 13.31GB、vid…

    Trending2026-05-31github.com原文 ↗
    –
  • ai-boost/awesome-harness-engineering

    这个 awesome list 聚焦 AI agent harness engineering,即模型外部的 context、tool interface、planning artifact、verification loop、memory、sandbox 和 orchestration。README 把资源分为 Foundations、Agent Loop、Planning、Context De…

    Trending2026-05-31github.com原文 ↗
    –
  • VT Code - open-source terminal coding agent in Rust

    VT Code 是 Rust 写的终端 coding agent,定位是带 robust shell safety、代码理解和多 provider failover 的本地开发工具。README 列出 GitHub Copilot、OpenAI、Anthropic、Gemini、DeepSeek、OpenRouter、Ollama、LM Studio 等 provider,并支持 skills、f…

    Project2026-05-31github.com原文 ↗
    –
  • Tokentoll, a CI gate for LLM API cost regressions

    tokentoll 是 LLM API 调用成本的 CI gate,静态扫描 Python、JavaScript 和 TypeScript 中的模型调用并在 PR 上给 PASS/WARN/FAIL。README 示例规则包括月度成本增量 250 美元、单 callsite 月成本 100 美元、相对增长 5x,并支持 OpenAI、Anthropic、Google GenAI、LiteLLM、L…

    Project2026-05-31github.com原文 ↗
    –
  • SaladDay/cc-switch-cli

    cc-switch-cli 是跨平台 CLI,用于管理 Claude Code、Codex、Gemini CLI 等 agent 工具的 provider 配置和环境。它的实用点在于把不同 agent CLI 的配置切换、环境变量和 provider 管理集中起来。值得看的是多 agent 工具共存后,配置漂移本身会成为开发环境维护成本。

    Trending2026-05-31github.com原文 ↗
    –
  • How we contain Claude across products

    Simon Willison 摘要 Anthropic 关于 Claude.ai、Claude Code 和 Cowork 沙箱隔离机制的说明。核心看点是同一模型在不同产品里对应不同执行风险,因此需要不同隔离边界、权限模型和环境控制。值得看的是 agent 产品安全不只是模型安全,还包括运行时、文件系统、网络和用户数据边界。

    Blog2026-05-31simonwillison.net原文 ↗
    –
  • GH05TCREW/pentestagent

    PentestAgent 是面向黑盒安全测试、bug bounty 和红队流程的 AI agent 框架。它的核心价值不是替代安全人员,而是把侦察、测试、记录和流程推进包装成 agent 可执行工作流。值得看的是安全测试天然要求权限边界、证据记录和可复现步骤,正好检验 agent harness 是否足够可控。

    Trending2026-05-31github.com原文 ↗
    –
  • ryoppippi/ccusage

    当 agent 使用进入日常开发,token 成本会变成团队运营指标。ccusage 的实用点是统一读取本地日志,不需要登录服务;它也让不同 agent、模型和项目的成本差异可见。

    Trending2026-05-30github.com原文 ↗
    –
  • mastra-ai/mastra

    Mastra 的定位是把 agent 应用开发从 demo 推向工程框架:不仅有 agent 和工具调用,还把 eval、观测和迭代纳入一等功能。TypeScript 生态让它更贴近 Web 产品团队。

    Trending2026-05-30github.com原文 ↗
    –
  • git-ai-project/git-ai

    这个项目的关键是不用“检测”AI 代码,而是在生成时记录来源。它把 AI attribution 变成 Git 原生元数据,适合审计、合规和评估工具效果;需要 agent 集成足够可靠。

    Trending2026-05-30github.com原文 ↗
    –
  • Tiny-vLLM

    它不是又一个包装库,而是把推理服务器关键机制拆成可读课程和源码。适合理解 vLLM 背后的内存与 kernel 工程;若要生产部署,还需要补齐模型覆盖、调度鲁棒性和运维能力。

    Project2026-05-30github.com原文 ↗
    –
  • Claude-code-replay

    这个项目关注的是 agent 开发中的可追溯性:当代码变化来自多轮工具调用时,日志比最终 diff 更能解释意图。它的有效性取决于 Claude Code 日志是否完整记录写入内容和路径。

    Project2026-05-30github.com原文 ↗
    –
  • Claude Code: Everything you can configure that the docs don’t tell you

    这篇文章像一份“源码考古版操作手册”。它最有价值的点是揭示 Claude Code 的控制面比文档更强:hook 可以改写命令、注入上下文、自动批准或阻断操作,这既是扩展能力也是安全责任。

    Blog2026-05-30buildingbetter.tech原文 ↗
    –
  • AISlop

    AISlop 的取舍是明确不用 LLM 做判断,因此可重复、快、适合 CI。它检测的是模式化腐烂,不是语义 bug;最好作为 agent 编辑后的第一层卫生检查,再把剩余问题交给人或更强的 review agent。

    Project2026-05-30github.com原文 ↗
    –
  • langfuse/langfuse

    开源 LLM engineering 平台,提供观测、评估、prompt 管理、数据集和 playground。

    Trending2026-05-29github.com原文 ↗
    –
  • affaan-m/ECC

    ECC 是面向 Claude Code、Codex、Opencode、Cursor 等工具的 agent harness 优化包,仓库包含多平台配置、agents、skills、hooks、commands、rules 和安装器。README 声称插件安装可提供 63 agents、249 skills、79 legacy command shims,并强调不要重复叠加插件和手动安装。

    Trending2026-05-29github.com原文 ↗
    –
  • Various LLM Smells

    一篇整理 LLM 应用中常见工程坏味道的个人技术文章。

    Blog2026-05-29shvbsle.in原文 ↗
    –
  • Hermes Desktop

    它的工程价值在 packaging 而不是重写 agent:把 Python agent、Vue/Koa UI、Electron 更新与平台安装器整合为一个下载物。风险也来自捆绑:上游 hermes-agent、web-ui、Python 版本和补丁链都要持续维护。

    Project2026-05-29github.com原文 ↗
    –
  • Benchmarks are Not Enough: RAMP for Runtime Assessing of Agentic Models in Production Systems

    RAMP 的重点是把 agent 评测从单题正确率移到运行时可观察性:失败传播、恢复行为和资源浪费成为一等指标。它也提示静态 benchmark 高分可能掩盖 serial workflow 中的能力塌陷。

    Paper2026-05-29arxiv.org原文 ↗
    –
  • AG2B

    浏览器端 agent runtime,使用 WebMCP 暴露工具并在前端运行 agent loop。

    Project2026-05-29ag2b.ai原文 ↗
    –