主题 · Topic
6.2 执行环境与沙箱Execution & Sandboxing
本主题共 59 条 · 最早 2026-05-31 · 最新 2026-07-25
2026 年 7 月18
-
citrolabs/ego-lite
Ego Lite 把普通用户标签页与 Agent 自动化任务隔离到不同浏览空间,减少自动点击、导航和凭据访问对日常浏览的干扰。它以浏览器容器化思路划分状态,而不是让 Agent 直接接管主会话。隔离能降低误操作半径,但如果两个空间共享下载目录、扩展或系统密钥,仍需继续收紧边界。
原文 ↗– -
AgentCgroup: Understanding and Controlling OS Resources of AI Agents
AgentCgroup 通过观测沙箱化编码 Agent 的 CPU、内存、进程树和 I/O 波动,研究自主任务如何在操作系统层面形成突发资源需求。系统借鉴 cgroup 的隔离与配额机制,为多租户 Agent 提供按会话控制、动态限额和异常终止能力。它把 Agent 可靠性问题落到传统资源治理层,尤其适用于同机并发运行大量工具型任务的环境。
原文 ↗– -
Pullrun
Pullrun 让同一个 OCI 镜像既能由普通容器运行时启动,也能被转换并放进 Firecracker microVM,减少为两种隔离级别维护两套制品。项目处理镜像拉取、rootfs 和 microVM 启动编排,使开发环境与更强隔离的生产执行共享 artifact;这对运行不可信作业或 agent 工具尤其有吸引力。
原文 ↗– -
Superserve
Superserve 用 Firecracker microVM 承载长时间运行的 AI agent,为每个任务提供隔离文件系统、进程和网络边界。产品定位覆盖按需创建、暂停与恢复执行环境,让代理可以跨小时或跨天保留工作状态。相比普通容器,microVM 提供更强隔离,但启动、镜像分发和状态持久化是平台需要解决的核心成本。
原文 ↗– -
Serve-avd
Serve-avd 把 Android 模拟器变成可远程操作的浏览器目标:`adb screenrecord` 产生 H.264 流,WebCodecs 解码,旧环境回退到 MJPEG,输入控制经 WebSocket 回传。它无需 root、应用插件或 instrumentation,就能提供点击、拖动、键盘、导航键、旋转与截图,特别适合让代理或远程 CI 观察移动应用。代价是视频流和 adb 注…
原文 ↗– -
Byre
Byre 用一个本地容器包住项目目录,让代理保留编译器、编辑器和常用工具,同时默认接触不到主机其余文件。`byre develop` 可作用于项目、worktree 或 scratch 目录,单二进制覆盖 Linux 与 macOS,目标是在“能正常开发”和“最小主机权限”之间取得实用平衡。它比云沙箱更便于本地迭代,不过边界强度最终取决于容器运行时、挂载和显式放行的能力。
原文 ↗– -
Spoold - Durable curl without a database or broker
spoold 是本地 daemon 版 durable curl:提交端把 HTTP delivery 写入磁盘 journal 后即可返回,投递、重试和恢复由后台进程负责。它的 reliability boundary 是一个自包含 daemon 加 owner-only journal,不依赖 PostgreSQL、Redis、Kafka、云账户或语言 SDK。README 列出 append…
原文 ↗– -
Agent-run
Agent-run 在隔离沙箱中运行 coding agent,给模型执行命令和改写代码设置更清晰的环境边界。它面向的是代理真正落地时的工程问题:依赖安装、文件修改、外部命令和潜在副作用都需要可控空间。与单纯 prompt 约束相比,沙箱提供的是运行时层面的风险收敛。
原文 ↗– -
TencentCloud/CubeSandbox
CubeSandbox 是 TencentCloud 开源的 AI agent sandbox service,底层基于 RustVMM 和 KVM,强调 hardware-isolated、E2B-compatible 和高并发。README 称它支持单节点和多节点部署,可在 60ms 内创建 fully serviceable sandbox,单实例内存 overhead 小于 5MB;Git…
原文 ↗– -
Tarit - Self-host sandbox cloud and hypervisor for AI agents
Tarit 是面向 AI agent 和 RL environment 的 microVM sandbox cloud,底层是 rust-vmm/KVM,仓库分成 `vmm/` 和 orchestrator `orch/` 两层。`taritd` 负责 multi-node placement、warm pools、networking、snapshots、SSH/PTY access、per-k…
原文 ↗– -
Fortress - a stealth Chromium so your agents stop getting blocked
Fortress 是一个 Chromium fork,目标是让 scraper 和 browser agent 通过 CDP 连接后减少自动化指纹被拦截。它不是在页面层注入 JavaScript stealth patch,而是在 Chromium C++ 内部修正 canvas、WebGL、audio、fonts、navigator 等约 30 个 detector surface;README…
原文 ↗– -
CLRK, an open-source agent runtime with gVisor and MitM guardrails
CLRK 是框架无关的 agent runtime,重点是把执行隔离、网络策略和观测能力从上层 agent 框架中抽出来。README 中最具体的组合是 gVisor 沙箱加中间人式网络 guardrail,可以在 agent 跑代码、访问网页或调用工具时施加边界。它的看点不是再做一个 agent SDK,而是补 runtime 层的安全和治理空缺。
原文 ↗– -
Building Agents That Don't Break Themselves
Fly.io 文章给 agent 工程一个清晰拆分:agent loop 可以长期存在并保留记忆,但执行 shell 命令的地方应该是可丢弃 sandbox。文中两个例子都用 Sprite,把每个 session 或 task 的命令放进隔离环境;危险命令不再靠“确认提示”防主机,而是靠主机不在攻击面里。最具体的演示是 agent 错删应用目录和 git/python 后,用 checkpoint…
原文 ↗– -
Tinysandbox
Tinysandbox 用 QuickJS WASM isolates 运行 JavaScript,README 给出的单个 sandbox 内存量级约为 17.5MB,并支持虚拟文件系统、checkpoint、restore、stdout 流式输出和受控 IO。它面向高并发 agent fanout,不走完整容器路线,而是用更小的 isolate 承载短生命周期代码执行。具体可取之处在于 che…
原文 ↗– -
Matrix, an open-source cloud computer for coding agents
Matrix OS 把 Claude、Codex、Cursor、OpenCode、Pi、Gemini CLI 等 coding agents 放到一台持久运行的私有云电脑里,提供终端、repo、preview、文件和 workflow。页面把 Symphony 定义为 orchestration layer:并行 sessions、task queues、terminal runs、preview…
原文 ↗– -
Managed Autonomy at Runtime: Gear-Based Safety and Governance for Single- and Multi-Agent Cyber-Physical Systems
论文设计了五档 execution gears、utility-gated dispatch 和 event-driven fallback,把 LLM 软件 agent 与机器人 CPS 的自治控制放在统一运行时里处理。多 agent 场景中,它把 runtime evidence 映射到 SMART lifecycle 的四个治理状态,并用 consensus gating、swarm-lev…
原文 ↗– -
Z-Jail
Z-Jail 是约 130 KiB 的 C99 Linux sandbox,用 namespaces、pivot_root、capability dropping、NO_NEW_PRIVS、seccomp-BPF、audit JSON 和 BLAKE2b hashing 叠出多层隔离。README 的 syscall whitelist-v1 只有 15 个 syscall,且强调无外部依赖、单…
原文 ↗– -
TakoVM
TakoVM 是给 agents 执行代码的自托管 runtime,组合 ephemeral Docker workspace、job queue、execution history、retry、replay/fork debugging 和 REST/Python SDK。安全层面,README 写明每个 job 单独 container,默认无网络,可选 gVisor、default-deny…
原文 ↗–
2026 年 6 月40
-
rivet-dev/agentos
AgentOS 是用于在隔离 Linux VM 中运行 coding agents 的轻量 agent 操作系统,仓库描述称其是 sandboxes 的更快、更轻、更便宜替代,并内置 agent orchestration。它把 agent execution environment 当作核心产品,而不是附属脚本。这个方向的关键在于并行任务、可丢弃环境、文件系统隔离和安全执行;coding age…
原文 ↗– -
Claude-CLI
claude-cli 是一个 shell wrapper,把 Claude Code 放进 Docker 容器运行,同时保留宿主机上的 Claude 配置和会话。README 支持 no-dir、current-dir、single-dir、multi-dir 模式;多目录模式会 mount 多个目录并把第一个设为容器工作目录,适合跨仓库任务。配置持久化通过 bind-mount `~/.clau…
原文 ↗– -
Adrafinil
Adrafinil 是一个 macOS 工具,把“保持唤醒”限定在 AI coding agent 正在跑任务的窗口内。它处理的是一个很具体的移动办公痛点:合盖会让 Mac 睡眠并中断 agent,但全局常亮工具又容易忘记关闭。这个项目的看点不是复杂算法,而是把电源管理和 agent 工作状态绑定成一个更窄的自动化条件。
原文 ↗– -
ZeroGate - API gateway to scale cloud GPUs to zero when idle
ZeroGate 是事件驱动的 GPU orchestration fabric,位于 application gateway 与底层硬件提供商之间,处理 vLLM 多租户推理的排队、扩容、闲置回收和计费记录。README 描述 Redis distributed locks、Kafka gateway、PostgreSQL billing ledger、本地 mock mode、simulato…
原文 ↗– -
Temporary Cloudflare Accounts for AI agents
Simon Willison 记录 Cloudflare Workers 的临时账号部署能力及其实际用途。核心点是给 AI agents 可撤销、生命周期有限的部署身份,而不是把长期账户或高权限 token 交给 agent。这样的账户模型把权限边界嵌入平台流程,适合自动化部署、演示环境和短期实验。
原文 ↗– -
Temporary Cloudflare Accounts for AI Agents
Cloudflare 把 agent 部署里的账号注册和 OAuth 摩擦降成一个短生命周期账号机制:`wrangler deploy --temporary` 会创建临时 Cloudflare account、给 Wrangler 一个 API token,并返回可交给人的 claim URL。文章给出的硬边界是部署默认存活 60 分钟,期间用户可以认领为永久账号,否则自动过期。这个发布反映出平…
原文 ↗– -
Cordium
Cordium 把 sandbox 和基础设施访问控制放到同一个平台里:Workspace 是 Kubernetes 上的 rootless container sandbox,可用于远程开发、agent task 和 CI/CD workload。README 反复强调的差异点是 secretless access,借 Octelium ZTNA 让 sandbox 内部按身份和策略访问 SSH…
原文 ↗– -
How we run Firecracker VMs inside EC2 and start browsers in less than 1s
Browser-use 解释其在 EC2 内运行 Firecracker VM 并快速启动浏览器沙箱的架构。digest 的关键数字是浏览器启动低于 1 秒,问题域是 agent 浏览器执行环境的隔离、冷启动和吞吐。它对浏览器 agent 基础设施很具体,因为浏览器会话既重又危险,沙箱成本直接影响产品可用性。
原文 ↗– -
Vpod
Vpod 在 WebAssembly 里运行 RV64GC RISC-V 虚拟机,用 snapshot 方式给不可信进程启动一个轻量 Linux 环境;README 明确写到启动目标是 under a second。它通过 WASI 0.2 与宿主通信,文件系统、网络和 stdio 都受控暴露,而 CPU 寄存器、内存和文件系统状态留在 WASM sandbox 内。项目同时提供 CLI 和 Py…
原文 ↗– -
Agentspace
Agentspace 把长时间运行的 Codex 或 Claude Code 任务放进 Docker:每个 task 拥有独立 volume、throwaway container 和 `agent/<repo>/<task>` 分支,用户可 detach/attach,就像 multiplexer,但工作区天然隔离。`spawn` 从当前 repo 推断 origin 和 base branch…
原文 ↗– -
trycua/cua
cua 是 computer-use agents 的基础设施仓库,覆盖 agent-ready sandboxes、background desktop drivers、benchmarks 和 macOS/Linux VM 管理。README 展示同一 API 可控制 Linux、macOS、Windows、Android 或自带镜像,agent 能执行 shell、截图、点击、输入和移动手势…
原文 ↗– -
Running local models is good now
Vicki Boykis 的判断来自实际本地开发使用,而不是单个 leaderboard。她在 2022 M2 Mac、64GB RAM、1TB storage 上试过 Mistral 7B、Gemma、OpenAI OSS-20B、Qwen 3 MoE 等模型和 llama.cpp、Ollama、LM Studio 等栈,认为 Gemma 4 近期让本地 agentic coding 达到约 7…
原文 ↗– -
Manim-Studio
Manim-Studio 走的是 prompt → OpenAI 写 Manim scene → InstaVM 渲染 → MP4 的路线。README 中架构由长驻 FastAPI app、SQLite job store、`/api/jobs` 与 `/poll` 长轮询接口、短生命周期渲染 VM 组成,渲染基础镜像包含 `manim==0.20.1`、cairo、pango 和 ffmpeg…
原文 ↗– -
Bastion
Bastion 面向后台 coding agents 提供隔离 Linux VM,定位在 agent 执行环境而不是代码生成模型本身。digest 给出的关键事实是它把长期运行的编码任务放入独立虚拟机,减少 agent 与开发者主机共享文件系统、凭据和进程空间的风险。它的价值在于把“让 agent 干活”拆成模型能力与运行隔离两层来处理。
原文 ↗– -
Afterburner
Afterburner 把 JavaScript/TypeScript 包装成 `.afb` 包:`afb.toml` 描述包,`manifold.json` 声明能力,源码在 sandbox 内执行。`burn` CLI 能 scaffold、run、test、package、publish,也能通过 agent hook 把 AI 写出的 `node app.js`、`npm test`、`n…
原文 ↗– -
superradcompany/microsandbox
Microsandbox 为 untrusted workloads 提供 fast local microVMs,README 明确列出 AI agents、user code、plugins、CI jobs、dev environments、scrapers 和 automation 等场景。它试图填补进程级隔离和远程沙箱之间的空档:本地启动、延迟低,但边界比普通子进程和容器更硬。随着 age…
原文 ↗– -
pydantic/monty
Monty 是 Pydantic 团队用 Rust 写的最小安全 Python 解释器,目标是执行 LLM 生成的 Python 工具代码,而不启动完整容器。它通过外部函数控制文件系统、网络和环境变量访问,支持 typechecking、资源限制、stdout/stderr 收集、async/sync host calls,以及在外部函数调用点 snapshot 成 bytes 后 resume。…
原文 ↗– -
OpenAI to acquire Ona
OpenAI 宣布计划收购 Ona,交易仍需常规 closing conditions 和监管批准,closing 前双方仍独立运营。OpenAI 表示 Ona 团队将在完成后加入 Codex 团队,推进 secure、persistent enterprise execution capabilities,帮助 Codex 更安全地进入生产工作流。公告列举的目标场景包括运行测试、修复 issue…
原文 ↗– -
hyperlight-dev/hyperlight
Hyperlight 是可嵌入应用的轻量 VMM,用 microVM 低延迟运行不可信代码,也是 CNCF sandbox 项目。README 写明它适合毫秒级创建/销毁 sandbox、微秒级 guest function calls、FaaS 和 snapshot/restore,但不适合通用虚拟化或需要完整 Linux syscalls、网络、文件系统的工作负载。它是 agent 代码执行隔…
原文 ↗– -
microsoft/mxc
Microsoft eXecution Container 是用于运行不可信代码、模型输出、插件和工具的跨平台沙箱系统。README 说它支持 Windows、Linux、macOS,并把 OS-native process sandbox 到 full VM 的 containment backend 放在统一 JSON schema 和 TypeScript SDK 后。仓库当前是 early…
原文 ↗– -
firecracker-microvm/firecracker
Firecracker 是轻量 microVM 技术,用于 serverless 和多租户容器工作负载。仓库描述强调 secure and fast microVMs,它的核心是在 VM 隔离强度和容器级资源效率之间取折中。随着 AI tool execution 和 untrusted code sandbox 需求上升,Firecracker 仍是隔离设计的基准参考。
原文 ↗– -
TakoVM
TakoVM 用 Docker 容器运行不可信 Python,并可叠加 gVisor sandboxing。项目内建 job queue、worker pool、执行历史、重试、idempotency_key、rerun/fork API 和默认无网络策略;安装路径是 `pip install "tako-vm[server]"` 后启动 server,再用 HTTP POST 提交代码。它把“安…
原文 ↗– -
Kyushu
Kyushu 是面向 JavaScript workers 的自托管 WASM sandbox。公开介绍把它拆成 worker 和 runner 两部分,目标是在容器、microVM 之外提供更轻量的隔离执行层。它值得看的是运行边界:把 Web worker 形态的代码放进 WASM 沙箱,适合函数级、插件式或多租户脚本执行。
原文 ↗– -
micropython-wasm 0.1a2
micropython-wasm 0.1a2 给这个 WASM MicroPython 包加入 CLI。这个小版本让沙箱不只作为库被嵌入,也能在命令行直接试运行和复现实验。对安全工具而言,CLI 常常是最短的验证路径。
原文 ↗– -
Running Python code in a sandbox with MicroPython and WASM
Simon Willison 用 MicroPython、WebAssembly 和 wasmtime 做 Python 执行沙箱,并把它用于 Datasette Agent 的代码执行插件。实现细节包括持久 interpreter state、host function 队列、可选择暴露的宿主函数,以及约 362KB 的 WASM blob。文章的价值在于把“让 agent 跑代码”拆成内存、C…
原文 ↗– -
The ways we contain Claude across products
Anthropic 这篇工程文把 agent 安全从“模型拒绝”拉回环境边界:gVisor 容器、devcontainer、VM、文件系统和 egress 控制才是限制 blast radius 的硬约束。文中给出两个有用数字:用户会批准约 93% 的 Claude Code 权限提示,而 Claude Code auto mode 在执行前能捕获约 83% 的 overeager behavio…
原文 ↗– -
Boxes.dev
Boxes.dev 把每个 Codex 或 Claude Code 线程放到一台独立云 VM 中,而不是只给一个 worktree。项目页强调 fork 已有开发环境、保留服务/端口/数据库状态、支持移动端接管和定时任务;它解决的是并行 agent 的隔离、持久运行和远程控制问题。
原文 ↗– -
nanocoai/nanoclaw
NanoClaw 是轻量 OpenClaw 替代项目,把 agents 跑在容器里并连接 WhatsApp、Telegram、Discord、Slack、Teams、iMessage、Matrix、Google Chat、Webex、Linear、GitHub、WeChat 和 email。README 摘要称它基于 Anthropic Claude Agent SDK,凭证不进入容器,而是通过…
原文 ↗– -
micropython-wasm 0.1a1
micropython-wasm 0.1a1 是 Simon Willison 为 sandbox 实验推进的 alpha 更新,digest 指出它修复了先前限制。MicroPython + WASM 的组合使浏览器或受限 runtime 中运行 Python 片段更可控。它与 datasette-agent-micropython 一起构成了 agent 安全执行小工具链。
原文 ↗– -
datasette-agent-micropython 0.1a0
Simon Willison 发布 Datasette Agent 的 MicroPython sandbox alpha,用 WASM 执行 Python 代码。这个方向把 agent 可运行代码限制在更小、更可控的解释器环境里,适合数据分析和插件实验。它的关键不是性能,而是用 WASM sandbox 给 agent 代码执行提供边界。
原文 ↗– -
Self-hosted dev sandboxes with preview URLs
该项目提供自托管开发沙箱:每个沙箱是带 shell、Node、Python、git 和常用工具的 Docker 容器,并自动获得 HTTPS preview URL。公开说明强调它不依赖 Kubernetes,而是 Go control plane、SQLite state 和 Traefik 路由;沙箱 idle 时停止,下一次 HTTP 请求唤醒,workspace 可跨停止和重启持久化。安全…
原文 ↗– -
NVIDIA/OpenShell
OpenShell 是 NVIDIA 面向 autonomous AI agents 的安全、私有 runtime。README 摘要称它通过 sandboxed execution environments 保护数据、凭证和基础设施,并用 declarative YAML policies 阻止未授权文件访问、数据外泄和 uncontrolled network activity。NVIDIA…
原文 ↗– -
Jabsco
通过 RDP 管理远程桌面和测试 VM 的 agent harness。
原文 ↗– -
Holo3.1: Fast & Local Computer Use Agents
Hugging Face 博客介绍 Holo3.1,本地运行的 computer-use agent 系列,强调速度、本地部署和桌面/浏览器操作能力。它把 computer-use agent 放在低延迟与隐私需求中,而不是完全依赖远程托管模型。值得看的是,本地 agent 若能保持可用性,会改变 GUI 自动化的部署边界。
原文 ↗– -
Clor
面向 coding agent 的运行与托管平台,围绕 agent 执行环境和安全模型构建。
原文 ↗– -
AlexsJones/llmfit
根据本地硬件评估可运行 LLM 模型与 provider 的命令行工具。
原文 ↗– -
mattpocock/sandcastle
Sandcastle 是 TypeScript library,用 `sandcastle.run()` 编排 AI coding agents 在 isolated sandboxes 中工作。它 provider-agnostic,内置 Docker、Podman、Vercel Firecracker microVMs,也可自定义 provider;负责 branch strategy、运行…
原文 ↗– -
Vmette
vmette 是 macOS 本地 Linux microVM sandbox,基于 Apple Virtualization.framework,为不可信本地 AI agents 提供硬件隔离边界。它默认无 host filesystem、无网络,只有显式共享目录和开启 egress 才可访问;每次运行 fresh guest,约 1 秒启动,并提供 CLI、Rust/C ABI、daemon…
原文 ↗– -
pydantic-monty investigation
Simon Willison 记录对 Rust 实现 Python sandbox Monty 的调查。digest 指向的关键是 sandbox 的真实边界,而不是“Rust 写的所以安全”这类标签。它值得看作安全阅读样本:把 sandbox 的承诺拆成可执行行为、逃逸面、依赖假设和实际可用范围。
原文 ↗– -
Agentpack
Agentpack 给 Claude Code、Codex、OpenCode 等 coding agent 提供隔离配置层。digest 信息指向的核心问题是:agent CLI 越多,全局配置、项目上下文和工具权限越容易互相污染。这个项目值得看作 agent tooling 的“环境管理”层,把一次性本地配置推进到按项目、按任务可复现的运行单元。
原文 ↗–
2026 年 5 月1
-
How we contain Claude across products
Simon Willison 摘要 Anthropic 关于 Claude.ai、Claude Code 和 Cowork 沙箱隔离机制的说明。核心看点是同一模型在不同产品里对应不同执行风险,因此需要不同隔离边界、权限模型和环境控制。值得看的是 agent 产品安全不只是模型安全,还包括运行时、文件系统、网络和用户数据边界。
原文 ↗–