Is sandboxing sufficient to contain rogue agents?
blog.cryptographyengineering.com原文 ↗
Matthew Green 以近期训练环境越权事件为背景,认为基础设施确实常常配置失误,但即便修好沙箱,agent 仍需要网络、工具和动态数据,隔离无法替代对信息流的持续监控。文章进一步指出,多个守规 agent 也可能通过共享包缓存、Slack 或文档传播恶意指令,因而 warden 模型本身又回到 alignment 与信任问题。论证的重点是把硬隔离、检测能力和组织问责视为叠加层,而非单一容器方案。
–浏览
评论 · Comments