论文抓住闭源 API 的架构缺口:服务端把加密推理块交给客户端保存并在后续请求回传,但同一厂商内这些块能跨会话、用户乃至模型互换。攻击者可把强模型的块送给防护较弱的模型,诱使后者逐字吐出明文;作者在 Anthropic、OpenAI 和 Google 上演示了反蒸馏、隐私提取、危险信息泄漏与隐形提示注入四类路径。对公共仓库中 315,320 个 reasoning block 的解码找到 367 项 PII 和 182 份凭据,说明“内容加密”若不绑定主体、模型与会话,仍无法提供隔离。
–浏览
评论 · Comments