每日 Harness 开源 · Source
返回本期 · Back to 2026-06-12

博客文章 · Blog Posts2026-06-12 · Friday, June 12, 2026

Anthropic Walks Back Policy That Could Have ‘Sabotaged’ AI Researchers Using Claude

simonwillison.net原文 ↗

Anthropic Walks Back Policy That Could Have ‘Sabotaged’ AI Researchers Using Claude
Simon Willison 摘要 Anthropic 调整 Fable 5 安全策略并让相关 guardrails 可见的事件。它和 TechCrunch 报道互相呼应:Fable/Mythos 级模型需要强防护,但过宽的 cyber guardrails 会让合法安全研究和代码审查 workflow 被误伤。“walks back” 与 “visible guardrails” 两个关键词说明,变化不只是后端策略调参,也涉及用户能否理解为何被拦。模型安全策略若不可见,研究者很难区分自己做错了什么、模型能力不足,还是产品策略在静默降级。
浏览

评论 · Comments