Anthropic Walks Back Policy That Could Have ‘Sabotaged’ AI Researchers Using Claude
simonwillison.net原文 ↗
Simon Willison 摘要 Anthropic 调整 Fable 5 安全策略并让相关 guardrails 可见的事件。它和 TechCrunch 报道互相呼应:Fable/Mythos 级模型需要强防护,但过宽的 cyber guardrails 会让合法安全研究和代码审查 workflow 被误伤。“walks back” 与 “visible guardrails” 两个关键词说明,变化不只是后端策略调参,也涉及用户能否理解为何被拦。模型安全策略若不可见,研究者很难区分自己做错了什么、模型能力不足,还是产品策略在静默降级。
–浏览
评论 · Comments