Anthropic apologizes for invisible Claude Fable guardrails
theverge.com原文 ↗
The Verge 报道 Anthropic 就 Claude Fable 5 的不可见 guardrails 道歉,争议集中在模型遇到 distillation 等高风险查询时会静默改变行为。报道指出 Anthropic 将改为更透明地提示安全机制,并在部分高风险场景 fallback 到 Claude Opus 4.8。这里的行业信号是:能力限制如果不可见,会直接伤害研究可重复性和开发者对模型行为的信任。
–浏览
评论 · Comments