Do Thinking Tokens Help with Safety?
arxiv.org原文 ↗
这篇挑战了“thinking tokens 会自然带来更安全 deliberation”的直觉。跨 GPT-OSS、Qwen、Olmo、Phi 等 open-weight reasoning model,第一 token 的隐藏表示已经能预测最终拒答/遵从,AUROC 0.84-0.95、balanced accuracy 约 88%;最终结果在前约 20% thinking 后很少改变。论文还指出约 74% 文本层面的 deliberation 发生时,分布已经锁到一侧,这让许多 safety CoT 解释更像事后补全。
–浏览
评论 · Comments