每日 Harness 开源 · Source
返回本期 · Back to 2026-06-26

论文 · Papers2026-06-26 · Friday, June 26, 2026

Do Thinking Tokens Help with Safety?

arxiv.org原文 ↗

Do Thinking Tokens Help with Safety?
这篇挑战了“thinking tokens 会自然带来更安全 deliberation”的直觉。跨 GPT-OSS、Qwen、Olmo、Phi 等 open-weight reasoning model,第一 token 的隐藏表示已经能预测最终拒答/遵从,AUROC 0.84-0.95、balanced accuracy 约 88%;最终结果在前约 20% thinking 后很少改变。论文还指出约 74% 文本层面的 deliberation 发生时,分布已经锁到一侧,这让许多 safety CoT 解释更像事后补全。
浏览

评论 · Comments