每日 Harness 开源 · Source
返回本期 · Back to 2026-06-19

论文 · Papers2026-06-19 · Friday, June 19, 2026

STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability

arxiv.org原文 ↗

STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability
STARE 分析 GRPO 的 token 级熵动态,指出 trajectory-level advantage 与 token surprisal 之间存在四象限结构和近临界现象。方法用 batch 内 surprisal quantile 选出熵关键 token,重加权其 advantage,并用 target-entropy gate 做闭环控制。实验跨 1.5B 到 32B、短 CoT、长 CoT 和多轮工具任务,在 AIME24/25 上比 DAPO 等强基线平均高 4%-8%。
浏览

评论 · Comments