每日 Harness 开源 · Source
返回本期 · Back to 2026-06-13

论文 · Papers2026-06-13 · Saturday, June 13, 2026

ReSum

arxiv.org原文 ↗

ReSum
ReSum 处理 RLVR 长推理中的上下文预算问题:模型不是无限拉长 rollout,而是在推理中主动自总结并重组轨迹。它用 summarization-aware adaptive rollout 构造对比分支,比较有无总结短语时的轨迹收益;实验报告平均性能提升 4%,rollout length 降低 18.6%。这篇论文的看点是把 summarization 变成强化学习中的可奖励行为,而非外部压缩器。
浏览

评论 · Comments