每日 Harness 开源 · Source
返回本期 · Back to 2026-06-17

论文 · Papers2026-06-17 · Wednesday, June 17, 2026

ExpRL: Exploratory RL for LLM Mid-Training

arxiv.org原文 ↗

ExpRL: Exploratory RL for LLM Mid-Training
ExpRL 用 RL-based mid-training 替代部分人工 curated reasoning traces。它把人类参考解隐藏起来,只用于生成 problem-specific grading rubrics;policy 从原 prompt 采样推理轨迹,再由 LLM judge 给 outcome-level 或 process-level dense rewards。论文报告在困难数学推理上优于 SFT、稀疏奖励 GRPO 和 self-distillation,并为后续 sparse-reward RL 提供更好的初始化;贡献在于把“学习推理原语”转成可扩展的探索与评分问题。
浏览

评论 · Comments