Hugging Face open-r1 是 DeepSeek-R1 的开放复现实验仓库,包含 SFT、GRPO 和 synthetic data generation 脚本,并用 Makefile 串起训练、生成、评测流程。项目计划按三步推进:复现 R1-Distill、复现 R1-Zero 的纯 RL 管线、展示 base model 到 RL-tuned 的多阶段训练。README 记录 Step 1 已发布 Mixture-of-Thoughts,包含 350k verified reasoning traces,另有 10k CodeForces problems 和 100k solutions 的蒸馏数据。它的工程价值在于把“复现 reasoning model”拆成可执行 recipes,而不是只发布权重或论文。
–浏览
评论 · Comments