NanoRL
github.com原文 ↗
nanoRL 用约 1,800 行、7 个文件把 CartPole 教学实验和 GPU 集群异步 RLVR 放进一套 loop,明确不依赖 Ray、TRL、DeepSpeed。REINFORCE、PPO、GRPO、RLOO 只通过 advantage 计算区分,统一更新式是 advantage 与 logprob 的均值,适合读代码而不是当黑盒包导入。
–浏览
github.com原文 ↗
评论 · Comments