PrimeIntellect-ai/prime-rl
github.com原文 ↗
PRIME-RL 是面向大规模 agentic RL 的异步训练框架。README 标出 fully asynchronous RL,并给出规模目标:支持 1000+ GPUs,以及用 FSDP2 等机制训练 1T+ MoE models。它的关注点不在单个环境奖励函数,而在大规模 RL 训练的吞吐、调度和工程可改性。
–浏览
github.com原文 ↗
评论 · Comments