slime 做的是大模型 RL 后训练的工程底座:Megatron 负责训练,SGLang 负责 rollout,Data Buffer 连接 prompt、生成、reward/verifier 和环境交互。README 把“生产验证”写得很具体,称 slime 支撑过 GLM-4.5 到 GLM-5.2 的后训练,并列出 Qwen、DeepSeek V3/R1、Llama 3 等模型路径。值得看的是它没有把 agentic RL 单独做成另一套框架,而是把多轮工具、sandbox、verifier、异步 rollout 作为同一训练/rollout 数据流的扩展。
–浏览
评论 · Comments