返回本期 · Back to 2026-08-06 GitHub 热门 · GitHub Trending2026-08-06 · Thursday, August 6, 2026 NovaSky-AI/SkyRL github.com原文 ↗ Agent RL / 可验证奖励合成数据与训练环境框架与脚手架其他垂直 SkyRL 把强化学习训练、推理后端、长时程代理和 Gym 环境组成模块化全栈,既能用自有硬件,也能接 Tinker API,任务覆盖数学、代码、搜索和 SQL。README 记录过仅用 653 个样本训练小型推理模型的早期实验。比单一 PPO 脚本更有用的是,它让算法、rollout 后端和交互环境可以分别替换,便于定位收益究竟来自哪一层。 –浏览 –点赞 复制链接 评论 · Comments
评论 · Comments