MakazhanAlpamys/Soup
github.com原文 ↗
Soup 用单个 YAML 描述模型、数据和训练策略,把微调与后训练收束为一条命令,并通过层在主存与显存间移动实现低显存流式训练。README 报告 RTX 3050 4GB 上 Llama 3.1 8B NF4 占用 3.32GB、约 119.6 token/s,但注明测量早于一次正确性修复且尚未重跑;修复后的发布评测由 0.423 升到 0.731。项目真正值得试验之处是极低硬件门槛,同时这些注释也提醒性能数字必须与同版本正确性结果绑定。
–浏览
评论 · Comments