NVIDIA-NeMo/Automodel
github.com原文 ↗
AutoModel 在原生 PyTorch Distributed 上提供 LLM/VLM 训练、Hugging Face 兼容与多维并行配方。README 展示 Qwen3.8-2.4T-A95B 的 EP32/PP8 全量微调、Kimi K3 在 256 张 GB200 上训练,以及 276B 总参数、每 token 激活 12B 的模型跑在 64 张 H100 上。它面向的不是单机易用性,而是让超大 MoE 配置仍保留接近 PyTorch 的可改代码路径。
–浏览
评论 · Comments