NanoEuler
github.com原文 ↗
NanoEuler 从零实现 GPT-2 风格语言模型,核心不依赖 PyTorch、autograd 或 ML 库,而是手写 forward/backward、byte-level BPE、预训练和 supervised fine-tuning。CUDA 版本包含 cuBLAS matmul、RMSNorm、RoPE、grouped-query attention、手写 tiled FlashAttention、SwiGLU、softmax/cross-entropy 和 AdamW;README 称 FlashAttention 让训练 step 约快 3 倍,GPU 梯度与 CPU reference 校验到约 1e-6。作者也把边界说清楚:约 116M 参数、单 RTX 4070 训练的模型只是 GPT-2-small 气质的文本生成器,不是实用助手。这个项目的实质价值在于工程可解释性,所有参数、梯度、tokenizer、kernel 和 SFT 流程都能逐层读到。
–浏览
评论 · Comments