Fast NF4 dequantization Triton kernel
github.com原文 ↗
这个项目实现了面向 4-bit LLM 推理的 NF4 dequantization Triton kernel。它聚焦低比特推理中的解量化开销,通过自定义 GPU kernel 减少从 NF4 权重还原到计算格式的瓶颈。对推理优化来说,这类小型 kernel 项目很有参考价值,因为性能收益常出现在模型主体之外的内存和格式转换环节。
–浏览
github.com原文 ↗
评论 · Comments