MiniMax Sparse Attention
arxiv.org原文 ↗
MiniMax Sparse Attention 用一个轻量 Index Branch 为每个 GQA group 选择 Top-k KV blocks,Main Branch 只在被选 block 上做 exact block-sparse attention。论文在 109B 参数原生多模态模型上报告,1M context 下 per-token attention compute 降低 28.4x,配套 kernel 在 H800 上带来 14.2x prefill 和 7.6x decoding wall-clock speedups。它的工程含量在于稀疏策略和 GPU kernel 同设计,而不是只给抽象复杂度。
–浏览
评论 · Comments