每日 Harness 开源 · Source
返回本期 · Back to 2026-06-13

论文 · Papers2026-06-13 · Saturday, June 13, 2026

MiniMax Sparse Attention

arxiv.org原文 ↗

MiniMax Sparse Attention
MiniMax Sparse Attention 用一个轻量 Index Branch 为每个 GQA group 选择 Top-k KV blocks,Main Branch 只在被选 block 上做 exact block-sparse attention。论文在 109B 参数原生多模态模型上报告,1M context 下 per-token attention compute 降低 28.4x,配套 kernel 在 H800 上带来 14.2x prefill 和 7.6x decoding wall-clock speedups。它的工程含量在于稀疏策略和 GPU kernel 同设计,而不是只给抽象复杂度。
浏览

评论 · Comments