每日 Harness 开源 · Source
返回本期 · Back to 2026-08-15

论文 · Papers2026-08-15 · Saturday, August 15, 2026

Reduced Matrix Multiplication

arxiv.org原文 ↗

Reduced Matrix Multiplication
Reduced Matrix Multiplication 在矩阵收缩维度上按当前输入挑选高信息切片,以保留率调节算量,不需要重训或额外校准模型。实验从 1B 延伸到 70B,覆盖判别、生成、长上下文和多模态任务,并观察到 attention 通常比 MLP 更可削减;面向 A100 的自定义 kernel 在长序列获得实际运行时收益。后一点很关键,因为输入自适应稀疏若只减少理论 FLOPs,却无法形成规则访存,通常不会转化为端到端速度。
浏览

评论 · Comments