Dynamic Linear Attention
arxiv.org原文 ↗
Dynamic Linear Attention 试图修补多状态线性注意力的固定合并策略:高信息语义转折处保留高分辨率,稳定区域更激进压缩。它的两个模块分别做 information-aware dynamic state merging 和固定容量 state cache 管理,作者在两类线性注意力模型上预训练,并在 16 个数据集、3 类任务上报告优于 SOTA;看点是把长上下文效率问题转成动态记忆建模问题。
–浏览
评论 · Comments