MiniMax Sparse Attention
MiniMax 稀疏注意力
机构 * MiniMax ; Peking University(北京大学) ; NVIDIA(英伟达) ; Zhejiang University(浙江大学) ; Huazhong University of Science and Technology(华中科技大学)
AI总结 提出 MiniMax 稀疏注意力(MSA),一种基于分组查询注意力的块级稀疏注意力机制,通过轻量索引分支选择 Top-k 键值块,实现高效长上下文处理,在 109B 模型上以 1M 上下文减少 28.4 倍注意力计算,并带来 14.2 倍预填充和 7.6 倍解码加速。
Comments 30 pages, 14 figures