论文导读
线性注意力与RNN模型在长序列处理中具备恒定推理显存优势,但其隐藏状态更新受限于标量衰减,在复杂状态追踪上明显逊色于Transformer。弗莱堡大学联合微软研究院、图宾根大学与洛桑联邦理工学院等机构推出了复数域增量更新架构Complex KDA。该架构仅以线性计算代价成功引入二维旋转机制,在极低推理显存下展现出卓越的上下文长度外推能力。
核心背景与线性机制代数解密
在大语言模型处理超长文本的算力与显存竞赛中,以Kimi等国产模型为代表的线性注意力架构凭借线性的时间开销和极低推理显存吸引了全球目光。然而经典增量更新规则大多局限于一维实数标量衰减,导致隐藏状态矩阵在连续记忆长文本中的多实体位置信息时容易发生特征退化。来自弗莱堡大学、微软研究院、图宾根大学与洛桑联邦理工学院的研究团队联合展开攻关,在数学理论层面首次揭示了复数增量更新的非交换代数本质。
研究团队所提出的Complex KDA架构,核心突破在于将传统模型中单一维度的数值缩放扩展为复数平面上的二维旋转矩阵。数学推导严格证明,单层复数增量更新机制便足以建模三维旋转群SO(3)及其子群,而以往的实数线性注意力往往需要堆叠两层乃至更多网络层才能勉强模拟出类似的状态变换效果。
图:来自弗莱堡大学及合作机构的论文核心研究人员在校园前合影
复数增量更新与状态旋转建模
在标准合成状态追踪以及超长文本语言建模测试中,Complex KDA展现出了强大的结构优势与长度泛化潜力。当评估序列长度从训练时的8K直接外推测试至32K乃至64K时,传统线性模型的困惑度往往迅速发散,而Complex KDA的困惑度曲线却保持极其平稳。模型在大幅节省隐藏状态矩阵维度的同时,对远端实体属性关联的召回率提升了超过15个百分点,完美克服了线性模型的历史遗忘症。
图:欧洲科研团队在学术研讨与线性注意力机制理论推导期间的实景
关键突破与长文本长度外推
更为可贵的是,这一升级并未牺牲线性注意力引以为傲的工程推理效率。由于复数乘法在现代GPU张量核心上可以被高效拆解为成对实数乘加运算,其在端到端训练吞吐量上几乎与标准实数Delta注意力保持一致,推理延迟增加几乎可以忽略不计。
图:引入复数空间旋转机制后的增量更新规则与线性状态追踪链路
未来应用与落地展望
该研究不仅为非Transformer架构的大模型底层设计提供了坚实完备的代数理论支撑,也为构建下一代绿色高效的长文本基础大模型指明了方向。未来随着更多硬件原生复数算子的深度定制优化,基于复数旋转机制的线性模型有望在个人终端超长对话与端侧实时长视频流分析中迎来规模化落地。