Sparse Growing Transformer: Training-Time Sparse Depth Allocation via Progressive Attention Looping
稀疏增长变换器:通过渐进注意力循环实现训练时稀疏深度分配
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) ; Baidu Inc.(百度公司)
AI总结 本文提出稀疏增长变换器,通过渐进式注意力循环实现训练时的稀疏深度分配,减少计算冗余并提升性能。