Hybrid Linear Attention Done Right: Efficient Distillation and Effective Architectures for Extremely Long Contexts
混合线性注意力的正确实现:用于超长上下文的高效蒸馏和有效架构
机构 * NLP Group, DCST, IAI, Tsinghua University(清华大学自然语言处理组、数据计算技术研究所、人工智能院) ; ModelBest Inc., Beijing, China(ModelBest公司)
AI总结 本文提出HALO流程和HypeNet架构,通过高效蒸馏将Transformer模型转换为RNN-注意力混合模型,实现超长上下文的高性能与高效率。
Comments 20 pages, 8 figures