Retrofitting Linear Attention into Diffusion Language Models
将线性注意力改造融入扩散语言模型
机构 * Apple(苹果公司) ; Google DeepMind(谷歌DeepMind) ; Harvard University(哈佛大学) ; MIT(麻省理工学院)
AI总结 本文提出分块混合注意力,将其融入预训练dLLM LLaDA~2.1得到LLaDA-Hybrid,在保持基准性能的同时提升解码吞吐量与并发请求支持能力。
大厂专区
将线性注意力改造融入扩散语言模型
机构 * Apple(苹果公司) ; Google DeepMind(谷歌DeepMind) ; Harvard University(哈佛大学) ; MIT(麻省理工学院)
AI总结 本文提出分块混合注意力,将其融入预训练dLLM LLaDA~2.1得到LLaDA-Hybrid,在保持基准性能的同时提升解码吞吐量与并发请求支持能力。