The Key to Going Linear: Analysis-Driven Transformer Linearization
走向线性的关键:分析驱动的Transformer线性化
机构 * Qualcomm AI Research(高通人工智能研究中心)
AI总结 研究针对因果自注意力二次成本限制长上下文Transformer推理的问题,通过分析状态更新设计,发现softmax原理及近似误差源,引入结构干预,在多模型上扩展线性化方法,提升性能并匹配复杂缓存框架的长上下文检索。
大厂专区
走向线性的关键:分析驱动的Transformer线性化
机构 * Qualcomm AI Research(高通人工智能研究中心)
AI总结 研究针对因果自注意力二次成本限制长上下文Transformer推理的问题,通过分析状态更新设计,发现softmax原理及近似误差源,引入结构干预,在多模型上扩展线性化方法,提升性能并匹配复杂缓存框架的长上下文检索。
FPTQuant:用于大语言模型量化的函数保持变换
机构 * Qualcomm AI Research(高通人工智能研究)
AI总结 研究针对大语言模型推理能耗高问题,提出FPTQuant方法,通过引入三种函数保持变换促进Transformer量化,经训练使模型在量化时保持功能,实现静态INT4量化,有最小开销且速度大幅提升,在精度-速度权衡上表现优异。
Comments Forty-third International Conference on Machine Learning (ICML 2026)