FPTQuant: Function-Preserving Transforms for LLM Quantization
FPTQuant:用于大语言模型量化的函数保持变换
机构 * Qualcomm AI Research(高通人工智能研究)
AI总结 研究针对大语言模型推理能耗高问题,提出FPTQuant方法,通过引入三种函数保持变换促进Transformer量化,经训练使模型在量化时保持功能,实现静态INT4量化,有最小开销且速度大幅提升,在精度-速度权衡上表现优异。
Comments Forty-third International Conference on Machine Learning (ICML 2026)