MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference
MXSens:用于高效大语言模型推理的灵敏度感知混合精度量化
机构 * EPFL(洛桑联邦理工学院) ; Tsinghua University(清华大学) ; MangoBoost Inc.(芒果助推公司) ; Korea University(韩国大学) ; Google DeepMind(谷歌深度思维)
AI总结 研究针对大语言模型推理中4位量化因异常值致精度降的问题,提出MXSens方法,基于列和层灵敏度分配混合尾数比特宽度,无需训练,利用MXINT块结构,在多模型任务中优于现有方法,平衡了量化的准确性与资源效率。