Minimizing the Hidden Cost of Scales: Graph-Guided Ultra-Low-Bit Quantization for Large Language Models
最小化缩放因子的隐藏成本:面向大语言模型的图引导超低位量化
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);post-training(abstract)
AI总结 提出SAGE-PTQ框架,通过图引导的显著性感知量化分离显著与非显著权重,实现超低位量化并最小化缩放开销,在LLaMA-3-8B上困惑度降至6.74且内存低于BiLLM的50%。
Comments Preprint. 18 pages, 10 figures, 7 tables, including appendix