论文导读
Together AI、伊利诺伊大学香槟分校与得克萨斯大学奥斯汀分校提出QATFactory,让没有原生FP4训练单元的H100也能模拟NVFP4和MXFP4量化感知训练。在9B模型的论文设定中,NVFP4准确率达68.9%;框架覆盖8B到230B模型,但结果需按格式、任务和基准分别解读。
量化不该等到训练后才突然发生
常见训练后量化是先用高精度训练,再把权重和激活压到低比特。这一步会引入新误差,而训练过程从未见过它。QATFactory在前向计算中模拟目标格式的量化和反量化,保留可更新的潜在权重,让模型边学边适应误差。最终检查点可直接导出部署格式,减少进入推理后端前的二次有损转换。
图:流程对比显示,训练后转换可能造成准确度损失,而QAT把部署格式纳入训练。
蒸馏与强化学习都带着量化噪声跑
框架包含两条主路。量化感知蒸馏用冻结的BF16教师提供目标;量化感知强化学习让低精度行为者生成轨迹,再更新学习器。模拟量化层同时处理权重和激活,训练结束后可面向vLLM、SGLang和llama.cpp等后端导出。重点不是一个孤立技巧,而是把训练、格式与部署接口连成闭环。
图:架构图把教师蒸馏、低精度行为者和量化矩阵乘放在同一训练框架中。
不同FP4格式不能共用一份处方
NVFP4与MXFP4的分块、尺度和可表示数值并不相同,最佳训练配置也不一样。论文用语言建模、长序列和推理评测比较多个规模,其中9B模型的NVFP4准确率达到68.9%。作者还报告,同等Token下32K长序列训练平均比4K配置高1.9分,说明数据形态也在改变低比特结果,不能只比较位宽。
图:多组曲线比较NVFP4、MXFP4以及权重或权重激活量化,差异随模型而变。
落地要看训练与部署硬件是否真对齐
H100上能模拟训练,并不等于它会以FP4速度执行全部训练算子。实际收益要同时核算训练成本、导出后端、目标GPU吞吐和任务精度。后续若在更多开放检查点上公布端到端复现,才能更准确判断低比特训练是否值得投入。
企业采用时还需要建立格式级验收:同一检查点分别导出NVFP4与MXFP4,在目标服务器上跑真实上下文长度、并发量和业务题集,记录吞吐、首Token延迟、显存与回退率。训练曲线好看却在部署后端发生不支持算子或隐式升精度,收益就会消失。另一个关键是保存高精度基线和可逆导出流程,发现某类推理能力显著下降时,可以定位是训练配方、量化格式还是运行库版本造成,而不是重新训练整个模型。
因此,采购新硬件前应先用现有集群跑一轮可复现的小规模配方,并把模型精度、训练时长和导出兼容性放在同一张验收表里。这样才能区分算法收益与专用算力带来的收益。