英特尔中国研究院发布ScaleQ-1.58,把推理大模型权重压缩为三值表示。Qwen3-1.7B版本只使用400万校准Token,在4项数学和代码任务上的平均表现达到BitNet b1.58 2B4T的90.52%以上,量化所需校准Token少约100万倍。
团队把问题定位到传统量化校准忽略了推理过程。模型平时用长思维链解题,量化时却只看短问题或普通文本,低比特权重没有针对真正的推理状态调整。
论文图1:加入推理轨迹的AYOT在五项数学与代码任务上明显高于常规校准。
校准材料改成模型自己的解题过程
ScaleQ使用“关注自身思维”方法。高精度原模型先对校准问题生成推理轨迹和最终答案,三值化时再把问题、推理过程与答案一起作为上下文。量化优化因此看到模型实际推理时的激活分布。
论文图2:左侧校准忽略思维链,右侧AYOT把原模型生成的推理轨迹纳入三值化。
ScaleQ-1.58把AYOT接到已有CAT-Q可微三值化方法上,没有重新训练数万亿Token的低比特模型。论文还报告,Qwen3-4B三值版本相对先前方案平均绝对提高8.97个百分点。
1.58比特模型重新写出了完整步骤
常规校准后的三值模型在复杂数学题上容易跳步、循环或给出错误结果。加入AYOT后,同一Qwen3-4B量化模型能保留更完整的推导结构。这里的1.58比特是三值权重的平均信息表示,运行时还涉及激活精度、算子和硬件支持,不能按文件大小直接换算端到端速度。
论文图3:常规三值化与AYOT版本回答同一复杂数学问题时的推理差异。
实验覆盖稠密模型与混合专家模型,最大规模达到235B参数,也包含数学、代码、科学逻辑、常识和基础语言生成任务。模型越大,三值化后的相对表现整体越好,但各任务损失并不相同。
校准Token继续增加,表现仍在上涨
Qwen3-4B的实验显示,校准Token从较小规模增加时,量化模型准确率继续上升,曲线尚未完全饱和。400万Token是一个突出效率点,不代表继续增加数据毫无价值。
论文图4:更多校准Token继续改善Qwen3-4B三值模型在多个任务上的准确率。
论文比较的是研究基准上的准确率和相对数据量,没有给出所有硬件上的实际吞吐、功耗与延迟。1.58比特权重能否在部署端兑现优势,还取决于三值算子、内存布局和芯片支持。代码仓库已公开,完整工程收益仍需在目标硬件上复测。