QaRL: Rollout-Aligned Quantization-Aware RL for Fast and Stable Training under Training--Inference Mismatch
QaRL:基于回放对齐的量化感知强化学习用于在训练-推理不匹配下的快速稳定训练
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; City University of Hong Kong(香港城市大学) ; Zhejiang University(浙江大学)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出QaRL,通过对齐训练和回放的量化过程,解决训练-推理不匹配问题,提升训练效率和稳定性,同时保持低比特吞吐量优势。