Towards a Unified View of Large Language Model Post-Training
迈向大规模语言模型后训练的统一视角
机构 * Tsinghua University(清华大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; WeChat AI Code(微信AI代码)
专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);large language model(title);SFT(abstract)
AI总结 本文提出混合后训练算法,通过统一的优化过程整合在线与离线数据,实现稳定探索与有效利用演示,提升大规模语言模型的推理能力。