Reinforcement Learning for Large Model: A Survey
为大模型设计强化学习:综述
机构 * National University of Singapore(新加坡国立大学) ; Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 评测与基准 :large language model(abstract);language model(abstract);RLHF(abstract)
AI总结 本文综述了视觉强化学习领域,探讨了多模态大语言模型、视觉生成等四个主题,分析了算法设计、奖励工程及评估协议,并指出了样本效率、泛化能力等开放挑战。
Comments 22 pages