LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation
LVRPO:基于GRPO的语言-视觉对齐用于多模态理解和生成
机构 * Department of Machine Learning, CMU, USA(卡内基梅隆大学机器学习系,美国) ; Department of Machine Learning, MBZUAI, UAE(穆罕默德·本·扎耶德人工智能大学机器学习系,阿联酋) ; Department of Artificial Intelligence, Hanyang University ERICA, South Korea(汉阳大学ERICA校区人工智能系,韩国)
专题命中 后训练与偏好优化 :foundation model(abstract);pretraining(abstract);preference optimization(abstract);分类 cs.AI、cs.LG
AI总结 本文提出LVRPO框架,通过GRPO显式对齐语言和视觉表示,提升多模态理解和生成性能,无需辅助编码器或人工目标。