Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs
以标注为回滚:面向视频多模态大语言模型的高效可扩展强化学习
机构 * Nankai University(南开大学) ; Northwestern Polytechnical University(西北工业大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; NKIARI
专题命中 视觉定位与Grounding :MLLM(summary_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出OraRL算法,将标注作为神谕回滚解耦优势估计,实现高效可扩展的视频MLLM强化学习,在多项视频感知基准上超越现有模型,解码速度大幅提升。
Comments Project page: https://orarl.github.io/