Spotlight on Token Perception for Multimodal Reinforcement Learning
多模态强化学习中的token感知聚焦
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; Nanjing University(南京大学) ; Wuhan University(武汉大学)
AI总结 本文提出VPPO算法,通过token感知优化提升多模态强化学习的视觉推理能力。
Comments Accepted by ICLR 2026, project page: https://github.com/huaixuheqing/VPPO-RL