R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
机构 * Nanyang Technological University(南洋理工大学)
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICCV 2025 Camera Ready