Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院自动化研究所人工智能学院)
专题命中 视觉推理 :visual reasoning(title,abstract);vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI
Comments 51 pages, 23 figures, NeurIPS'25