Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs
学习聚焦与精确裁剪:一种带有信息缺口和接地损失的强化学习框架用于多模态大语言模型
机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) ; Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出一种无需轨迹监督的两阶段强化学习框架,通过信息缺口机制和接地损失提升多模态大语言模型在复杂视觉场景中的感知与推理能力,实验显示其在高分辨率视觉问答基准上达到最优性能。
Comments Accepted by CVPR 2026