More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models
不止于最终答案:提升视觉提取和逻辑一致性的视觉语言模型
机构 * Virginia Tech(弗吉尼亚理工大学) ; Adobe Research(Adobe研究院) ; Apple(苹果公司)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
AI总结 PeRL-VL通过解耦框架提升视觉语言模型的视觉提取和推理一致性,实现Pass@1准确率提升。