arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

文字说错也不带偏?Meta等让AI看图答对率升至70.7%

作者:arXivDaily编辑部 arXiv 2610.10563 cs · cs.AI · cs.CV

论文导读

卡内基梅隆大学、Meta联合提出SLVR,让AI先定位图片里的目标,再挑证据、组织答案,推理时不必写出长段过程。在300项带错误描述的诊断测试中,正确率从41.7%升至70.7%。模型可以回到画面核对颜色、数量和空间关系,减少跟着文字猜答案。

描述没写雨伞,AI得自己找

论文展示一张街边照片,蓝色围挡前有人和购物车,右侧还能看到黄色雨伞。原始描述直接写了雨伞,回答“右边有什么”可以抄文字。训练时把这条线索删掉,问题保持不变,AI必须从图里找出答案。

选项中还放入购物车、路灯等在画面里真实存在的对象。它们看起来合理,却不符合问题指定的位置。这类对照促使模型同时核对对象和关系,减少凭常见搭配猜测。

第一阶段从已有视觉推理数据中构建约2万条这样的样本。生成工具负责删去目标信息和设计选项,另一套检查负责排除答案泄漏、指代不清和多个正确答案;团队也抽查了约1000条。

图:蓝色围挡前的街景里有行人、购物车与黄色雨伞,文字样本删去了雨伞这一目标线索。

先找区域,内部推理也分步骤

第二阶段把模型内部推理分成几种具体工作:计划看什么,定位相关区域,选出图像证据,再综合得到答案。以盘中绿苹果计数为例,先找到盘子,再关注绿色苹果,最后给出数量。

图:左侧删去描述中的答案线索,右侧依次组织计划、定位、证据和答案的内部状态。

这些步骤不必全部写成供用户阅读的句子。训练时用已有计划、目标框和图像块监督内部状态,推理时在连续表示里完成中间计算,再生成最后的回答。它仍然进行推理,只是少生成显式的长段解释。

研究基于Qwen2.5-VL-7B,保持视觉编码器冻结,训练语言模型部分。位置和证据监督分别约束不同阶段,使内部计算有可检查的任务分工。论文并未把避免文字解码的开销汇总成某个固定倍数的实际加速。

错误描述下,300题答对70.7%

诊断测试选取300项与训练不重叠的案例,故意把描述里的关键视觉事实改成看似合理的错误信息,图像和问题不变。SLVR正确率为70.7%,基础模型为41.7%,提高29个百分点;跟随错误描述的错误率从46.0%降到14.7%。

描述保持正确时,两者正确率分别为84.3%和72.3%。同一个模型在图文冲突时仍然更难答对,70.7%不能推广成对任意错误提示都可靠。只做第一阶段训练的版本为58.3%,说明后续结构化推理还有额外贡献。

常规基准中,MMVP从66.7升到76.1,BLINK关系题从38.8升到53.0,分别提高9.4和14.2个百分点。空间、图表与视觉数学任务也有改善,但这些分数各有题目和计算方式,不能当成同一套综合正确率。

应用前景:看图问答,继续检查证据是否找对

论文对照了长文字推理、未分工的内部推理和按任务组织的内部状态。新方法保留了计划、区域和证据的监督,可以继续检查答错时究竟是看错位置,还是找到了对象却判断错关系。

后续扩展可以比较不同规模和不同架构,或让模型根据问题调整内部推理预算。作者目前的实验集中在7B骨干,已有多个视觉基准和误导描述测试,可以用相同口径继续检验迁移后的表现。

图:三条流程分别用文字链、无结构内部状态和分工的内部状态完成视觉推理。

参考资料

https://arxiv.org/abs/2610.10563

https://bogao-code.github.io/SLVR/

↑