香港科技大学(广州)、腾讯元宝、清华大学和腾讯ARC实验室联合发布SnapBench,系统测试手机“拍照再提问”检索遇到的脏输入。基准包含1145个查询、9085个图库候选和53种受控损坏,并评估16种多模态检索器。
结果呈现出明显不对称:图片模糊、压缩或低光会显著拉低检索,文字错拼主要伤害纯文本检索,对图文联合检索影响较小。更反常的是,干净图片单独检索经常胜过图文一起搜,粗糙问题有时会把正确视觉信号拖偏。
每次查询都有干净版和损坏版
现有多模态检索基准多使用清晰图片和规范问题,即使加入噪声,也常缺少同一查询的成对对照。SnapBench为每个“拍照—提问”任务保留干净输入,再分别施加图像侧和文本侧损坏,使研究者能判断性能下降究竟来自哪种模态。
53种条件覆盖模糊、压缩、光照、旋转、透视、镜头畸变、低分辨率、裁切等手机常见问题,也包含错字、漏字等文本扰动。图库中的正负样本经过人工标注,既有外观相似但语义错误的难负例,也有与问题描述接近但实体不符的候选。
图:论文Figure 1原始矢量图的高分辨率渲染,展示拍照、提问和图库检索任务。
图片一坏,文字通常救不回来
16种系统覆盖双塔编码器和基于嵌入的视觉语言模型。配对结果显示,图像损坏普遍造成明显退化;文字损坏对纯文本路径影响更大,但在图文联合输入中相对有限。手机拍摄质量因此成为比问题拼写更敏感的环节。
原因并非文字完全无用,而是很多问题很短,例如“这是什么”或“哪里可以买到”。它们提供的实体信息很少,无法补回模糊照片里丢失的细节。反过来,当图片清晰时,粗粒度文字可能把检索向错误类别拉动,出现干净图像单独搜索优于联合搜索的现象。
图:论文Figure 2原始矢量图的高分辨率渲染,展示查询构造、损坏模拟与人工标注。
MOOR先估计哪种模态值得相信
团队提出MOOR,一种以模态为锚、感知离群程度并自适应重加权的融合方法。它不再固定把图片和文字按同一比例相加,而是依据当前输入的可靠性调整权重:图片明显受损时减少视觉置信,文字过于粗糙时避免让它覆盖干净图像。
论文的非对称实验进一步量化了图像侧与文本侧退化的差别。这类校准不能恢复已经消失的像素或实体信息,却能减少“坏模态拖累好模态”。实验基于受控损坏,真实手机环境还会同时出现遮挡、网络压缩和用户描述偏差,不能把单因素结果直接等同于全部线上分布。
图:论文附录原始图的高分辨率渲染,对比图像侧与文本侧损坏造成的检索退化。
手机检索走向融合前的可靠性判断
对拍照搜索、识物和购物入口而言,产品可以先检测失焦、过暗或严重裁切,再提示用户重拍;也可以在后台动态选择图像、文字或联合检索路径。SnapBench提供了成对测试集,使这些策略能在上线前按损坏类型分别验证。
下一步需要引入真实用户连续拍摄、不同手机传感器和多语言短问句,并观察可靠性估计是否会误伤少数类别。项目代码已经公开,外部系统可以在相同图库和损坏条件下复测,而不是只报告一组干净输入的平均召回率。
产品侧还可以记录重拍提示是否真的改善结果。如果系统检测到模糊后要求用户靠近或增加光线,第二张照片的召回提升才是可感知收益;若提示过于频繁,用户可能直接放弃。把检索指标、重拍次数和完成时间联合评估,比单独追求鲁棒分数更接近手机交互。
可靠性估计也应经过类别校准。细粒度花卉、零件和商品型号依赖局部纹理,轻微模糊就可能致命;地标或大物体则能容忍更多损坏。按任务动态设定融合权重,可能比全局统一规则更稳。