arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

搜图也能连续追问:CoCo-IR四轮检索命中率做到44.1%

arXiv 2608.05149 cs.CV

伊利诺伊大学厄巴纳-香槟分校、Google DeepMind和OpenAI研究者提出CoCo-IR,把“拿一张参考图加一句修改要求”的图像检索,扩展为可连续追问的多轮搜索。用户可以先换颜色,再改背景,随后引用前面某一轮的视角或物体继续筛选。

团队训练的12B模型TIE在四轮对话上取得44.1%的R@1,即第一条结果命中目标;把完整历史交给Gemini 2.5 Pro压成单条指令,再接传统单轮检索器,最好成绩为28.2%。

单轮图像检索与多轮CoCo-IR任务对比

论文图1:传统方法需要把历史压缩成一句指令,TIE直接读取交错的图片与文字并处理跨轮引用。

每一轮都生成新的检索向量

TIE把历史图片、修改指令和当前请求排成一条多模态序列。每轮末尾放置一个特殊的嵌入标记,由它汇总此前上下文并输出新的图像检索向量;轮内使用双向注意力融合图文,轮与轮之间保持因果顺序。

TIE模型如何处理多轮图文上下文

论文图2:每轮末尾的嵌入标记汇总此前历史,线性投影后的向量用于匹配目标图片。

这套设计避免把“原图”“第二张图”“不要刚才那双手”等引用提前改写成一句话。单轮模型即使拿到强模型生成的摘要,也可能丢掉图像中的局部属性和先后关系。

数据引擎自己出题,也自己挑难例

人工编写多轮图像检索对话成本很高。团队让多模态模型从图片对中生成变换指令,再进行自我检查;训练时还专门挖掘“很像正确答案、但漏掉一项要求”的困难负样本,迫使检索向量保留细粒度条件。

困难负样本的自动验证

论文图4:候选图匹配模糊图书馆背景,却没有把书封改成蓝色,因此被判定为困难负样本。

在单轮CIRCO基准上,TIE达到39.4 mAP@5;在新建CoCo-IR基准中,12B版本的四轮R@1为44.1%,4B版本为31.1%。完整上下文带来的收益随对话深入变得更明显。

从独立指令生成多轮交互链

论文图5:数据引擎把彼此独立的修改要求改写成会引用早先图片的连续对话。

44.1%仍意味着多数四轮任务失败

TIE的主要失败集中在精确空间关系:物体朝向、相对位置、局部编辑一旦跨多轮累积,模型容易丢失约束。训练数据多数由模型合成,真实用户表达的跳跃、反悔和含糊指代覆盖不足;基准中的超长交互数量也有限。

44.1%显著高于经过摘要改造的单轮系统,但离稳定可用仍有距离。论文验证的是一种多轮检索架构和自建基准上的结果,不代表现有搜索产品已经开放对应能力。

参考资料

https://arxiv.org/abs/2608.05149

https://coco-ir.github.io/