Correlation Hashing Network for Efficient Cross-Modal Retrieval
专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV
Comments 7 pages
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV
Comments 7 pages
专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV
专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI;multimodal(comments)
Comments CIKM 2024 (International Conference on Information and Knowledge Management), Multimodal Search and Recommendations Workshop
前所未见:基于一致视频源数据集的真正零样本组合图像检索基准测试
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 跨模态检索 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 针对现有零样本组合图像检索数据集存在参考与目标图像不相关、非真正零样本的问题,提出ZeroSight基准,包含来自视频的一致参考-目标对和训练无关的MLLM驱动方法SC4CIR,通过三重对称一致性检查识别难负样本,实验表明现有方法性能被高估。
超越噪声信号:用于多模态序列推荐的双层去噪
专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract)
AI总结 研究多模态序列推荐中的双重噪声困境,提出DDMSR框架,从特征拓扑和序列频率角度净化信号,设计基于图的特征去噪与频域序列去噪模块,纳入多模态对比对齐目标,实验证明该框架性能优于基线。
Comments Accepted by ACM MM 2026. 12 Pages
OC-Distill:基于跨模态蒸馏的面向本体的对比学习用于ICU风险预测
机构 * UC Berkeley(伯克利大学) ; UCSF(旧金山大学) ; Samsung Advanced Institute of Technology (SAIT)(三星先进技术研究所)
专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract)
AI总结 OC-Distill通过两阶段框架提升ICU风险预测性能,利用本体感知对比学习和跨模态知识蒸馏,提高模型对患者相似性的捕捉能力及预测效率。
语言的成本:质心擦除揭示并利用多模态语言模型中的模态竞争
机构 * Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; USI Lugano(卢加诺大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究发现多模态语言模型在视觉任务中表现不佳,通过质心替换方法揭示语言表征优于视觉,通过文本质心对比解码提升准确率,不同训练方法影响结果。
Comments 37 pages, 8 figures, 28 tables
V-Mem:面向多模态智能体长期记忆的模态路由检索
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 该研究针对多模态智能体记忆的模态与相似性-相关性差距,提出V-Mem系统,通过模态路由检索优化,在Mem-Gallery、LoCoMo数据集上显著提升多模态问答性能。
Comments 19 pages, 2 figures, 16 tables. Code: https://github.com/Dingyi-Kang/V-Mem
GeoArbiter:面向遥感多模态大语言模型的可验证性导向 grounding 方法
机构 * University of Minnesota, Twin Cities(明尼苏达大学双城分校)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)
AI总结 该研究针对遥感多模态大语言模型的事实断言问题,提出无需训练的 GeoArbiter 流程,通过仅注入图像无法验证的地理事实,有效降低了模型的断言级幻觉并提升了对冲突记录的鲁棒性。
面向有效联邦多模态图学习的多层面异质性导航方法
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)
AI总结 针对联邦多模态图学习的多层面异质性问题,本文提出FedTCR算法,通过两阶段范式与拓扑感知跨模态路由机制,在7个领域的图中心与模态中心任务上优于现有最优基线。
Comments Under Review
CaIRec:面向不完整多模态推荐的校准模态补全方法
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)
AI总结 本文针对多模态推荐中模态缺失导致的跨模态结构失真与偏好适应差距问题,提出两阶段框架CaIRec,经多组实验验证其有效性与鲁棒性。
CMDR:上下文多模态文档检索
机构 * Human Informatics Labs.(人文信息实验室) ; NTT, Inc.(日本NTT公司)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究多模态文档检索,提出CMDR-Embed框架联合编码页面纳入文档上下文,引入CMCL对比学习目标训练,实验证明该框架显著优于非上下文嵌入,凸显上下文感知多模态嵌入对文档检索的重要性。
Comments Accepted by ECCV 2026; project page: https://cmdr-bench.github.io/
迷失在末尾:多模态检索增强问答中的首因偏差
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; The Ohio State University(俄亥俄州立大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究多模态知识型视觉问答中检索上下文的位置依赖,发现不同于纯文本的U形效应,出现首因偏差(开头优于末尾),并通过消融实验定位原因为指令调优阅读器的提示槽0。
Comments 15 pages, 9 figures
超越文本:为多模态电子商务检索对齐视觉与语言
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)
AI总结 研究电子商务领域双塔检索模型的统一文本-图像融合,指出特定领域微调及查询与产品文本和图像模态的两阶段对齐很关键,提出新型模态融合网络并验证其有效性。
检索增强的多模态学习用于低同源性偏移下的酶-底物相互作用预测
机构 * School of Information Science and Engineering, East China University of Science and Technology(华东理工大学信息科学与工程学院) ; Institute of Natural Sciences and Zhangjiang Institute for Advanced Study, Shanghai Jiao Tong University(上海交通大学自然科学研究院和张江高等研究院) ; School of Life Sciences and Biotechnology, Shanghai Jiao Tong University(上海交通大学生命科学技术学院)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)
AI总结 提出RAMMESI框架,通过跨模态交互建模、自适应融合和检索增强,解决酶-底物相互作用预测中稀疏正监督和低同源性分布偏移问题,在低序列一致性场景下表现优异。
Comments 13 pages, 6 figures
减法让你获得更多:面向多模态多跳问答的差距感知检索
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)
AI总结 针对多模态多跳问答中的证据集补全和序列池构建任务,提出GRAIL框架,通过隐式查询重写和上下文减法查询引导,解决语义锚定问题,实现组合跨模态推理,在MultimodalQA上获得40.3%的宏平均性能提升。
EReL@MIR 2025 多模态文档检索挑战赛(赛道1)概述
机构 * University of Cambridge(剑桥大学) ; Cambridge United Kingdom(剑桥英国)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文介绍了EReL@MIR 2025多模态文档检索挑战赛(赛道1)的设计、数据集、评估协议、最终排名及前三名获胜系统的分析,所有系统均基于Qwen2-VL系列解码器多模态大语言模型嵌入器。
Comments MDR Challenge Report at WWW2025
OVA-IB:用于多模态对齐的一对多信息瓶颈
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) ; UiT – The Arctic University of Norway(挪威北极大学) ; University of Copenhagen(哥本哈根大学) ; Norwegian Computing Center(挪威计算中心) ; University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract)
AI总结 提出基于信息瓶颈的一对多对齐框架OVA-IB,通过充分性对比下界和最小性正则化实现任意数量模态的对齐,在分类、回归和跨模态检索任务中表现鲁棒。
COMET:音频-文本多模态对比嵌入中模态间隙的概念空间剖析
机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; Centre for Vision, Speech, and Signal Processing (CVSSP), University of Surrey(Surrey 大学视觉、语音和信号处理中心)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS
AI总结 提出COMET框架,通过PLS-SVD分解揭示CLAP模型中模态间隙主要由少数共享概念轴贡献,并基于谱截断方法无训练地缓解间隙,实现零样本音频字幕接近全监督性能。
学习有序的多模态表示以进行复合材料设计
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Tongji University(同济大学) ; A*STAR CFAR(新加坡A*STAR CFAR)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)
AI总结 本研究提出了一种基于有序性的多模态预训练框架ORDER,用于复合材料设计,通过整合异构数据源来捕捉纤维分布,从而在连续设计空间中实现有效的属性预测和微结构生成。
以效用为导向的多模态证据选择用于多模态检索增强生成
机构 * Arizona State University(亚利桑那州立大学) ; Texas A&M University(德克萨斯大学) ; Morgan Stanley(摩根大通)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出以信息论视角重构多模态证据选择,定义证据效用为模型输出分布的信息增益,通过引入潜在的证据有效性概念,提出无需训练的代理加速框架,实验证明在MRAG-Bench和Visual-RAG上优于现有RAG基线并降低计算成本。
Comments Accepted to ACL 2026
非常高效的长文档多模态重排序方法
机构 * Magellan Technology Research Institute (MTRI)(马杰拉技术研究院(MTRI))
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文提出ZipRerank,通过轻量级查询-图像早期交互机制和单次前向传递消除自回归解码,实现高效多模态重排序,实验表明其在MMDocIR基准上性能优异且显著降低LLM推理延迟。
Comments To appear in ICML 2026
通过排序检索进行多模态数据整理
机构 * NVIDIA
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)
AI总结 本文提出通过优化训练对和嵌入模型来提升多模态检索对齐,利用对称核子采样和专家嵌入引擎减少模态驱动的分离,有效缩小模态差距。
Comments ICLR DATA-FM 2026
DeepTaxon: 一种可解释的检索增强多模态框架,用于统一的物种识别与发现
机构 * National University of Singapore(新加坡国立大学) ; Hunan University(湖南大学) ; Xiangtan University(湘潭大学) ; Hunan Normal University(湖南师范大学) ; Zhejiang University(浙江大学) ; Cornell University(康奈尔大学) ; Meituan(美团)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM
AI总结 DeepTaxon通过可解释的检索增强多模态框架,统一物种识别与发现,通过检索证据进行链式推理,提升识别和发现的准确性与可解释性。
Comments 13 pages, 6 figures, 9 tables
打破幻觉:基于共识的生成对抗多模态嵌入中对抗性幻觉的缓解
机构 * Lund University(隆德大学) ; Google DeepMind(谷歌DeepMind)
专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract)
AI总结 本文提出一种任务无关的缓解机制,利用生成模型恢复多模态嵌入的自然对齐,通过生成采样策略和共识聚合方案提升防御效果,实验显示其显著降低对抗性幻觉攻击成功率。
Region-R1: 增强多模态重排序的查询侧区域裁剪
机构 * Texas A&M University(德克萨斯A&M大学)
专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 Region-R1通过在重排序阶段引入区域裁剪机制,提升多模态重排序的鲁棒性,实验表明其在E-VQA和InfoSeek基准上显著提升召回率。
Comments 12 pages, 4 figures, accepted to ACL 2026 Findings, code available at https://github.com/taco-group/Region-R1
MMEmb-R1: 基于推理增强的多模态嵌入与配对感知选择及自适应控制
机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) ; ByteDance(字节跳动)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出MMEmb-R1框架,通过引入配对感知推理选择和强化学习,解决多模态嵌入中推理与对比监督不匹配及推理冗余的问题,实验显示其在MMEB-V2基准上达到71.2分,参数更少且推理效率更高。
JEPA-MSAC:一种联合嵌入预测架构用于多模态传感辅助通信
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)
AI总结 本文提出JEPA-MSAC框架,通过联合嵌入预测架构实现多模态传感辅助通信的自监督学习,支持多任务预测并降低适应成本。
Comments 13 pages, 10 figures
LITTA:晚期交互与测试时对齐用于视觉接地多模态检索
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 LITTA通过查询扩展提升多模态文档检索,利用晚期交互评分和反向排名融合提高检索鲁棒性,适用于计算机科学、制药和工业手册等多领域。
AMES:基于晚期交互检索的近似多模态企业搜索
机构 * Apple(苹果公司)
专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);cross-modal(abstract)
AI总结 AMES通过晚期交互检索架构实现多模态企业搜索,无需架构重设计,利用多向量编码器将文本、图像和视频嵌入共享空间,实验显示其在可扩展的Solr系统中表现优异。