arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3460 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3460 篇

2010.09641 2020-10-20 cs.MM cs.AI 84%

DIME: An Online Tool for the Visual Comparison of Cross-Modal Retrieval Models

Tony Zhao, Jaeyoung Choi, Gerald Friedland

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.02497 2019-07-30 cs.IR cs.CV cs.MM 84%

Cross-Modal Interaction Networks for Query-Based Moment Retrieval in Videos

Zhu Zhang, Zhijie Lin, Zhou Zhao, Zhenxin Xiao

专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM

Comments Accepted by SIGIR 2019 as a full paper

Journal ref SIGIR, 2019, pages 655-664

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.07075 2019-06-12 cs.IR cs.CL cs.CV cs.SI 84%

Deep Unified Multimodal Embeddings for Understanding both Content and Users in Social Media Networks

Karan Sikka, Lucas Van Bramer, Ajay Divakaran

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

Comments Preprint submitted to IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.07660 2019-04-19 cs.LG cs.CV cs.MM 84%

Discriminative Supervised Hashing for Cross-Modal similarity Search

Jun Yu, Xiao-Jun Wu, Josef Kittler

专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM

Comments 7 pages,3 figures,4 tables;The paper is under consideration at Image and Vision Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.05127 2017-08-25 cs.CV cs.MM 84%

Deep Binary Reconstruction for Cross-modal Hashing

Xuelong Li, Di Hu, Feiping Nie

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM

Comments 8 pages, 5 figures, accepted by ACM Multimedia 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1607.06215 2016-07-22 cs.MM cs.CL cs.IR 84%

A Comprehensive Survey on Cross-modal Retrieval

Kaiye Wang, Qiyue Yin, Wei Wang, Shu Wu, Liang Wang

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL、cs.MM

Comments 20 pages, 11 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.02004 2019-01-09 cs.CV 84%

Self-Supervised Learning from Web Data for Multimodal Retrieval

Raul Gomez, Lluis Gomez, Jaume Gibert, Dimosthenis Karatzas

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CV;multi-modal(comments)

Comments Submitted to Multi-Modal Scene Understanding. arXiv admin note: substantial text overlap with arXiv:1808.06368

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.04931 2018-09-14 cs.HC cs.CV cs.LG 84%

Multimodal Local-Global Ranking Fusion for Emotion Recognition

Paul Pu Liang, Amir Zadeh, Louis-Philippe Morency

专题命中 跨模态检索 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV

Comments ACM International Conference on Multimodal Interaction (ICMI 2018)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20019 2026-08-21 cs.AI 新提交 83%

Contrastive Mixed Prompt Learning for Incomplete Multimodal Sentiment Analysis with Unseen Modality Combination

针对未见模态组合的不完整多模态情感分析的对比混合提示学习

Kaixin Xu, NaiJin Liu, Yulin Kang, Tangyue Jin, Zixuan Yu, Wenxi Zhao, Yibei Liu, Qianle Zhang, Yangyang Wu, Mengying Zhu, Meng Xi

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对未见模态组合下的不完整多模态情感分析问题,提出CMPL模型,通过标签引导对比学习、带软路由的模态组合提示及三种提示对比策略,在三类数据集上较SOTA准确率提升超5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16628 2026-08-18 cs.AI 新提交 83%

Hypergraph-based Multimodal Retrieval-Augmented Generation with Incremental Refinement

基于超图的多模态检索增强生成与增量优化

Shenao Chen, Yidan Xu, Xiangmin Han, Rundong Xue, Duanpo Wu, Yuhan Gao, Chenggang Yan, Yue Gao

机构 * Hangzhou Dianzi University(杭州电子科技大学) Beijing University of Technology(北京工业大学) Tsinghua University(清华大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 该研究针对现有多模态检索增强生成系统的二元连接局限与优化冗余问题,提出Hyper-M2RAG框架,通过多模态超图建模与锚点驱动的增量优化机制,在多模态基准数据集上实现优于现有方法的性能。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15096 2026-08-18 cs.CV eess.IV 新提交 83%

MODAL: Multi-Modal Object Re-ID via Model-Driven Sparse Decoupling and Text-Image Differential Filtering

MODAL:基于模型驱动稀疏解耦与文本-图像差分滤波的多模态对象重识别

Chengbo Huang, Jun-Jie Huang, Long Lan, Tianrui Liu, Xueqiong Li, Yuanxi Peng, Xinwang Liu, Meng Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院)

专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MODAL多模态对象重识别框架,通过多模态特征稀疏解耦模块与文本-图像差分滤波模块解决现有方法的特征纠缠与模态缺失性能下降问题,在四个数据集上取得SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23694 2026-08-18 cs.CL 版本更新 83%

ChartFI: Benchmarking Faithfulness and Insightfulness of Chart Descriptions from Multimodal Large Language Models

ChartFI: 多模态大语言模型图表描述的忠实性与洞察力基准测试

Fen Wang, Zekai Shao, Qiman Kang, Chunran Hu, Zhixuan Zhang, Lexu Xie, Chao Liu, Siming Chen

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Zhengzhou Zhongke Institute of Integrated Circuit and System Application(郑州中凯集成电路与系统应用研究院) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 提出ChartFI-Bench基准,包含896个复杂图表-描述对,并设计四个评估指标(忠实性、覆盖率、信息量、敏锐度),系统评估多模态大语言模型生成图表描述的质量。

Comments Accepted by VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12987 2026-08-14 cs.IR cs.AI 新提交 83%

Generative Universal Multimodal Retrieval with Dual-role Identifiers

基于双角色标识符的生成式通用多模态检索

Kaipeng Li, Haitao Yu, Xuanchen Zhou

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.AI

AI总结 本文针对生成式信息检索的三大挑战,提出具备双角色标识符的DrIG框架,经实验验证其在多模态检索任务中性能优于现有基线,且能平衡效率与效果。

Comments This paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06516 2026-08-10 cs.LG cs.AI 新提交 83%

CertBind from Multimodal Connectivity to Certifiable Retrieval Decisions

CertBind:从多模态连接到可验证的检索决策

Shuheng Cao, Zhenhao Zhang, Ruiqi Chen, Renjie Cao, Weijia Zhang, Siyu Zhang, Jiaxin Liu, Xiangyu Zeng, Haotian Geng, Fan Gu

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 该研究提出CertBind多尺度理论,解决多模态编码器组合后的检索决策可验证问题,通过多尺度设计实现误差控制与恢复,在实验中验证了其对原生检索能力的可控性与无损害性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06059 2026-08-07 cs.CV 新提交 83%

DARAD: Dual Adapters and Ranking-Aware Distillation for Continual Remote Sensing Image-Text Retrieval

DARAD:用于持续遥感图像-文本检索的双适配器与排序感知蒸馏框架

Xi Chen, Xu Chen, Xiangyang Jia, Wei Wang, Xu Zhang, Zhenyuan Sun

专题命中 跨模态检索 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对持续遥感图像-文本检索中跨模态对齐空间失真的问题,提出双适配器与排序感知蒸馏框架DARAD,通过双分支设计与双向排序蒸馏实现新数据适应性与历史数据有效性的平衡,性能优于现有持续学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04052 2026-08-06 cs.CR cs.CV cs.LG 新提交 83%

When Modalities Fail to Tango: Conformal Backdoor Detection in Multimodal Contrastive Learning

当模态无法“共舞”:多模态对比学习中的共形后门检测

Yiming Chen, Kemou Li, Haiwei Wu, Jiantao Zhou

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 针对多模态对比学习后门检测方法的缺陷,提出CASCADE两阶段共形框架,在CC3M数据集上实现高TPR下低FPR与高AUROC,可应对自适应攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12735 2026-08-06 cs.CV 版本更新 83%

AffectAgent: Collaborative Multi-Agent Reasoning for Retrieval-Augmented Multimodal Emotion Recognition

AffectAgent:协同多智能体推理用于检索增强的多模态情感识别

Zeheng Wang, Zitong Yu, Yijie Zhu, Bo Zhao, Haochen Liang, Taorui Wang, Wei Xia, Jiayu Zhang, Zhishu Liu, Hui Ma, Fei Ma, Qi Tian

机构 * Great Bay University(大湾大学) Guangming Laboratory(光明实验室)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出AffectAgent,通过协同多智能体推理框架,解决多模态情感识别中的模态模糊和复杂情感依赖问题,引入MB-MoE和RAAF提升表现。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01430 2026-08-04 cs.AI 新提交 83%

MRAFnd: Multimodal Retrieval-Augmented Framework for Zero-Shot Fake News Detection

MRAFnd:面向零样本假新闻检测的多模态检索增强框架

Lehan Zhang, Yinlei Cheng, Shiqi Hu Yiheng Zhou, Shangxi Li, Naidong Zhao

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对零样本假新闻检测的现有方法无法识别重复虚假手段与跨模态差异的问题,本文提出多模态检索增强框架MRAFnd,经多智能体协作推理,在Weibo-21等数据集上准确率最高提升2.35%,优于现有方法。

Comments 14 pages, 6 figures, 2 tables, Presented at the MMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24861 2026-07-29 cs.IR cs.AI 新提交 83%

HVM-GraphRAG: Holistic-View Multimodal Graph Retrieval-Augmented Generation on Complex Document

HVM-GraphRAG:复杂文档上的整体视图多模态图检索增强生成

Xin He, Yili Wang, Wenqi Fan, Qing Li, Qinggang Zhang, Yi Chang, Xin Wang

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对复杂文档问答中跨模态证据索引不可靠和图遍历昂贵的问题,提出HVM-GraphRAG框架,用整体视图指导图构建,检索时在概念级图上搜索并通过索引访问证据,实验证明其能提升答案性能和检索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10023 2026-07-27 cs.SD cs.LG cs.MM 版本更新 83%

Local Multimodal Music Alignment from Global Supervision

基于全局监督的局部多模态音乐对齐

Irmak Bukey, Zachary Novack, Jongmin Jung, Dasaem Jeong, Chris Donahue

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 研究如何利用全局监督实现局部多模态音乐对齐,提出FuSiLi方法,通过基于Sinkhorn的软对齐操作局部特征,结合传统全局相似性微调预训练编码器,在跨模态检索和帧级对齐任务中表现出色,优于多种基线。

Comments ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17673 2026-07-21 cs.LG cs.AI 新提交 83%

Beyond Objective Expressivity: Geometry Preservation in Multimodal Contrastive Learning

超越目标表现力:多模态对比学习中的几何保留

Tillmann Rheude, Roland Eils, Benjamin Wild

机构 * Berlin Institute of Health, Charité - Universitätsmedizin Berlin(柏林健康研究院,柏林夏里特大学医学中心) Department of Mathematics and Computer Science, Freie Universität Berlin(柏林自由大学数学与计算机科学系) Intelligent Medicine Institute, Fudan University(复旦大学智能医学研究院)

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.AI

AI总结 研究多模态对比学习从成对扩展到高阶对齐的挑战,确定编码器雅可比条件是关键因素,引入几何保留编码器,通过正则化调节雅可比,实验证明改善其条件可提升检索和线性探针性能,表明多模态对比学习还取决于编码器几何和优化属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25693 2026-07-21 cs.AI 版本更新 83%

RADD: Retrieval-Augmented Discrete Diffusion for Multi-Modal Knowledge Graph Completion

RADD:基于检索的离散扩散用于多模态知识图谱补全

Guanglin Niu, Bo Li

机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院)

专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文提出RADD框架,通过分离检索与重排序过程,提升多模态知识图谱补全的性能,实验表明其在多个基准上表现最佳。

Comments 13 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13522 2026-07-16 cs.RO cs.CV 新提交 83%

Kepler-Encoder-v0.1: Towards a Multimodal Embedding Model for Robots

开普勒编码器v0.1:迈向机器人的多模态嵌入模型

Ishneet Sukhvinder Singh, Dhanoosh Pooranakumaran, Alex Nguyen, Jia Qi Yip

机构 * Menlo Research(门洛研究公司)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究针对机器人理解自身状态问题,提出开普勒编码器v0.1,通过学习查询交叉注意力层融合多模态信息,经自监督训练。实验表明其仅视觉潜空间能恢复末端执行器状态,优于其他方法,单个编码器涵盖多个机器人,冻结潜空间有多种用途。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12764 2026-07-15 cs.CV 新提交 83%

EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval

EvoGraph-R1:用于智能检索的自进化多模态知识超图

Jiashi Lin, Changhong Jiang, Xiangru Lin, Ruifei Zhang, Xinyi Zhu, Jiyao Liu, Cheng Tang, Ye Du, Shujian Gao, Junzhi Ning, Lihao Liu, Ziyan Huang, Tianbin Li, Jin Ye, Junjun He

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Monash University(莫纳什大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究针对现有GraphRAG方法将知识图视为静态数据结构的局限,提出EvoGraph-R1自进化框架,把检索建模为MDP,智能体通过多种操作使超图结构进化以支持多跳推理,实验证明该方法在多模态问答基准测试中大幅优于现有基线。

Comments 10 pages main paper, 6 figures. CVPR 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15868 2026-07-14 cs.CV 版本更新 83%

SOLAR: Self-supervised Joint Learning for Symmetric Multimodal Retrieval

SOLAR:用于对称多模态检索的自监督联合学习

Wenjie Yang, Hang Yu, Yuyu Guo, Peng Di

机构 * Ant Group(蚂蚁集团)

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出SOLAR框架,通过自监督学习解决对称多模态检索问题,利用未标记数据提升模型性能,实验显示其在基准测试中优于现有方法。

Comments Accepted by ICML 2026. Code, model and benchmark are available at https://github.com/codefuse-ai/SOLAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04969 2026-07-14 cs.IR cs.AI 版本更新 83%

MG$^2$-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation

MG$^2$-RAG:多粒度图用于多模态检索增强生成

Sijun Dai, Qiang Huang, Xiaoxing You, Jun Yu

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 MG$^2$-RAG通过构建层次化多模态知识图谱,融合文本与视觉信息,提升多模态检索与生成性能,实验显示其在四个任务中均取得最佳效果,同时显著提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02076 2026-07-09 cs.LG cs.AI 版本更新 83%

FDRMFL: Multimodal Federated Feature Extraction Model Based on Information Maximization and Contrastive Learning

FDRMFL:基于信息最大化和对比学习的多模态联邦特征提取模型

Haozhe Wu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对非IID数据分布下联邦回归的多模态特征提取难题,提出FDRMFL框架,通过统一的四项局部目标应对挑战,实验表明该框架能有效降低平均MSE,在六种联邦算法中表现最佳。

Comments Accepted author manuscript; published version DOI: 10.1016/j.asoc.2026.115874

Journal ref Applied Soft Computing 202 (2026) 115874

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00379 2026-07-02 cs.IR cs.CV 新提交 83%

Attribute-Prompted Kernel Hashing for Unsupervised Data-Efficient Cross-Modal Retrieval

属性提示核哈希用于无监督数据高效跨模态检索

Runhao Li, Xiaoxu Ma, Zhenyu Weng, Yue Zhang, Guibo Luo, Huiping Zhuang, Zhiping Lin, Yap-Peng Tan

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) VinUniversity

专题命中 跨模态检索 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 提出属性提示核哈希(APKH),利用视觉-语言基础模型的广义属性先验,通过上下文优化属性核映射和核平滑对比对齐,在数据受限场景下实现从可见到不可见类别的跨模态检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31517 2026-07-01 cs.IR cs.CV 新提交 83%

Unsupervised Data-Efficient Cross-Modal Retrieval with Global-Neighborhood Alignment Hashing

基于全局邻域对齐哈希的无监督数据高效跨模态检索

Runhao Li, Xiaoxu Ma, Zhenyu Weng, Yue Zhang, Guibo Luo, Huiping Zhuang, Zhiping Lin, Yap-Peng Tan

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(华南理工大学吴贤铭智能工程学院) College of Computer and Information Engineering, Henan Normal University(河南师范大学计算机与信息工程学院) VinUniversity(Vin大学)

专题命中 跨模态检索 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 提出全局邻域对齐哈希(GNAH),通过原型锚定全局对齐和对比随机邻域对齐,在少量图像-文本对下学习紧凑二进制码,实现数据高效的无监督跨模态检索。

Journal ref 2026 IEEE International Conference on Image Processing (ICIP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27010 2026-06-26 cs.IR cs.MM 新提交 83%

TriPAH: Imbalance-Aware Tri-Prompt Affinity Hashing for Cross-Modal Medical Retrieval

TriPAH:面向跨模态医学检索的不平衡感知三提示亲和哈希

Jiaming Bian, Songming Li, Yurui Song, Yunfei Chen, Yichao Cao, Jun Long

专题命中 跨模态检索 :cross-modal(title,abstract);image-text(abstract);分类 cs.MM

AI总结 提出TriPAH框架,通过本体引导的患者级提示、轻量级提示-令牌混合器及不平衡感知多任务目标,解决跨模态医学哈希检索中的语义碎片、长尾标签和量化脆弱性问题,在三个数据集上超越现有方法。

Comments 10 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏