arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3475 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3475 篇

1703.07026 2017-04-06 cs.LG cs.CV stat.ML 79%

Cross-modal Deep Metric Learning with Multi-task Regularization

Xin Huang, Yuxin Peng

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

Comments Revision: Added reference [7] 6 pages, 1 figure, to appear in the proceedings of the IEEE International Conference on Multimedia and Expo (ICME), Jul 10, 2017 - Jul 14, 2017, Hong Kong, Hong Kong

详情

展开后加载摘要…

URL PDF HTML 收藏
1704.00763 2017-04-05 cs.CV 79%

AMC: Attention guided Multi-modal Correlation Learning for Image Search

Kan Chen, Trung Bui, Fang Chen, Zhaowen Wang, Ram Nevatia

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

Comments CVPR 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1702.01101 2017-02-06 cs.CL 79%

Multilingual Multi-modal Embeddings for Natural Language Processing

Iacer Calixto, Qun Liu, Nick Campbell

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CL

Comments 4 pages (5 including references), no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1607.07295 2016-07-26 cs.CV 79%

Learning Aligned Cross-Modal Representations from Weakly Aligned Data

Lluis Castrejon, Yusuf Aytar, Carl Vondrick, Hamed Pirsiavash, Antonio Torralba

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

Comments Conference paper at CVPR 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1508.00715 2016-04-21 cs.CL cs.SI 79%

Multi-Modal Bayesian Embeddings for Learning Social Knowledge Graphs

Zhilin Yang, Jie Tang, William Cohen

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
1601.02705 2016-01-13 cs.RO cs.AI cs.LG 79%

Robobarista: Learning to Manipulate Novel Objects via Deep Multimodal Embedding

Jaeyong Sung, Seok Hyun Jin, Ian Lenz, Ashutosh Saxena

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

Comments Journal Version

详情

展开后加载摘要…

URL PDF HTML 收藏
1409.3970 2016-01-01 cs.CV cs.IR cs.LG cs.NE 79%

A Deep and Autoregressive Approach for Topic Modeling of Multimodal Data

Yin Zheng, Yu-Jin Zhang, Hugo Larochelle

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

Comments 24 pages, 10 figures. A version has been accepted by TPAMI on Aug 4th, 2015. Add footnote about how to train the model in practice in Section 5.1. arXiv admin note: substantial text overlap with arXiv:1305.5306

详情

展开后加载摘要…

URL PDF HTML 收藏
1511.06746 2015-11-23 cs.CV cs.LG 79%

Images Don't Lie: Transferring Deep Visual Semantic Features to Large-Scale Multimodal Learning to Rank

Corey Lynch, Kamelia Aryafar, Josh Attenberg

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1507.05670 2015-11-11 cs.CV cs.LG 79%

Building a Large-scale Multimodal Knowledge Base System for Answering Visual Queries

Yuke Zhu, Ce Zhang, Christopher Ré, Li Fei-Fei

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
0905.2435 2009-12-01 cs.AI cs.LO 79%

Quantified Multimodal Logics in Simple Type Theory

Christoph Benzmueller, Lawrence C. Paulson

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

Comments ii + 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20318 2026-08-04 cs.CV cs.MM 版本更新 79%

UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval

UniCVR:从对齐到重排序的统一零样本复合视觉检索

Haokun Wen, Xuemeng Song, Haoyu Zhang, Weili Guan, Xiangyu Zhao, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学) Southern University of Science and Technology(南方科技大学) Pengcheng Laboratory(鹏城实验室)

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.MM

AI总结 UniCVR提出首个统一零样本复合视觉检索框架,结合多模态大语言模型与视觉语言预训练模型,通过两阶段方法实现多任务联合优化,实验表明其在五个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16918 2026-07-15 cs.CV cs.AI 版本更新 79%

Xray-Visual Models: Scaling Vision models on Industry Scale Data

Xray-Visual模型:在产业级数据上扩展视觉模型

Shlok Mishra, Tsung-Yu Lin, Linda Wang, Hongli Xu, Yimin Liu, Michael Hsu, Chaitanya Ahuja, Hao Yuan, Jianpeng Cheng, Hong-You Chen, Haoyuan Xu, Chao Li, Sreya Dutta Roy, Abhijeet Awasthi, Jihye Moon, Don Husa, Michael Ge, Sumedha Singla, Arkabandhu Chowdhury, Phong Dingh, Satya Narayan Shukla, Yonghuan Yang, David Jacobs, Qi Guo, Jun Xiao, Xiangjun Fan, Aashu Singh

机构 * Meta-AI MIT(麻省理工学院) University of Maryland(马里兰大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 Xray-Visual通过三阶段训练流程和LLM2CLIP技术,在产业级数据上实现高效多模态视觉模型,取得最佳性能并提升鲁棒性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29464 2026-06-30 cs.CV cs.AI 79%

Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation

秩感知双曲对齐用于视觉-语言数据集蒸馏

Jongoh Jeong, Sun-Kyung Lee, Kuk-Jin Yoon

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 提出RAHA方法,利用双曲几何和显式对齐容量控制,通过非对称目标优化蒸馏对,在共享范围强制测地线对齐并正则化残差子空间,提升跨模态检索和迁移鲁棒性。

Comments Accepted for publication at ECCV 2026. Project Page: https://andyj1.github.io/raha

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20523 2026-06-19 cs.CV cs.AI cs.DB 新提交 79%

SARLO-80: Worldwide Slant SAR Language Optic Dataset 80cm

SARLO-80:全球斜距SAR语言光学数据集80cm

Solène Debuysère, Nicolas Trouvé, Nathan Letheule, Elise Colin, Georgia Channing

机构 * DEMR-ONERA – The French Aerospace Lab, Université Paris-Saclay(法国航空航天实验室DEMR-ONERA,巴黎-萨克雷大学) DTIS-ONERA – The French Aerospace Lab, Université Paris-Saclay(法国航空航天实验室DTIS-ONERA,巴黎-萨克雷大学) Hugging Face

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 为解决高分辨率SAR与光学图像及文本对齐的数据稀缺问题,基于Umbra SLC数据构建了80cm斜距网格的SAR-光学-文本三元组数据集,支持跨模态检索与生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16397 2026-04-21 cs.CL cs.AI 79%

From Attribution to Abstention: Training-Free Attention-Based Auditing for Clinical Summarization

从归因到回避:基于注意力的无训练审计用于临床摘要

Qianqi Yan, Huy Nguyen, Sumana Srivatsa, Hari Bandi, Xin Eric Wang, Krishnaram Kenthapadi

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Oracle Health AI

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ClinTrace框架,通过解码器注意力权重提取临床有用信号,实现无训练的注意力基于审计,提升临床摘要的透明性和可靠性,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02098 2026-03-25 cs.IR cs.CL cs.CV 79%

Efficient and High-Fidelity Omni Modality Retrieval

高效且高保真的多模态检索

Chuong Huynh, Manh Luong, Abhinav Shrivastava

机构 * University of Maryland, College Park, USA(美国马里兰大学 College Park 分校) Monash University(墨尔本大学)

专题命中 跨模态检索 :multimodal(abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出OmniRet模型,解决多模态检索中的计算效率与表示保真度问题,通过注意力机制和改进的池化方法提升三模态(文本、视觉、音频)检索性能,并引入新的音频中心多模态基准测试。

Comments CVPR 2026. Project page: https://hmchuong.github.io/omniret

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14177 2026-02-17 cs.CV cs.AI 79%

Towards Spatial Transcriptomics-driven Pathology Foundation Models

迈向基于空间转录组的病理基础模型

Konstantin Hemker, Andrew H. Song, Cristina Almagro-Pérez, Guillaume Jaume, Sophia J. Wagner, Anurag Vaidya, Nikola Simidjievski, Mateja Jamnik, Faisal Mahmood

机构 * Department of Pathology, Mass General Brigham, Harvard Medical School, Boston, MA, USA(病理学系,马萨诸塞州总医院与哈佛医学院,波士顿,马萨诸塞州,美国) Department of Computer Science & Technology, University of Cambridge, Cambridge, UK(计算机科学与技术系,剑桥大学,剑桥,英国) Cancer Program, Broad Institute of Harvard and MIT, Cambridge, MA, USA(癌症计划,哈佛与麻省理工联合学院,剑桥,马萨诸塞州,美国) Data Science Program, Dana-Farber Cancer Institute, Boston, MA, USA(数据科学计划,达纳-法伯癌症研究所,波士顿,马萨诸塞州,美国) Harvard-MIT Division of Health Sciences and Technology, Massachusetts Institute of Technology, Cambridge, MA, USA(哈佛-麻省理工健康科学与技术 division,麻省理工学院,剑桥,马萨诸塞州,美国) Télécom Paris, Institut Polytechnique de Paris, Paris, France(巴黎电信学院,巴黎理工学院,巴黎,法国) Harvard Data Science Initiative, Harvard University, Cambridge, MA, USA(哈佛大学数据科学倡议,哈佛大学,剑桥,马萨诸塞州,美国)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 SEAL通过整合局部分子信息提升病理基础模型性能,实现跨模态应用与领域泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22115 2026-08-25 cs.LG 新提交 78%

CST: Collaborative Selective Transmission for Communication-Efficient Multimodal Edge Inference

CST:面向通信高效多模态边缘推理的协作式选择性传输

Hai Chi, Junrui Zhang, Rui Ning, Chonggang Wang, Robert Gazda, Huanrui Yang, Hongyi Wu

机构 * University of Arizona(亚利桑那大学) Old Dominion University(奥多明尼昂大学) InterDigital(InterDigital公司)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对多模态边缘推理的通信开销与延迟问题,提出CST框架,仅传输辅助设备与主设备表征互补的稀疏特征,在低特征传输占比下实现最优任务性能,且端到端推理速度最高提升4.27倍。

Comments 11 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23291 2026-08-25 cs.IR 版本更新 78%

URecJPQ: Memory-efficient Multimodal Recommendation Models through RecJPQ in Large-Scale Scenarios

URecJPQ:大规模场景下通过RecJPQ实现内存高效的多模态推荐模型

Giuseppe Spillo, Zixuan Yi, Aleksandr Petrov, Cataldo Musto, Craig Macdonald, Iadh Ounis

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 提出URecJPQ方法,通过联合乘积量化将用户/物品表示为共享子嵌入的拼接,显著减少参数量和内存占用,在大规模多模态推荐中实现86%-98%的模型压缩,仅轻微损失精度。

Comments This manuscript has been published in the Springer's Journal of Intelligent Information Systems: https://link.springer.com/article/10.1007/s10844-026-01088-x

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16929 2026-08-19 cs.LG 新提交 78%

Mr.Dec: Daily-Scale Longitudinal Multimodal Modeling for 30-Day Readmission Prediction

Mr.Dec:用于30天再入院预测的日尺度纵向多模态建模

Minjun Kim, Jong Hak Moon

机构 * Yeji X

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本研究提出Mr.Dec模型,通过Transformer解码器整合每日EHR与CXR数据,结合疾病特异性监督对比学习,在MIMIC-IV等数据集上实现30天再入院预测的SOTA性能,还可识别住院关键天数提供临床解释。

Comments MICCAI 2026 MultiTab Workshop Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18255 2026-08-19 eess.SP 版本更新 78%

WiFo-MiSAC: A Wireless Foundation Model for Multimodal Sensing and Communication Integration via Synesthesia of Machines (SoM)

WiFo-MiSAC:一种无线基础模型,通过机器的通感(SoM)实现多模态感知与通信的整合

Xuanyu Liu, Shijian Gao, Boxun Liu, Xiang Cheng, Liuqing Yang

专题命中 跨模态检索 :multimodal(title);cross-modal(abstract)

AI总结 WiFo-MiSAC通过统一空间的自监督预训练,解决通信与传感数据碎片化处理导致的泛化问题,采用共享-特定解耦的混合专家架构,实现多模态交互,实验表明其在多任务中表现优异,具备强大的少样本适应与新模态集成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15662 2026-08-18 cs.LG 新提交 78%

Sequential Multimodal Evidence Optimization for Product Media Ranking in E-Commerce

电商中产品媒体排序的序列多模态证据优化

Prasenjit Dey, Frank McIntyre, Arnab Sinha

机构 * Amazon.com Inc.(亚马逊公司)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对电商产品媒体排序问题,本文提出SMEO框架,通过轨迹效用模型和生存加权自回归策略优化,提升转化率并减少消费者划动次数。

Comments Proceedings of the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026), Rome, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05809 2026-08-14 cs.CR cs.LG 版本更新 78%

Adjustable Text-Guided Backdoor Attacks with Natural-Word Triggers on Multimodal Pretrained Models

隐蔽且可调节的文本引导后门攻击多模态预训练模型

Yiyang Zhang, Chaojian Yu, Ziming Hong, Yuanjie Shao, Qinmu Peng, Tongliang Liu, Xinge You

机构 * National Anti-Counterfeit Engineering Research Center, Huazhong University of Science and Technology(华中科技大学国家防伪工程技术研究中心) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) Sydney AI Centre, The University of Sydney(悉尼大学悉尼人工智能中心)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出一种基于文本的后门攻击方法,利用常见文本词汇作为触发器,提升攻击隐蔽性和实用性,并通过视觉对抗扰动调节模型对文本触发器的学习,实现可控的攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10857 2026-08-12 cs.LG 新提交 78%

FiGuRO: Intrinsic Dimension Estimation for Multi-Modal Data

FiGuRO:面向多模态数据的本征维度估计

Viktoria Schuster, Sana Tonekaboni, Caroline Uhler

专题命中 跨模态检索 :multi-modal(title,abstract)

AI总结 本研究提出FiGuRO框架,用于在模型容量与超参数约束下估计单/多模态数据的本征维度,可实现共享与私有信息解耦,性能优于现有技术且可应用于单模态预训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07067 2026-08-10 cs.AI cs.CL cs.IR cs.MM 新提交 78%

DocMemo: Dynamic Evidence Discovery via Probabilistic Memory-Guided Retrieval for Multi-Modal Document Understanding

DocMemo:面向多模态文档理解的概率记忆引导检索动态证据发现框架

Hanshu Yao, Janfeng Zhong, Niu Lian, Jinpeng Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 跨模态检索 :multi-modal(title);分类 cs.CL、cs.AI、cs.MM

AI总结 针对长文档理解的静态检索与跨轮记忆局限,提出记忆引导框架DocMemo,通过三层记忆与多轮优化实现动态证据发现,在3个基准上取得SOTA性能。

Comments DocMemo is a memory-guided framework for long-document reasoning that uses tri-level memory and dynamic Bayesian belief updating to overcome static retrieval limits and improve evidence tracking. 16 pages, 4 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05655 2026-08-07 cs.IR 新提交 78%

Is Personalized Modality Weighting Actually Personalized? A Controlled Audit of Per-User Weighting Claims in Multimodal Recommenders

个性化模态加权真的是个性化的吗?多模态推荐器中每用户加权声明的受控审计

Jingyuan Zheng, Xin Zhang, Yang Gu, Dongjing Wang, Yuxiang Wang, Xudong Shen, Haiping Zhang, Youhuizi Li, Dongjin Yu

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 该研究审计多模态推荐器的每用户模态加权是否真正个性化,发现单一全局模态权重已提供几乎全部内容增益,每用户加权无一致效用,建议将real-GM与real-shuf作为个性化声明的最低证据标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10252 2026-08-06 cs.CR 版本更新 78%

Bridging Source Code and Bytecode for Smart Contract Vulnerability Detection via Dual-Perspective Cross-Modal Distillation

ExDoS:专家引导的双焦点跨模态蒸馏用于智能合约漏洞检测

Ye Tian, Yifan Jia, Yanbin Wang, Jianguo Sun, Haitao Xu, Xin Wang, Zhihua Fu

专题命中 跨模态检索 :cross-modal(title,abstract)

AI总结 本文提出ExDoS方法,通过双焦点蒸馏框架,从源代码到字节码转移语义知识,提升智能合约漏洞检测的细粒度对齐与识别能力。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02907 2026-08-05 cs.LG 新提交 78%

Bayesian Data Reweighting Improves Multimodal Retrieval for Knowledge-Based Visual Question Answering

贝叶斯数据重加权改进基于知识的视觉问答的多模态检索

Jingchen Sun, Shaobo Han, Ruiyi Zhang, Naresh Kumar Devulapally, Ming Liu, Yitao Long, Vishnu Suresh Lokhande, Changyou Chen

机构 * University at Buffalo(布法罗大学) NEC Laboratories America(美国 NEC 实验室) Adobe Research(奥多比研究院) Iowa State University(爱荷华州立大学) New York University(纽约大学)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对基于知识的视觉问答中多模态检索的负样本处理问题,提出贝叶斯数据重加权框架,通过概率建模与随机EM优化,在三个检索器和七个基准上提升了检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01852 2026-08-04 cs.DB cs.IR 新提交 78%

Multimodal Embeddings for 3D Similarity Search in Semantic Web-of-Things Digital-Twin Platforms

面向语义物联网数字孪生平台中三维相似度搜索的多模态嵌入

Oussama Zaid, Romaric Gaudel, Hassan Thomas, Maria Massri, Philippe Raipin-Parv{é}dy

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文针对语义物联网数字孪生平台缺乏三维相似度搜索能力的问题,提出多模态嵌入框架,在Thing'in平台实现后经S3DIS验证,可支持混合本体-向量查询,满足相关领域的三维相似度搜索需求。

Journal ref 4th International Workshop on the Semantic WEb of EveryThing (SWEET 2026), co-located with ICWE 2026, Jun 2026, Lyon, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17184 2026-07-31 cs.IR 版本更新 78%

Learning Sparse Representations of Multimodal Content for Enhanced Cold Item Recommendation

学习多模态内容的稀疏表示以增强冷启动项目推荐

Gregor Meehan, Johan Pauwels

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对数字平台项目目录规模大及冷启动问题,提出利用稀疏嵌入优势,通过改进冷启动训练方法和设计预稀疏化激活技术,降低存储成本并提升冷启动推荐准确性,还展示了稀疏内容嵌入的可解释性与稳健性。

Comments Accepted at RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏