arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3484 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3484 篇

2608.17203 2026-08-19 stat.ML cs.LG math.ST stat.TH 新提交 71%

Expressivity In Multimodal Contrastive Learning

多模态对比学习中的表达能力

Andrew Stuart, Florian Wolf

专题命中 跨模态检索 :multimodal(title)

AI总结 该研究针对多模态对比学习的表达能力展开分析,明确CLIP架构的表达能力随模态数量变化,提出Hadamard-CLIP模型,实现任意数量模态联合分布的通用近似且保留CLIP的检索优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19733 2026-07-14 physics.chem-ph cs.LG 版本更新 71%

NMIRacle: Multi-modal Generative Molecular Elucidation from IR and NMR Spectra

NMIRacle:从红外和核磁共振谱进行多模生成分子解析

Federico Ottomano, Yingzhen Li, Alex M. Ganose

机构 * Federico Ottomano Yingzhen Li Alex M. Ganose

专题命中 跨模态检索 :multi-modal(title)

AI总结 NMIRacle通过两阶段生成框架,利用红外和核磁共振光谱数据实现分子结构的高精度解析,优于现有方法并保持复杂性下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15514 2026-06-16 cs.RO cs.LG 新提交 71%

Reinforcement Learning-Guided Retrieval with Soft Fusion for Robust Multimodal Imitation Learning under Missing Modalities

强化学习引导的软融合检索用于缺失模态下的鲁棒多模态模仿学习

Hassan Ismkhan, Hamid Bouchahcia

机构 * Bournemouth University(伯恩茅斯大学)

专题命中 跨模态检索 :multimodal(title)

AI总结 提出RL4IL方法,利用强化学习策略从训练库中检索最相关专家演示,并通过软交叉注意力融合生成动作,有效处理传感器缺失问题,在LIBERO基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11382 2026-06-11 cs.LG q-bio.BM 新提交 71%

GLACIER: A Multimodal Student-Teacher Foundation Model for Molecular Property Prediction

GLACIER:用于分子性质预测的多模态师生基础模型

Emily Nguyen, Yongchan Hong, Harsh Toshniwal, Yan Liu, Andreas Luttens

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) Department of Quantitative and Computational Biology, University of Southern California(南加州大学定量与计算生物学系) Amazon(亚马逊) Department of Medical Biochemistry and Biophysics, Science for Life Laboratory, Karolinska Institutet(卡罗林斯卡学院医学生物化学与生物物理系,生命科学实验室)

专题命中 跨模态检索 :multimodal(title)

AI总结 提出GLACIER师生框架,通过融合分子图、SMILES和物理化学描述符三种模态,并利用大模型蒸馏,实现高效准确的分子性质预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08997 2026-05-12 eess.SP 71%

SEM-RAG: Structure-Preserving Multimodal Graph Compilation and Entropy-Guided Retrieval for Telecommunication Standards

SEM-RAG:结构保持的多模态图编译与熵引导检索用于电信标准

Yuzhi Yang, Lina Bariah, Yuhuan Lu, Hang Zou, Mérouane Debbah

专题命中 跨模态检索 :multimodal(title)

AI总结 本文提出SEM-RAG框架,通过结构保持编译和熵引导检索提升电信标准文档检索性能,实验显示其在表格和公式密集型问题上表现优异,准确率高达94.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11028 2026-01-19 cs.LG 71%

AVP-Pro: An Adaptive Multi-Modal Fusion and Contrastive Learning Approach for Comprehensive Two-Stage Antiviral Peptide Identification

AVP-Pro: 一种自适应多模态融合与对比学习方法用于全面两阶段抗病毒肽鉴定

Xinru Wen, Weizhong Lin, zi liu, Xuan Xiao

专题命中 跨模态检索 :multi-modal(title)

AI总结 AVP-Pro通过自适应多模态融合和对比学习方法,实现了抗病毒肽的高效两阶段鉴定,提升了模型判别能力和小样本下的分类精度。

Comments arXiv admin note: substantial text overlap with arXiv:2512.21544

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21544 2025-12-29 cs.LG 71%

AVP-Fusion: Adaptive Multi-Modal Fusion and Contrastive Learning for Two-Stage Antiviral Peptide Identification

AVP-Fusion:适应性多模态融合与对比学习用于两阶段抗病毒肽识别

Xinru Wen, Weizhong Lin, Xuan Xiao

专题命中 跨模态检索 :multi-modal(title)

AI总结 AVP-Fusion通过自适应多模态融合与对比学习,实现了抗病毒肽的两阶段高效识别,显著提升准确率和决策边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01558 2025-10-03 cs.CE cs.LG eess.SP 71%

CardioRAG: A Retrieval-Augmented Generation Framework for Multimodal Chagas Disease Detection

Zhengyang Shen, Xuehao Zhai, Hua Tu, Mayue Shi

机构 * Department of Electrical and Electronic Engineering Imperial College London(帝国理工学院电子与电气工程系) Department of Civil and Environmental Engineering Imperial College London(帝国理工学院土木与环境工程系) Institute of Biomedical Engineering Department of Engineering Science University of Oxford(牛津大学生物医学工程研究所)

专题命中 跨模态检索 :multimodal(title)

Comments 4 pages, 2 figures. Accepted for oral presentation at the 52nd international Computing in Cardiology Conference (CinC2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16768 2025-06-23 cs.IR 71%

eSapiens: A Real-World NLP Framework for Multimodal Document Understanding and Enterprise Knowledge Processing

Isaac Shi, Zeyuan Li, Wenli Wang, Lewei He, Yang Yang, Tianyu Shi

专题命中 跨模态检索 :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08953 2025-05-15 q-bio.QM 71%

Multimodal Modeling of Ultradian Rhythms Using the Hankel Alternative View of Koopman (HAVOK) Analysis

Emmanuel Molefi, Billy C. Smith, Christopher Thornton, Peter N. Taylor, Yujiang Wang

专题命中 跨模态检索 :multimodal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11251 2024-12-03 cs.IR 71%

Unifying Multimodal Retrieval via Document Screenshot Embedding

Xueguang Ma, Sheng-Chieh Lin, Minghan Li, Wenhu Chen, Jimmy Lin

专题命中 跨模态检索 :multimodal(title)

Comments EMNLP2024 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20325 2024-10-29 cs.LG cs.SI 71%

Domain Specific Data Distillation and Multi-modal Embedding Generation

Sharadind Peddiraju, Srini Rajagopal

专题命中 跨模态检索 :multi-modal(title)

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00955 2024-08-06 cs.LG cs.CY 71%

FairEHR-CLP: Towards Fairness-Aware Clinical Predictions with Contrastive Learning in Multimodal Electronic Health Records

Yuqing Wang, Malvika Pillai, Yun Zhao, Catherine Curtin, Tina Hernandez-Boussard

专题命中 跨模态检索 :multimodal(title)

Comments MLHC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15151 2024-04-24 q-bio.NC 71%

Semantic distance organizes social knowledge: Insights from semantic dementia and cross-modal conceptual space

Y. Ivette Colón, Matthew Rouse, Matthew A. Lambon Ralph, Timothy T. Rogers

专题命中 跨模态检索 :cross-modal(title)

Comments 6 pages, CogSci proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06556 2023-08-15 cs.IR 71%

Contrastive Learning for Cross-modal Artist Retrieval

Andres Ferraro, Jaehun Kim, Sergio Oramas, Andreas Ehmann, Fabien Gouyon

专题命中 跨模态检索 :cross-modal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11080 2023-04-24 eess.SP cs.LG 71%

Multimodal contrastive learning for diagnosing cardiovascular diseases from electrocardiography (ECG) signals and patient metadata

Tue M. Cao, Nhat H. Tran, Phi Le Nguyen, Hieu Pham

专题命中 跨模态检索 :multimodal(title)

Comments Accepted for presentation at the Midwest Machine Learning Symposium (MMLS 2023), Chicago, IL, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06991 2023-04-17 cs.IR 71%

WYTIWYR: A User Intent-Aware Framework with Multi-modal Inputs for Visualization Retrieval

Shishi Xiao, Yihan Hou, Cheng Jin, Wei Zeng

专题命中 跨模态检索 :multi-modal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.14779 2022-11-29 cs.CR cs.LG q-fin.ST 71%

Who is Gambling? Finding Cryptocurrency Gamblers Using Multi-modal Retrieval Methods

Zhengjie Huang, Zhenguang Liu, Jianhai Chen, Qinming He, Shuang Wu, Lei Zhu, Meng Wang

专题命中 跨模态检索 :multi-modal(title)

Journal ref International Journal of Multimedia Information Retrieval (2022): 1-13

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.12866 2019-12-02 cs.IR 71%

Macross: Urban Dynamics Modeling based on Metapath Guided Cross-Modal Embedding

Yunan Zhang, Heting Gao, Tarek Abdelzaher

专题命中 跨模态检索 :cross-modal(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.10335 2019-10-24 cs.LG cs.HC cs.SI stat.ML 71%

USTAR: Online Multimodal Embedding for Modeling User-Guided Spatiotemporal Activity

Amila Silva, Shanika Karunasekera, Christopher Leckie, Ling Luo

专题命中 跨模态检索 :multimodal(title)

Comments 10 pages, IEEE International Conference on Big Data 2019 (IEEE Big Data 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1505.02798 2015-05-13 cs.IR 71%

Math Search for the Masses: Multimodal Search Interfaces and Appearance-Based Retrieval

Richard Zanibbi, Awelemdy Orakwue

专题命中 跨模态检索 :multimodal(title)

Comments Paper for Invited Talk at 2015 Conference on Intelligent Computer Mathematics (July, Washington DC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16536 2026-08-18 cs.CR cs.CL 新提交 70%

DSPrompt: Dynamic Soft Prompt Defense Against M-RAG Corruption

DSPrompt:针对M-RAG污染的动态软提示防御

Chang Liu, Yuni Lai, Mingyue Cui, Cong Tian, Yunyan Zhang, Xian Wu, Kai Zhou, Bin Xiao

专题命中 跨模态检索 :multimodal(abstract,abstract_cn);分类 cs.CL

AI总结 本文针对M-RAG面临的对抗攻击问题,提出DSPrompt动态软提示防御框架,通过在冻结检索器编码器插入可学习软提示,以低开销实现了优于现有方法的防御效果,同时维持检索与生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02583 2026-08-18 cs.CV 版本更新 70%

FusionBERT: Multi-View Image--3D Retrieval via Cross-Attention Visual Fusion and Normal-Aware 3D Encoder

FusionBERT: 多视角图像-3D检索 via 跨注意力视觉融合与正常感知3D编码器

Wei Li, Yufan Ren, Hanqing Jiang, Jianhui Ding, Zhen Peng, Leman Feng, Yichun Shentu, Guoqiang Xu, Baigui Sun

机构 * IROOTECH TECHNOLOGY Wolf 1069 b Lab, Sany Group(三一集团Wolf 1069 b实验室) Zhejiang University(浙江大学) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) BPIT, Sany Group(三一集团BPIT)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 FusionBERT通过跨注意力视觉融合和正常感知3D编码器,实现多视角图像-3D多模态检索,提升跨模态检索性能。

Comments 9 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14355 2026-08-17 cs.AI 新提交 70%

Disentangled Shared Representations Improve Morpho-Transcriptomic Integration

解耦共享表示可改进形态-转录组整合

Julian Ostermaier, Swann Ruyter, Reuben Dorent, Daniel Racoceanu

机构 * ESPCI Paris, PSL University(巴黎高等物理化工学院,PSL大学) Sorbonne Université(索邦大学) CNRS(法国国家科学研究中心) Inserm(法国国家健康与医学研究院) AP-HP(巴黎公共医疗集团) Inria(法国国家信息与自动化研究所) Paris Brain Institute – ICM(巴黎脑研究所 – ICM)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本研究针对空间转录组学的多模态表示学习问题,对比不同模型的标准与解耦变体,发现解耦共享与模态特有信息可提升相关指标,为多模态学习提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09931 2026-08-11 cs.CV 新提交 70%

Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots

监督之前的感知:来自反事实盲区的自包含视觉蒸馏

Shravan Venkatraman, Omkar Thawakar, Ritesh Thawkar, Abdelrahman Shaker, Rao Muhammad Anwer

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Aalto University(阿尔托大学)

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 该研究提出首个完全自包含的视觉自蒸馏框架 CVPD,通过识别模型视觉盲区生成密集对比监督,在 Qwen3-VL-8B-Instruct 上的 12 个基准中优于 6 个自进化基线,取得多项指标提升且无性能倒退。

Comments BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03292 2026-08-05 cs.AI 新提交 70%

DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning

DocTrace:面向可追溯的长文档视觉问答的分层证据图推理方法

Le Xiang, Zhicheng Guan, Hong Chen, Xiaocong Lin, Zhenghua Lei, Teng Hu, Bolei He, Long Zeng

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 本文提出DocTrace分层框架,将长文档视觉问答建模为显式证据图推理问题,经两阶段训练优化后,在三个基准上优于现有模型,且推理可追溯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02688 2026-08-05 cs.LG cs.AI 新提交 70%

Learning Molecular Representations from Cellular Phenotypes with Structure Preservation

基于结构保留的细胞表型分子表示学习

Xuan Lin, Jingyu Sheng, Tengfei Ma, Li Sun, Dapeng Xiong

机构 * Xiangtan University(湘潭大学) Hunan University(湖南大学) Beijing University of Posts and Telecommunications(北京邮电大学) Southeast University(东南大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出结构保留的PhenMol框架,通过解耦分子与细胞表示实现表型引导对齐,在多类任务上提升性能,为药物发现整合细胞表型与化学知识提供了有效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12477 2026-07-17 cs.AI cs.LG 版本更新 70%

DualHNIE: Dual-Channel Hypergraph Learning for Node Importance Estimation in Heterogeneous Knowledge Graphs

MetaHGNIE:异构知识图谱中的元路径诱导超图对比学习

Jiawen Chen, Yanyan He, Qi Shao, Mengli Wei, Duxin Chen, Wenwu Yu, Yanlong Zhao

机构 * Jiangsu Key Laboratory of Networked Collective Intelligence, School of Mathematics, Southeast University(江苏网络集体智能重点实验室,数学学院,东南大学) Jiangsu Key Laboratory of Networked Collective Intelligence, School of Cyber Science and Engineering, Southeast University(江苏网络集体智能重点实验室,网络科学与工程学院,东南大学) State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, University of Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 研究异构知识图谱中节点重要性估计问题,提出DualHNIE框架,通过构建高阶知识图谱、引入互补编码器及对比对齐机制进行显式高阶建模和解缠双通道表示学习,实验验证其优于现有方法。

Comments Accepted by IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00798 2026-07-02 cs.CV 新提交 70%

ClinRAG-GRAPH: Clinical-prior Retrieval-Augmented Graph Model with Domain Adversarial Learning for Breast pCR Prediction

ClinRAG-GRAPH: 基于临床先验的检索增强图模型与领域对抗学习用于乳腺癌pCR预测

Yaofei Duan, Yuhao Huang, Tianyu Zhang, Yuan Gao, Luyi Han, Xin Wang, Xinyu Xie, Xinglong Liang, Chunyao Lu, Muzhen He, Patrick Pang, Yue Sun, Ning Mao, Tao Tan, Ritse Mann

机构 * Department of Medical Imaging, Radboud University Medical Center, Nijmegen, The Netherlands(拉德堡德大学医学中心医学影像科,奈梅亨,荷兰) The Netherlands Cancer Institute, Amsterdam, The Netherlands(荷兰癌症研究所,阿姆斯特丹,荷兰) Faculty of Applied Sciences, Macao Polytechnic University, Macau, China(澳门理工大学应用科学学院,澳门,中国) Boston Children’s Hospital, Harvard Medical School, Boston, USA(波士顿儿童医院,哈佛医学院,波士顿,美国) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences, Hong Kong, China(中国科学院香港创新研究院人工智能与机器人创新中心,香港,中国) Imaging Division, University Medical Center Utrecht, Utrecht, The Netherlands(乌得勒支大学医学中心影像部,乌得勒支,荷兰) Department of Radiology, Fuzhou University Affiliated Provincial Hospital, Fuzhou, China(福州大学附属省立医院放射科,福州,中国) Department of Radiology, Yantai Yuhuangding Hospital, Shandong, China(烟台毓璜顶医院放射科,山东,中国)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出ClinRAG-GRAPH框架,通过构建患者内临床先验图、双分支领域对抗学习和大语言模型驱动的子图检索增强模块,实现术前pCR预测,在内部和外部测试集上取得良好性能。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00374 2026-07-02 cs.CV cs.AI cs.CL cs.IR cs.MM 新提交 70%

Learning to Compose: Revisiting Proxy Task Design for Zero-Shot Composed Image Retrieval

学习组合:重新审视零样本组合图像检索的代理任务设计

Jingjing Zhang, Lei Zhang, Zheren Fu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出FoCo模型,通过文本锚定的视觉聚合和上下文条件语义补全两个代理任务联合学习组合函数,在零样本组合图像检索中取得最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏