arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6917 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6917 篇

2603.00699 2026-03-03 astro-ph.IM 78%

Deep learning-based astronomical multimodal data fusion: A comprehensive review

基于深度学习的天文多模态数据融合:综述

Wujun Shao, Dongwei Fan, Chenzhou Cui, Yunfei Xu, Shirui Wei, Xin Lyu

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文综述了基于深度学习的天文多模态数据融合方法,探讨了其在数据融合中的应用、挑战及未来发展方向。

Journal ref Information Fusion 130 (2026) 104103

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00193 2026-03-03 q-bio.QM 78%

Multimodal Alignment Improves Generalizability of Genomic Biomarker Prediction in Computational Pathology

多模态对齐提升了计算病理学中基因组生物标志物预测的泛化能力

Ekaterina Redekop, Eric Zimmermann, Ava P Amini, Alex X Lu, Neil Tenenholtz, James Brian Hall, Lorin Crawford, Kristen A Severson

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 MARBLE通过多模态对比预训练策略,将组织病理学图像与基因组生物标志物的表示对齐,提升计算病理学中基因组生物标志物预测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23862 2026-03-02 cs.HC 78%

Human-Centered Multimodal Fusion for Sexism Detection in Memes with Eye-Tracking, Heart Rate, and EEG Signals

以人类为中心的多模态融合用于表情包中性别歧视检测:结合眼动追踪、心率和EEG信号

Iván Arcos, Paolo Rosso, Elena Gomis-Vicent

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出了一种结合眼动追踪、心率和EEG信号的多模态融合模型,用于更准确地检测表情包中的性别歧视。

Comments Accepted to appear in the Proceedings of LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19955 2026-03-02 cs.IR 78%

Multimodal-enhanced Federated Recommendation: A Group-wise Fusion Approach

多模态增强的联邦推荐:一种组级融合方法

Chunxu Zhang, Weipeng Zhang, Guodong Long, Zhiheng Xue, Riting Xia, Bo Yang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出了一种多模态增强的联邦推荐方法,通过组级融合机制提升推荐系统在多模态特征整合方面的性能。

Comments Accepted at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22796 2026-02-27 cs.IT math.IT 78%

Multi-modal Data Driven Virtual Base Station Construction for Massive MIMO Beam Alignment

多模态数据驱动的大规模MIMO波束对准虚拟基站构造

Yijie Bian, Wei Guo, Jie Yang, Shenghui Song, Jun Zhang, Shi Jin, Khaled B. Letaief

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出利用多模态数据构建虚拟基站以优化大规模MIMO波束对准,通过几何镜像和稀疏表示提升频谱效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18005 2026-02-23 eess.SP 78%

Multi-Modal Sensing Residual-Corrected GNN for mmWave Path Loss Prediction via Synesthesia of Machines

多模态感知残差校正图神经网络用于毫米波路径损耗预测的机器合成感知

Mengyuan Lu, Lu Bai, Xiang Cheng

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出一种多模态感知残差校正图神经网络,用于毫米波路径损耗预测,结合拓扑感知图表示和细粒度视觉语义,实现高精度路径损耗估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08755 2026-02-19 cs.LG 78%

Align and Adapt: Multimodal Multiview Human Activity Recognition under Arbitrary View Combinations

对齐与适应:在任意视图组合下的人类活动识别多模态多视角学习

Duc-Anh Nguyen, Nhien-An Le-Khac

机构 * University College Dublin(都柏林大学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 AliAd通过结合多视角对比学习和专家混合模块,实现任意视图组合下的灵活多模态人类活动识别,提升模型适应性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09507 2026-02-11 cs.LG 78%

Towards Uniformity and Alignment for Multimodal Representation Learning

迈向多模态表示学习的统一性与对齐

Wenzhe Yin, Pan Zhou, Zehao Xiao, Jie Liu, Shujian Yu, Jan-Jakob Sonke, Efstratios Gavves

机构 * University of Amsterdam(阿姆斯特丹大学) The Netherlands Cancer Institute(荷兰癌症研究所) The Arctic University of Norway(挪威北极大学) Singapore Management University(新加坡管理大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出了一种多模态表示学习的方法,通过分离对齐和统一性以解决冲突,提升模型在检索和生成任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07465 2026-02-10 cs.LG 78%

Multi-Modal Data Fusion for Moisture Content Prediction in Apple Drying

多模态数据融合用于苹果干燥中的含水率预测

Shichen Li, Chenhui Shao

机构 * Department of Mechanical Science and Engineering, University of Illinois at Urbana-Champaign, Urbana, IL 61801, USA(伊利诺伊大学厄巴纳-香槟分校机械科学与工程系) Department of Mechanical Engineering, University of Michigan, Ann Arbor, MI 48109, USA(密歇根大学安娜堡分校机械工程系)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出多模态数据融合框架,通过融合表格数据和图像数据提高苹果干燥含水率预测的准确性,有效降低误差并增强鲁棒性。

Comments Accepted for publication in the Proceedings of the 53rd North American Manufacturing Research Conference (NAMRC 53), to appear in Manufacturing Letters

Journal ref Manufacturing Letters Volume 44, Supplement, August 2025, Pages 1316-1325

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18742 2026-02-04 cs.LG 78%

Constraint Matters: Multi-Modal Representation for Reducing Mixed-Integer Linear programming

约束至关重要:用于减少混合整数线性规划的多模态表示

Jiajun Li, Yixuan Li, Ran Hou, Yu Ding, Shisi Guan, Jiahui Duan, Xiongwei Han, Tao Zhong, Vincent Chau, Weiwei Wu, Wanyuan Wang

机构 * Southeast University(东南大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出了一种基于约束的多模态表示方法,用于提高混合整数线性规划问题的求解效率和解的质量。

Comments Accecpted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00730 2026-02-03 cs.IR 78%

Towards Trustworthy Multimodal Recommendation

迈向可信的多模态推荐

Zixuan Li

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出了一种多模态推荐系统中的可信度校正方法,通过学习模态特征的软对应关系以提升鲁棒性,并验证了交互级可信度的两个关键观察。

Comments Preprint, 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02399 2026-02-03 cs.CR 78%

AtomGraph: Tackling Atomicity Violation in Smart Contracts using Multimodal GCNs

AtomGraph: 通过多模态GCN解决智能合约中的原子性违规问题

Xiaoqi Li, Zongwei Li, Wenkai Li, Zeng Zhang, Lei Xie

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 AtomGraph通过多模态GCN检测智能合约中的原子性违规,实现高准确率和F1分数,优于现有工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19908 2026-01-29 cs.AR cs.LG 78%

CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference

基于芯片组的异构近内存加速用于边缘多模态大语言模型推理

Yanru Chen, Runyang Tian, Yue Pan, Zheyu Li, Weihong Xu, Tajana Rosing

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 CHIME通过异构近内存加速方案,提升边缘多模态大语言模型推理的效率和能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18683 2026-01-27 stat.ME astro-ph.IM cs.LG 78%

Learned harmonic mean estimation of the marginal likelihood for multimodal posteriors with flow matching

基于流匹配的连续归一化流用于多模后验的学得谐均估计

Alicja Polanska, Jason D. McEwen

机构 * Mullard Space Science Laboratory, University College London(穆尔空间科学实验室,伦敦大学学院) Alan Turing Institute(艾伦·图灵研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出基于流匹配的连续归一化流,用于高效估计多模后验的边际似然,解决了传统方法在处理复杂后验时的局限性。

Comments Submitted to 44th International Workshop on Bayesian Inference and Maximum Entropy Methods in Science and Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05840 2026-01-27 cs.LG 78%

Multimodal Trajectory Representation Learning for Travel Time Estimation

多模态轨迹表示学习用于旅行时间估计

Zhi Liu, Xuyuan Hu, Xiao Han, Zhehao Dai, Zhaolin Deng, Guojiang Shen, Xiangjie Kong

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang University of Technology College of Computer Science(浙江工业大学计算机科学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出多模态动态轨迹整合框架,通过整合GPS、网格轨迹和道路网络约束,提升旅行时间估计的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15390 2026-01-23 cs.LG 78%

FedUMM: A General Framework for Federated Learning with Unified Multimodal Models

FedUMM: 一种统一多模态模型的联邦学习通用框架

Zhaolong Su, Leheng Zhao, Xiaoying Wu, Ziyue Xu, Jindong Wang

机构 * NVIDIA

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 FedUMM提出了一种低通信成本的联邦学习框架,用于训练统一多模态模型,通过参数高效微调实现客户端和服务器的高效协作,提升了隐私保护下的多模态模型训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14942 2026-01-22 cs.LG eess.SP 78%

Communication-Efficient Multi-Modal Edge Inference via Uncertainty-Aware Distributed Learning

通过不确定性感知的分布式学习实现高效的多模态边缘推断

Hang Zhao, Hongru Li, Dongfang Xu, Shenghui Song, Khaled B. Letaief

机构 * Dept. of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出一种三阶段通信感知分布式学习框架,通过减少通信开销和提升稳健性,实现高效的多模态边缘推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13979 2026-01-21 cs.RO 78%

Active Cross-Modal Visuo-Tactile Perception of Deformable Linear Objects

主动跨模态视觉-触觉感知用于可变形线性物体

Raffaele Mazza, Ciro Natale, Pietro Falco

机构 * Dipartimento di Ingegneria, Università degli Studi della Campania Luigi Vanvitelli(工程学院,坎帕尼亚路易吉·范维蒂利大学) Dipartimento di Ingegneria dell’Informazione, Università degli Studi di Padova(信息工程学院,帕多瓦大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 本文提出一种结合视觉和触觉的跨模态感知框架,用于重建受遮挡的可变形线性物体的3D形状。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11545 2026-01-21 cs.HC 78%

Multimodal Data Fusion to Capture Dynamic Interactions between Built Environment and Vulnerable Older Adults

多模态数据融合以捕捉建成环境与易受伤害的老年人之间的动态交互

Houhao Liang, Azrin Jamaluddin, Kresimir Friganovic, Kirstie Neo, Raphael Han, Navrag Singh, Panos Mavros

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本研究通过多模态数据融合技术,探索建成环境对易受伤害老年人移动性的影响,为包容性城市规划提供数据支持。

Comments This work has been accepted to the AAAI 2026 Workshop on AI for Urban Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07399 2026-01-19 cs.IR 78%

Are Multimodal Embeddings Truly Beneficial for Recommendation? A Deep Dive into Whole vs. Individual Modalities

多模态嵌入真的能提升推荐效果吗?对整体与个体模态的深入探究

Yu Ye, Junchen Fu, Yu Song, Kaiwen Zheng, Joemon M. Jose

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 研究探讨多模态嵌入对推荐效果的实际影响,发现整体嵌入提升效果有限,但文本模态单独使用效果显著,图像模态则不具优势。

Comments Accepted by ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06140 2026-01-13 cs.LG stat.ML 78%

Causal and Federated Multimodal Learning for Cardiovascular Risk Prediction under Heterogeneous Populations

因果与联邦多模态学习用于异质人群中的心血管风险预测

Rohit Kaushik, Eva Kaushik

机构 * Hanson Professional Services(Hanson专业服务) University of Tennessee, Knoxville(田纳西大学 Knoxville分校) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种融合因果学习与联邦学习的多模态框架,用于在异质人群中预测心血管风险,通过整合多种生物医学数据并确保隐私和可解释性,提升预测的鲁棒性和公平性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22947 2026-01-12 eess.SP 78%

Intelligent Multimodal Multi-Sensor Fusion-Based UAV Identification, Localization, and Countermeasures for Safeguarding Low-Altitude Economy

智能多模多传感器融合-based无人机识别、定位与防护系统用于保障低空经济安全

Yi Tao, Zhen Gao, Fangquan Ye, Jingbo Xu, Tao Song, Weidong Li, Yu Su, Lu Peng, Xiaomei Wu, Tong Qin, Zhongxiang Li, Dezhi Zheng

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出基于深度学习的多模多传感器融合系统,用于实现无人机的识别、定位与防护,提升低空经济安全防护效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24793 2026-01-01 cs.LG cs.NE 78%

Self-Supervised Neural Architecture Search for Multimodal Deep Neural Networks

多模态深度神经网络的自监督神经架构搜索

Shota Suzuki, Satoshi Ono

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出了一种自监督学习方法,用于多模态深度神经网络的架构搜索,能够在未标记数据上有效设计DNN架构。

Journal ref IEICE Transactions on Information and Systems, Vol.E108.D, No. 6, pp. 640-643, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22102 2025-12-29 cs.LG 78%

Explainable Multimodal Regression via Information Decomposition

通过信息分解实现可解释的多模态回归

Zhaozhao Ma, Shujian Yu

机构 * Zhejiang University(浙江大学) Georgia Institute of Technology(佐治亚理工学院) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) UiT - The Arctic University of Norway(挪威北极大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出基于部分信息分解的多模态回归框架,通过分解模态特定表示为唯一、冗余和协同组件,提升预测准确性和可解释性,并在多个数据集上验证其有效性。

Comments Project Page: https://github.com/zhaozhaoma/PIDReg

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21543 2025-12-29 cs.IR 78%

CEMG: Collaborative-Enhanced Multimodal Generative Recommendation

CEMG: 基于协作增强的多模态生成推荐

Yuzhen Lin, Hongyi Chen, Xuanjing Chen, Shaowen Wang, Ivonne Xu, Dongming Jiang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 CEMG通过多模态融合层和残差量化变分自编码器,提升多模态生成推荐的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18117 2025-12-23 cs.IR 78%

Factorized Transport Alignment for Multimodal and Multiview E-commerce Representation Learning

因子化运输对多模态和多视角电商表示学习

Xiwen Chen, Yen-Chieh Lien, Susan Liu, María Castaños, Abolfazl Razi, Xiaoting Zhao, Congzhe Su

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出因子化运输框架,通过统一多模态和多视角学习,提升电商场景下的检索性能。

Comments Accepted by WSDM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10729 2025-12-23 cs.LG 78%

Using LLMs for Late Multimodal Sensor Fusion for Activity Recognition

利用大语言模型进行晚阶段多模态传感器融合以进行活动识别

Ilker Demirel, Karan Thakkar, Benjamin Elizalde, Miquel Espi Marques, Aditya Sarathy, Yang Bai, Umamahesh Srinivas, Jiajie Xu, Shirley Ren, Jaya Narain

机构 * Apple(苹果公司) MIT(麻省理工学院) Johns Hopkins(约翰霍普金斯大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 利用大语言模型进行晚阶段多模态融合,实现零样本和单样本活动分类,无需特定任务训练。

Comments NeurIPS Workshop on Learning from Time Series for Health

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05037 2025-12-19 cs.LG 78%

ModalSurv: Investigating opportunities and limitations of multimodal deep survival learning in prostate and bladder cancer

ModalSurv: 探索多模态深度生存学习在前列腺和膀胱癌中的机会与局限

Noorul Wahab, Ethar Alzaid, Jiaqi Lv, Fayyaz Minhas, Adam Shephard, Shan E Ahmed Raza

机构 * TIA Centre, Department of Computer Science, University of Warwick, UK(沃里克大学计算机科学系TIA中心,英国)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 ModalSurv通过多模态数据整合提升生存预测,但在外部测试中临床特征表现更优,揭示了多模态对齐的挑战和泛化能力的限制。

Comments 4 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22780 2025-12-17 cs.LG physics.geo-ph 78%

Multimodal Atmospheric Super-Resolution With Deep Generative Models

多模态大气超分辨率与深度生成模型

Dibyajyoti Chakraborty, Haiwen Guan, Jason Stock, Troy Arcomano, Guido Cervone, Romit Maulik

机构 * Information Sciences and Technology(信息科学与技术系) The Pennsylvania State University(宾夕法尼亚州立大学) Environmental Science Division(环境科学部) Argonne National Laboratory(阿贡国家实验室) Department of Geography(地理系)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出利用基于分数的扩散模型进行多模态大气超分辨率,通过结合稀疏观测数据提升高维状态恢复精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12881 2025-12-16 cs.LG q-bio.NC stat.ML 78%

Unsupervised learning of multiscale switching dynamical system models from multimodal neural data

从多模态神经数据中无监督学习多尺度切换动力学系统模型

DongKyu Kim, Han-Lin Hsieh, Maryam M. Shanechi

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出了一种无监督学习方法,通过多尺度神经观测学习切换多尺度动力学系统模型,以更准确解码行为并提升脑机接口性能。

Comments 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏