arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6917 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6917 篇

2604.26313 2026-04-30 cs.CR cs.LG 78%

VulStyle: A Multi-Modal Pre-Training for Code Stylometry-Augmented Vulnerability Detection

VulStyle:一种多模态预训练用于代码风格度量增强的漏洞检测

Chidera Biringa, Ajmal Abbas, Vishnu Selvaraj, Gokhan Kul

机构 * University of Massachusetts Dartmouth(马萨诸塞大学达特茅斯分校)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 VulStyle通过融合函数级源代码、非终端AST结构和代码风格度量特征,提升漏洞检测性能,实现BigVul和VulDeePecker上的F1指标提升。

Comments 12 pages, 2 figures. Accepted at the 56th Annual IEEE/IFIP International Conference on Dependable Systems and Networks (DSN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23112 2026-04-28 cs.LG 78%

Conditional Imputation for Within-Modality Missingness in Multi-Modal Federated Learning

多模态联邦学习中模态内缺失的条件补全

Wugeng Zheng, Ziwen Kan, Katie Wang, Chen Chen, Song Wang

机构 * University of Central Florida(佛罗里达大学)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract)

AI总结 本文提出CondI框架,通过条件扩散模型解决多模态联邦学习中的模态内缺失问题,采用两阶段训练流程提升模态特定提取器和联合嵌入空间的性能,实验表明在三个临床数据集上效果与现有方法相当。

Comments Wugeng Zheng and Ziwen Kan contributed equally to this work. Song Wang is the corresponding author. Accepted to FedVision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22763 2026-04-28 cs.HC 78%

A learning health system in Neurorehabilitation as a foundation for multimodal patient representation

神经康复中的学习健康系统作为多模态患者表示的基础

Thomas Weikert, Eljas Roellin, Lukas Heumos, Fabian J. Theis, Diego Paez-Granados, Chris Easthope Awai

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出通过整合多模态数据采集、模型计算和临床可视化,构建神经康复中的学习健康系统,以促进临床与机器学习的合作,解决数据碎片化、互操作性差和临床人员参与度低的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12938 2026-04-28 cs.LG physics.ao-ph 78%

Local Off-Grid Weather Forecasting with Multi-Modal Earth Observation Data

本地非网格天气预报与多模态地球观测数据

Qidong Yang, Jonathan Giezendanner, Daniel Salles Civitarese, Johannes Jakubik, Eric Schmitt, Anirban Chandra, Jeremy Vila, Detlef Hohl, Chris Hill, Campbell Watson, Sherrie Wang

机构 * Massachusetts Institute of Technology(麻省理工学院) IBM Research(IBM研究院) Shell Information Technology International Inc.(壳牌信息技术国际公司)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出一种多模态Transformer模型,通过端到端训练将网格化预报降尺度至非网格位置,提升局部天气预测精度,实验显示其优于多种非数据驱动和数据驱动的非网格预报方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21585 2026-04-24 eess.SP 78%

Scalable Multimodal Beam Alignment in V2X: An Anti-Imbalance Graph Learning Approach

面向V2X的可扩展多模态波束对齐:一种反不平衡图学习方法

Jiahui Liang, Shuoyao Wang, Shijian Gao

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种分布式多模态图波束对齐框架,利用车载多模态传感数据预测隐式反馈,并通过图神经网络协调多用户对齐,提升可扩展性并减少开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18460 2026-04-21 cs.LG 78%

Learning Invariant Modality Representation for Robust Multimodal Learning from a Causal Inference Perspective

从因果推断视角学习不变模态表示以实现稳健的多模态学习

Sijie Mai, Shiqin Han

机构 * School of Computer Science, South China Normal University(华南师范大学计算机学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出CmIR框架,通过因果推断分离模态中的因果不变表示与环境特定的虚假表示,提升多模态学习的鲁棒性和泛化能力。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14839 2026-04-17 cs.IR 78%

Well Begun is Half Done: Training-Free and Model-Agnostic Semantically Guaranteed User Representation Initialization for Multimodal Recommendation

万事开头难:免训练 且模型无关的语义保证用户表示初始化方法用于多模态推荐

Jinfeng Xu, Zheyu Chen, Shuo Yang, Jinze Li, Hewei Wang, Jianheng Tang, Wei Wang, Xiping Hu, Edith C. H. Ngai

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出SG-URInit方法,通过整合用户交互物品的模态特征和全局聚类特征,实现免训练且模型无关的用户表示初始化,有效提升多模态推荐性能并缓解物品冷启动问题。

Comments Accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11066 2026-04-17 cs.IR 78%

Decoupled Multimodal Fusion for User Interest Modeling in Click-Through Rate Prediction

解耦多模态融合用于点击通过率预测中的用户兴趣建模

Alin Fan, Hanqing Li, Sihan Lu, Jingsong Yuan, Jiandong Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出解耦多模态融合方法,通过构建目标感知特征和优化注意力机制,提升用户兴趣建模效果,实验表明在公开和工业数据集上均取得显著提升。

Comments Accepted by ICDE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13247 2026-04-16 cs.CE 78%

Cross-Platform Domain Adaptation for Multi-Modal MOOC Learner Satisfaction Prediction

跨平台领域适应用于多模态MOOC学习者满意度预测

Jakub Kowalski, Magdalena Piotrowska

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文研究了在缺乏目标平台标签的情况下,利用跨平台领域适应技术进行多模态MOOC学习者满意度预测,提出ADAPT-MS框架,通过文本编码、跨平台表征对齐、评分偏差校正和缺失行为模态处理,提升了预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10086 2026-04-14 astro-ph.IM 78%

A Multi-modal Fusion Network for Star-Galaxy Classification from CSST Simulated Datasets

基于CSST模拟数据的多模态融合网络用于星系分类

Zhuoming Han, Tianmeng Zhang, Chao Liu, Chenxiaoji Ling

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出基于ResNet-50和BiLSTM的多模态融合网络,利用CSST模拟数据提升星系和恒星分类性能,达到99.81%的召回率。

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09905 2026-04-14 cs.LG 78%

Improving Pediatric Emergency Department Triage with Modality Dropout in Late Fusion Multimodal EHR Models

通过晚期融合多模态EHR模型中的模态脱落改进儿科急诊分诊

Tyler Yang, Romal Mitr

机构 * Stanford University(斯坦福大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种晚期融合多模态架构,结合XGBoost和Bio_ClinicalBERT处理结构化数据和非结构化文本,通过逻辑回归元分类器预测急诊严重程度指数,通过模态脱落提升模型在儿科群体中的泛化能力。

Comments 10 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08971 2026-04-13 cs.LG 78%

Modality-Aware Zero-Shot Pruning and Sparse Attention for Efficient Multimodal Edge Inference

感知-aware零样本剪枝与稀疏注意力用于高效多模态边缘推断

Yueyuan Sui, Payal Mohapatra, Doğaç Eldenk, Haodong Yang, Yiting Zhang, Haoyan Zhang, Qi Zhu, Stephen Xia

机构 * Northwestern University(西北大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出SentryFuse框架,通过模态感知的剪枝和稀疏注意力机制,在无需微调的情况下提升多模态边缘推断的效率与准确性,实现12.7%的平均精度提升和28.2%的内存减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08089 2026-04-10 cs.SE 78%

GALA: Multimodal Graph Alignment for Bug Localization in Automated Program Repair

GALA: 多模态图对齐用于自动化程序修复中的缺陷定位

Zhuoyao Liu, Zhengran Zeng, Shu-Dong Huang, Yang Liu, Shikun Zhang, Wei Ye

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 GALA通过多模态图对齐方法,解决GUI截图场景下自动化程序修复的缺陷定位问题,通过结构化推理提升视觉与代码的映射精度。

Comments Code available at: https://github.com/lzyyyyy666/GALA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08065 2026-04-10 cs.LG 78%

Multimodal Latent Reasoning via Predictive Embeddings

通过预测嵌入进行多模态潜在推理

Ashutosh Adhikari, Mirella Lapata

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出Pearl框架,通过学习专家工具使用轨迹在潜在空间中进行多模态推理,无需显式调用工具,优于传统重建方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07746 2026-04-10 cs.LG cs.CE physics.comp-ph 78%

Towards Rapid Constitutive Model Discovery from Multi-Modal Data: Physics Augmented Finite Element Model Updating (paFEMU)

面向多模态数据的快速本构模型发现:物理增强有限元模型更新(paFEMU)

Jingye Tan, Govinda Anantha Padmanabha, Steven J. Yang, Nikolaos Bouklas

机构 * University of Southern California(南加州大学) Cornell University(康奈尔大学) Ecole Polytechnique Federale de Lausanne (EPFL)(洛桑联邦理工学院) Pasteur Labs

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出paFEMU方法,结合AI本构建模、稀疏化可解释模型发现和基于有限元的伴随优化,利用多模态数据实现快速本构模型发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05668 2026-04-08 eess.SP 78%

A BEV-Fusion Based Framework for Sequential Multi-Modal Beam Prediction in mmWave Systems

基于BEV融合的毫米波系统中顺序多模束预测框架

Jiaming Zeng, Cunhua Pan, Haoyang Weng, Ruijing Liu, Hong Ren, Jiangzhou Wang

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出基于BEV融合的框架,通过统一相机、激光雷达、雷达和GPS模态,在共享鸟瞰图表示中实现空间一致的多模融合,提升毫米波系统中束预测的准确性。

Comments 13pages,7figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02818 2026-04-06 physics.ao-ph 78%

MAG-Net: Physics-Aware Multi-Modal Fusion of Geostationary Satellite and Radar for Severe Convective Precipitation Nowcasting

MAG-Net:融合静止卫星和雷达的物理感知多模态融合用于强对流降水nowcasting

Dandan Chen, Yaqiang Wang, Anyuan Xiong, Enda Zhu

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 MAG-Net通过融合静止卫星和雷达数据,利用物理约束提升对强对流降水的nowcasting性能,优于现有确定性和生成性模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02108 2026-04-03 cs.RO cs.LG 78%

Cross-Modal Visuo-Tactile Object Perception

跨模态视觉-触觉物体感知

Anirvan Dutta, Simone Tasciotti, Claudia Cusseddu, Ang Li, Panayiota Poirazi, Julijana Gjorgjieva, Etienne Burdet, Patrick van der Smagt, Mohsen Kaboli

机构 * BMW Group AG(宝马集团) Imperial College of Science, Technology and Medicine(帝国理工学院) University of Crete(克里特大学) Institute of Molecular Biology and Biotechnology, Foundation for Research and Technology-Hellas(分子生物学与生物技术研究所,研究与技术基金会-希腊) Technical University of Munich(慕尼黑工业大学) Eötvös Loránd University(罗兰大学) Foundation Robotics Labs(基础机器人实验室) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 本文提出跨模态潜在滤波器(CMLF),通过贝叶斯推断实现视觉与触觉信息的双向传递,提升机器人在不确定性下的物理属性估计效率与鲁棒性,同时展现类人感知耦合现象。

Comments 23 pages, 8 figures, 1 table. Submitted for review to journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04595 2026-03-27 cs.LG 78%

A Late-Fusion Multimodal AI Framework for Privacy-Preserving Deduplication in National Healthcare Data Environments

一种用于国家医疗数据环境中的隐私保护去重的晚融合多模态AI框架

Mohammed Omer Shakeel Ahmed

机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种多模态AI框架,通过语义嵌入、行为模式和设备元数据的晚融合方法,实现隐私保护下的去重,提升公共健康分析的可靠性。

Comments 6 pages, 1 figure, 1 table. Accepted for publication in the 2025 IEEE International Conference on Future Machine Learning and Data Science (FMLDS)

Journal ref 2025 IEEE International Conference on Future Machine Learning and Data Science (FMLDS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24024 2026-03-26 eess.SP 78%

Sensing-Assisted Adaptive Beam Probing with Calibrated Multimodal Priors and Uncertainty-Aware Scheduling

基于校准多模态先验和不确定性感知调度的传感辅助自适应波束探测

Abidemi Orimogunje, Vukan Ninkovic, Ognjen Kundacina, Hyunwoo Park, Sunwoo Kim, Dejan Vukobratovic, Evariste Twahirwa, Gaspard Gashema

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种传感辅助自适应探测策略,利用多模态传感数据校准波束先验,通过深度Q-集合预测波束奖励并结合置信度调度,减少训练开销并提高可靠性。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13677 2026-03-24 cs.CV cs.AI cs.LG cs.MM 78%

HeCoFuse: Cross-Modal Complementary V2X Cooperative Perception with Heterogeneous Sensors

HeCoFuse: 跨模态互补V2X协作感知与异构传感器

Chuheng Wei, Ziye Qin, Walter Zimmer, Guoyuan Wu, Matthew J. Barth

机构 * College of Engineering, Center for Environmental Research and Technology, University of California at Riverside(加州大学河滨分校工程学院、环境研究与技术中心) School of Transportation and Logistics, Southwest Jiaotong University(西南交通大学交通运输与物流学院) Chair of Robotics, Artificial Intelligence and Real-time Systems, TUM School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算机、信息与技术学院机器人、人工智能与实时系统教授职位)

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV、cs.AI、cs.MM

AI总结 HeCoFuse提出一种统一框架,通过通道和空间注意力机制实现异构传感器下的跨模态特征融合,提升协作感知的可靠性与性能,实验显示其在TUMTraf-V2X数据集上达到43.22%的3D mAP,优于基线方法。

Comments Ranked first in CVPR DriveX workshop TUM-Traf V2X challenge. Accepted by ITSC2025

Journal ref Proceedings of the 2025 IEEE 28th International Conference on Intelligent Transportation Systems (ITSC), pp. 1214-1221, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19596 2026-03-18 eess.SP cs.LG 78%

Towards Robust Multimodal Physiological Foundation Models: Handling Arbitrary Missing Modalities

迈向稳健的多模态生理基础模型:处理任意缺失模态

Wei-Bang Jiang, Xi Fu, Yi Ding, Cuntai Guan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出PhysioOmni模型,通过解耦多模态信号提取通用表示,解决现有方法在跨数据集泛化和缺失模态处理上的不足,实验显示其在情绪识别等任务中表现优异。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15004 2026-03-17 cs.SE 78%

TriFusion-LLM: Prior-Guided Multimodal Fusion with LLM Arbitration for Fine-grained Code Clone Detection

TriFusion-LLM:基于LLM仲裁的先验引导多模态融合用于细粒度代码克隆检测

Mengdi Li, Yuming Liu, He Wang, Zifeng Xu, Yuqing Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出TriFusion-LLM框架,结合传统机器学习的启发式相似性先验、AST结构信号和CodeBERT语义嵌入,提升细粒度代码克隆检测的分类性能,实验表明其在BigCloneBench上将Macro-F1提升至0.875。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12192 2026-03-17 physics.optics 78%

Multimodal Fusion Network for Micro-displacement Measurement via Michelson Interferometer

用于迈克尔逊干涉仪的多模融合网络微位移测量

Zixing Jia, Jiawei Li, Ziping Chen, Xin Li

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种多模融合网络用于高精度微位移测量,通过引入双头学习机制解决半波位移模糊问题,实现高精度位移和整数干涉阶分类,具备实时性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12726 2026-03-16 cs.IR cs.LG 78%

Anchored Alignment: Preventing Positional Collapse in Multimodal Recommender Systems

锚定对齐:防止多模态推荐系统中的位置坍塌

Yonghun Jeong, David Yoon Suk Kang, Yeon-Chang Lee

机构 * UNIST Ulsan(乌尼斯特大学(乌山)) Chungbuk National University(Chungbuk国立大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出AnchorRec框架,通过轻量投影域的间接锚定对齐方法,避免多模态推荐系统中的位置坍塌,提升推荐准确性和多模态表达性。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15414 2026-03-11 eess.IV 78%

Entropy-and-Channel-Aware Adaptive-Rate Semantic Communication with MLLM-Aided Feature Compensation

熵与信道感知的自适应速率语义通信 with MLLM辅助特征补偿

Weixuan Chen, Qianqian Yang, Yuhao Chen, Chongwen Huang, Qian Wang, Zehui Xiong, Zhaoyang Zhang

专题命中 多模态训练与对齐 :MLLM(title);multimodal(abstract)

AI总结 本文提出一种基于熵与信道感知的自适应速率语义通信框架,利用MLLM辅助特征补偿提升通信效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17204 2026-03-05 cs.LG cs.CE 78%

SpecBridge: Bridging Mass Spectrometry and Molecular Representations via Cross-Modal Alignment

SpecBridge: 通过跨模态对齐弥合质谱与分子表示

Yinkai Wang, Yan Zhou Chen, Xiaohui Chen, Li-Ping Liu, Soha Hassoun

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 SpecBridge通过跨模态对齐方法提升质谱数据中分子鉴定的准确性,利用冻结的基础模型实现高效检索。

Comments We have found a problem in the preprocessing/evaluation pipeline

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02672 2026-03-04 physics.plasm-ph 78%

PanoMHD: Multimodal Modelling of Plasma Dynamics towards Tokamak Control

PanoMHD:面向托卡马克控制的等离子体动力学多模态建模

Hyeongjun Noh, Chweeho Heo, Xiaotian Gao, Yong-Su Na

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 PanoMHD通过多模态建模提升等离子体稳定性预测,实现对托卡马克控制的先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22903 2026-03-04 cs.IR cs.LG 78%

PSQE: A Theoretical-Practical Approach to Pseudo Seed Quality Enhancement for Unsupervised Multimodal Entity Alignment

PSQE:一种伪种子质量增强的理论-实践方法用于无监督多模态实体对齐

Yunpeng Hong, Chenyang Bu, Jie Zhang, Yi He, Di Wu, Xindong Wu

机构 * Key Laboratory of Knowledge Engineering with Big Data (the Ministry of Education of China), Hefei University of Technology(大数据知识工程重点实验室(教育部)、合肥工业大学) Department of Data Science, College of William and Mary(威廉与玛丽学院数据科学系) College of Computer and Information Science, Southwest University(西南大学计算机与信息科学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 PSQE通过多模态信息和聚类重采样提升伪种子质量,改善无监督多模态实体对齐的精度与图覆盖平衡性。

Comments 2026 SIGKDD Accept

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11062 2026-03-04 cs.LG cs.IR 78%

MoToRec: Sparse-Regularized Multimodal Tokenization for Cold-Start Recommendation

MoToRec:基于稀疏正则化的多模态分词用于冷启动推荐

Jialin Liu, Zhaorui Zhang, Ray C. C. Cheung

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 MoToRec通过稀疏正则化的多模态分词方法,解决冷启动推荐中的数据稀疏性和新物品表示问题,提升推荐系统性能。

Comments Accepted to AAAI 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏