arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9204 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9204 篇

2603.09940 2026-03-11 cs.LG 78%

SignalMC-MED: A Multimodal Benchmark for Evaluating Biosignal Foundation Models on Single-Lead ECG and PPG

SignalMC-MED: 一种用于评估单导联ECG和PPG上生物信号基础模型的多模态基准

Fredrik K. Gustafsson, Xiao Gu, Mattia Carletti, Patitapaban Palo, David W. Eyre, David A. Clifton

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 SignalMC-MED是一个用于评估单导联ECG和PPG上生物信号基础模型的多模态基准,展示了多模态融合和长时信号在提升模型性能上的优势。

Comments Code is available at https://github.com/fregu856/SignalMC-MED

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06919 2026-03-10 cs.RO 78%

SurgSync: Time-Synchronized Multi-Modal Data Collection Framework and Dataset for Surgical Robotics

SurgSync: 用于手术机器人的时间同步多模态数据采集框架和数据集

Haoying Zhou, Chang Liu, Yimeng Wu, Junlin Wu, Zijian Wu, Yu Chung Lee, Sara Martuscelli, Spetimiu E. Salcudean, Gregory S. Fischer, Peter Kazanzides

机构 * Department of Robotics Engineering, Worcester Polytechnic Institute(机器人工程系,沃斯特理工学院) Laboratory for Computational Sensing and Robotics(计算感知与机器人实验室) Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学) Robotics and Control Laboratory, the University of British Columbia(机器人与控制实验室,不列颠哥伦比亚大学) Department of Electronics, Information and Bioengineering, Politecnico di Milano(电子、信息与生物工程系,米兰理工学院)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 SurgSync提出了一种时间同步的多模态数据采集框架和数据集,用于手术机器人中的高阶控制与训练,通过多传感器和后处理工具提升数据质量与实用性。

Comments Accepted By International Conference on Robotics and Automation (ICRA), IEEE, 2026. More details can be found at https://surgsync.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06243 2026-03-09 cs.IR 78%

MLLMRec-R1: Incentivizing Reasoning Capability in Large Language Models for Multimodal Sequential Recommendation

MLLMRec-R1: 通过大型语言模型增强多模态序列推荐的推理能力

Yu Wang, Yonghui Yang, Le Wu, Jiancan Wu, Hefei Xu, Hui Lin

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 MLLMRec-R1通过离线文本化视觉信号和混合粒度数据增强策略,提升多模态序列推荐中基于GRPO的推理效率与稳定性。

Comments 14 pages, 10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16953 2026-03-03 cs.LG stat.ML 78%

ICYM2I: The illusion of multimodal informativeness under missingness

ICYM2I: 多模态信息性在缺失情况下的错觉

Young Sang Choi, Vincent Jeanselme, Pierre Elias, Shalmali Joshi

机构 * Department of Biomedical Informatics, Columbia University(生物医学信息学系,哥伦比亚大学) Seymour, Paul, and Gloria Milstein Division of Cardiology, Department of Medicine, Columbia University Irving Medical Center(塞缪尔、保罗和格洛丽亚米尔斯坦心脏病科,哥伦比亚大学伊万格琳医学中心)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 ICYM2I框架通过逆概率加权修正,解决多模态学习中因缺失模式变化导致的信息增益估计偏差问题。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21686 2026-02-26 stat.ML cs.LG 78%

Multimodal Datasets with Controllable Mutual Information

具有可控互信息的多模态数据集

Raheem Karim Hashmani, Garrett W. Merz, Helen Qu, Mariel Pettee, Kyle Cranmer

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Flatiron Institute(Flatiron研究所)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出了一种生成具有可控互信息的多模态数据集的框架,用于评估互信息估计器和多模态自监督学习技术。

Comments 16 pages, 7 figures, 2 tables. Our code is publicly available at https://github.com/RKHashmani/MmMi-Datasets. Datasets generated based on Figure 1 can be found at https://huggingface.co/datasets/RKHashmani/mmmi-dag1-2modalities-cifar10

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20994 2026-02-25 eess.IV cs.AI cs.CL cs.CV cs.LG 78%

Multimodal MRI Report Findings Supervised Brain Lesion Segmentation with Substructures

多模态MRI报告辅助的监督性脑部病变分割与亚结构

Yubin Ge, Yongsong Huang, Xiaofeng Liu

机构 * Amazon AWS(亚马逊AWS) Yale University(耶鲁大学) Tohoku University(东北大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究提出MS-RSuper方法,通过解析报告中的定量和定性信息,结合亚结构和不确定性,提升脑部病变分割的准确性。

Comments IEEE International Symposium on Biomedical Imaging (ISBI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17354 2026-02-20 cs.IR 78%

Training-free Graph-based Imputation of Missing Modalities in Multimodal Recommendation

无需训练的基于图的多模态推荐中缺失模态的补全

Daniele Malitesta, Emanuele Rossi, Claudio Pomo, Tommaso Di Noia, Fragkiskos D. Malliaros

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出无需训练的基于图的多模态推荐中缺失模态补全方法,通过图特征插值提升多模态推荐性能。

Comments Accepted in IEEE Transactions on Knowledge and Data Engineering (IEEE TKDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09103 2026-02-19 cs.RO 78%

IMPACT: Behavioral Intention-aware Multimodal Trajectory Prediction with Adaptive Context Trimming

IMPACT: 基于适应性上下文修剪的多模态轨迹预测:行为意图感知

Jiawei Sun, Xibin Yue, Jiahui Li, Tianle Shen, Chengran Yuan, Shuo Sun, Sheng Guo, Quanyun Zhou, Marcelo H Ang

机构 * National University of Singapore(新加坡国立大学) Xiaomi EV(小米电动车)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 IMPACT提出了一种基于适应性上下文修剪的多模态轨迹预测框架,通过联合预测行为意图和轨迹,提升预测精度、可解释性和效率,并在Waymo数据集上取得优异成绩。

Comments accepted by IEEE Robotics and Automation Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14017 2026-02-17 cs.LG 78%

S2SServiceBench: A Multimodal Benchmark for Last-Mile S2S Climate Services

S2SServiceBench:一个多模态基准用于最后一公里S2S气候服务

Chenyue Li, Wen Deng, Zhuotao Sun, Mengxi Jin, Hanzhe Cui, Han Li, Shentong Li, Man Kit Yu, Ming Long Lai, Yuhao Yang, Mengqian Lu, Binhang Yuan

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University of Information Science and Technology(南京信息工程大学) Beijing Normal University(北京师范大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 S2SServiceBench是一个多模态基准,用于评估S2S气候服务中最后一公里的可靠性,通过10种服务产品和1000多个评估项目,揭示了多模态大语言模型在不确定性下的决策推理挑战。

Comments 18 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13269 2026-02-17 cs.NI 78%

Modality-Tailored Age of Information for Multimodal Data in Edge Computing Systems

多模态数据在边缘计算系统中的模态定制信息年龄

Ying Liu, Yifan Zhang, Xinyu Wang, Chao Yang, Kandaraj Piamrat, Stephan Sigg, Zheng Changr, Yusheng Ji

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出模态定制信息年龄(MAoI)度量标准,用于多模态数据在边缘计算中的资源管理和策略优化,并设计了联合采样卸载优化算法以最小化平均 MAoI。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12087 2026-02-13 cs.LG 78%

Geometry of Uncertainty: Learning Metric Spaces for Multimodal State Estimation in RL

不确定性几何:用于强化学习中多模态状态估计的度量空间学习

Alfredo Reichlin, Adriano Pacciarelli, Danica Kragic, Miguel Vasco

机构 * Division of Robotics, Perception, and Learning(机器人、感知与学习系) KTH Royal Institute of Technology(皇家理工学院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出了一种学习多模态状态估计的度量空间方法,通过自适应整合多种传感器模态,提升了RL任务中的鲁棒性和状态估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03220 2026-02-12 eess.SP 78%

Multimodal-Wireless: A Large-Scale Dataset for Sensing and Communication

多模态无线:一种大规模数据集用于传感与通信

Tianhao Mao, Le Liang, Jie Yang, Hao Ye, Shi Jin, Geoffrey Ye Li

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出多模态无线数据集,用于多模态传感与通信研究,包含高分辨率CSI与多种传感器数据,支持通信与协同感知应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20222 2026-02-10 cs.LG 78%

Decoupling and Damping: Structurally-Regularized Gradient Matching for Multimodal Graph Condensation

解耦与阻尼:用于多模态图压缩的结构正则化梯度匹配

Lian Shen, Zhendan Chen, Meijia Song, Yinhui jiang, Ziming Su, Juan Liu, Xiangrong Liu

机构 * Xiamen University(厦门大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出SR-GM框架,通过梯度解耦和结构阻尼正则化解决多模态图压缩中的语义错位和梯度噪声问题,实现高效稳定的图结构压缩。

Comments 12pages,7 figures,8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01318 2026-02-10 cs.HC 78%

AffectGPT-R1: Leveraging Reinforcement Learning for Open-Vocabulary Multimodal Emotion Recognition

AffectGPT-R1:利用强化学习进行开放词汇多模态情感识别

Zheng Lian, Fan Zhang, Yazhou Zhang, Jianhua Tao, Rui Liu, Haoyu Chen, Xiaobai Li, Bin He

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 AffectGPT-R1通过强化学习框架改进开放词汇多模态情感识别,利用奖励函数优化情绪度量并提升情绪理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21355 2026-02-09 cs.LG 78%

SMMILE: An Expert-Driven Benchmark for Multimodal Medical In-Context Learning

SMMILE:一个多模态医学上下文学习的专家驱动基准

Melanie Rieff, Maya Varma, Ossian Rabow, Subathra Adithan, Julie Kim, Ken Chang, Hannah Lee, Nidhi Rohatgi, Christian Bluethgen, Mohamed S. Muneer, Jean-Benoit Delbrouck, Michael Moor

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Lund University(隆德大学) Jawaharlal Institute of Postgraduate Medical Education and Research(贾瓦哈拉尔·尼赫鲁医学教育与研究学院) UCSF(加州大学旧金山分校) University of Zurich(苏黎世大学) University Hospital Zurich(苏黎世大学医院) HOPPR

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 SMMILE是一个专家驱动的多模态医学上下文学习基准,评估了15个MLLMs在医学任务中的多模态ICL能力,发现其表现有限且易受无关示例和最近性偏见影响。

Comments NeurIPS 2025 (Datasets & Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03208 2026-02-06 cs.LG 78%

HiMAL: A Multimodal Hierarchical Multi-task Auxiliary Learning framework for predicting and explaining Alzheimer disease progression

HiMAL:一种用于预测和解释阿尔茨海默病进展的多模态分层多任务辅助学习框架

Sayantan Kumar, Sean Yu, Andrew Michelson, Thomas Kannampallil, Philip Payne

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 HiMAL通过多模态分层多任务学习框架,预测和解释MCI患者向AD进展的风险,展现高预测性能和临床应用潜力。

Comments Currently under review in Journal of Medical Informatics Association (JAMIA). 6 figures, 3 tables

Journal ref JAMIA Open, Volume 7, Issue 3, October 2024, ooae087

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04299 2026-02-05 cs.HC 78%

A Multimodal fNIRS-EEG Dataset for Unilateral Limb Motor Imagery

用于单侧肢体运动想象的多模态fNIRS-EEG数据集

Lufeng Feng, Baomin Xu, Haoran Zhang, Bihai Lin, Zuxuan Deng, Sidi Tao, Chenyu Liu, Shifan Jia, Li Duan, Ziyu Jia

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出MIND数据集,用于单侧肢体多方向运动想象,通过融合fNIRS和EEG数据提升BCI分类性能。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16196 2026-02-04 stat.ME 78%

Inference on the Significance of Modalities in Multimodal Generalized Linear Models

在多模态广义线性模型中模态显著性的推断

Wanting Jin, Guorong Wu, Quefeng Li

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出了一种基于熵的度量方法,用于评估多模态广义线性模型中各模态的信息增益,并通过模拟和神经影像数据验证了其有效性。

Comments This research was supported by the National Institutes of Health under grant R01-AG073259

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09509 2026-02-03 cs.RO 78%

SMapper: A Multi-Modal Data Acquisition Platform for SLAM Benchmarking

SMapper: 一种用于SLAM基准测试的多模态数据采集平台

Pedro Miguel Bastos Soares, Ali Tourani, Miguel Fernandez-Cortizas, Asier Bikandi-Noya, Holger Voos, Jose Luis Sanchez-Lopez

机构 * Automation and Robotics Research Group (ARG), Interdisciplinary Centre for Security, Reliability, and Trust (SnT), University of Luxembourg(卢森堡大学自动化与机器人研究组(ARG)、安全、可靠与信任跨学科研究中心(SnT))

专题命中 多模态评测 :multi-modal(title);multimodal(abstract)

AI总结 SMapper是一种用于SLAM基准测试的多模态数据采集平台,通过开放硬件设计和可重复的数据收集,提供高精度的SLAM数据集和基准测试结果,推动SLAM算法的发展和评估。

Comments 13 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03774 2026-02-03 cs.LG 78%

Contamination Detection for VLMs using Multi-Modal Semantic Perturbation

使用多模态语义扰动检测VLMs中的污染

Jaden Park, Mu Cai, Feng Yao, Jingbo Shang, Soochahn Lee, Yong Jae Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California, San Diego(加州大学圣地亚哥分校) Kookmin University(韩国庆北大学)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 本文提出了一种基于多模态语义扰动的检测方法,用于识别和验证受污染的视觉语言模型。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22416 2026-02-02 cs.LG 78%

MM-OpenFGL: A Comprehensive Benchmark for Multimodal Federated Graph Learning

MM-OpenFGL: 一种多模态联邦图学习的综合基准

Xunkai Li, Yuming Ai, Yinlin Zhu, Haodong Lu, Yi Zhang, Guohao Fu, Bowen Fan, Qiangqiang Dai, Rong-Hua Li, Guoren Wang

机构 * Beijing Institute of Technology, Beijing, China(北京理工大学) Sun Yat-sen University, Guangzhou, China(中山大学) Shandong University, Weihai, China(山东大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 MM-OpenFGL是首个多模态联邦图学习的综合基准,通过19个数据集和57种方法系统评估MMFGL的必要性、有效性、鲁棒性和效率。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22185 2026-02-02 cs.CR cs.CY 78%

MemeChain: A Multimodal Cross-Chain Dataset for Meme Coin Forensics and Risk Analysis

MemeChain: 一个多模态跨链数据集用于迷因币取证与风险分析

Alberto Maria Mongardini, Alessandro Mei

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 MemeChain是一个多模态跨链数据集,用于研究迷因币的取证和风险分析,包含34,988个迷因币,整合链上与链下数据以提高风险建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21829 2026-01-30 cs.RO 78%

GAZELOAD A Multimodal Eye-Tracking Dataset for Mental Workload in Industrial Human-Robot Collaboration

GAZELOAD:用于工业人机协作中心理负荷的多模态眼动数据集

Bsher Karbouj, Baha Eddin Gaaloul, Jorg Kruger

机构 * Department of industrial Automation Technology TU Berlin(工业自动化技术系 柏林技术大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 GAZELOAD数据集通过多模态眼动数据支持工业人机协作中心理负荷的估计与分析,包含眼动信号、环境数据及自我报告评分,用于算法开发与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19198 2026-01-28 cs.IR 78%

Propagating Similarity, Mitigating Uncertainty: Similarity Propagation-enhanced Uncertainty for Multimodal Recommendation

传播相似性,缓解不确定性:多模态推荐的相似性传播增强不确定性

Xinzhuo Wu, Hongbo Wang, Yuan Lin, Kan Xu, Liang Yang, Hongfei Lin

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 SPUMR通过构建模态相似性图和协作相似性图,结合不确定性感知的偏好聚合模块,提升多模态推荐系统的特征融合和不确定性估计能力。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09497 2026-01-28 quant-ph 78%

Quantum mixture-density network for multimodal probabilistic prediction

量子混合密度网络用于多模概率预测

Jaemin Seo

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 量子混合密度网络通过参数化量子电路高效建模多模分布,在双缝实验和混沌分岔任务中优于经典方法,展现量子机器学习在概率回归中的优势。

Journal ref IEEE Access 13 (2025) 199317-199325

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17916 2026-01-27 cs.LG 78%

UniPACT: A Multimodal Framework for Prognostic Question Answering on Raw ECG and Structured EHR

UniPACT:一种多模态框架,用于基于原始ECG和结构化EHR的预后问题回答

Jialu Tang, Tong Xia, Yuan Lu, Aaqib Saeed

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 UniPACT通过多模态融合和结构化提示机制,实现对ECG和EHR的预后问题回答,取得优异的AUROC性能。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17102 2026-01-27 q-bio.QM 78%

Domain-Aware Geometric Multimodal Learning for Multi-Domain Protein-Ligand Affinity Prediction

领域感知的几何多模态学习用于多领域蛋白质-配体亲和力预测

Shuo Zhang, Jian K. Liu

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 DAGML通过领域感知的几何多模态学习框架,有效提升多领域蛋白质-配体亲和力预测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11558 2026-01-23 cs.DB 78%

Bridging Radiology and Pathology: A DICOM-Based Framework for Multimodal Mapping and Integrated Visualization

连接放射学与病理科:基于DICOM的多模态映射与集成可视化框架

Nilesh P. Rijhwani, Titus J. Brinker, Peter Neher, Marco Nolden, Klaus Maier-Hein, Maximilian Fischer, Christoph Wies

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本研究提出一种基于DICOM的跨学科工具,通过多模态映射和集成可视化,促进放射学与病理科的协同分析与研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13639 2026-01-21 cs.RO 78%

A General One-Shot Multimodal Active Perception Framework for Robotic Manipulation: Learning to Predict Optimal Viewpoint

一种通用的一次性多模态主动感知框架用于机器人操作:学习预测最佳视角

Deyun Qin, Zezhi Liu, Hanqian Luo, Xiao Liang, Yongchun Fang

机构 * Institute of Robotics and Automatic Information Systems, College of Artificial Intelligence, Nankai University(机器人与自动信息系统研究所,人工智能学院,南开大学) Tianjin Key Laboratory of Intelligent Robotics, Nankai University(智能机器人重点实验室,南开大学) College of Artificial Intelligence, Nankai University(人工智能学院,南开大学) Department of Computing, The Hong Kong Polytechnic University(computing 部门,香港理工大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出了一种通用的一次性多模态主动感知框架,用于机器人操作,通过多模态特征融合和交叉注意力机制提升抓取成功率,并实现仿真到现实的无缝迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09853 2026-01-21 cs.LG 78%

ConSurv: Multimodal Continual Learning for Survival Analysis

ConSurv:面向生存分析的多模态持续学习

Dianzhi Yu, Conghao Xiong, Yankai Chen, Wenqian Cui, Xinni Zhang, Yifei Zhang, Hao Chen, Joseph J. Y. Sung, Irwin King

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 ConSurv是首个用于生存分析的多模态持续学习方法,通过多阶段混合专家和特征受限重放技术,有效解决灾难性遗忘和复杂模态交互问题。

Comments 14 pages, 4 figures. This is the extended version of the paper accepted at AAAI 2026, which includes all technical appendices and additional experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏