arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-11 至 2026-03-11 共收录 75 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 16 篇

2603.09258 2026-03-11 cs.CV 79%

Multimodal Graph Representation Learning with Dynamic Information Pathways

多模态图表示学习中的动态信息路径

Xiaobin Hong, Mingkai Lin, Xiaoli Wang, Chaoqun Wang, Wenzhong Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出DiP框架,通过动态信息路径实现多模态图表示学习,提升跨模态消息传播的适应性和表达性。

Comments 12 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13015 2026-03-11 cs.CV 79%

Multimodal Classification via Total Correlation Maximization

通过总相关性最大化实现多模态分类

Feng Yu, Xiangyu Wu, Yang Yang, Jianfeng Lu

机构 * Nanjing University of Science and Technology(南京理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出TCMax方法,通过最大化多模态特征与标签间的总相关性,缓解模态竞争并提升多模态分类性能。

Comments Accepted for publication at ICLR 2026; 19 pages; 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21064 2026-03-11 cs.CV 79%

Multimodal Skeleton-Based Action Representation Learning via Decomposition and Composition

多模态骨骼基动作表示学习通过分解与组合

Hongsong Wang, Heng Fei, Bingxuan Dai, Jie Gui

机构 * School of Computer Science and Engineering, Southeast University, Nanjing 210096, China(东南大学计算机科学与工程学院,南京210096,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用关键实验室(东南大学),中华人民共和国教育部,中国) School of Cyber Science and Engineering, Southeast University, Nanjing 210096, China(东南大学网络安全科学与工程学院,南京210096,中国) Engineering Research Center of Blockchain Application, Supervision And Management (Southeast University), Ministry of Education, China(区块链应用、监督与管理工程研究中心(东南大学),中华人民共和国教育部,中国) Purple Mountain Laboratories, Nanjing 210000, China(紫金山实验室,南京210000,中国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种自监督的多模态骨骼基动作表示学习框架,通过分解与组合策略平衡效率与效果,提升动作识别性能。

Comments Accepted by Machine Intelligence Research (Journal Impact Factor 8.7, 2024)

Journal ref Machine Intelligence Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15414 2026-03-11 eess.IV 78%

Entropy-and-Channel-Aware Adaptive-Rate Semantic Communication with MLLM-Aided Feature Compensation

熵与信道感知的自适应速率语义通信 with MLLM辅助特征补偿

Weixuan Chen, Qianqian Yang, Yuhao Chen, Chongwen Huang, Qian Wang, Zehui Xiong, Zhaoyang Zhang

专题命中 多模态训练与对齐 :MLLM(title);multimodal(abstract)

AI总结 本文提出一种基于熵与信道感知的自适应速率语义通信框架,利用MLLM辅助特征补偿提升通信效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18811 2026-03-11 cs.CV cs.AI 62%

Mitigating Long-Tail Bias in HOI Detection via Adaptive Diversity Cache

通过自适应多样性缓存缓解HOI检测中的长尾偏差

Yuqiu Jiang, Xiaozhen Qiao, Yifan Chen, Ye Zheng, Zhe Sun, Xuelong Li

机构 * College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出自适应多样性缓存模块,通过无训练机制缓解HOI检测中的长尾偏差,提升稀有类别检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09740 2026-03-11 cs.RO cs.CV 57%

Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments

逐步奖励:面向连续环境的视觉语言导航中的步骤感知对比对齐

Haoyuan Li, Rui Liu, Hehe Fan, Yi Yang

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院,杭州,中国)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出SACA框架,通过步骤感知对比对齐提升连续环境中视觉语言导航的性能,解决传统方法在错误恢复和训练稳定性方面的不足。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09702 2026-03-11 cs.CV 57%

TriFusion-SR: Joint Tri-Modal Medical Image Fusion and SR

TriFusion-SR:联合三模态医学图像融合与超分辨率

Fayaz Ali Dharejo, Sharif S. M. A., Aiman Khalil, Nachiket Chaudhary, Rizwan Ali Naqvi, Radu Timofte

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 TriFusion-SR通过联合三模态医学图像融合与超分辨率技术,利用小波引导的条件扩散框架实现频率感知的跨模态交互,提升图像质量和分辨率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09466 2026-03-11 cs.CV 57%

TopoOR: A Unified Topological Scene Representation for the Operating Room

TopoOR: 一种用于手术室的统一拓扑场景表示

Tony Danjun Wang, Ka Young Kim, Tolga Birdal, Nassir Navab, Lennart Bastian

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Imperial College London(伦敦帝国理工学院) Kyung Hee University(韩国庆熙大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 TopoOR通过更高阶拓扑结构建模手术室的多模态特性,提升场景表达能力,优于传统图和LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09149 2026-03-11 cs.CV 57%

RTFDNet: Fusion-Decoupling for Robust RGB-T Segmentation

RTFDNet:用于鲁棒RGB-T分割的融合-解耦

Kunyu Tan, Mingjian Liang

机构 * independent researchers(独立研究人员)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 RTFDNet通过融合与解耦机制提升RGB-T分割的鲁棒性,采用三分支编码器-解码器结构,结合协同特征融合、跨模态解耦正则化和区域解耦正则化,实现高效独立推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03596 2026-03-11 cs.HC 50%

Exploring EEG and Eye Movement Fusion for Multi-Class Target RSVP-BCI

探索EEG和眼动融合用于多类目标RSVP-BCI

Xujin Li, Wei Wei, Kun Zhao, Jiayu Mao, Yizhuo Lu, Shuang Qiu, Huiguang He

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出MTREE-Net,通过融合EEG和眼动数据提升多类RSVP-BCI的解码性能。

Comments 17 pages, 9 figures

Journal ref Information Fusion, 2025, 121: 103135

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18741 2026-03-11 stat.ME 50%

Spectral Graph Filtering for Modality-Specific Representation Learning

基于谱图滤波的模态特异性表示学习

Shira Yoffe, Amit Moscovich, Ariel Jaffe

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出DELVE方法,通过谱图滤波提取模态特异性潜在变量,以识别不同模态间的差异结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08763 2026-03-11 cs.LG cs.RO 50%

SPREAD: Subspace Representation Distillation for Lifelong Imitation Learning

SPREAD: 为终身模仿学习的子空间表示蒸馏

Kaushik Roy, Giovanni D'urso, Nicholas Lawrance, Brendan Tidd, Peyman Moghadam

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 SPREAD通过子空间表示蒸馏方法,在终身模仿学习中提升知识迁移和泛化能力,缓解灾难性遗忘,实现最优性能。

Comments IEEE International Conference on Robotics & Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 3 篇

2603.09206 2026-03-11 cs.CV cs.LG 57%

MM-Zero: Self-Evolving Multi-Model Vision Language Models From Zero Data

MM-Zero: 从零数据自我进化多模型视觉语言模型

Zongxia Li, Hongyang Du, Chengsong Huang, Xiyang Wu, Lantao Yu, Yicheng He, Jing Xie, Xiaomin Wu, Zhichao Liu, Jiarui Zhang, Fuxiao Liu

机构 * University of Maryland(马里兰大学) Brown University(布朗大学) Washington University in St. Louis(圣路易斯华盛顿大学) Adobe University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Southern California(南加州大学) NVIDIA

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 MM-Zero通过多角色框架实现VLM零数据自我进化,提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09251 2026-03-11 stat.ML cs.LG cs.NA math.NA 50%

A Generative Sampler for distributions with possible discrete parameter based on Reversibility

基于可逆性的生成采样器:用于可能具有离散参数分布的采样器

Lei Li, Zhen Wang, Lishuo Zhang

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University, Shanghai, 200240, P.R.China(上海交通大学数学科学学院) Institute of Natural Sciences, MOE-LSC, Shanghai Jiao Tong University, Shanghai, 200240, P.R.China(上海交通大学自然科学研究院)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出了一种基于可逆性的生成采样器,适用于具有离散参数分布的复杂系统,通过最小化MMD来实现高效的采样方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01929 2026-03-11 astro-ph.HE physics.data-an physics.soc-ph 50%

Exploring blazars through sonification. Visual and auditory insights into multifrequency variability

通过声音化探索喷流星系。视觉和听觉对多频率变化的洞察

Gustavo Magallanes-Guijón, Sergio Mendoza

专题命中 其他多模态 :multimodal(abstract)

AI总结 本研究通过声音化和可视化技术分析喷流星系的多频率变化,揭示其复杂行为并提升科学交流的包容性。

Comments 16 pages, 9 figures. Accepted for publication in RASTI (RAS Techniques and Instruments)

Journal ref RAS Techniques and Instruments, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏