arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-27 至 2025-11-27 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 9 篇

2306.15711 2025-11-27 cs.AI q-bio.NC 83%

Semi-supervised Multimodal Representation Learning through a Global Workspace

通过全局工作空间实现半监督多模态表示学习

Benjamin Devillers, Léopold Maytié, Rufin VanRullen

机构 * CerCo, CNRS UMR 5549, Université de Toulouse and ANITI, Artificial and Natural Intelligence Toulouse Institute(CerCo、CNRS UMR 5549、图卢兹大学和ANITI人工智能与自然智能图卢兹研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出了一种受全局工作空间概念启发的神经网络架构,通过自监督学习实现多模态表示对齐与转换,显著减少对匹配数据的需求。

Comments Under review

Journal ref IEEE Transactions on Neural Networks and Learning Systems 36 (5), 7843-7857 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21106 2025-11-27 cs.CV 79%

EM-KD: Distilling Efficient Multimodal Large Language Model with Unbalanced Vision Tokens

EM-KD: 通过不平衡视觉标记的知识蒸馏提升高效多模态大语言模型

Ze Feng, Sen Yang, Boqiang Duan, Wankou Yang, Jingdong Wang

机构 * Baidu VIS(百度视觉)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 EM-KD通过改进的知识蒸馏方法,有效提升高效多模态大语言模型的视觉理解和效率。

Comments accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20997 2025-11-27 cs.LG cs.AI 79%

FANoise: Singular Value-Adaptive Noise Modulation for Robust Multimodal Representation Learning

FANoise:奇异值自适应噪声调制用于鲁棒多模态表示学习

Jiaoyang Li, Jun Fang, Tianhao Gao, Xiaohui Zhang, Zhiyuan Liu, Chao Liu, Pengzhang Liu, Qixia Jiang

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 FANoise通过自适应噪声注入策略提升多模态表示学习的鲁棒性和性能

Comments 13 pages, 5 figures, accept to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10133 2025-11-27 cs.CV 79%

MANGO: Multimodal Attention-based Normalizing Flow Approach to Fusion Learning

MANGO: 多模态基于注意力的归一化流方法用于融合学习

Thanh-Dat Truong, Christophe Bobda, Nitin Agarwal, Khoa Luu

机构 * CVIU Lab, University of Arkansas, USA(大学实验室,亚利桑那大学,美国) University of Florida, USA(佛罗里达大学,美国) COSMOS Research Center, University of Arkansas, Little Rock, USA(研究机构,亚利桑那大学,小石城,美国) ICSI, University of California, Berkeley, USA(研究机构,加州大学伯克利分校,美国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 MANGO提出了一种基于归一化流和可逆交叉注意力机制的多模态融合学习方法,通过三种新型交叉注意力机制提升多模态数据的建模能力。

Comments Accepted to NeurIPS'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20871 2025-11-27 cs.CY cs.LG 78%

A review on data fusion in multimodal learning analytics and educational data mining

多模态学习分析与教育数据挖掘中数据融合的综述

Wilson Chango, Juan A. Lara, Rebeca Cerezo, Cristóbal Romero

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文综述了多模态学习分析与教育数据挖掘中数据融合的应用、方法及挑战。

Journal ref WIREs Data Mining and Knowledge Discovery, 12(4), e1458 (2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21452 2025-11-27 eess.IV 71%

Semantic-Enhanced Feature Matching with Learnable Geometric Verification for Cross-Modal Neuron Registration

语义增强的特征匹配与可学习几何验证用于跨模态神经元配准

Wenwei Li, Lingyi Cai, Hui Gong, Qingming Luo, Anan Li

专题命中 多模态训练与对齐 :cross-modal(title)

AI总结 本文提出一种结合语义增强和可学习几何验证的深度学习框架,用于解决跨模态神经元配准中的模态差距、数据稀缺和组织形变问题,提升生物医学影像配准精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21389 2025-11-27 cs.IR cs.AI 57%

FITRep: Attention-Guided Item Representation via MLLMs

FITRep: 通过大语言模型实现的注意力引导的项目表示

Guoxiao Zhang, Ao Li, Tan Qu, Qianlong Xie, Xingxing Wang

机构 * Meituan(美团)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 FITRep通过引入注意力引导的白盒表示框架,利用多模态大语言模型实现细粒度项目去重,提升了广告点击率和每千次展示成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14264 2025-11-27 cs.CV 57%

Directed-Tokens: A Robust Multi-Modality Alignment Approach to Large Language-Vision Models

Directed-Tokens: 一种稳健的多模态对齐方法用于大语言-视觉模型

Thanh-Dat Truong, Huu-Thien Tran, Tran Thai Son, Bhiksha Raj, Khoa Luu

机构 * CVIU Lab, University of Arkansas, USA(美国亚拉巴马大学CVIU实验室) Vietnam National University, Ho Chi Minh City University of Science, Vietnam(越南国家大学胡志明市科技大学) Carnegie Mellon University, USA(美国卡内基梅隆大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Directed-Tokens方法,通过引入图像和文本顺序重建任务及新的损失函数,提升大语言-视觉模型的鲁棒性和跨模态对齐能力,在多个基准上取得最佳性能。

Comments Accepted to NeurIPS'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20704 2025-11-27 cs.LG stat.ML 50%

Pretraining Transformer-Based Models on Diffusion-Generated Synthetic Graphs for Alzheimer's Disease Prediction

基于扩散生成合成图的Transformer模型预训练用于阿尔茨海默病预测

Abolfazl Moslemi, Hossein Peyvandi

机构 * Sharif University of Technology(谢里夫理工学院) Pasargad Institute for Advanced Innovative Solutions(帕萨尔加德先进创新解决方案研究所)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本研究提出基于扩散生成合成图的Transformer模型,通过预训练提升阿尔茨海默病预测的准确性和泛化能力。

Comments 14 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏