arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-23 至 2025-12-23 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 15 篇

2512.18986 2025-12-23 cs.LG cs.AI 83%

R-GenIMA: Integrating Neuroimaging and Genetics with Interpretable Multimodal AI for Alzheimer's Disease Progression

R-GenIMA:整合神经影像与基因组学的可解释多模态AI用于阿尔茨海默病进展

Kun Zhao, Siyuan Dai, Yingying Zhang, Guodong Liu, Pengfei Gu, Chenghua Lin, Paul M. Thompson, Alex Leow, Heng Huang, Lifang He, Liang Zhan, Haoteng Tang

机构 * Eli and Lilly company(艾利和利公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 R-GenIMA通过整合神经影像与基因组学,利用可解释的多模态AI方法,实现了对阿尔茨海默病进展的精准预测与机制揭示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19213 2025-12-23 cs.CV 79%

InvCoSS: Inversion-driven Continual Self-supervised Learning in Medical Multi-modal Image Pre-training

InvCoSS: 基于反向驱动的医学多模态图像预训练中的连续自监督学习

Zihao Luo, Shaohao Rui, Zhenyu Tang, Guotai Wang, Xiaosong Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Brain-Computer Interface & Brain-Inspired Intelligence Key Laboratory of Sichuan Province(四川省脑机接口与脑启发智能重点实验室)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 InvCoSS通过反向生成合成图像和多尺度融合网络,实现连续自监督学习,减少存储需求并保护数据隐私。

Comments 16 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14972 2025-12-23 cs.CL 79%

Multimodal Cultural Safety: Evaluation Framework and Alignment Strategies

多模态文化安全:评估框架与对齐策略

Haoyi Qiu, Kung-Hsiang Huang, Ruichen Zheng, Jiao Sun, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Salesforce AI Research(Salesforce人工智能研究) Google DeepMind(谷歌DeepMind)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出CROSS基准和CROSS-Eval框架,评估多模态模型的文化安全能力,发现提升推理能力可改善文化对齐,但需结合监督微调和偏好微调策略以增强文化合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11361 2025-12-23 cs.CL 79%

VLDBench Evaluating Multimodal Disinformation with Regulatory Alignment

VLDBench:评估具有监管对齐的多模态虚假信息

Shaina Raza, Ashmal Vayani, Aditya Jain, Aravind Narayanan, Vahid Reza Khazaie, Syed Raza Bashir, Elham Dolatabadi, Gias Uddin, Christos Emmanouilidis, Rizwan Qureshi, Mubarak Shah

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 VLDBench 是首个多模态虚假信息检测基准,通过大规模标注数据提升检测准确率,支持 AI 管治框架下的可信虚假信息分析。

Comments Accepted in Information Fusion Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18117 2025-12-23 cs.IR 78%

Factorized Transport Alignment for Multimodal and Multiview E-commerce Representation Learning

因子化运输对多模态和多视角电商表示学习

Xiwen Chen, Yen-Chieh Lien, Susan Liu, María Castaños, Abolfazl Razi, Xiaoting Zhao, Congzhe Su

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出因子化运输框架,通过统一多模态和多视角学习,提升电商场景下的检索性能。

Comments Accepted by WSDM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10729 2025-12-23 cs.LG 78%

Using LLMs for Late Multimodal Sensor Fusion for Activity Recognition

利用大语言模型进行晚阶段多模态传感器融合以进行活动识别

Ilker Demirel, Karan Thakkar, Benjamin Elizalde, Miquel Espi Marques, Aditya Sarathy, Yang Bai, Umamahesh Srinivas, Jiajie Xu, Shirley Ren, Jaya Narain

机构 * Apple(苹果公司) MIT(麻省理工学院) Johns Hopkins(约翰霍普金斯大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 利用大语言模型进行晚阶段多模态融合,实现零样本和单样本活动分类,无需特定任务训练。

Comments NeurIPS Workshop on Learning from Time Series for Health

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18245 2025-12-23 cs.CV cs.AI 76%

Spectral Discrepancy and Cross-modal Semantic Consistency Learning for Object Detection in Hyperspectral Image

光谱偏差与跨模态语义一致性学习用于超光谱图像的目标检测

Xiao He, Chang Tang, Xinwang Liu, Wei Zhang, Zhimin Gao, Chuankun Li, Shaohua Qiu, Jiangfeng Xu

机构 * School of Computer, Wuhan University(武汉大学计算机学院) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) school of computer, National University of Defense Technology(国防科技大学计算机学院) Shandong Provincial Key Laboratory of Computer Networks, Shandong Computer Science Center (National Supercomputing Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(山东省计算机网络重点实验室、山东省计算机科学中心(国家超级计算中心济南中心)、齐鲁工业大学(山东省科学院)) School of Computer and Artificial Intelligence, Zhengzhou University(郑州大学计算机与人工智能学院) School of Information and Communication Engineering, North University of China(北方大学信息与通信工程学院) National Key Laboratory of Electromagnetic Energy, Naval University of Engineering(电磁能国家重点实验室、海军工程大学) Hexagon AB

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV、cs.AI

AI总结 本文提出SDCM网络,通过光谱偏差与跨模态语义一致性学习,提升超光谱图像目标检测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23950 2025-12-23 cs.AI 70%

InterMT: Multi-Turn Interleaved Preference Alignment with Human Feedback

InterMT:基于人类反馈的多轮交错偏好对齐

Boyuan Chen, Donghai Hong, Jiaming Ji, Jiacheng Zheng, Bowen Dong, Jiayi Zhou, Kaile Wang, Juntao Dai, Xuyao Wang, Wenqi Chen, Qirui Zheng, Wenxin Li, Sirui Han, Yike Guo, Yaodong Yang

机构 * Institute for AI, Peking University(人工智能研究院,北京大学) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.AI

AI总结 InterMT通过多轮多模态交互的偏好数据集探索,旨在提升多模态大模型的交互能力,结合人类反馈和专家注释,揭示多轮扩展规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18496 2025-12-23 cs.CV 70%

Adaptive-VoCo: Complexity-Aware Visual Token Compression for Vision-Language Models

Adaptive-VoCo: 用于视觉-语言模型的复杂度感知视觉标记压缩

Xiaoyang Guo, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 Adaptive-VoCo通过动态压缩视觉标记提升视觉-语言模型的效率与鲁棒性

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18504 2025-12-23 cs.CV cs.AI 62%

GTMA: Dynamic Representation Optimization for OOD Vision-Language Models

GTMA:面向视觉-语言模型的动态表示优化

Jensen Zhang, Ningyuan Liu, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 GTMA通过动态表示优化提升视觉-语言模型在分布外任务中的性能,有效解决模态不对称问题,提升零样本和少样本准确率15-20%。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19390 2025-12-23 cs.RO cs.CV cs.GR 57%

TwinAligner: Visual-Dynamic Alignment Empowers Physics-aware Real2Sim2Real for Robotic Manipulation

TwinAligner: 视觉-动态对齐赋能物理感知的实境到仿真到现实的机器人操控

Hongwei Fan, Hang Dai, Jiyao Zhang, Jinzhou Li, Qiyang Yan, Yujie Zhao, Mingju Gao, Jinghang Wu, Hao Tang, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学CFCS) PKU-AgiBot Lab(北京大学AgiBot实验室) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 TwinAligner通过视觉和动态对齐技术,解决仿真与现实之间的差距,提升机器人操控的可扩展学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19180 2025-12-23 cs.LG cs.AI 57%

Practical Quantum-Classical Feature Fusion for complex data Classification

实用量子-经典特征融合用于复杂数据分类

Azadeh Alavi, Fatemeh Kouchmeshki, Abdolrahman Alavi

机构 * RMIT University(皇家墨尔本理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种交叉注意中融合架构,通过多模态融合提升复杂数据分类性能,证明了量子信息与经典特征结合的重要性。

Comments 16 pages, 3 figues

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18910 2025-12-23 cs.CV 57%

Delta-LLaVA: Base-then-Specialize Alignment for Token-Efficient Vision-Language Models

Delta-LLaVA: 基于令牌效率的视觉-语言模型对齐方法

Mohamad Zamini, Diksha Shukla

机构 * University of Wyoming(怀俄明大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 Delta-LLaVA通过低秩Delta投影和轻量级Transformer块实现视觉-语言模型的高效对齐,提升推理速度和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17436 2025-12-23 cs.CV 57%

Xiaomi MiMo-VL-Miloco Technical Report

小米 MiMo-VL-Miloco 技术报告

Jiaze Li, Jingyang Chen, Yuxun Qu, Shijie Xu, Zhenru Lin, Junyou Zhu, Boshen Xu, Wenhui Tan, Pei Fu, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * Xiaomi(小米)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 小米提出 MiMo-VL-Miloco 模型,专为家庭场景设计,通过两阶段训练提升多模态推理与家庭场景理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20617 2025-12-23 stat.CO 50%

Approximating evidence via bounded harmonic means

通过有界调和均值近似证据

Dana Naderi, Christian P Robert, Kaniav Kamary, Darren Wraith

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 通过椭圆覆盖方法改进调和均值估计器,有效解决无限方差问题,提供更稳定和精确的证据近似

详情

展开后加载摘要…

URL PDF HTML 收藏