arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-23 至 2026-01-23 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 5 篇

2601.15316 2026-01-23 cs.AI cs.CV 84%

The Paradigm Shift: A Comprehensive Survey on Large Vision Language Models for Multimodal Fake News Detection

范式转变:大型视觉语言模型在多模态虚假新闻检测中的全面调查

Wei Ai, Yilong Tan, Yuntao Shou, Tao Meng, Haowen Chen, Zhixiong He, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(计算机与数学学院,中央南大学林业科技学院) College of Computer Science and Electronic Engineering, Hunan University(计算机科学与电子工程学院,湖南大学) College of Economics and Management, Central South University of Forestry and Technology(经济管理学院,中央南大学林业科技学院) Department of Computer Science, State University of New York(计算机科学系,纽约州立大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过大型视觉语言模型全面调查多模态虚假新闻检测,分析其发展历程、技术挑战及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15734 2026-01-23 cs.CV 79%

Sub-Region-Aware Modality Fusion and Adaptive Prompting for Multi-Modal Brain Tumor Segmentation

子区域感知模态融合与自适应提示的多模态脑肿瘤分割

Shadi Alijani, Fereshteh Aghaee Meibodi, Homayoun Najjaran

机构 * University of Victoria, BC, Canada(维多利亚大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出子区域感知模态融合与自适应提示方法,提升多模态脑肿瘤分割的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15390 2026-01-23 cs.LG 78%

FedUMM: A General Framework for Federated Learning with Unified Multimodal Models

FedUMM: 一种统一多模态模型的联邦学习通用框架

Zhaolong Su, Leheng Zhao, Xiaoying Wu, Ziyue Xu, Jindong Wang

机构 * NVIDIA

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 FedUMM提出了一种低通信成本的联邦学习框架,用于训练统一多模态模型,通过参数高效微调实现客户端和服务器的高效协作,提升了隐私保护下的多模态模型训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16009 2026-01-23 cs.SE 50%

The Role of Cognitive Abilities in Requirements Inspection: Comparing UML and Textual Representations

认知能力在需求检查中的作用:比较UML和文本表示

Giovanna Broccia, Sira Vegas, Alessio Ferrari

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本研究比较UML和文本表示在需求检查中的效果,发现认知能力影响UML辅助检查的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15786 2026-01-23 cs.CE 50%

Endowing Molecular Language with Geometry Perception via Modality Compensation for High-Throughput Quantum Hamiltonian Prediction

通过模态补偿赋予分子语言几何感知能力以实现高通量量子哈密顿量预测

Zhenzhong Wang, Yongjie Hou, Chenggong Huang, Yuxuan Du, Dacheng Tao, Min Jiang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 通过模态补偿赋予分子语言几何感知能力,利用 SMILES 实现高通量量子哈密顿量预测,提高计算效率与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏