arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-28 至 2026-01-28 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6 篇

2601.19325 2026-01-28 cs.CV cs.AI 81%

Innovator-VL: A Multimodal Large Language Model for Scientific Discovery

Innovator-VL:一种用于科学发现的多模态大语言模型

Zichen Wen, Boxue Yang, Shuang Chen, Yaojie Zhang, Yuhang Han, Junlong Ke, Cong Wang, Yicheng Fu, Jiawang Zhao, Jiangchao Yao, Xi Fang, Zhen Wang, Henxing Cai, Lin Yao, Zhifeng Gao, Yanhui Hong, Nang Yuan, Yixuan Li, Guojiang Zhao, Haoyi Tao, Nan Wang, Han Lyu, Guolin Ke, Ning Liao, Xiaoxing Wang, Kai Chen, Zhiyu Li, Feiyu Xiong, Sihan Hu, Kun Chen, Yanfeng Wang, Weinan E, Linfeng Zhang, Linfeng Zhang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Theoretical Physics, Chinese Academy of Sciences(中国科学院理论物理研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Innovator-VL通过高效数据选择和透明训练方法,在科学发现中实现高性能多模态模型。

Comments Innovator-VL tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06832 2026-01-28 cs.AI 70%

Remote Sensing Image Intelligent Interpretation with the Language-Centered Perspective: Principles, Methods and Challenges

遥感图像智能解读的以语言为中心的视角:原理、方法与挑战

Haifeng Li, Wang Guo, Haiyang Wu, Mengwei Wu, Jipeng Zhang, Qing Zhu, Yu Liu, Xin Huang, Chao Tao

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) Faculty of Geosciences and Environmental Engineering, Southwest Jiaotong University(西南交通大学地质科学与环境工程学院) School of Earth and Space Sciences, Peking University(北京大学地球与空间科学学院) Institute of Remote Sensing Information Processing (IRSIP), Wuhan University(武汉大学遥感信息处理研究所)

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.AI

AI总结 本文提出以语言为中心的遥感图像解读框架,探讨LLMs作为认知核心的作用,并总结多模态表示、知识关联等核心挑战,为认知驱动的智能地理空间分析提供理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19112 2026-01-28 cs.AI cs.MM cs.SD 62%

Uncertainty-Aware 3D Emotional Talking Face Synthesis with Emotion Prior Distillation

具有情绪先验蒸馏的不确定性感知3D情感说话面孔合成

Nanhan Shen, Zhilei Liu

机构 * School of Artificial Intelligence, Tianjin University, Tianjin, China(人工智能学院,天津大学,天津,中国)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI、cs.MM

AI总结 UA-3DTalk通过引入情绪先验蒸馏和不确定性感知模块,提升3D情感说话面孔合成的音频-视觉对齐和渲染质量。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19349 2026-01-28 eess.IV cs.CV 57%

AMGFormer: Adaptive Multi-Granular Transformer for Brain Tumor Segmentation with Missing Modalities

AMGFormer: 适应性多粒度变换器用于缺失模态的脑肿瘤分割

Chengxiang Guo, Jian Wang, Junhua Fei, Xiao Li, Chunling Chen, Yun Jin

机构 * 1 Faculty of Information Engineering Automation, Kunming University of Science Technology 2 Hepatobiliary \& Pancreatic Surgery, First People's Hospital of Yunnan/KUST Affiliated Hospital

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 AMGFormer通过三个协同模块提升脑肿瘤分割在缺失模态下的稳定性,实现高精度分割和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19247 2026-01-28 cs.CV 57%

TIGaussian: Disentangle Gaussians for Spatial-Awared Text-Image-3D Alignment

TIGaussian: 解耦高斯分布以实现空间感知的图文-3D对齐

Jiarun Liu, Qifeng Chen, Yiru Zhao, Minghua Liu, Baorui Ma, Sheng Yang

机构 * Unmanned Vehicle Dept., Cainiao Inc., Alibaba Group, Hangzhou, China(阿里巴巴集团 Cainiao 无人机部门,杭州,中国) Hillbot, Sunnyvale, USA(Hillbot,美国 Sunnyvale) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 TIGaussian通过多分支3DGS分词器和模态特定对齐策略,实现空间感知的图文-3D跨模态对齐,提升3D相关任务的预训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17177 2026-01-28 cs.CV cs.LG 57%

A Genealogy of Foundation Models in Remote Sensing

遥感领域基础模型的谱系

Kevin Lane, Morteza Karimzadeh

机构 * University of Colorado, Boulder(科罗拉多大学博尔德分校)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文探讨了遥感领域基础模型的发展历程,分析了单传感器与多传感器方法的优劣,并提出了未来改进方向。

Comments 28 pages, submitted to ACM SigSpatial, accepted as of January 12th, 2026. This is the second revision from the original 20-page manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏