arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-24 至 2025-12-24 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6 篇

2512.19934 2025-12-24 cs.CV cs.AI cs.LG 86%

Vehicle-centric Perception via Multimodal Structured Pre-training

基于多模态结构预训练的车辆感知

Wentao Wu, Xiao Wang, Chenglong Li, Jin Tang, Bin Luo

机构 * Information Materials and Intelligent Sensing Laboratory of Anhui Province(安徽省信息材料与智能感知实验室) Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省多模态认知计算重点实验室) the School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VehicleMAE-V2,通过多模态结构先验知识提升车辆感知的预训练能力,采用SMM、CRM和SRM模块增强模型对车辆结构和语义的理解。

Comments Journal extension of VehicleMAE (AAAI 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20084 2025-12-24 cs.LG cs.AI 79%

QE-Catalytic: A Graph-Language Multimodal Base Model for Relaxed-Energy Prediction in Catalytic Adsorption

QE-Catalytic: 一种图-语言多模态基础模型,用于催化吸附中放松能量的预测

Yanjie Li, Jian Xu, Xueqing Chen, Lina Yu, Shiming Xiang, Weijun Li, Cheng-lin Liu

机构 * AnnLab(安实验室) Institute of Semiconductors, Chinese Academy of Sciences(半导体研究所,中国科学院) Zhongguancun Academy(中关村学院) State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Computer Network Information Center(计算机网络信息中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 QE-Catalytic结合语言模型与图Transformer,实现高精度催化吸附能量预测及逆向设计

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20026 2025-12-24 cs.CV 79%

MAPI-GNN: Multi-Activation Plane Interaction Graph Neural Network for Multimodal Medical Diagnosis

MAPI-GNN:多激活平面交互图神经网络用于多模态医学诊断

Ziwei Qin, Xuhui Song, Deqing Huang, Na Qin, Jun Li

机构 * Ziwei Qin(独立研究者) Xuhui Song(独立研究者) Deqing Huang(独立研究者) Na Qin(独立研究者) Jun Li(独立研究者)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 MAPI-GNN通过多激活平面交互机制,有效建模患者特异性病理关系,提升多模态医学诊断的准确性。

Comments Accepted by Proceedings of the AAAI Conference on Artificial Intelligence 40 (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20561 2025-12-24 cs.CV 74%

FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models

FlashVLM: 大规模多模态模型中的文本引导视觉令牌选择

Kaitong Cai, Jusheng Zhang, Jing Yang, Yijia Fan, Pengtao Xie, Jian Wang, Keze Wang

机构 * Sun Yat-sen University(中山大学) University of California, San Diego(加州大学圣地亚哥分校) Snap Inc.(Snap公司)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV

AI总结 FlashVLM通过文本引导的视觉令牌选择,实现了高效压缩和高准确率,在大规模多模态模型中表现出色。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20556 2025-12-24 cs.CV 57%

Multi-Grained Text-Guided Image Fusion for Multi-Exposure and Multi-Focus Scenarios

多粒度文本引导图像融合用于多曝光和多聚焦场景

Mingwei Tang, Jiahao Nie, Guang Yang, Ziqing Cui, Jie Li

机构 * Xidian University(西安电子科技大学) Nanyang Technological University(新加坡国立大学) Xi’an University of Technology(西安理工大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出MTIF方法,通过多粒度文本描述和跨模态调节模块提升多曝光和多聚焦图像融合性能。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20034 2025-12-24 cs.IR 50%

VSA:Visual-Structural Alignment for UI-to-Code

VSA:面向UI到代码的视觉-结构对齐

Xian Wu, Ming Zhang, Zhiyu Fang, Fei Li, Bin Wang, Yong Jiang, Hao Zhou

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 VSA通过视觉-结构对齐提升UI到代码的模块化和一致性,生成类型安全的组件以提高软件工程效率。

详情

展开后加载摘要…

URL PDF HTML 收藏