arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-13 至 2025-08-13 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 12 篇

2508.09085 2025-08-13 cs.NI cs.AI cs.LG 83%

Dynamic Uncertainty-aware Multimodal Fusion for Outdoor Health Monitoring

Zihan Fang, Zheng Lin, Senkang Hu, Yihang Tao, Yiqin Deng, Xianhao Chen, Yuguang Fang

机构 * Hong Kong JC STEM Lab of Smart City and Department of Computer Science, City University of Hong Kong(香港JC STEM实验室及城市大学计算机科学系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08589 2025-08-13 cs.CV 83%

DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding

Wenwen Yu, Zhibo Yang, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08925 2025-08-13 eess.AS cs.SD 79%

LPGNet: A Lightweight Network with Parallel Attention and Gated Fusion for Multimodal Emotion Recognition

Zhining He, Yang Xiao

机构 * Guangzhou University(广州大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 eess.AS

Comments Under peering review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01057 2025-08-13 cs.AI cs.RO 79%

Edge-Based Multimodal Sensor Data Fusion with Vision Language Models (VLMs) for Real-time Autonomous Vehicle Accident Avoidance

Fengze Yang, Bo Yu, Yang Zhou, Xuewen Luo, Zhengzhong Tu, Chenxi Liu

机构 * Department of Civil & Environmental Engineering University of Utah(土木与环境工程系 犹他大学) Zachry Department of Civil and Environmental Engineering Texas A&M University(扎克里系 土木与环境工程系 德克萨斯农工大学) Department of Computer Science & Engineering Texas A&M University(计算机科学与工程系 德克萨斯农工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

Comments 24 pages, 6 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08279 2025-08-13 cs.LG cs.AI 79%

XFMNet: Decoding Cross-Site and Nonstationary Water Patterns via Stepwise Multimodal Fusion for Long-Term Water Quality Forecasting

Ziqi Wang, Hailiang Zhao, Cheng Bao, Wenzhuo Qian, Yuhao Yang, Xueqiang Sun, Shuiguang Deng

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15250 2025-08-13 cs.LG 78%

Multi-modal Policies with Physics-informed Representations in Complex Fluid Environments

Haodong Feng, Peiyan Hu, Yue Wang, Dixia Fan

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08257 2025-08-13 eess.SP cs.RO 78%

Where is the Boundary: Multimodal Sensor Fusion Test Bench for Tissue Boundary Delineation

Zacharias Chen, Alexa Cristelle Cahilig, Sarah Dias, Prithu Kolar, Ravi Prakash, Patrick J. Codd

机构 * Duke University(杜克大学) Research Triangle High School(研究三角高中) North Carolina School of Science and Mathematics(北卡罗来纳科学与数学高中)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

Comments 4 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09018 2025-08-13 cs.CV cs.CL cs.LG 76%

Bridging the Visual Gap: Fine-Tuning Multimodal Models with Knowledge-Adapted Captions

Moran Yanuka, Assaf Ben Kish, Yonatan Bitton, Idan Szpektor, Raja Giryes

机构 * Tel Aviv University(特拉维夫大学) Google Research(谷歌研究)

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.CL

Comments Accepted to NAACL 2025

Journal ref Proceedings of the 2025 Conference of the North American Chapter of the Association for Computational Linguistics, Human Language Technologies, Long Papers, pp. 10497-10518

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08602 2025-08-13 eess.SP 67%

Biomedical Signal Processing: EEG and ECG Classification with Discrete Wavelet Transforms, Energy Distribution, and Convolutional Neural Networks

Justin London

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08917 2025-08-13 cs.CV 57%

A Pseudo Global Fusion Paradigm-Based Cross-View Network for LiDAR-Based Place Recognition

Jintao Cheng, Jiehao Luo, Xieyuanli Chen, Jin Wu, Rui Fan, Xiaoyu Tang, Wei Zhang

机构 * School of Electronics and Information Engineering, and Xingzhi College, South China Normal University(电子信息工程学院和星智学院,华南师范大学) School of Data Science and Engineering, and Xingzhi College, South China Normal University(数据科学与工程学院和星智学院,华南师范大学) College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学) College of Electronics & Information Engineering, Shanghai Research Institute for Intelligent Autonomous Systems, the State Key Laboratory of Intelligent Autonomous Systems, and Frontiers Science Center for Intelligent Autonomous Systems, Tongji University(电子与信息工程学院,上海智能自主系统研究所,智能自主系统国家重点实验室,智能自主系统前沿科学中心,同济大学) Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(电子与计算机工程系,香港科技大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08697 2025-08-13 cs.CV 57%

ROD: RGB-Only Fast and Efficient Off-road Freespace Detection

Tong Sun, Hongliang Ye, Jilin Mei, Liang Chen, Fangzhou Zhao, Leiqiang Zong, Yu Hu

机构 * Research Center for Intelligent Computing Systems, Institute of Computing Technology, Chinese Academy of Sciences(智能计算系统研究室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Astronomical Computing Research Center, Zhejiang Lab(天文计算研究室,浙江实验室) Beijing Special Vehicle Academy(北京特种车辆学院) School of Computer Science and Technology, University of Chinese Academy of Sciences(计算机科学与技术学院,中国科学院大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Journal ref ICRA2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14835 2025-08-13 eess.SP 50%

Aligning Beam with Imbalanced Multi-modality: A Generative Federated Learning Approach

Jiahui Liang, Miaowen Wen, Shuoyao Wang, Yuxuan Liang, Shijian Gao

专题命中 多模态训练与对齐 :multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏