arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-14 至 2025-08-14 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 8 篇

2501.03012 2025-08-14 cs.AI cs.CL cs.CV 85%

Analyzing Finetuning Representation Shift for Multimodal LLMs Steering

Pegah Khayatan, Mustafa Shukor, Jayneel Parekh, Arnaud Dapogny, Matthieu Cord

机构 * ISIR, Sorbonne Université(ISIR,索邦大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments ICCV 2025. The first three authors contributed equally. Project page and code: https://pegah- kh.github.io/projects/lmm-finetuning-analysis-and-steering/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09717 2025-08-14 cs.CV cs.LG 79%

Multimodal Sheaf-based Network for Glioblastoma Molecular Subtype Prediction

Shekhnaz Idrissova, Islem Rekik

机构 * BASIRA Lab, Imperial-X(BASIRA实验室、Imperial-X) Department of Computing, Imperial College London, United Kingdom(计算系、帝国理工学院伦敦分校,英国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09182 2025-08-14 eess.IV cs.CV 79%

MedPatch: Confidence-Guided Multi-Stage Fusion for Multimodal Clinical Data

Baraa Al Jorf, Farah Shamout

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09664 2025-08-14 cs.IR 78%

Multimodal Fusion And Sparse Attention-based Alignment Model for Long Sequential Recommendation

Yongrui Fu, Jian Liu, Tao Li, Zonggang Wu, Shouke Qin, Hanmeng Liu

专题命中 多模态训练与对齐 :multimodal(title,abstract)

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09941 2025-08-14 cs.LG cs.AI 70%

FedRecon: Missing Modality Reconstruction in Heterogeneous Distributed Environments

Junming Liu, Yanting Gao, Yifei Sun, Yufei Jin, Yirong Chen, Ding Wang, Guosun Zeng

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

Comments 21 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09802 2025-08-14 cs.CV 57%

MUJICA: Reforming SISR Models for PBR Material Super-Resolution via Cross-Map Attention

Xin Du, Maoyuan Xu, Zhi Ying

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14332 2025-08-14 cs.CV 57%

ViCToR: Improving Visual Comprehension via Token Reconstruction for Pretraining LMMs

Yin Xie, Kaicheng Yang, Peirou Liang, Xiang An, Yongle Zhao, Yumeng Wang, Ziyong Feng, Roy Miles, Ismail Elezi, Jiankang Deng

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

Comments 10 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09227 2025-08-14 cs.LG cs.AI cs.CE 57%

GSMT: Graph Fusion and Spatiotemporal TaskCorrection for Multi-Bus Trajectory Prediction

Fan Ding, Hwa Hui Tew, Junn Yong Loo, Susilawati, LiTong Liu, Fang Yu Leong, Xuewen Luo, Kar Keong Chin, Jia Jun Gan

机构 * School of Information Technology, Monash University Malaysia(墨尔本大学马来西亚分校信息科技学院) School of Engineering, Monash University Malaysia(墨尔本大学马来西亚分校工程学院) Perunding Atur Trafik Sdn Bhd, Malaysia(马来西亚交通自动化有限公司)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

Comments This paper has been accepted by ITSC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏