arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-01 至 2025-08-01 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 5 篇

2507.23402 2025-08-01 cs.CV cs.AI cs.LG 84%

AGA: An adaptive group alignment framework for structured medical cross-modal representation learning

Wei Li, Xun Gong, Jiao Li, Xiaobin Sun

机构 * School of Computing and Artificial Intelligence(计算机与人工智能学院) Southwest Jiaotong University(西南交通大学) Department of Gastroenterology(消化内科部) The Third People’s Hospital of Chengdu(成都第三人民医院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22477 2025-08-01 cs.CV cs.AI 84%

LIDAR: Lightweight Adaptive Cue-Aware Fusion Vision Mamba for Multimodal Segmentation of Structural Cracks

Hui Liu, Chen Jia, Fan Shi, Xu Cheng, Mengfei Shi, Xia Xie, Shengyong Chen

机构 * Tianjin University of Technology(天津理工大学) Hainan University(海南大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments This paper has been accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23444 2025-08-01 cs.MM 83%

Hybrid CNN-Mamba Enhancement Network for Robust Multimodal Sentiment Analysis

Xiang Li, Xianfu Cheng, Xiaoming Zhang, Zhoujun Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19119 2025-08-01 cs.CV cs.AI 62%

PatchTraj: Unified Time-Frequency Representation Learning via Dynamic Patches for Trajectory Prediction

Yanghong Liu, Xingping Dong, Ming Li, Weixing Zhang, Yidong Lou

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20216 2025-08-01 cs.CV 57%

Dual-Stream Global-Local Feature Collaborative Representation Network for Scene Classification of Mining Area

Shuqi Fan, Haoyi Wang, Xianju Li

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

Comments Accepted to IJCNN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏