arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-07-30 至 2025-07-30 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2506.18985 2025-07-30 cs.CV cs.AI 82%

GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models

Guanxi Shen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

Comments Keywords: Explainable Computer Vision, Large Vision-Language Models, AI Interpretability, Explainable AI, Visual Saliency, Attribution Maps, Cross-Modal Attribution, Human Attention Alignment, AI Transparency

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21489 2025-07-30 cs.CV 77%

Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval

Zhichuan Wang, Yang Zhou, Zhe Liu, Rui Yu, Song Bai, Yulong Wang, Xinwei He, Xiang Bai

机构 * Huazhong Agricultural University(华中农业大学) Shenzhen University(深圳大学) The University of Hong Kong(香港大学) University of Louisville(路易斯安那大学) ByteDance(字节跳动) Huazhong University of Science and Technology(华中科技大学)

专题命中 图文多模态 :multi-modal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22024 2025-07-30 eess.IV cs.CV 70%

Cardiac-CLIP: A Vision-Language Foundation Model for 3D Cardiac CT Images

Yutao Hu, Ying Zheng, Shumei Miao, Xiaolei Zhang, Jiahao Xia, Yaolei Qi, Yiyang Zhang, Yuting He, Qian Chen, Jing Ye, Hongyan Qiao, Xiuhua Hu, Lei Xu, Jiayin Zhang, Hui Liu, Minwen Zheng, Yining Wang, Daimin Zhang, Ji Zhang, Wenqi Shao, Yun Liu, Longjiang Zhang, Guanyu Yang

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21246 2025-07-30 cs.CV cs.AI 62%

On Explaining Visual Captioning with Hybrid Markov Logic Networks

Monika Shah, Somdeb Sarkhel, Deepak Venugopal

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21794 2025-07-30 cs.CV 57%

Distribution-Based Masked Medical Vision-Language Model Using Structured Reports

Shreyank N Gowda, Ruichi Zhang, Xiao Gu, Ying Weng, Lu Yang

机构 * School of Computer Science, University of Nottingham(计算机科学学院,诺丁汉大学) Department of Computer Science and Technology, School of Informatics, Xiamen University(计算机科学与技术系,信息学院,厦门大学) CHI Lab, University of Oxford(CHI实验室,牛津大学) School of Computer Science, University of Nottingham Ningbo China(计算机科学学院,宁波大学中国)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted in MICCAI-W 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21291 2025-07-30 cs.CV 57%

Fairness and Robustness of CLIP-Based Models for Chest X-rays

Théo Sourget, David Restrepo, Céline Hudelot, Enzo Ferrante, Stergios Christodoulidis, Maria Vakalopoulou

机构 * MICS, CentraleSupélec - Université Paris-Saclay(MICS,中央超导学院——巴黎萨克雷大学) CONICET, Universidad de Buenos Aires(CONICET,布宜诺斯艾利斯大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted for publication at the FAIMI MICCAI workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21165 2025-07-30 eess.IV cs.CV 57%

Querying GI Endoscopy Images: A VQA Approach

Gaurav Parajuli

机构 * Johannes Kepler University Linz(约翰·凯撒大学林茨)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19651 2025-07-30 cs.CV cs.LG cs.PF 57%

PEVLM: Parallel Encoding for Vision-Language Models

Letian Kang, Shixian Luo, Yiqiang Li, Yuxin Yin, Shenxuan Zhou, Xiaoyang Yu, Jin Yang, Yong Wu

机构 * Li Auto Inc.(利自动公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏