arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2502.16842 2025-02-25 cs.CV 57%

Exploring Causes and Mitigation of Hallucinations in Large Vision Language Models

Yaqi Sun, Kyohei Atarashi, Koh Takeuchi, Hisashi Kashima

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16815 2025-02-25 cs.CV 57%

CLIP-SENet: CLIP-based Semantic Enhancement Network for Vehicle Re-identification

Liping Lu, Zihao Fu, Duanfeng Chu, Wei Wang, Bingrong Xu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16790 2025-02-25 cs.CL 57%

Are Large Language Models Good Data Preprocessors?

Elyas Meguellati, Nardiena Pratama, Shazia Sadiq, Gianluca Demartini

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08119 2025-02-25 cs.CV 57%

Q-VLM: Post-training Quantization for Large Vision-Language Models

Changyuan Wang, Ziwei Wang, Xiuwei Xu, Yansong Tang, Jie Zhou, Jiwen Lu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15381 2025-02-24 cs.CV 57%

MOVE: A Mixture-of-Vision-Encoders Approach for Domain-Focused Vision-Language Processing

Matvey Skripkin, Elizaveta Goncharova, Dmitrii Tarasov, Andrey Kuznetsov

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 10 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14976 2025-02-24 cs.LG cs.CR cs.CV 57%

EigenShield: Causal Subspace Filtering via Random Matrix Theory for Adversarially Robust Vision-Language Models

Nastaran Darabi, Devashri Naik, Sina Tayebati, Dinithi Jayasuriya, Ranganath Krishnan, Amit Ranjan Trivedi

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14881 2025-02-24 cs.CR cs.CV 57%

A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations

Mang Ye, Xuankun Rong, Wenke Huang, Bo Du, Nenghai Yu, Dacheng Tao

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13942 2025-02-20 cs.CV 57%

A Chain-of-Thought Subspace Meta-Learning for Few-shot Image Captioning with Large Vision and Language Models

Hao Huang, Shuaihang Yuan, Yu Hao, Congcong Wen, Yi Fang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 11 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12469 2025-02-14 eess.SP cs.AI cs.LG cs.NI 57%

AI Flow at the Network Edge

Jiawei Shao, Xuelong Li

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments This paper has been accepted to IEEE Network Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17869 2025-02-14 cs.CV 57%

Grid Jigsaw Representation with CLIP: A New Perspective on Image Clustering

Zijie Song, Zhenzhen Hu, Richang Hong

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Journal ref Multimedia Systems 31, 105 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08391 2025-02-13 cs.CV 57%

ViLa-MIL: Dual-scale Vision-Language Multiple Instance Learning for Whole Slide Image Classification

Jiangbo Shi, Chen Li, Tieliang Gong, Yefeng Zheng, Huazhu Fu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments CVPR 2024 (Updated version with corrections for typos and errors.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17883 2025-02-13 cs.AI 57%

Lightweight Neural App Control

Filippos Christianos, Georgios Papoudakis, Thomas Coste, Jianye Hao, Jun Wang, Kun Shao

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

Comments ICLR 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19270 2025-02-13 cs.CV cs.LG 57%

Learning without Forgetting for Vision-Language Models

Da-Wei Zhou, Yuanhan Zhang, Yan Wang, Jingyi Ning, Han-Jia Ye, De-Chuan Zhan, Ziwei Liu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted to TPAMI. Code is available at https://github.com/zhoudw-zdw/PROOF

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13921 2025-02-12 cs.CL 57%

The Breeze 2 Herd of Models: Traditional Chinese LLMs Based on Llama with Vision-Aware and Function-Calling Capabilities

MediaTek Research, :, Chan-Jan Hsu, Chia-Sheng Liu, Meng-Hsi Chen, Muxi Chen, Po-Chun Hsu, Yi-Chang Chen, Da-Shan Shiu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06460 2025-02-11 cs.CV 57%

Group-CLIP Uncertainty Modeling for Group Re-Identification

Qingxin Zhang, Haoyan Wei, Yang Qian

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16158 2025-02-11 cs.CV 57%

HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding

Chenxin Tao, Shiqian Su, Xizhou Zhu, Chenyu Zhang, Zhe Chen, Jiawen Liu, Wenhai Wang, Lewei Lu, Gao Huang, Yu Qiao, Jifeng Dai

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01404 2025-02-11 cs.CL 57%

What Is Missing in Multilingual Visual Reasoning and How to Fix It

Yueqi Song, Simran Khanuja, Graham Neubig

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18624 2025-02-10 cs.CR cs.AI 57%

Membership Inference Attacks Against Vision-Language Models

Yuke Hu, Zheng Li, Zhihao Liu, Yang Zhang, Zhan Qin, Kui Ren, Chun Chen

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

Comments Accepted by USENIX'25; 22 pages, 28 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10815 2025-02-10 cs.CV 57%

Exploring scalable medical image encoders beyond text supervision

Fernando Pérez-García, Harshita Sharma, Sam Bond-Taylor, Kenza Bouzid, Valentina Salvatelli, Maximilian Ilse, Shruthi Bannur, Daniel C. Castro, Anton Schwaighofer, Matthew P. Lungren, Maria Teodora Wetscherek, Noel Codella, Stephanie L. Hyland, Javier Alvarez-Valle, Ozan Oktay

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Journal ref Nature Machine Intelligence (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02740 2025-02-06 cs.LG cs.AI 57%

Vision-Language Model Dialog Games for Self-Improvement

Ksenia Konyushkova, Christos Kaplanis, Serkan Cabi, Misha Denil

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00719 2025-02-04 cs.CV 57%

Vision and Language Reference Prompt into SAM for Few-shot Segmentation

Kosuke Sakurai, Ryotaro Shimizu, Masayuki Goto

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17426 2025-02-04 cs.CV cs.RO 57%

Benchmarking and Improving Bird's Eye View Perception Robustness in Autonomous Driving

Shaoyuan Xie, Lingdong Kong, Wenwei Zhang, Jiawei Ren, Liang Pan, Kai Chen, Ziwei Liu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments TPAMI 2025; 17 pages, 13 figures, 11 tables; Code at this https URL: https://github.com/Daniel-xsy/RoboBEV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15040 2025-01-28 cs.CV 57%

Complementary Subspace Low-Rank Adaptation of Vision-Language Models for Few-Shot Classification

Zhongqi Wang, Jia Dai, Kai Li, Xu Li, Yanmeng Guo, Maosheng Xiang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15021 2025-01-28 cs.CL 57%

AKVQ-VL: Attention-Aware KV Cache Adaptive 2-Bit Quantization for Vision-Language Models

Zunhai Su, Wang Shen, Linge Li, Zhe Chen, Hanyu Wei, Huangqi Yu, Kehong Yuan

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11327 2025-01-24 cs.CV 57%

ClawMachine: Learning to Fetch Visual Tokens for Referential Comprehension

Tianren Ma, Lingxi Xie, Yunjie Tian, Boyu Yang, Qixiang Ye

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments ICLR 2025. Code is available at github.com/martian422/ClawMachine

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03189 2025-01-23 cs.CV 57%

Generalizable Prompt Tuning for Vision-Language Models

Qian Zhang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11485 2025-01-22 cs.CV 57%

SimLabel: Consistency-Guided OOD Detection with Pretrained Vision-Language Models

Shu Zou, Xinyu Tian, Qinyu Zhao, Zhaoyuan Yang, Jing Zhang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08443 2025-01-20 cs.CV cs.LG 57%

Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models

Xu Li, Yi Zheng, Haotian Chen, Xiaolei Chen, Yuxuan Liang, Chenghang Lai, Bin Li, Xiangyang Xue

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09039 2025-01-17 cs.CR cs.AI cs.CY 57%

Playing Devil's Advocate: Unmasking Toxicity and Vulnerabilities in Large Vision-Language Models

Abdulkadir Erol, Trilok Padhi, Agnik Saha, Ugur Kursuncu, Mehmet Emin Aktas

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08597 2025-01-16 cs.CL 57%

Dynamic Knowledge Integration for Enhanced Vision-Language Reasoning

Julian Perry, Surasakdi Siripong, Thanakorn Phonchai

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏