arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4672 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4672 篇

2310.17869 2025-02-14 cs.CV 57%

Grid Jigsaw Representation with CLIP: A New Perspective on Image Clustering

Zijie Song, Zhenzhen Hu, Richang Hong

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Journal ref Multimedia Systems 31, 105 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08391 2025-02-13 cs.CV 57%

ViLa-MIL: Dual-scale Vision-Language Multiple Instance Learning for Whole Slide Image Classification

Jiangbo Shi, Chen Li, Tieliang Gong, Yefeng Zheng, Huazhu Fu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments CVPR 2024 (Updated version with corrections for typos and errors.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17883 2025-02-13 cs.AI 57%

Lightweight Neural App Control

Filippos Christianos, Georgios Papoudakis, Thomas Coste, Jianye Hao, Jun Wang, Kun Shao

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

Comments ICLR 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19270 2025-02-13 cs.CV cs.LG 57%

Learning without Forgetting for Vision-Language Models

Da-Wei Zhou, Yuanhan Zhang, Yan Wang, Jingyi Ning, Han-Jia Ye, De-Chuan Zhan, Ziwei Liu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted to TPAMI. Code is available at https://github.com/zhoudw-zdw/PROOF

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13921 2025-02-12 cs.CL 57%

The Breeze 2 Herd of Models: Traditional Chinese LLMs Based on Llama with Vision-Aware and Function-Calling Capabilities

MediaTek Research, :, Chan-Jan Hsu, Chia-Sheng Liu, Meng-Hsi Chen, Muxi Chen, Po-Chun Hsu, Yi-Chang Chen, Da-Shan Shiu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06460 2025-02-11 cs.CV 57%

Group-CLIP Uncertainty Modeling for Group Re-Identification

Qingxin Zhang, Haoyan Wei, Yang Qian

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16158 2025-02-11 cs.CV 57%

HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding

Chenxin Tao, Shiqian Su, Xizhou Zhu, Chenyu Zhang, Zhe Chen, Jiawen Liu, Wenhai Wang, Lewei Lu, Gao Huang, Yu Qiao, Jifeng Dai

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01404 2025-02-11 cs.CL 57%

What Is Missing in Multilingual Visual Reasoning and How to Fix It

Yueqi Song, Simran Khanuja, Graham Neubig

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18624 2025-02-10 cs.CR cs.AI 57%

Membership Inference Attacks Against Vision-Language Models

Yuke Hu, Zheng Li, Zhihao Liu, Yang Zhang, Zhan Qin, Kui Ren, Chun Chen

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

Comments Accepted by USENIX'25; 22 pages, 28 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10815 2025-02-10 cs.CV 57%

Exploring scalable medical image encoders beyond text supervision

Fernando Pérez-García, Harshita Sharma, Sam Bond-Taylor, Kenza Bouzid, Valentina Salvatelli, Maximilian Ilse, Shruthi Bannur, Daniel C. Castro, Anton Schwaighofer, Matthew P. Lungren, Maria Teodora Wetscherek, Noel Codella, Stephanie L. Hyland, Javier Alvarez-Valle, Ozan Oktay

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Journal ref Nature Machine Intelligence (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02740 2025-02-06 cs.LG cs.AI 57%

Vision-Language Model Dialog Games for Self-Improvement

Ksenia Konyushkova, Christos Kaplanis, Serkan Cabi, Misha Denil

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00719 2025-02-04 cs.CV 57%

Vision and Language Reference Prompt into SAM for Few-shot Segmentation

Kosuke Sakurai, Ryotaro Shimizu, Masayuki Goto

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17426 2025-02-04 cs.CV cs.RO 57%

Benchmarking and Improving Bird's Eye View Perception Robustness in Autonomous Driving

Shaoyuan Xie, Lingdong Kong, Wenwei Zhang, Jiawei Ren, Liang Pan, Kai Chen, Ziwei Liu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments TPAMI 2025; 17 pages, 13 figures, 11 tables; Code at this https URL: https://github.com/Daniel-xsy/RoboBEV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15040 2025-01-28 cs.CV 57%

Complementary Subspace Low-Rank Adaptation of Vision-Language Models for Few-Shot Classification

Zhongqi Wang, Jia Dai, Kai Li, Xu Li, Yanmeng Guo, Maosheng Xiang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15021 2025-01-28 cs.CL 57%

AKVQ-VL: Attention-Aware KV Cache Adaptive 2-Bit Quantization for Vision-Language Models

Zunhai Su, Wang Shen, Linge Li, Zhe Chen, Hanyu Wei, Huangqi Yu, Kehong Yuan

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11327 2025-01-24 cs.CV 57%

ClawMachine: Learning to Fetch Visual Tokens for Referential Comprehension

Tianren Ma, Lingxi Xie, Yunjie Tian, Boyu Yang, Qixiang Ye

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments ICLR 2025. Code is available at github.com/martian422/ClawMachine

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03189 2025-01-23 cs.CV 57%

Generalizable Prompt Tuning for Vision-Language Models

Qian Zhang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11485 2025-01-22 cs.CV 57%

SimLabel: Consistency-Guided OOD Detection with Pretrained Vision-Language Models

Shu Zou, Xinyu Tian, Qinyu Zhao, Zhaoyuan Yang, Jing Zhang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08443 2025-01-20 cs.CV cs.LG 57%

Instruction-Guided Fusion of Multi-Layer Visual Features in Large Vision-Language Models

Xu Li, Yi Zheng, Haotian Chen, Xiaolei Chen, Yuxuan Liang, Chenghang Lai, Bin Li, Xiangyang Xue

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09039 2025-01-17 cs.CR cs.AI cs.CY 57%

Playing Devil's Advocate: Unmasking Toxicity and Vulnerabilities in Large Vision-Language Models

Abdulkadir Erol, Trilok Padhi, Agnik Saha, Ugur Kursuncu, Mehmet Emin Aktas

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08597 2025-01-16 cs.CL 57%

Dynamic Knowledge Integration for Enhanced Vision-Language Reasoning

Julian Perry, Surasakdi Siripong, Thanakorn Phonchai

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17345 2025-01-16 cs.CV 57%

3VL: Using Trees to Improve Vision-Language Models' Interpretability

Nir Yellinek, Leonid Karlinsky, Raja Giryes

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments accepted to IEEE TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07802 2025-01-15 cs.AI physics.space-ph 57%

Visual Language Models as Operator Agents in the Space Domain

Alejandro Carrasco, Marco Nedungadi, Enrico M. Zucchelli, Amit Jain, Victor Rodriguez-Fernandez, Richard Linares

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments Updated version of the paper presented in 2025 AIAA SciTech. https://arc.aiaa.org/doi/10.2514/6.2025-1543

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07109 2025-01-14 cs.CV 57%

The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering

Anupam Pandey, Deepjyoti Bodo, Arpan Phukan, Asif Ekbal

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14789 2025-01-14 cs.LG cs.CV 57%

Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers

Hongbo Liu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06809 2025-01-14 cs.CV 57%

RSRefSeg: Referring Remote Sensing Image Segmentation with Foundation Models

Keyan Chen, Jiafan Zhang, Chenyang Liu, Zhengxia Zou, Zhenwei Shi

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05398 2025-01-10 cs.LG cs.AI 57%

Mechanistic understanding and validation of large AI models with SemanticLens

Maximilian Dreyer, Jim Berend, Tobias Labarta, Johanna Vielhaben, Thomas Wiegand, Sebastian Lapuschkin, Wojciech Samek

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments 74 pages (18 pages manuscript, 7 pages references, 49 pages appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01767 2025-01-09 cs.CV 57%

LogicAD: Explainable Anomaly Detection via VLM-based Text Feature Extraction

Er Jin, Qihui Feng, Yongli Mou, Stefan Decker, Gerhard Lakemeyer, Oliver Simons, Johannes Stegmaier

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted for publication at aaai25, project page: https://jasonjin34.github.io/logicad.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02716 2025-01-09 cs.CV cs.LG 57%

Light-weight Fine-tuning Method for Defending Adversarial Noise in Pre-trained Medical Vision-Language Models

Xu Han, Linghao Jin, Xuezhe Ma, Xiaofeng Liu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.08110 2025-01-08 cs.LG cs.AI 57%

AtMan: Understanding Transformer Predictions Through Memory Efficient Attention Manipulation

Björn Deiseroth, Mayukh Deb, Samuel Weinbach, Manuel Brack, Patrick Schramowski, Kristian Kersting

专题命中 图文多模态 :image-text(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏