arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4672 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4672 篇

2312.00110 2024-06-03 cs.CV 57%

CLIP-QDA: An Explainable Concept Bottleneck Model

Rémi Kazmierczak, Eloïse Berthier, Goran Frehse, Gianni Franchi

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Journal ref Transactions on Machine Learning Research (05/2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20339 2024-05-31 cs.CV 57%

Visual Perception by Large Language Model's Weights

Feipeng Ma, Hongwei Xue, Guangting Wang, Yizhou Zhou, Fengyun Rao, Shilin Yan, Yueyi Zhang, Siying Wu, Mike Zheng Shou, Xiaoyan Sun

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19675 2024-05-31 cs.CV 57%

Knowledge-grounded Adaptation Strategy for Vision-language Models: Building Unique Case-set for Screening Mammograms for Residents Training

Aisha Urooj Khan, John Garrett, Tyler Bradshaw, Lonie Salkowski, Jiwoong Jason Jeong, Amara Tariq, Imon Banerjee

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16134 2024-05-31 cs.CV 57%

Breaking the False Sense of Security in Backdoor Defense through Re-Activation Attack

Mingli Zhu, Siyuan Liang, Baoyuan Wu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18812 2024-05-30 cs.CV 57%

MindSemantix: Deciphering Brain Visual Experiences with a Brain-Language Model

Ziqi Ren, Jie Li, Xuetong Xue, Xin Li, Fan Yang, Zhicheng Jiao, Xinbo Gao

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12678 2024-05-27 cs.CV 57%

Exploring Interactive Semantic Alignment for Efficient HOI Detection with Vision-language Model

Jihao Dong, Renjie Pan, Hua Yang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15155 2024-05-27 cs.CV 57%

CLIP model is an Efficient Online Lifelong Learner

Leyuan Wang, Liuyu Xiang, Yujie Wei, Yunlong Wang, Zhaofeng He

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09683 2024-05-24 cs.CV 57%

Scaling Open-Vocabulary Object Detection

Matthias Minderer, Alexey Gritsenko, Neil Houlsby

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02944 2024-05-24 cs.CV cs.LG 57%

Neural Image Compression with Text-guided Encoding for both Pixel-level and Perceptual Fidelity

Hagyeong Lee, Minkyu Kim, Jun-Hyuk Kim, Seungeon Kim, Dokwan Oh, Jaeho Lee

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11205 2024-05-21 cs.CV 57%

Fuse & Calibrate: A bi-directional Vision-Language Guided Framework for Referring Image Segmentation

Yichen Yan, Xingjian He, Sihan Chen, Shichen Lu, Jing Liu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 12 pages, 4 figures ICIC2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08911 2024-05-16 cs.CV cs.LG 57%

CLIP with Quality Captions: A Strong Pretraining for Vision Tasks

Pavan Kumar Anasosalu Vasu, Hadi Pouransari, Fartash Faghri, Oncel Tuzel

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12732 2024-05-08 cs.CV 57%

CLIP-KD: An Empirical Study of CLIP Model Distillation

Chuanguang Yang, Zhulin An, Libo Huang, Junyu Bi, Xinqiang Yu, Han Yang, Boyu Diao, Yongjun Xu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments CVPR-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15726 2024-05-07 cs.CV 57%

CLIPose: Category-Level Object Pose Estimation with Pre-trained Vision-Language Knowledge

Xiao Lin, Minghao Zhu, Ronghao Dang, Guangliang Zhou, Shaolong Shu, Feng Lin, Chengju Liu, Qijun Chen

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 14 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01691 2024-05-06 cs.CV cs.LG cs.RO 57%

Language-Enhanced Latent Representations for Out-of-Distribution Detection in Autonomous Driving

Zhenjiang Mao, Dong-You Jhong, Ao Wang, Ivan Ruchkin

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Presented at the Robot Trust for Symbiotic Societies (RTSS) Workshop, co-located with ICRA 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04504 2024-05-06 cs.LG cs.AI 57%

Compositional Learning of Visually-Grounded Concepts Using Reinforcement

Zijun Lin, Haidi Azaman, M Ganesh Kumar, Cheston Tan

专题命中 图文多模态 :image-text(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07027 2024-05-01 cs.CV cs.LG 57%

Utilizing Synthetic Data for Medical Vision-Language Pre-training: Bypassing the Need for Real Images

Che Liu, Anand Shah, Wenjia Bai, Rossella Arcucci

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by CVPR 2024 Workshop Data Curation and Augmentation in Enhancing Medical Imaging Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18106 2024-04-30 cs.CV 57%

Semi-supervised Text-based Person Search

Daming Gao, Yang Bai, Min Cao, Hao Dou, Mang Ye, Min Zhang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16637 2024-04-26 cs.CV 57%

Zero-Shot Distillation for Image Encoders: How to Make Effective Use of Synthetic Data

Niclas Popp, Jan Hendrik Metzen, Matthias Hein

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14696 2024-04-25 cs.CV 57%

Adaptive Prompt Learning with Negative Textual Semantics and Uncertainty Modeling for Universal Multi-Source Domain Adaptation

Yuxiang Yang, Lu Wen, Yuanyuan Xu, Jiliu Zhou, Yan Wang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by ICME2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15182 2024-04-24 cs.LG cs.AI 57%

FLoRA: Enhancing Vision-Language Models with Parameter-Efficient Federated Learning

Duy Phuong Nguyen, J. Pablo Munoz, Ali Jannesari

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12139 2024-04-19 cs.CV 57%

Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models

Shouwei Ruan, Yinpeng Dong, Hanqing Liu, Yao Huang, Hang Su, Xingxing Wei

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11998 2024-04-19 cs.CV 57%

Curriculum Point Prompting for Weakly-Supervised Referring Image Segmentation

Qiyuan Dai, Sibei Yang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11249 2024-04-18 cs.CV 57%

A Progressive Framework of Vision-language Knowledge Distillation and Alignment for Multilingual Scene

Wenbo Zhang, Yifan Zhang, Jianfeng Lin, Binqiang Huang, Jinlu Zhang, Wenhao Yu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03788 2024-04-18 cs.CV 57%

Low-light Image Enhancement via CLIP-Fourier Guided Wavelet Diffusion

Minglong Xue, Jinhong He, Wenhai Wang, Mingliang Zhou

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10193 2024-04-17 cs.CV 57%

Consistency and Uncertainty: Identifying Unreliable Responses From Black-Box Vision-Language Models for Selective Visual Question Answering

Zaid Khan, Yun Fu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06129 2024-04-17 cs.CV 57%

Distilling Vision-Language Models on Millions of Videos

Yue Zhao, Long Zhao, Xingyi Zhou, Jialin Wu, Chun-Te Chu, Hui Miao, Florian Schroff, Hartwig Adam, Ting Liu, Boqing Gong, Philipp Krähenbühl, Liangzhe Yuan

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments CVPR 2024. Project page: https://zhaoyue-zephyrus.github.io/video-instruction-tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04016 2024-04-17 cs.CV 57%

PartDistill: 3D Shape Part Segmentation by Vision-Language Model Distillation

Ardian Umam, Cheng-Kun Yang, Min-Hung Chen, Jen-Hui Chuang, Yen-Yu Lin

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments CVPR 2024 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02612 2024-04-17 cs.CV 57%

GPT-4V-AD: Exploring Grounding Potential of VQA-oriented GPT-4V for Zero-shot Anomaly Detection

Jiangning Zhang, Haoyang He, Xuhai Chen, Zhucun Xue, Yabiao Wang, Chengjie Wang, Lei Xie, Yong Liu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11029 2024-04-17 cs.CV 57%

RemoteCLIP: A Vision Language Foundation Model for Remote Sensing

Fan Liu, Delong Chen, Zhangqingyun Guan, Xiaocong Zhou, Jiale Zhu, Qiaolin Ye, Liyong Fu, Jun Zhou

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Geoscience and Remote Sensing (TGRS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09216 2024-04-16 cs.CV 57%

DetCLIPv3: Towards Versatile Generative Open-vocabulary Object Detection

Lewei Yao, Renjie Pi, Jianhua Han, Xiaodan Liang, Hang Xu, Wei Zhang, Zhenguo Li, Dan Xu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted to CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏