arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1583 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1583 篇

2311.04257 2023-11-13 cs.CL cs.CV 57%

mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration

Qinghao Ye, Haiyang Xu, Jiabo Ye, Ming Yan, Anwen Hu, Haowei Liu, Qi Qian, Ji Zhang, Fei Huang, Jingren Zhou

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01034 2023-11-03 cs.CV 57%

Learning to Adapt CLIP for Few-Shot Monocular Depth Estimation

Xueting Hu, Ce Zhang, Yi Zhang, Bowen Hai, Ke Yu, Zhihai He

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by WACV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18949 2023-10-31 cs.CV 57%

Customize StyleGAN with One Hand Sketch

Shaocong Zhang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15985 2023-10-25 cs.CV 57%

Vision-Language Pseudo-Labels for Single-Positive Multi-Label Learning

Xin Xing, Zhexiao Xiong, Abby Stylianou, Srikumar Sastry, Liyu Gong, Nathan Jacobs

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.08931 2023-10-23 cs.CV cs.CL 57%

Enhancing Textbooks with Visuals from the Web for Improved Learning

Janvijay Singh, Vilém Zouhar, Mrinmaya Sachan

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments EMNLP 2023; 14 pages (8+6)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09929 2023-10-17 cs.CV cs.CL 57%

Prompting Scientific Names for Zero-Shot Species Recognition

Shubham Parashar, Zhiqiu Lin, Yanan Li, Shu Kong

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08368 2023-10-13 cs.CV 57%

Mapping Memes to Words for Multimodal Hateful Meme Classification

Giovanni Burbi, Alberto Baldrati, Lorenzo Agnolucci, Marco Bertini, Alberto Del Bimbo

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ICCV2023 CLVL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06838 2023-10-11 cs.CV 57%

AutoAD II: The Sequel -- Who, When, and What in Movie Audio Description

Tengda Han, Max Bain, Arsha Nagrani, Gül Varol, Weidi Xie, Andrew Zisserman

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ICCV2023. Project page: https://www.robots.ox.ac.uk/vgg/research/autoad/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02426 2023-10-05 cs.CV 57%

EditVal: Benchmarking Diffusion Based Text-Guided Image Editing Methods

Samyadeep Basu, Mehrdad Saberi, Shweta Bhardwaj, Atoosa Malemir Chegini, Daniela Massiceti, Maziar Sanjabi, Shell Xu Hu, Soheil Feizi

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.11553 2023-09-26 cs.CV 57%

MuMUR : Multilingual Multimodal Universal Retrieval

Avinash Madasu, Estelle Aflalo, Gabriela Ben Melech Stan, Shachar Rosenman, Shao-Yen Tseng, Gedas Bertasius, Vasudev Lal

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments This is an extension of the previous MKTVR paper (for which you can find a reference here : https://dl.acm.org/doi/abs/10.1007/978-3-031-28244-7_42 or in a previous version on arxiv). This version was published to the Information Retrieval Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.12530 2023-09-25 cs.CV 57%

A Sentence Speaks a Thousand Images: Domain Generalization through Distilling CLIP with Language Guidance

Zeyi Huang, Andy Zhou, Zijian Lin, Mu Cai, Haohan Wang, Yong Jae Lee

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments to appear at ICCV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08928 2023-09-19 cs.CV 57%

In-Style: Bridging Text and Uncurated Videos with Style Transfer for Text-Video Retrieval

Nina Shvetsova, Anna Kukleva, Bernt Schiele, Hilde Kuehne

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Published at ICCV 2023, code: https://github.com/ninatu/in_style

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08531 2023-09-18 cs.CV cs.CL eess.AS eess.IV 57%

Towards Practical and Efficient Image-to-Speech Captioning with Vision-Language Pre-training and Multi-modal Tokens

Minsu Kim, Jeongsoo Choi, Soumi Maiti, Jeong Hun Yeo, Shinji Watanabe, Yong Man Ro

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10755 2023-09-18 cs.CL cs.CV 57%

WanJuan: A Comprehensive Multimodal Dataset for Advancing English and Chinese Large Models

Conghui He, Zhenjiang Jin, Chao Xu, Jiantao Qiu, Bin Wang, Wei Li, Hang Yan, Jiaqi Wang, Dahua Lin

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06526 2023-09-15 cs.CV cs.GR 57%

AvatarFusion: Zero-shot Generation of Clothing-Decoupled 3D Avatars Using 2D Diffusion

Shuo Huang, Zongxin Yang, Liangting Li, Yi Yang, Jia Jia

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by ACM Multimedia 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16474 2023-09-01 cs.CL cs.AI 57%

Enhancing Subtask Performance of Multi-modal Large Language Model

Yongqiang Zhao, Zhenyu Li, Feng Zhang, Xinhai Xu, Donghong Liu

专题命中 其他VLM :MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10554 2023-08-22 cs.CV 57%

Improving Diversity in Zero-Shot GAN Adaptation with Semantic Variations

Seogkyu Jeon, Bei Liu, Pilhyeon Lee, Kibeom Hong, Jianlong Fu, Hyeran Byun

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted to ICCV 2023 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09089 2023-08-21 cs.SD cs.CV cs.IR cs.MM eess.AS 57%

Bridging High-Quality Audio and Video via Language for Sound Effects Retrieval from Visual Queries

Julia Wilkins, Justin Salamon, Magdalena Fuentes, Juan Pablo Bello, Oriol Nieto

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments WASPAA 2023. Project page: https://juliawilkins.github.io/sound-effects-retrieval-from-video/. 4 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08754 2023-08-21 cs.CV 57%

Fine-grained Text and Image Guided Point Cloud Completion with CLIP Model

Wei Song, Jun Zhou, Mingjie Wang, Hongchen Tan, Nannan Li, Xiuping Liu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06038 2023-08-21 cs.CV 57%

Diverse Data Augmentation with Diffusions for Effective Test-time Prompt Tuning

Chun-Mei Feng, Kai Yu, Yong Liu, Salman Khan, Wangmeng Zuo

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Proceedings of the IEEE/CVF International Conference on Computer Vision 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03685 2023-08-08 cs.CV 57%

Learning Concise and Descriptive Attributes for Visual Recognition

An Yan, Yu Wang, Yiwu Zhong, Chengyu Dong, Zexue He, Yujie Lu, William Wang, Jingbo Shang, Julian McAuley

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12964 2023-08-07 cs.CV 57%

Text-based Person Search without Parallel Image-Text Data

Yang Bai, Jingyao Wang, Min Cao, Chen Chen, Ziqiang Cao, Liqiang Nie, Min Zhang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by ACM MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16125 2023-08-03 cs.CL cs.CV 57%

SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension

Bohao Li, Rui Wang, Guangzhi Wang, Yuying Ge, Yixiao Ge, Ying Shan

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Technical Report; Project released at: https://github.com/AILab-CVC/SEED-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12980 2023-07-25 cs.CV 57%

A Systematic Survey of Prompt Engineering on Vision-Language Foundation Models

Jindong Gu, Zhen Han, Shuo Chen, Ahmad Beirami, Bailan He, Gengyuan Zhang, Ruotong Liao, Yao Qin, Volker Tresp, Philip Torr

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13223 2023-07-12 cs.CV 57%

Exploring Structured Semantic Prior for Multi Label Recognition with Incomplete Labels

Zixuan Ding, Ao Wang, Hui Chen, Qiang Zhang, Pengzhang Liu, Yongjun Bao, Weipeng Yan, Jungong Han

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.16529 2023-06-30 cs.IR cs.AI cs.DL 57%

Multimodal Search on Iconclass using Vision-Language Pre-Trained Models

Cristian Santini, Etienne Posthumus, Mary Ann Tan, Oleksandra Bruns, Tabea Tietz, Harald Sack

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08226 2023-06-16 cs.CV cs.GR 57%

CLIPXPlore: Coupled CLIP and Shape Spaces for 3D Shape Exploration

Jingyu Hu, Ka-Hei Hui, Zhengzhe liu, Hao Zhang, Chi-Wing Fu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19924 2023-06-02 cs.CV 57%

Joint Adaptive Representations for Image-Language Learning

AJ Piergiovanni, Anelia Angelova

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments T4V Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18203 2023-06-01 cs.CV 57%

Concept Decomposition for Visual Exploration and Inspiration

Yael Vinker, Andrey Voynov, Daniel Cohen-Or, Ariel Shamir

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments https://inspirationtree.github.io/inspirationtree/

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06602 2023-04-14 cs.CV 57%

A-CAP: Anticipation Captioning with Commonsense Knowledge

Duc Minh Vo, Quoc-An Luong, Akihiro Sugimoto, Hideki Nakayama

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted to CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏