arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46122 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4657 篇

2401.11337 2024-01-23 cs.CV cs.AI 62%

Prompting Large Vision-Language Models for Compositional Reasoning

Timothy Ossowski, Ming Jiang, Junjie Hu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02506 2024-01-22 cs.LG cs.AI cs.CV 62%

Prismer: A Vision-Language Model with Multi-Task Experts

Shikun Liu, Linxi Fan, Edward Johns, Zhiding Yu, Chaowei Xiao, Anima Anandkumar

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Published at TMLR 2024. Project Page: https://shikun.io/projects/prismer Code: https://github.com/NVlabs/prismer

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09763 2024-01-19 cs.CV cs.AI 62%

CLIP Model for Images to Textual Prompts Based on Top-k Neighbors

Xin Zhang, Xin Zhang, YeMing Cai, Tianzhi Jia

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments CLIP model, KNN, image-to-prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01179 2024-01-03 cs.CV cs.AI cs.LG 62%

Freeze the backbones: A Parameter-Efficient Contrastive Approach to Robust Medical Vision-Language Pre-training

Jiuming Qin, Che Liu, Sibo Cheng, Yike Guo, Rossella Arcucci

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06166 2024-01-01 cs.CV cs.AI 62%

Can Vision-Language Models be a Good Guesser? Exploring VLMs for Times and Location Reasoning

Gengyuan Zhang, Yurui Zhang, Kerui Zhang, Volker Tresp

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Accepted to WACV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10253 2023-12-29 cs.CV cs.CL cs.LG 62%

StableLLaVA: Enhanced Visual Instruction Tuning with Synthesized Image-Dialogue Data

Yanda Li, Chi Zhang, Gang Yu, Zhibin Wang, Bin Fu, Guosheng Lin, Chunhua Shen, Ling Chen, Yunchao Wei

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Project page: https://github.com/icoz69/StableLLAVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10045 2023-12-22 cs.CV cs.CL 62%

An Empirical Study of CLIP for Text-based Person Search

Min Cao, Yang Bai, Ziyin Zeng, Mang Ye, Min Zhang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted by AAAI 2024. Code is available at https://github.com/Flame-Chasers/TBPS-CLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12458 2023-12-21 cs.CL cs.AI 62%

When Parameter-efficient Tuning Meets General-purpose Vision-language Models

Yihang Zhai, Haixin Wang, Jianlong Chang, Xinlong Yang, Jinan Sun, Shikun Zhang, Qi Tian

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07221 2023-12-13 cs.CV cs.AI 62%

Transferring CLIP's Knowledge into Zero-Shot Point Cloud Semantic Segmentation

Yuanbin Wang, Shaofei Huang, Yulu Gao, Zhen Wang, Rui Wang, Kehua Sheng, Bo Zhang, Si Liu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00910 2023-12-13 cs.CV cs.AI 62%

CoPL: Contextual Prompt Learning for Vision-Language Understanding

Koustava Goswami, Srikrishna Karanam, Prateksha Udhayanan, K J Joseph, Balaji Vasan Srinivasan

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted at AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.02924 2023-12-11 cs.CV cs.AI 62%

Interpretable Visual Understanding with Cognitive Attention Network

Xuejiao Tang, Wenbin Zhang, Yi Yu, Kea Turner, Tyler Derr, Mengyu Wang, Eirini Ntoutsi

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments ICANN21

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02191 2023-12-06 cs.CV cs.AI 62%

Prompt Tuning for Zero-shot Compositional Learning

Lingyu Zhang, Ting Hua, Yilin Shen, Hongxia Jin

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01656 2023-12-06 cs.IR cs.AI cs.CV cs.HC 62%

The Contemporary Art of Image Search: Iterative User Intent Expansion via Vision-Language Model

Yilin Ye, Qian Zhu, Shishi Xiao, Kang Zhang, Wei Zeng

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by The 2024 ACM SIGCHI Conference on Computer-Supported Cooperative Work & Social Computing (CSCW) (Proc. CSCW 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18592 2023-12-01 cs.CV cs.AI 62%

Semantic-Aware Frame-Event Fusion based Pattern Recognition via Large Vision-Language Models

Dong Li, Jiandong Jin, Yuhao Zhang, Yanlin Zhong, Yaoyang Wu, Lan Chen, Xiao Wang, Bin Luo

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments In Peer Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08172 2023-11-28 cs.MM cs.CV 62%

Vision-Language Instruction Tuning: A Review and Analysis

Chen Li, Yixiao Ge, Dian Li, Ying Shan

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments 34 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02080 2023-11-21 cs.CV cs.CL cs.LG 62%

Benchmarking Robustness of Adaptation Methods on Pre-trained Vision-Language Models

Shuo Chen, Jindong Gu, Zhen Han, Yunpu Ma, Philip Torr, Volker Tresp

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted at NeurIPS 2023 Datasets and Benchmarks Track; 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01361 2023-11-03 cs.CV cs.CL 62%

GPT-4V(ision) as a Generalist Evaluator for Vision-Language Tasks

Xinlu Zhang, Yujie Lu, Weizhi Wang, An Yan, Jun Yan, Lianke Qin, Heng Wang, Xifeng Yan, William Yang Wang, Linda Ruth Petzold

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00206 2023-11-02 cs.CV cs.AI 62%

ChatGPT-Powered Hierarchical Comparisons for Image Classification

Zhiyuan Ren, Yiyang Su, Xiaoming Liu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments Neurips 2023 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14897 2023-10-31 cs.CL cs.CV cs.LG 62%

Text encoders bottleneck compositionality in contrastive vision-language models

Amita Kamath, Jack Hessel, Kai-Wei Chang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15325 2023-10-25 cs.CV cs.CL cs.LG 62%

LXMERT Model Compression for Visual Question Answering

Maryam Hashemi, Ghazaleh Mahmoudi, Sara Kodeiri, Hadi Sheikhi, Sauleh Eetemadi

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments To appear in The Fourth Annual West Coast NLP (WeCNLP) Summit

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15166 2023-10-24 cs.CV cs.CL 62%

Large Language Models are Visual Reasoning Coordinators

Liangyu Chen, Bo Li, Sheng Shen, Jingkang Yang, Chunyuan Li, Kurt Keutzer, Trevor Darrell, Ziwei Liu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14108 2023-10-24 cs.LG cs.AI cs.CV 62%

CLIP meets Model Zoo Experts: Pseudo-Supervision for Visual Enhancement

Mohammadreza Salehi, Mehrdad Farajtabar, Maxwell Horton, Fartash Faghri, Hadi Pouransari, Raviteja Vemulapalli, Oncel Tuzel, Ali Farhadi, Mohammad Rastegari, Sachin Mehta

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.05065 2023-10-18 cs.CV cs.AI 62%

Toward Building General Foundation Models for Language, Vision, and Vision-Language Understanding Tasks

Xinsong Zhang, Yan Zeng, Jipeng Zhang, Hang Li

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09929 2023-10-17 cs.CV cs.CL 62%

Prompting Scientific Names for Zero-Shot Species Recognition

Shubham Parashar, Zhiqiu Lin, Yanan Li, Shu Kong

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12966 2023-10-16 cs.CV cs.CL 62%

Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

Jinze Bai, Shuai Bai, Shusheng Yang, Shijie Wang, Sinan Tan, Peng Wang, Junyang Lin, Chang Zhou, Jingren Zhou

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Code, demo and models are available at https://github.com/QwenLM/Qwen-VL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02988 2023-10-05 cs.CV cs.AI 62%

Probing Intersectional Biases in Vision-Language Models with Counterfactual Examples

Phillip Howard, Avinash Madasu, Tiep Le, Gustavo Lujan Moreno, Vasudev Lal

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02804 2023-10-05 cs.CL cs.CV cs.LG 62%

DOMINO: A Dual-System for Multi-step Visual Language Reasoning

Peifang Wang, Olga Golovneva, Armen Aghajanyan, Xiang Ren, Muhao Chen, Asli Celikyilmaz, Maryam Fazel-Zarandi

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00398 2023-10-02 cs.CV cs.AI cs.LG 62%

ProbVLM: Probabilistic Adapter for Frozen Vision-Language Models

Uddeshya Upadhyay, Shyamgopal Karthik, Massimiliano Mancini, Zeynep Akata

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.15343 2023-09-28 cs.CV cs.AI 62%

Sigmoid Loss for Language Image Pre-Training

Xiaohua Zhai, Basil Mustafa, Alexander Kolesnikov, Lucas Beyer

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments ICCV'23 Oral. arXiv v2: fix typo in pseudocode; v3: clarify t vs t' init; v4: add SigLIP Base, Large, Shape-Optimized 400M results. Models released at: https://github.com/google-research/big_vision. Xiaohua and Lucas contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14381 2023-09-27 cs.CL cs.AI 62%

Survey of Social Bias in Vision-Language Models

Nayeon Lee, Yejin Bang, Holy Lovenia, Samuel Cahyawijaya, Wenliang Dai, Pascale Fung

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏