arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2404.11998 2024-04-19 cs.CV 57%

Curriculum Point Prompting for Weakly-Supervised Referring Image Segmentation

Qiyuan Dai, Sibei Yang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11249 2024-04-18 cs.CV 57%

A Progressive Framework of Vision-language Knowledge Distillation and Alignment for Multilingual Scene

Wenbo Zhang, Yifan Zhang, Jianfeng Lin, Binqiang Huang, Jinlu Zhang, Wenhao Yu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03788 2024-04-18 cs.CV 57%

Low-light Image Enhancement via CLIP-Fourier Guided Wavelet Diffusion

Minglong Xue, Jinhong He, Wenhai Wang, Mingliang Zhou

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10193 2024-04-17 cs.CV 57%

Consistency and Uncertainty: Identifying Unreliable Responses From Black-Box Vision-Language Models for Selective Visual Question Answering

Zaid Khan, Yun Fu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06129 2024-04-17 cs.CV 57%

Distilling Vision-Language Models on Millions of Videos

Yue Zhao, Long Zhao, Xingyi Zhou, Jialin Wu, Chun-Te Chu, Hui Miao, Florian Schroff, Hartwig Adam, Ting Liu, Boqing Gong, Philipp Krähenbühl, Liangzhe Yuan

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments CVPR 2024. Project page: https://zhaoyue-zephyrus.github.io/video-instruction-tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04016 2024-04-17 cs.CV 57%

PartDistill: 3D Shape Part Segmentation by Vision-Language Model Distillation

Ardian Umam, Cheng-Kun Yang, Min-Hung Chen, Jen-Hui Chuang, Yen-Yu Lin

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments CVPR 2024 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02612 2024-04-17 cs.CV 57%

GPT-4V-AD: Exploring Grounding Potential of VQA-oriented GPT-4V for Zero-shot Anomaly Detection

Jiangning Zhang, Haoyang He, Xuhai Chen, Zhucun Xue, Yabiao Wang, Chengjie Wang, Lei Xie, Yong Liu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11029 2024-04-17 cs.CV 57%

RemoteCLIP: A Vision Language Foundation Model for Remote Sensing

Fan Liu, Delong Chen, Zhangqingyun Guan, Xiaocong Zhou, Jiale Zhu, Qiaolin Ye, Liyong Fu, Jun Zhou

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Geoscience and Remote Sensing (TGRS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09216 2024-04-16 cs.CV 57%

DetCLIPv3: Towards Versatile Generative Open-vocabulary Object Detection

Lewei Yao, Renjie Pi, Jianhua Han, Xiaodan Liang, Hang Xu, Wei Zhang, Zhenguo Li, Dan Xu

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted to CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08226 2024-04-15 cs.CV 57%

Improving Continuous Sign Language Recognition with Adapted Image Models

Lianyu Hu, Tongkai Shi, Liqing Gao, Zekang Liu, Wei Feng

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06918 2024-04-11 cs.CV 57%

HRVDA: High-Resolution Visual Document Assistant

Chaohu Liu, Kun Yin, Haoyu Cao, Xinghua Jiang, Xin Li, Yinsong Liu, Deqiang Jiang, Xing Sun, Linli Xu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted to CVPR 2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06244 2024-04-10 cs.CV 57%

Anchor-based Robust Finetuning of Vision-Language Models

Jinwei Han, Zhiwen Lin, Zhongyisun Sun, Yingguo Gao, Ke Yan, Shouhong Ding, Yuan Gao, Gui-Song Xia

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20330 2024-04-10 cs.CV 57%

Are We on the Right Way for Evaluating Large Vision-Language Models?

Lin Chen, Jinsong Li, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Zehui Chen, Haodong Duan, Jiaqi Wang, Yu Qiao, Dahua Lin, Feng Zhao

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Project page: https://mmstar-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05621 2024-04-09 cs.CV 57%

MULTIFLOW: Shifting Towards Task-Agnostic Vision-Language Pruning

Matteo Farina, Massimiliano Mancini, Elia Cunegatti, Gaowen Liu, Giovanni Iacca, Elisa Ricci

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04627 2024-04-09 cs.CV 57%

Self-Training Large Language Models for Improved Visual Program Synthesis With Visual Reinforcement

Zaid Khan, Vijay Kumar BG, Samuel Schulter, Yun Fu, Manmohan Chandraker

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03539 2024-04-05 cs.CV 57%

Is CLIP the main roadblock for fine-grained open-world perception?

Lorenzo Bianchi, Fabio Carrara, Nicola Messina, Fabrizio Falchi

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02460 2024-04-05 cs.CV 57%

Improved Zero-Shot Classification by Adapting VLMs with Text Descriptions

Oindrila Saha, Grant Van Horn, Subhransu Maji

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02415 2024-04-04 cs.CV 57%

What Are We Measuring When We Evaluate Large Vision-Language Models? An Analysis of Latent Factors and Biases

Anthony Meng Huat Tiong, Junqi Zhao, Boyang Li, Junnan Li, Steven C. H. Hoi, Caiming Xiong

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00909 2024-04-02 cs.CV 57%

Learning by Correction: Efficient Tuning Task for Zero-Shot Generative Vision-Language Reasoning

Rongjie Li, Yu Wu, Xuming He

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.11797 2024-04-02 cs.CV 57%

CAT-Seg: Cost Aggregation for Open-Vocabulary Semantic Segmentation

Seokju Cho, Heeseong Shin, Sunghwan Hong, Anurag Arnab, Paul Hongsuck Seo, Seungryong Kim

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted to CVPR 2024. Project page: https://ku-cvlab.github.io/CAT-Seg/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20078 2024-04-01 cs.CV cs.LG 57%

Negative Label Guided OOD Detection with Pretrained Vision-Language Models

Xue Jiang, Feng Liu, Zhen Fang, Hong Chen, Tongliang Liu, Feng Zheng, Bo Han

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments ICLR 2024 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19193 2024-03-29 cs.CV 57%

Text Data-Centric Image Captioning with Interactive Prompts

Yiyu Wang, Hao Luo, Jungang Xu, Yingfei Sun, Fan Wang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18996 2024-03-29 cs.CV 57%

Envisioning MedCLIP: A Deep Dive into Explainability for Medical Vision-Language Models

Anees Ur Rehman Hashmi, Dwarikanath Mahapatra, Mohammad Yaqub

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18572 2024-03-28 cs.SD eess.AS 57%

ACES: Evaluating Automated Audio Captioning Models on the Semantics of Sounds

Gijs Wijngaard, Elia Formisano, Bruno L. Giordano, Michel Dumontier

专题命中 图文多模态 :multimodal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17315 2024-03-26 cs.CV 57%

Explaining CLIP's performance disparities on data from blind/low vision users

Daniela Massiceti, Camilla Longden, Agnieszka Słowik, Samuel Wills, Martin Grayson, Cecily Morrison

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted at 2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.11100 2024-03-26 cs.CV 57%

Supporting Vision-Language Model Inference with Confounder-pruning Knowledge Prompt

Jiangmeng Li, Wenyi Mo, Wenwen Qiang, Bing Su, Changwen Zheng, Hui Xiong, Ji-Rong Wen

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11170 2024-03-25 cs.CV cs.CR 57%

Inducing High Energy-Latency of Large Vision-Language Models with Verbose Images

Kuofeng Gao, Yang Bai, Jindong Gu, Shu-Tao Xia, Philip Torr, Zhifeng Li, Wei Liu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11038 2024-03-25 cs.CV cs.LG 57%

UniChest: Conquer-and-Divide Pre-training for Multi-Source Chest X-Ray Classification

Tianjie Dai, Ruipeng Zhang, Feng Hong, Jiangchao Yao, Ya Zhang, Yanfeng Wang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted at IEEE Transactions on Medical Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12966 2024-03-22 cs.CV 57%

Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models

Zuyan Liu, Yuhao Dong, Yongming Rao, Jie Zhou, Jiwen Lu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Project Page: https://sites.google.com/view/chain-of-spot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12596 2024-03-20 cs.CL 57%

Chart-based Reasoning: Transferring Capabilities from LLMs to VLMs

Victor Carbune, Hassan Mansoor, Fangyu Liu, Rahul Aralikatte, Gilles Baechler, Jindong Chen, Abhanshu Sharma

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

Comments Findings of NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏