arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2312.08578 2024-06-18 cs.CV 57%

A Picture is Worth More Than 77 Text Tokens: Evaluating CLIP-Style Models on Dense Captions

Jack Urbanek, Florian Bordes, Pietro Astolfi, Mary Williamson, Vasu Sharma, Adriana Romero-Soriano

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17851 2024-06-18 cs.CV 57%

Leveraging VLM-Based Pipelines to Annotate 3D Objects

Rishabh Kabra, Loic Matthey, Alexander Lerchner, Niloy J. Mitra

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09994 2024-06-17 cs.CL 57%

Precision Empowers, Excess Distracts: Visual Question Answering With Dynamically Infused Knowledge In Language Models

Manas Jhalani, Annervaz K M, Pushpak Bhattacharyya

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09240 2024-06-14 cs.CV 57%

Comparison Visual Instruction Tuning

Wei Lin, Muhammad Jehanzeb Mirza, Sivan Doveh, Rogerio Feris, Raja Giryes, Sepp Hochreiter, Leonid Karlinsky

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Project page: https://wlin-at.github.io/cad_vi ; Huggingface dataset repo: https://huggingface.co/datasets/wlin21at/CaD-Inst

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09198 2024-06-14 cs.CV 57%

CLIP-Driven Cloth-Agnostic Feature Learning for Cloth-Changing Person Re-Identification

Shuang Li, Jiaxu Leng, Guozhang Li, Ji Gan, Haosheng chen, Xinbo Gao

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15734 2024-06-12 cs.CV 57%

LM4LV: A Frozen Large Language Model for Low-level Vision Tasks

Boyang Zheng, Jinjin Gu, Shijun Li, Chao Dong

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.21013 2024-06-05 cs.CV 57%

StrucTexTv3: An Efficient Vision-Language Model for Text-rich Image Perception, Comprehension, and Beyond

Pengyuan Lyu, Yulin Li, Hao Zhou, Weihong Ma, Xingyu Wan, Qunyi Xie, Liang Wu, Chengquan Zhang, Kun Yao, Errui Ding, Jingdong Wang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01987 2024-06-05 cs.CV 57%

Dealing with All-stage Missing Modality: Towards A Universal Model with Robust Reconstruction and Personalization

Yunpeng Zhao, Cheng Chen, Qing You Pang, Quanzheng Li, Carol Tang, Beng-Ti Ang, Yueming Jin

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10896 2024-06-04 cs.CV 57%

PaLM2-VAdapter: Progressively Aligned Language Model Makes a Strong Vision-language Adapter

Junfei Xiao, Zheng Xu, Alan Yuille, Shen Yan, Boyu Wang

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Technical report, 15 pages; v2 fix typos, add additional results in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00110 2024-06-03 cs.CV 57%

CLIP-QDA: An Explainable Concept Bottleneck Model

Rémi Kazmierczak, Eloïse Berthier, Goran Frehse, Gianni Franchi

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Journal ref Transactions on Machine Learning Research (05/2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20339 2024-05-31 cs.CV 57%

Visual Perception by Large Language Model's Weights

Feipeng Ma, Hongwei Xue, Guangting Wang, Yizhou Zhou, Fengyun Rao, Shilin Yan, Yueyi Zhang, Siying Wu, Mike Zheng Shou, Xiaoyan Sun

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19675 2024-05-31 cs.CV 57%

Knowledge-grounded Adaptation Strategy for Vision-language Models: Building Unique Case-set for Screening Mammograms for Residents Training

Aisha Urooj Khan, John Garrett, Tyler Bradshaw, Lonie Salkowski, Jiwoong Jason Jeong, Amara Tariq, Imon Banerjee

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16134 2024-05-31 cs.CV 57%

Breaking the False Sense of Security in Backdoor Defense through Re-Activation Attack

Mingli Zhu, Siyuan Liang, Baoyuan Wu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18812 2024-05-30 cs.CV 57%

MindSemantix: Deciphering Brain Visual Experiences with a Brain-Language Model

Ziqi Ren, Jie Li, Xuetong Xue, Xin Li, Fan Yang, Zhicheng Jiao, Xinbo Gao

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12678 2024-05-27 cs.CV 57%

Exploring Interactive Semantic Alignment for Efficient HOI Detection with Vision-language Model

Jihao Dong, Renjie Pan, Hua Yang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15155 2024-05-27 cs.CV 57%

CLIP model is an Efficient Online Lifelong Learner

Leyuan Wang, Liuyu Xiang, Yujie Wei, Yunlong Wang, Zhaofeng He

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09683 2024-05-24 cs.CV 57%

Scaling Open-Vocabulary Object Detection

Matthias Minderer, Alexey Gritsenko, Neil Houlsby

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02944 2024-05-24 cs.CV cs.LG 57%

Neural Image Compression with Text-guided Encoding for both Pixel-level and Perceptual Fidelity

Hagyeong Lee, Minkyu Kim, Jun-Hyuk Kim, Seungeon Kim, Dokwan Oh, Jaeho Lee

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11205 2024-05-21 cs.CV 57%

Fuse & Calibrate: A bi-directional Vision-Language Guided Framework for Referring Image Segmentation

Yichen Yan, Xingjian He, Sihan Chen, Shichen Lu, Jing Liu

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 12 pages, 4 figures ICIC2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08911 2024-05-16 cs.CV cs.LG 57%

CLIP with Quality Captions: A Strong Pretraining for Vision Tasks

Pavan Kumar Anasosalu Vasu, Hadi Pouransari, Fartash Faghri, Oncel Tuzel

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12732 2024-05-08 cs.CV 57%

CLIP-KD: An Empirical Study of CLIP Model Distillation

Chuanguang Yang, Zhulin An, Libo Huang, Junyu Bi, Xinqiang Yu, Han Yang, Boyu Diao, Yongjun Xu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments CVPR-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15726 2024-05-07 cs.CV 57%

CLIPose: Category-Level Object Pose Estimation with Pre-trained Vision-Language Knowledge

Xiao Lin, Minghao Zhu, Ronghao Dang, Guangliang Zhou, Shaolong Shu, Feng Lin, Chengju Liu, Qijun Chen

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments 14 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01691 2024-05-06 cs.CV cs.LG cs.RO 57%

Language-Enhanced Latent Representations for Out-of-Distribution Detection in Autonomous Driving

Zhenjiang Mao, Dong-You Jhong, Ao Wang, Ivan Ruchkin

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Presented at the Robot Trust for Symbiotic Societies (RTSS) Workshop, co-located with ICRA 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04504 2024-05-06 cs.LG cs.AI 57%

Compositional Learning of Visually-Grounded Concepts Using Reinforcement

Zijun Lin, Haidi Azaman, M Ganesh Kumar, Cheston Tan

专题命中 图文多模态 :image-text(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07027 2024-05-01 cs.CV cs.LG 57%

Utilizing Synthetic Data for Medical Vision-Language Pre-training: Bypassing the Need for Real Images

Che Liu, Anand Shah, Wenjia Bai, Rossella Arcucci

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by CVPR 2024 Workshop Data Curation and Augmentation in Enhancing Medical Imaging Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18106 2024-04-30 cs.CV 57%

Semi-supervised Text-based Person Search

Daming Gao, Yang Bai, Min Cao, Hao Dou, Mang Ye, Min Zhang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16637 2024-04-26 cs.CV 57%

Zero-Shot Distillation for Image Encoders: How to Make Effective Use of Synthetic Data

Niclas Popp, Jan Hendrik Metzen, Matthias Hein

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14696 2024-04-25 cs.CV 57%

Adaptive Prompt Learning with Negative Textual Semantics and Uncertainty Modeling for Universal Multi-Source Domain Adaptation

Yuxiang Yang, Lu Wen, Yuanyuan Xu, Jiliu Zhou, Yan Wang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments Accepted by ICME2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15182 2024-04-24 cs.LG cs.AI 57%

FLoRA: Enhancing Vision-Language Models with Parameter-Efficient Federated Learning

Duy Phuong Nguyen, J. Pablo Munoz, Ali Jannesari

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12139 2024-04-19 cs.CV 57%

Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models

Shouwei Ruan, Yinpeng Dong, Hanqing Liu, Yao Huang, Hang Su, Xingxing Wei

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏