arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5084 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5084 篇

2407.19409 2024-07-30 cs.CL cs.CV 79%

LLAVADI: What Matters For Multimodal Large Language Models Distillation

Shilin Xu, Xiangtai Li, Haobo Yuan, Lu Qi, Yunhai Tong, Ming-Hsuan Yang

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18129 2024-07-29 cs.CL cs.AI 79%

Dallah: A Dialect-Aware Multimodal Large Language Model for Arabic

Fakhraddin Alwajih, Gagan Bhatia, Muhammad Abdul-Mageed

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15913 2024-07-24 cs.CV 79%

Test-Time Low Rank Adaptation via Confidence Maximization for Zero-Shot Generalization of Vision-Language Models

Raza Imam, Hanan Gani, Muhammad Huzaifa, Karthik Nandakumar

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Main paper: 11 pages, Supplementary material: 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14177 2024-07-22 cs.CV 79%

EVLM: An Efficient Vision-Language Model for Visual Understanding

Kaibing Chen, Dong Shen, Hanwen Zhong, Huasong Zhong, Kui Xia, Di Xu, Wei Yuan, Yifei Hu, Bin Wen, Tianke Zhang, Changyi Liu, Dewen Fan, Huihui Xiao, Jiahong Wu, Fan Yang, Size Li, Di Zhang

专题命中 VLM训练与架构 :vision-language model(title);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12580 2024-07-18 cs.CL cs.CV cs.IR 79%

E5-V: Universal Embeddings with Multimodal Large Language Models

Ting Jiang, Minghui Song, Zihan Zhang, Haizhen Huang, Weiwei Deng, Feng Sun, Qi Zhang, Deqing Wang, Fuzhen Zhuang

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

Comments Code and models are available at https://github.com/kongds/E5-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09037 2024-07-18 cs.CV cs.CL 79%

The First to Know: How Token Distributions Reveal Hidden Knowledge in Large Vision-Language Models?

Qinyu Zhao, Ming Xu, Kartik Gupta, Akshay Asthana, Liang Zheng, Stephen Gould

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments ECCV 2024. Project page: https://github.com/Qinyu-Allen-Zhao/LVLM-LP

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11422 2024-07-17 cs.CV 79%

Reflective Instruction Tuning: Mitigating Hallucinations in Large Vision-Language Models

Jinrui Zhang, Teng Wang, Haigang Zhang, Ping Lu, Feng Zheng

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments To appear at ECCV2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02350 2024-07-16 cs.CV 79%

Conceptual Codebook Learning for Vision-Language Models

Yi Zhang, Ke Yu, Siqi Wu, Zhihai He

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11400 2024-07-16 cs.CV cs.CL 79%

MuDPT: Multi-modal Deep-symphysis Prompt Tuning for Large Pre-trained Vision-Language Models

Yongzhu Miao, Shasha Li, Jintao Tang, Ting Wang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments The paper has been accepted by ICME 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04489 2024-07-08 cs.CV 79%

Dude: Dual Distribution-Aware Context Prompt Learning For Large Vision-Language Model

Duy M. H. Nguyen, An T. Le, Trung Q. Nguyen, Nghiem T. Diep, Tai Nguyen, Duy Duong-Tran, Jan Peters, Li Shen, Mathias Niepert, Daniel Sonntag

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Version 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02586 2024-07-04 cs.CV 79%

Improving Visual Storytelling with Multimodal Large Language Models

Xiaochuan Lin, Xiangyong Chen

专题命中 VLM训练与架构 :multimodal large language model(title);vision-language model(abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01886 2024-06-27 cs.CV 79%

InstructTA: Instruction-Tuned Targeted Attack for Large Vision-Language Models

Xunguang Wang, Zhenlan Ji, Pingchuan Ma, Zongjie Li, Shuai Wang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14496 2024-06-21 cs.CV cs.CL 79%

African or European Swallow? Benchmarking Large Vision-Language Models for Fine-Grained Object Classification

Gregor Geigle, Radu Timofte, Goran Glavaš

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07921 2024-06-21 cs.CV 79%

Can Better Text Semantics in Prompt Tuning Improve VLM Generalization?

Hari Chandana Kuchibhotla, Sai Srinivas Kancheti, Abbavaram Gowtham Reddy, Vineeth N Balasubramanian

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11309 2024-06-19 cs.CV 79%

BaFTA: Backprop-Free Test-Time Adaptation For Zero-Shot Vision-Language Models

Xuefeng Hu, Ke Zhang, Min Sun, Albert Chen, Cheng-Hao Kuo, Ram Nevatia

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Preprint updated from our earlier manuscript submitted to ICLR 2024 (https://openreview.net/forum?id=KNtcoAM5Gy)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11684 2024-06-18 cs.CL cs.AI 79%

ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models

Guiming Hardy Chen, Shunian Chen, Ruifei Zhang, Junying Chen, Xiangbo Wu, Zhiyi Zhang, Zhihong Chen, Jianquan Li, Xiang Wan, Benyou Wang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.AI

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14492 2024-06-17 cs.CL cs.AI 79%

Towards Robust Instruction Tuning on Multimodal Large Language Models

Wei Han, Hui Chen, Soujanya Poria

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.AI

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05432 2024-06-11 cs.CV 79%

Regularized Training with Generated Datasets for Name-Only Transfer of Vision-Language Models

Minho Park, Sunghyun Park, Jooyeol Yun, Jaegul Choo

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01837 2024-06-05 cs.CV 79%

Boosting Vision-Language Models with Transduction

Maxime Zanella, Benoît Gérin, Ismail Ben Ayed

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11549 2024-06-04 cs.CV 79%

Boosting Continual Learning of Vision-Language Models via Mixture-of-Experts Adapters

Jiazuo Yu, Yunzhi Zhuge, Lu Zhang, Ping Hu, Dong Wang, Huchuan Lu, You He

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments This work is accepted by CVPR2024. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18541 2024-06-04 cs.CV 79%

Low-Rank Few-Shot Adaptation of Vision-Language Models

Maxime Zanella, Ismail Ben Ayed

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20985 2024-06-03 cs.CV 79%

DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models

Linli Yao, Lei Li, Shuhuai Ren, Lean Wang, Yuanxin Liu, Xu Sun, Lu Hou

专题命中 VLM训练与架构 :multimodal large language model(title);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19675 2024-05-31 cs.CV 79%

Knowledge-grounded Adaptation Strategy for Vision-language Models: Building Unique Case-set for Screening Mammograms for Residents Training

Aisha Urooj Khan, John Garrett, Tyler Bradshaw, Lonie Salkowski, Jiwoong Jason Jeong, Amara Tariq, Imon Banerjee

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15728 2024-05-27 cs.CV 79%

Disease-informed Adaptation of Vision-Language Models

Jiajin Zhang, Ge Wang, Mannudeep K. Kalra, Pingkun Yan

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Early Accepted by MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03190 2024-05-07 cs.CV 79%

Adapting Dual-encoder Vision-language Models for Paraphrased Retrieval

Jiacheng Cheng, Hijung Valentina Shin, Nuno Vasconcelos, Bryan Russell, Fabian Caba Heilbron

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15100 2024-04-24 cs.CV cs.MM 79%

Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation

Xun Wu, Shaohan Huang, Furu Wei

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02145 2024-04-18 cs.CV 79%

Iterated Learning Improves Compositionality in Large Vision-Language Models

Chenhao Zheng, Jieyu Zhang, Aniruddha Kembhavi, Ranjay Krishna

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06129 2024-04-17 cs.CV 79%

Distilling Vision-Language Models on Millions of Videos

Yue Zhao, Long Zhao, Xingyi Zhou, Jialin Wu, Chun-Te Chu, Hui Miao, Florian Schroff, Hartwig Adam, Ting Liu, Boqing Gong, Philipp Krähenbühl, Liangzhe Yuan

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments CVPR 2024. Project page: https://zhaoyue-zephyrus.github.io/video-instruction-tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01964 2024-04-16 cs.CV cs.GR 79%

Semantics-aware Motion Retargeting with Vision-Language Models

Haodong Zhang, ZhiKe Chen, Haocheng Xu, Lei Hao, Xiaofei Wu, Songcen Xu, Zhensong Zhang, Yue Wang, Rong Xiong

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted in CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06244 2024-04-10 cs.CV 79%

Anchor-based Robust Finetuning of Vision-Language Models

Jinwei Han, Zhiwen Lin, Zhongyisun Sun, Yingguo Gao, Ke Yan, Shouhong Ding, Yuan Gao, Gui-Song Xia

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏