arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5084 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5084 篇

2403.16558 2024-04-01 cs.CV 79%

Elysium: Exploring Object-level Perception in Videos via MLLM

Han Wang, Yanjie Wang, Yongjie Ye, Yuxiang Nie, Can Huang

专题命中 VLM训练与架构 :MLLM(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18293 2024-03-28 cs.CV 79%

Efficient Test-Time Adaptation of Vision-Language Models

Adilbek Karmanov, Dayan Guan, Shijian Lu, Abdulmotaleb El Saddik, Eric Xing

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to CVPR 2024. The code has been released in \url{https://kdiaaa.github.io/tda/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13263 2024-03-21 cs.CV 79%

SC-Tune: Unleashing Self-Consistent Referential Comprehension in Large Vision Language Models

Tongtian Yue, Jie Cheng, Longteng Guo, Xingyuan Dai, Zijia Zhao, Xingjian He, Gang Xiong, Yisheng Lv, Jing Liu

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.CV

Comments Accepted by CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05657 2024-03-19 cs.CV 79%

Tag2Text: Guiding Vision-Language Model via Image Tagging

Xinyu Huang, Youcai Zhang, Jinyu Ma, Weiwei Tian, Rui Feng, Yuejie Zhang, Yaqian Li, Yandong Guo, Lei Zhang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10850 2024-03-19 cs.RO cs.AI 79%

GAgent: An Adaptive Rigid-Soft Gripping Agent with Vision Language Models for Complex Lighting Environments

Zhuowei Li, Miao Zhang, Xiaotian Lin, Meng Yin, Shuai Lu, Xueqian Wang

专题命中 VLM训练与架构 :vision language model(title);VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00414 2024-03-13 cs.CV cs.MM 79%

Vision-Language Models Learn Super Images for Efficient Partially Relevant Video Retrieval

Taichi Nishimura, Shota Nakada, Masayoshi Kondo

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.CV

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18476 2024-02-29 cs.CV 79%

IBD: Alleviating Hallucinations in Large Vision-Language Models via Image-Biased Decoding

Lanyun Zhu, Deyi Ji, Tianrun Chen, Peng Xu, Jieping Ye, Jun Liu

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01018 2024-02-29 cs.CV 79%

Controlling Vision-Language Models for Multi-Task Image Restoration

Ziwei Luo, Fredrik K. Gustafsson, Zheng Zhao, Jens Sjölund, Thomas B. Schön

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by ICLR 2024. Project page: https://algolzw.github.io/daclip-uir/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02330 2024-02-23 cs.CV cs.CL 79%

LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model

Yichen Zhu, Minjie Zhu, Ning Liu, Zhicai Ou, Xiaofeng Mou, Jian Tang

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV

Comments The datasets were incomplete as they did not include all the necessary copyrights

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13851 2024-02-22 cs.CV 79%

VL-Trojan: Multimodal Instruction Backdoor Attacks against Autoregressive Visual Language Models

Jiawei Liang, Siyuan Liang, Man Luo, Aishan Liu, Dongchen Han, Ee-Chien Chang, Xiaochun Cao

专题命中 VLM训练与架构 :visual language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14238 2024-01-18 cs.CV 79%

InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks

Zhe Chen, Jiannan Wu, Wenhai Wang, Weijie Su, Guo Chen, Sen Xing, Muyan Zhong, Qinglong Zhang, Xizhou Zhu, Lewei Lu, Bin Li, Ping Luo, Tong Lu, Yu Qiao, Jifeng Dai

专题命中 VLM训练与架构 :InternVL(title,abstract);分类 cs.CV

Comments 25 pages, 5 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07457 2024-01-17 cs.CV 79%

Concept-Guided Prompt Learning for Generalization in Vision-Language Models

Yi Zhang, Ce Zhang, Ke Yu, Yushun Tang, Zhihai He

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06331 2024-01-15 cs.CV 79%

Application Of Vision-Language Models For Assessing Osteoarthritis Disease Severity

Banafshe Felfeliyan, Yuyue Zhou, Shrimanti Ghosh, Jessica Kupper, Shaobo Liu, Abhilash Hareendranathan, Jacob L. Jaremko

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16279 2023-12-29 cs.CV 79%

Cloud-Device Collaborative Learning for Multimodal Large Language Models

Guanqun Wang, Jiaming Liu, Chenxuan Li, Junpeng Ma, Yuan Zhang, Xinyu Wei, Kevin Zhang, Maurice Chong, Ray Zhang, Yijiang Liu, Shanghang Zhang

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15901 2023-12-27 cs.CV 79%

Black-Box Tuning of Vision-Language Models with Effective Gradient Approximation

Zixian Guo, Yuxiang Wei, Ming Liu, Zhilong Ji, Jinfeng Bai, Yiwen Guo, Wangmeng Zuo

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12458 2023-12-21 cs.CL cs.AI 79%

When Parameter-efficient Tuning Meets General-purpose Vision-language Models

Yihang Zhai, Haixin Wang, Jianlong Chang, Xinlong Yang, Jinan Sun, Shikun Zhang, Qi Tian

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11865 2023-11-21 cs.CV 79%

VLM-Eval: A General Evaluation on Video Large Language Models

Shuailin Li, Yuang Zhang, Yucheng Zhao, Qiuyue Wang, Fan Jia, Yingfei Liu, Tiancai Wang

专题命中 VLM训练与架构 :VLM(title);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08844 2023-11-16 cs.CV cs.CL 79%

Violet: A Vision-Language Model for Arabic Image Captioning with Gemini Decoder

Abdelrahman Mohamed, Fakhraddin Alwajih, El Moatez Billah Nagoudi, Alcides Alcoba Inciarte, Muhammad Abdul-Mageed

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted in ArabicNLP Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06311 2023-10-11 cs.CV cs.MM 79%

Improving Compositional Text-to-image Generation with Large Vision-Language Models

Song Wen, Guian Fang, Renrui Zhang, Peng Gao, Hao Dong, Dimitris Metaxas

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04158 2023-09-11 cs.CV 79%

Context-Aware Prompt Tuning for Vision-Language Model with Dual-Alignment

Hongyu Hu, Tiancheng Lin, Jie Wang, Zhenbang Sun, Yi Xu

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.03406 2023-09-08 cs.CV 79%

Distribution-Aware Prompt Tuning for Vision-Language Models

Eulrang Cho, Jooyeon Kim, Hyunwoo J. Kim

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to ICCV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11507 2023-08-28 cs.CV cs.CL 79%

Unsupervised Prototype Adapter for Vision-Language Models

Yi Zhang, Ce Zhang, Xueting Hu, Zhihai He

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by PRCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11186 2023-08-23 cs.CV 79%

Knowledge-Aware Prompt Tuning for Generalizable Vision-Language Models

Baoshuo Kan, Teng Wang, Wenpeng Lu, Xiantong Zhen, Weili Guan, Feng Zheng

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.16198 2023-08-16 cs.CV cs.CL cs.MM 79%

SuS-X: Training-Free Name-Only Transfer of Vision-Language Models

Vishaal Udandarao, Ankush Gupta, Samuel Albanie

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted at ICCV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06009 2023-08-14 cs.CV cs.MM 79%

ViGT: Proposal-free Video Grounding with Learnable Token in Transformer

Kun Li, Dan Guo, Meng Wang

专题命中 VLM训练与架构 :grounding(title,abstract);分类 cs.CV

Comments This paper has been accepted by SCIENCE CHINA Information Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15049 2023-08-08 cs.CV 79%

Regularized Mask Tuning: Uncovering Hidden Knowledge in Pre-trained Vision-Language Models

Kecheng Zheng, Wei Wu, Ruili Feng, Kai Zhu, Jiawei Liu, Deli Zhao, Zheng-Jun Zha, Wei Chen, Yujun Shen

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted at ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.12402 2023-08-01 cs.CV cs.CL 79%

X$^2$-VLM: All-In-One Pre-trained Model For Vision-Language Tasks

Yan Zeng, Xinsong Zhang, Hang Li, Jiawei Wang, Jipeng Zhang, Wangchunshu Zhou

专题命中 VLM训练与架构 :VLM(title,abstract);分类 cs.CV

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15460 2023-07-31 cs.CV cs.CL 79%

Cross-Modal Concept Learning and Inference for Vision-Language Models

Yi Zhang, Ce Zhang, Yushun Tang, Zhihai He

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15266 2023-07-31 cs.CV 79%

RSGPT: A Remote Sensing Vision Language Model and Benchmark

Yuan Hu, Jianlong Yuan, Congcong Wen, Xiaonan Lu, Xiang Li

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05313 2023-05-09 cs.CV cs.CL 79%

Refined Vision-Language Modeling for Fine-grained Multi-modal Pre-training

Lisai Zhang, Qingcai Chen, Zhijian Chen, Yunpeng Han, Zhonghua Li, Zhao Cao

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Work in progress, v0.2

详情

展开后加载摘要…

URL PDF HTML 收藏