arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5095 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5095 篇

2408.01437 2025-09-22 cs.CV cs.GR 74%

Img2CAD: Reverse Engineering 3D CAD Models from Images through VLM-Assisted Conditional Factorization

Yang You, Mikaela Angelina Uy, Jiaqi Han, Rahul Thomas, Haotong Zhang, Yi Du, Hansheng Chen, Francis Engelmann, Suya You, Leonidas Guibas

机构 * Stanford University(斯坦福大学) NVIDIA(英伟达) Peking University(北京大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 VLM训练与架构 :VLM(title);分类 cs.CV

Comments Accepted to SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00039 2025-09-03 cs.CV 74%

AMMKD: Adaptive Multimodal Multi-teacher Distillation for Lightweight Vision-Language Models

Yuqi Li, Chuanguang Yang, Junhao Dong, Zhengtao Yao, Haoyan Xu, Zeyu Dong, Hansheng Zeng, Zhulin An, Yingli Tian

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.12429 2025-08-14 cs.CV 74%

Debiased Fine-Tuning for Vision-language Models by Prompt Regularization

Beier Zhu, Yulei Niu, Saeil Lee, Minhoe Hur, Hanwang Zhang

机构 * NTU(国立新加坡大学)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

Comments AAAI2023 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17963 2025-08-08 cs.CV 74%

M$^{2}$Chat: Empowering VLM for Multimodal LLM Interleaved Text-Image Generation

Xiaowei Chi, Junbo Qi, Rongyu Zhang, Shanghang Zhang, Qifeng Liu, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Waseda University(早稻田大学) Peking University(北京大学)

专题命中 VLM训练与架构 :VLM(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04107 2025-07-23 cs.CV 74%

VICI: VLM-Instructed Cross-view Image-localisation

Xiaohan Zhang, Tavis Shore, Chen Chen, Oscar Mendez, Simon Hadfield, Safwan Wshah

机构 * University of Vermont(佛罗里达大学) University of Surrey(塞弗尔大学) University of Central Florida(佛罗里达中央大学) Locus Robotics(Locus机器人公司)

专题命中 VLM训练与架构 :VLM(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09816 2025-07-21 cs.CV 74%

Mind the Modality Gap: Towards a Remote Sensing Vision-Language Model via Cross-modal Alignment

Angelos Zavras, Dimitrios Michail, Begüm Demir, Ioannis Papoutsis

机构 * organization= Orion Lab, National Observatory of Athens \& National Technical University of Athens , country= Greece organization= Department of Informatics \& Telematics, Harokopio University of Athens , country= Greece organization= Faculty of Electrical Engineering organization= BIFOLD - Berlin Institute for the Foundations of Learning

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

Comments Accepted at the ISPRS Journal of Photogrammetry and Remote Sensing. Our code implementation and weights for all experiments are publicly available at https://github.com/Orion-AI-Lab/MindTheModalityGap

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21863 2025-06-30 cs.CV 74%

Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling

Sungjune Park, Yeongyun Kim, Se Yeon Kim, Yong Man Ro

机构 * Integrated Vision and Language Lab., School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(整合视觉与语言实验室,电气工程学院,韩国科学技术院(KAIST))

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

Comments 13 pages including reference pages, 7 tables, and 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06406 2025-06-26 cs.CL cs.AI 74%

SMAR: Soft Modality-Aware Routing Strategy for MoE-based Multimodal Large Language Models Preserving Language Capabilities

Guoyang Xia, Yifeng Ding, Fengfa Li, Lei Ren, Wei Chen, Fangxiang Feng, Xiaojie Wang

专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00839 2025-06-24 cs.RO cs.AI 74%

Context-Aware Human Behavior Prediction Using Multimodal Large Language Models: Challenges and Insights

Yuchen Liu, Lino Lerch, Luigi Palmieri, Andrey Rudenko, Sebastian Koch, Timo Ropinski, Marco Aiello

机构 * Corporate Sector Research and Advance Engineering, Robert Bosch GmbH(罗伯特博世集团企业部门研究与先进工程) Service Computing Department, Institute of Architecture of Application Systems, University of Stuttgart(斯图加特大学应用系统研究所服务计算部门) Visual Computing Group, Ulm University(乌尔姆大学视觉计算组)

专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.AI

Comments Accepted at IEEE International Conference on Robot and Human Interactive Communication (RO-MAN), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13964 2025-06-18 eess.IV cs.LG 74%

Comparison of ConvNeXt and Vision-Language Models for Breast Density Assessment in Screening Mammography

Yusdivia Molina-Román, David Gómez-Ortiz, Ernestina Menasalvas-Ruiz, José Gerardo Tamez-Peña, Alejandro Santos-Díaz

机构 * School of Engineering and Sciences(工程与科学学院) School of Medical and Health Sciences(医学与健康科学学院)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.LG

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15289 2025-06-18 cs.CV 74%

Learning Invariant Causal Mechanism from Vision-Language Models

Zeen Song, Siyu Zhao, Xingyu Zhang, Jiangmeng Li, Changwen Zheng, Wenwen Qiang

机构 * Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

Comments Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13443 2025-03-25 cs.CV cs.MM 74%

DPC: Dual-Prompt Collaboration for Tuning Vision-Language Models

Haoyang Li, Liang Wang, Chao Wang, Jing Jiang, Yan Peng, Guodong Long

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

Comments Accepted by the IEEE/CVF Conference on Computer Vision and Pattern Recognition 2025 (CVPR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03230 2025-02-06 cs.CV cs.MM 74%

Efficient Vision Language Model Fine-tuning for Text-based Person Anomaly Search

Jiayi He, Shengeng Tang, Ao Liu, Lechao Cheng, Jingjing Wu, Yanyan Wei

专题命中 VLM训练与架构 :vision language model(title);分类 cs.CV

Comments Accepted by 2025 WWW Workshop on MORE

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09916 2025-01-24 cs.CV cs.CL 74%

Attribution Analysis Meets Model Editing: Advancing Knowledge Correction in Vision Language Models with VisEdit

Qizhou Chen, Taolin Zhang, Chengyu Wang, Xiaofeng He, Dakan Wang, Tingting Liu

专题命中 VLM训练与架构 :vision language model(title);分类 cs.CV

Comments Accepted to AAAI-2025 as an oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15277 2024-12-23 cs.CL cs.AI 74%

PLPP: Prompt Learning with Perplexity Is Self-Distillation for Vision-Language Models

Biao Liu, Wenyi Fang, Xiaoyu Wu, Yang Zheng, Zheng Hu, Bo Yuan

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10188 2024-12-16 cs.CV cs.CL 74%

LongVILA: Scaling Long-Context Visual Language Models for Long Videos

Yukang Chen, Fuzhao Xue, Dacheng Li, Qinghao Hu, Ligeng Zhu, Xiuyu Li, Yunhao Fang, Haotian Tang, Shang Yang, Zhijian Liu, Ethan He, Hongxu Yin, Pavlo Molchanov, Jan Kautz, Linxi Fan, Yuke Zhu, Yao Lu, Song Han

专题命中 VLM训练与架构 :visual language model(title);分类 cs.CV

Comments Code and models are available at https://github.com/NVlabs/VILA/tree/main/longvila

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14485 2024-12-11 cs.CV 74%

Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding

Yan Shu, Zheng Liu, Peitian Zhang, Minghao Qin, Junjie Zhou, Zhengyang Liang, Tiejun Huang, Bo Zhao

专题命中 VLM训练与架构 :vision language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16018 2024-11-26 cs.CV 74%

Style-Pro: Style-Guided Prompt Learning for Generalizable Vision-Language Models

Niloufar Alipour Talemi, Hossein Kashiani, Fatemeh Afghah

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

Comments Accepted to IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04223 2024-10-08 cs.LG physics.chem-ph q-bio.BM 74%

Multimodal Large Language Models for Inverse Molecular Design with Retrosynthetic Planning

Gang Liu, Michael Sun, Wojciech Matusik, Meng Jiang, Jie Chen

专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.LG

Comments 27 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04693 2024-09-10 cs.AI 74%

MuAP: Multi-step Adaptive Prompt Learning for Vision-Language Model with Missing Modality

Ruiting Dai, Yuqiao Tan, Lisi Mo, Tao He, Ke Qin, Shuang Liang

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03103 2024-08-30 cs.LG 74%

Learning to Prompt Your Domain for Vision-Language Models

Guoyizhe Wei, Feng Wang, Anshul Shah, Rama Chellappa

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14812 2024-08-28 cs.CV 74%

HPT++: Hierarchically Prompting Vision-Language Models with Multi-Granularity Knowledge Generation and Improved Structure Modeling

Yubin Wang, Xinyang Jiang, De Cheng, Wenli Sun, Dongsheng Li, Cairong Zhao

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

Comments 19 pages, 7 figures, 7 tables. arXiv admin note: substantial text overlap with arXiv:2312.06323

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12867 2024-08-26 cs.CV 74%

Semantic Alignment for Multimodal Large Language Models

Tao Wu, Mengze Li, Jingyuan Chen, Wei Ji, Wang Lin, Jinyang Gao, Kun Kuang, Zhou Zhao, Fei Wu

专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.CV

Comments Accepted by MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02586 2024-08-14 cs.CV 74%

Enhancing Vision-Language Models Generalization via Diversity-Driven Novel Feature Synthesis

Siyuan Yan, Cheng Luo, Zhen Yu, Zongyuan Ge

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08487 2024-06-17 cs.CV 74%

Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models

Yi-Fan Zhang, Qingsong Wen, Chaoyou Fu, Xue Wang, Zhang Zhang, Liang Wang, Rong Jin

专题命中 VLM训练与架构 :LLaVA(title);分类 cs.CV

Comments Project page: https://github.com/yfzhang114/SliME

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19009 2024-06-17 cs.CV 74%

Enhancing Vision-Language Model with Unmasked Token Alignment

Jihao Liu, Jinliang Zheng, Boxiao Liu, Yu Liu, Hongsheng Li

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

Comments Accepted by TMLR; Code and models are available at https://github.com/jihaonew/UTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07520 2024-04-15 cs.CV cs.CL 74%

PromptSync: Bridging Domain Gaps in Vision-Language Models through Class-Aware Prototype Alignment and Discrimination

Anant Khandelwal

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

Comments Accepted at CVPR 2024 LIMIT, 12 pages, 8 Tables, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11570 2024-03-13 cs.CV 74%

Understanding the Multi-modal Prompts of the Pre-trained Vision-Language Model

Shuailei Ma, Chen-Wei Xie, Ying Wei, Siyang Sun, Jiaqi Fan, Xiaoyi Bao, Yuxin Guo, Yun Zheng

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

Comments We find that the statistical information in Figure 2 neglect the statistics for tSOS, so we make corrections. Additionally, we change the statistical samples to those where CLIP misidentify, but prompt tuning identify correctly. At the same time, we also revise some of the descriptions. The changes to the supplementary materials will be updated shortly. arXiv admin note: text overlap with arXiv:2307.06948 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03774 2024-01-12 cs.CV 74%

Meta-Adapter: An Online Few-shot Learner for Vision-Language Model

Cheng Cheng, Lin Song, Ruoyi Xue, Hang Wang, Hongbin Sun, Yixiao Ge, Ying Shan

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

Comments Accepted by NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07408 2023-12-13 cs.CV 74%

Turbo: Informativity-Driven Acceleration Plug-In for Vision-Language Models

Chen Ju, Haicheng Wang, Zeqian Li, Xu Chen, Zhonghua Zhai, Weilin Huang, Shuai Xiao

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏