arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5067 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5067 篇

2505.24208 2025-06-02 cs.AI 83%

Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap

Wenhan Yang, Spencer Stice, Ali Payani, Baharan Mirzasoleiman

机构 * Computer Science Department UCLA(计算机科学系,加州大学洛杉矶分校) Cisco Systems Inc.(思科系统公司)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);LLaVA(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21465 2025-05-28 cs.CV cs.CL 83%

ID-Align: RoPE-Conscious Position Remapping for Dynamic High-Resolution Adaptation in Vision-Language Models

Bozhou Li, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12057 2025-05-20 cs.AI 83%

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction

Jing Zou, Qingqiu Li, Chenyu Lian, Lihao Liu, Xiaohan Yan, Shujun Wang, Jing Qin

机构 * Center for Smart Health, The Hong Kong Polytechnic University(智能健康中心,香港理工大学) School of Computer Science, Fudan University(复旦大学计算机科学学院) Amazon(亚马逊) Tongji University(同济大学) Department of Biomedical Engineering, The Hong Kong Polytechnic University(生物医学工程系,香港理工大学) Research Institute for Smart Ageing, The Hong Kong Polytechnic University(智能老龄化研究 institute,香港理工大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);InternVL(abstract);分类 cs.AI

Comments 12 pages, 5figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09897 2025-05-20 cs.CV 83%

TAMP: Token-Adaptive Layerwise Pruning in Multimodal Large Language Models

Jaewoo Lee, Keyang Xuan, Chanakya Ekbote, Sandeep Polisetty, Yi R. Fung, Paul Pu Liang

机构 * University of North Carolina Chapel Hill(北卡罗来纳大学教堂山分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Massachusetts Institute of Technology(麻省理工学院) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV

Comments ACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18711 2025-05-19 cs.CV cs.CL 83%

Evaluating Vision-Language Models as Evaluators in Path Planning

Mohamed Aghzal, Xiang Yue, Erion Plaku, Ziyu Yao

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Accepted to the 2025 IEEE / CVF Computer Vision and Pattern Recognition Conference (CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10088 2025-05-16 cs.CV 83%

MMRL++: Parameter-Efficient and Interaction-Aware Representation Learning for Vision-Language Models

Yuncheng Guo, Xiaodong Gu

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Due to the limitation "The abstract field cannot be longer than 1,920 characters", the abstract appearing here is slightly shorter than that in the PDF file

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09139 2025-05-15 cs.CV 83%

Beyond General Prompts: Automated Prompt Refinement using Contrastive Class Alignment Scores for Disambiguating Objects in Vision-Language Models

Lucas Choi, Ross Greer

机构 * University of California, Merced(加州大学默塞德分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07690 2025-05-13 cs.CV 83%

Beyond CLIP Generalization: Against Forward&Backward Forgetting Adapter for Continual Learning of Vision-Language Models

Songlin Dong, Chenhao Ding, Jiangyang Li, Jizhou Han, Qiang Wang, Yuhang He, Yihong Gong

机构 * College of Artificial Intelligence, Xi’an Jiaotong University(人工智能学院,西安交通大学) School of Software Engineering, Xi’an Jiaotong University(软件工程学院,西安交通大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03350 2025-05-07 cs.CV 83%

A Vision-Language Model for Focal Liver Lesion Classification

Song Jian, Hu Yuchang, Wang Hui, Chen Yen-Wei

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments 9 pages,4 figures, 4 tables,Innovation in Medicine and Healthcare Proceedings of 13th KES-InMed 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01828 2025-05-05 cs.RO cs.LG 83%

From Foresight to Forethought: VLM-In-the-Loop Policy Steering via Latent Alignment

Yilin Wu, Ran Tian, Gokul Swamy, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学) UC Berkeley(伯克利大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00134 2025-05-02 cs.CV 83%

Investigating Zero-Shot Diagnostic Pathology in Vision-Language Models with Efficient Prompt Design

Vasudev Sharma, Ahmed Alagha, Abdelhakim Khellaf, Vincent Quoc-Huy Trinh, Mahdi S. Hosseini

机构 * Department of Computer Science and Software Engineering (CSSE) Concordia University(计算机科学与软件工程系(CSSE)康科迪亚大学) University of Montreal Hospital Center(蒙特利尔大学医院中心) Mila–Quebec AI Institute(魁北克人工智能研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10742 2025-04-25 cs.LG cs.CL 83%

Keyframe-oriented Vision Token Pruning: Enhancing Efficiency of Large Vision Language Models on Long-Form Video Processing

Yudong Liu, Jingwei Sun, Yueqian Lin, Jingyang Zhang, Ming Yin, Qinsi Wang, Jianyi Zhang, Hai Li, Yiran Chen

机构 * Duke University(杜克大学) Duke Kunshan University(杜克昆山大学)

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05457 2025-04-09 cs.CV 83%

Taxonomy-Aware Evaluation of Vision-Language Models

Vésteinn Snæbjarnarson, Kevin Du, Niklas Stoehr, Serge Belongie, Ryan Cotterell, Nico Lang, Stella Frank

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17131 2025-04-08 cs.CV 83%

Scenario Understanding of Traffic Scenes Through Large Visual Language Models

Esteban Rivera, Jannik Lübberstedt, Nico Uhlemann, Markus Lienkamp

专题命中 VLM训练与架构 :visual language model(title,abstract);LLaVA(abstract);分类 cs.CV

Comments Accepted at WACV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01934 2025-04-04 cs.CV 83%

ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion Refinement

Runhui Huang, Chunwei Wang, Junwei Yang, Guansong Lu, Yunlong Yuan, Jianhua Han, Lu Hou, Wei Zhang, Lanqing Hong, Hengshuang Zhao, Hang Xu

专题命中 VLM训练与架构 :MLLM(title,abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20502 2025-04-01 cs.CV 83%

MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning

Yiwei Ma, Guohai Xu, Xiaoshuai Sun, Jiayi Ji, Jie Lou, Debing Zhang, Rongrong Ji

专题命中 VLM训练与架构 :MLLM(title,abstract);LLaVA(abstract);分类 cs.CV

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19839 2025-04-01 cs.CV 83%

FireEdit: Fine-grained Instruction-based Image Editing via Region-aware Vision Language Model

Jun Zhou, Jiahao Li, Zunnan Xu, Hanhui Li, Yiji Cheng, Fa-Ting Hong, Qin Lin, Qinglin Lu, Xiaodan Liang

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17238 2025-03-24 cs.CV 83%

Slide-Level Prompt Learning with Vision Language Models for Few-Shot Multiple Instance Learning in Histopathology

Devavrat Tomar, Guillaume Vray, Dwarikanath Mahapatra, Sudipta Roy, Jean-Philippe Thiran, Behzad Bozorgtabar

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted to ISBI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11905 2025-03-24 cs.RO cs.AI cs.IR 83%

AlignBot: Aligning VLM-powered Customized Task Planning with User Reminders Through Fine-Tuning for Household Robots

Zhaxizhuoma Zhaxizhuoma, Pengan Chen, Ziniu Wu, Jiawei Sun, Dong Wang, Peng Zhou, Nieqing Cao, Yan Ding, Bin Zhao, Xuelong Li

专题命中 VLM训练与架构 :VLM(title,abstract);LLaVA(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14478 2025-03-20 cs.CV 83%

Creation-MMBench: Assessing Context-Aware Creative Intelligence in MLLM

Xinyu Fang, Zhijian Chen, Kai Lan, Lixin Ma, Shengyuan Ding, Yingji Liang, Xiangyu Zhao, Farong Wen, Zicheng Zhang, Guofeng Zhang, Haodong Duan, Kai Chen, Dahua Lin

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

Comments Evaluation Code and dataset see https://github.com/open-compass/Creation-MMBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13642 2025-03-20 cs.CV 83%

SpatialBot: Precise Spatial Understanding with Vision Language Models

Wenxiao Cai, Iaroslav Ponomarenko, Jianhao Yuan, Xiaoqi Li, Wankou Yang, Hao Dong, Bo Zhao

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13171 2025-03-18 cs.RO cs.AI 83%

HybridGen: VLM-Guided Hybrid Planning for Scalable Data Generation of Imitation Learning

Wensheng Wang, Ning Tan

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12731 2025-03-18 cs.CV 83%

Navigating Heat Exposure: Simulation of Route Planning Based on Visual Language Model Agents

Haoran Ma, Kaihan Zhang, Jiannan Cai

专题命中 VLM训练与架构 :visual language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11549 2025-03-17 cs.CV 83%

Similarity-Aware Token Pruning: Your VLM but Faster

Ahmadreza Jeddi, Negin Baghbanzadeh, Elham Dolatabadi, Babak Taati

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV

Comments 15 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11368 2025-03-17 cs.CV 83%

PBR3DGen: A VLM-guided Mesh Generation with High-quality PBR Texture

Xiaokang Wei, Bowen Zhang, Xianghui Yang, Yuxuan Wang, Chunchao Guo, Xi Zhao, Yan Luximon

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

Comments Homepage: https://pbr3dgen1218.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10501 2025-03-14 cs.CV 83%

TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models

Xudong Tan, Peng Ye, Chongjun Tu, Jianjian Cao, Yaoxin Yang, Lin Zhang, Dongzhan Zhou, Tao Chen

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01428 2025-03-12 cs.CV 83%

GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models

Zhangyang Qi, Zhixiong Zhang, Ye Fang, Jiaqi Wang, Hengshuang Zhao

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Project page: https://gpt4scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07075 2025-03-11 cs.CV 83%

XR-VLM: Cross-Relationship Modeling with Multi-part Prompts and Visual Features for Fine-Grained Recognition

Chuanming Wang, Henming Mao, Huanhuan Zhang, Huiyuan Fu, Huadong Ma

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12915 2025-03-05 cs.CV 83%

VILA-M3: Enhancing Vision-Language Models with Medical Expert Knowledge

Vishwesh Nath, Wenqi Li, Dong Yang, Andriy Myronenko, Mingxin Zheng, Yao Lu, Zhijian Liu, Hongxu Yin, Yucheng Tang, Pengfei Guo, Can Zhao, Ziyue Xu, Yufan He, Greg Heinrich, Yee Man Law, Benjamin Simon, Stephanie Harmon, Stephen Aylward, Marc Edgar, Michael Zephyr, Song Han, Pavlo Molchanov, Baris Turkbey, Holger Roth, Daguang Xu

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11087 2025-03-05 cs.CV 83%

Locality Alignment Improves Vision-Language Models

Ian Covert, Tony Sun, James Zou, Tatsunori Hashimoto

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

Comments ICLR 2025 Camera-Ready

详情

展开后加载摘要…

URL PDF HTML 收藏