arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5084 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5084 篇

2412.06458 2025-08-01 cs.CV 79%

Pruning All-Rounder: Rethinking and Improving Inference Efficiency for Large Vision Language Models

Wei Suo, Ji Ma, Mengyang Sun, Lin Yuanbo Wu, Peng Wang, Yanning Zhang

机构 * Northwestern Polytechnical University(西北工业大学) Swansea University(斯旺西大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV

Comments Accepted by ICCV 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20842 2025-07-29 cs.CV 79%

METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models

Yuchen Liu, Yaoming Wang, Bowen Shi, Xiaopeng Zhang, Wenrui Dai, Chenglin Li, Hongkai Xiong, Qi Tian

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08607 2025-07-14 cs.CV 79%

BayesTTA: Continual-Temporal Test-Time Adaptation for Vision-Language Models via Gaussian Discriminant Analysis

Shuang Cui, Jinglin Xu, Yi Li, Xiongxin Tang, Jiangmeng Li, Jiahuan Zhou, Fanjiang Xu, Fuchun Sun, Hui Xiong

机构 * National Key Laboratory of Space Integrated Information System(国家空间信息集成系统重点实验室) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Wangxuan Institute of Computer Technology(计算机技术王轩研究所) Peking University(北京大学) Department of Computer Science and Technology(计算机科学与技术系) Tsinghua University(清华大学) Thrust of Artificial Intelligence, the Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能方向) Department of Computer Science & Engineering, the Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08410 2025-07-14 cs.CV 79%

Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models

Shijun Yang, Xiang Zhang, Wanqing Zhao, Hangzai Luo, Sheng Zhong, Jinye Peng, Jianping Fan

机构 * School of Information and Technology, Northwest University(信息与技术学院,西北大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05677 2025-07-10 cs.CV 79%

Integrated Structural Prompt Learning for Vision-Language Models

Jiahui Wang, Qin Xu, Bo Jiang, Bin Luo

机构 * School of Computer Science and Technology(计算机科学与技术学院) Anhui University(安徽大学) The Key Laboratory of Intelligent Computing(智能计算重点实验室) Intelligent Sensing Laboratory of Anhui Province(安徽省智能感知实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05668 2025-07-09 cs.CV 79%

Dynamic Rank Adaptation for Vision-Language Models

Jiahui Wang, Qin Xu, Bo Jiang, Bin Luo

机构 * Anhui University(安徽大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03283 2025-07-08 cs.CV 79%

MolVision: Molecular Property Prediction with Vision Language Models

Deepan Adak, Yogesh Singh Rawat, Shruti Vyas

机构 * NIT Kurukshetra(尼特学院) University of Central Florida(中央佛罗里达大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02279 2025-07-04 cs.CV 79%

LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models

Juntao Liu, Liqiang Niu, Wenchao Chen, Jie Zhou, Fandong Meng

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc(模式识别中心、微信AI、腾讯公司)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01673 2025-07-03 cs.CV 79%

Facial Emotion Learning with Text-Guided Multiview Fusion via Vision-Language Model for 3D/4D Facial Expression Recognition

Muzammil Behzad

机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油矿物大学) SDAIA-KFUPM Joint Research Center on Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23822 2025-07-01 cs.CV 79%

Interpretable Zero-Shot Learning with Locally-Aligned Vision-Language Model

Shiming Chen, Bowen Duan, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of AI(莫扎伊德大学人工智能学院) Huazhong University of Science and Technology(华中科技大学) Australian National University(澳大利亚国立大学) Linköping University(林雪平大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to ICCV'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16297 2025-07-01 cs.CV 79%

FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers

Renshan Zhang, Rui Shao, Gongwei Chen, Miao Zhang, Kaiwen Zhou, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

Comments Accepted to the IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00473 2025-06-19 cs.CV 79%

Jailbreak Large Vision-Language Models Through Multi-Modal Linkage

Yu Wang, Xiaofei Zhou, Yichen Wang, Geyuan Zhang, Tianxing He

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Shanghai Qi Zhi Institute(上海启智研究所) University of Chicago(芝加哥大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13166 2025-06-17 cs.CV 79%

GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models

Ruiguang Pei, Weiqing Sun, Zhihui Fu, Jun Wang

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12232 2025-06-17 cs.CV cs.CL 79%

Zero-Shot Scene Understanding with Multimodal Large Language Models for Automated Vehicles

Mohammed Elhenawy, Shadi Jaradat, Taqwa I. Alhadidi, Huthaifa I. Ashqar, Ahmed Jaber, Andry Rakotonirainy, Mohammad Abu Tami

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08666 2025-06-16 cs.CV 79%

LLaVA-c: Continual Improved Visual Instruction Tuning

Wenzhuo Liu, Fei Zhu, Haiyang Guo, Longhui Wei, Cheng-Lin Liu

机构 * School of Artificial Intelligence, UCAS(人工智能学院,UCAS) State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,CASIA) Centre for Artificial Intelligence and Robotics, HKISI-CAS(人工智能与机器人中心,HKISI-CAS) Huawei Inc(华为公司)

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07214 2025-06-10 cs.CV cs.CR 79%

Backdoor Attack on Vision Language Models with Stealthy Semantic Manipulation

Zhiyuan Zhong, Zhen Sun, Yepang Liu, Xinlei He, Guanhong Tao

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07077 2025-06-10 cs.CR cs.AI 79%

Dual-Priv Pruning : Efficient Differential Private Fine-Tuning in Multimodal Large Language Models

Qianshan Wei, Jiaqi Li, Zihan You, Yi Zhan, Kecen Li, Jialin Wu, Xinfeng Li Hengjun Liu, Yi Yu, Bin Cao, Yiwen Xu, Yang Liu, Guilin Qi

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04964 2025-06-10 cs.CV 79%

CAG-VLM: Fine-Tuning of a Large-Scale Model to Recognize Angiographic Images for Next-Generation Diagnostic Systems

Yuto Nakamura, Satoshi Kodera, Haruki Settai, Hiroki Shinohara, Masatsugu Tamura, Tomohiro Noguchi, Tatsuki Furusawa, Ryo Takizawa, Tempei Kabayama, Norihiko Takeda

机构 * The University of Tokyo(东京大学) The University of Tokyo Hospital(东京大学医院)

专题命中 VLM训练与架构 :VLM(title,abstract);分类 cs.CV

Comments The 4th Workshop on Computer Vision in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15334 2025-06-09 cs.CV 79%

Modality-Fair Preference Optimization for Trustworthy MLLM Alignment

Songtao Jiang, Yan Zhang, Ruizhe Chen, Tianxiang Hu, Yeying Jin, Qinglin He, Yang Feng, Jian Wu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动) National University of Singapore(新加坡国立大学) Angelalign Inc., China(中国Angelalign公司)

专题命中 VLM训练与架构 :MLLM(title);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04606 2025-06-06 cs.CV 79%

SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents

Alexander Huang-Menders, Xinhang Liu, Andy Xu, Yuyao Zhang, Chi-Keung Tang, Yu-Wing Tai

机构 * The Hong Kong University of Science and Technology(香港科技大学) Dartmouth College(达特茅斯学院)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18053 2025-06-06 cs.CL cs.CV 79%

DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models

Jianyu Liu, Hangyu Guo, Ranjie Duan, Xingyuan Bu, Yancheng He, Shilong Li, Hui Huang, Jiaheng Liu, Yucheng Wang, Chenchen Jing, Xingwei Qu, Xiao Zhang, Yingshui Tan, Yanan Wu, Jihao Gu, Yangguang Li, Jianke Zhu

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) M-A-P The Chinese University of Hong Kong(香港中文大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

Comments [NAACL 2025] The first four authors contribute equally, 23 pages, repo at https://github.com/Kizna1ver/DREAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02555 2025-06-04 cs.CV 79%

SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence

Zhitao Zeng, Zhu Zhuo, Xiaojun Jia, Erli Zhang, Junde Wu, Jiaan Zhang, Yuxuan Wang, Chang Han Low, Jian Jiang, Zilong Zheng, Xiaochun Cao, Yutong Ban, Qi Dou, Yang Liu, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Shanghai Jiao Tong University(上海交通大学) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments 29 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01724 2025-06-03 cs.CV 79%

Active Learning via Vision-Language Model Adaptation with Open Data

Tong Wang, Jiaqi Wang, Shu Kong

机构 * University of Macau(澳门大学) Shanghai AI Lab(上海人工智能实验室) Institute of Collaborative Innovation project webpage(协同创新项目研究所)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.CV

Comments Here is the project webpage: https://leowangtong.github.io/ALOR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15678 2025-06-02 cs.LG 79%

Testing the Limits of Fine-Tuning for Improving Visual Cognition in Vision Language Models

Luca M. Schulze Buschoff, Konstantinos Voudouris, Elif Akata, Matthias Bethge, Joshua B. Tenenbaum, Eric Schulz

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23358 2025-05-30 cs.CV 79%

Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model

Reem AlJunaid, Muzammil Behzad

机构 * KFUPM(科威特理工学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11501 2025-05-30 cs.CL cs.CV 79%

Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?

Zichen Wen, Yifeng Gao, Weijia Li, Conghui He, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) EPIC Lab, SJTU(EPIC实验室,SJTu) Shanghai AI Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19373 2025-05-27 cs.CV 79%

DiSa: Directional Saliency-Aware Prompt Learning for Generalizable Vision-Language Models

Niloufar Alipour Talemi, Hossein Kashiani, Hossein R. Nowdeh, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted at the 31st ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18503 2025-05-27 cs.CV 79%

Focus on What Matters: Enhancing Medical Vision-Language Models with Automatic Attention Alignment Tuning

Aofei Chang, Le Huang, Alex James Boyd, Parminder Bhatia, Taha Kass-Hout, Cao Xiao, Fenglong Ma

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to ACL2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10174 2025-05-27 cs.CV 79%

LLaVA-ReID: Selective Multi-image Questioner for Interactive Person Re-Identification

Yiding Lu, Mouxing Yang, Dezhong Peng, Peng Hu, Yijie Lin, Xi Peng

专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17835 2025-05-26 cs.CV 79%

VLM Models and Automated Grading of Atopic Dermatitis

Marc Lalonde, Hamed Ghodrati

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏