arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5084 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5084 篇

2510.00088 2025-10-02 cs.AI cs.CY 79%

Judging by Appearances? Auditing and Intervening Vision-Language Models for Bail Prediction

Sagnik Basu, Shubham Prakash, Ashish Maruti Barge, Siddharth D Jaiswal, Abhisek Dash, Saptarshi Ghosh, Animesh Mukherjee

机构 * Indian Institute of Technology Kharagpur(印度理工学院Khargapur分校) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25568 2025-10-01 cs.CL cs.AI 79%

Probing the Limits of Stylistic Alignment in Vision-Language Models

Asma Farajidizaji, Akash Gupta, Vatsal Raina

机构 * Imperial College London(伦敦帝国学院) Apta AI

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.AI

Comments 5 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13067 2025-09-30 cs.CV 79%

HERO: Rethinking Visual Token Early Dropping in High-Resolution Large Vision-Language Models

Xu Li, Yuxuan Liang, Xiaolei Chen, Yi Zheng, Haotian Chen, Bin Li, Xiangyang Xue

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22524 2025-09-29 cs.CV 79%

Color Names in Vision-Language Models

Alexandra Gomez-Villa, Pablo Hernández-Cámara, Muhammad Atif Butt, Valero Laparra, Jesus Malo, Javier Vazquez-Corral

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21102 2025-09-26 cs.CV 79%

Mammo-CLIP Dissect: A Framework for Analysing Mammography Concepts in Vision-Language Models

Suaiba Amina Salahuddin, Teresa Dorszewski, Marit Almenning Martiniussen, Tone Hovda, Antonio Portaluri, Solveig Thrun, Michael Kampffmeyer, Elisabeth Wetzer, Kristoffer Wickstrøm, Robert Jenssen

机构 * UiT The Arctic University of Norway(乌塔大学极地大学) Technical University of Denmark(技术大学) Østfold Hospital Trust(奥斯fold医院信托) Vestre Viken Hospital Trust(维斯特维肯医院信托) Radboud University Nijmegen Medical Centre(拉德堡德大学奈梅亨医疗中心) The Netherlands Cancer Institute(荷兰癌症研究所) Antoni van Leeuwenhoek Hospital(安东尼·弗莱明医院) University of Copenhagen(哥本哈根大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13739 2025-09-25 cs.CV 79%

Enhancing Targeted Adversarial Attacks on Large Vision-Language Models via Intermediate Projector

Yiming Cao, Yanjie Li, Kaisheng Liang, Bin Xiao

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19524 2025-09-25 cs.AI cs.RO 79%

Score the Steps, Not Just the Goal: VLM-Based Subgoal Evaluation for Robotic Manipulation

Ramy ElMallah, Krish Chhajer, Chi-Guhn Lee

机构 * University of Toronto(多伦多大学)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.AI

Comments Accepted to the CoRL 2025 Eval&Deploy Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01346 2025-09-24 cs.CV cs.CL 79%

Large Vision-Language Model Alignment and Misalignment: A Survey Through the Lens of Explainability

Dong Shu, Haiyan Zhao, Jingyu Hu, Weiru Liu, Ali Payani, Lu Cheng, Mengnan Du

机构 * Northwestern University(西北大学) New Jersey Institute of Technology(新泽西理工学院) University of Bristol(布里斯托大学) Cisco Research(思科研究) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09064 2025-09-12 cs.CV 79%

Enhancing 3D Medical Image Understanding with Pretraining Aided by 2D Multimodal Large Language Models

Qiuhui Chen, Xuancheng Yao, Huping Ye, Yi Hong

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

Comments Accepted by IEEE Journal of Biomedical and Health Informatics (JBHI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06130 2025-09-11 cs.CV cs.CL 79%

Self-Correcting Decoding with Generative Feedback for Mitigating Hallucinations in Large Vision-Language Models

Ce Zhang, Zifu Wan, Zhehan Kan, Martin Q. Ma, Simon Stepputtis, Deva Ramanan, Russ Salakhutdinov, Louis-Philippe Morency, Katia Sycara, Yaqi Xie

机构 * School of Computer Science, Carnegie Mellon University(计算机科学系,卡内基梅隆大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by ICLR 2025. Project page: https://zhangce01.github.io/DeGF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05000 2025-09-08 cs.CV 79%

Dual-Domain Perspective on Degradation-Aware Fusion: A VLM-Guided Robust Infrared and Visible Image Fusion Framework

Tianpei Zhang, Jufeng Zhao, Yiming Zhu, Guangmang Cui

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03895 2025-09-05 cs.CV 79%

Attn-Adapter: Attention Is All You Need for Online Few-shot Learner of Vision-Language Model

Phuoc-Nguyen Bui, Khanh-Binh Nguyen, Hyunseung Choo

机构 * Sungkyunkwan University(顺天大学) Deakin University(德金大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments ICCV 2025 - LIMIT Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20860 2025-09-03 cs.CV 79%

FedMVP: Federated Multimodal Visual Prompt Tuning for Vision-Language Models

Mainak Singha, Subhankar Roy, Sarthak Mehrotra, Ankit Jha, Moloud Abdar, Biplab Banerjee, Elisa Ricci

机构 * University of Trento(特伦托大学) University of Bergamo(贝拉姆奥大学) Indian Institute of Technology Bombay(印度班加罗尔理工学院) LNMIIT Jaipur(斋普尔LNMIIT) The University of Queensland(昆士兰大学) Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15144 2025-09-03 cs.CV 79%

Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models

Ankit Yadav, Lingqiao Liu, Yuankai Qi

机构 * The University of Adelaide(阿德莱德大学) Macquarie University(麦考瑞大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments 25 Pages Accepted in DICTA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16188 2025-08-29 cs.CL cs.CV cs.MM cs.SD eess.AS 79%

Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation

Weiting Tan, Jiachen Lian, Hirofumi Inaguma, Paden Tomasello, Philipp Koehn, Xutai Ma

机构 * Johns Hopkins University(约翰霍普金斯大学) Meta AI Research(Meta AI 研究)

专题命中 VLM训练与架构 :visual language model(title,abstract);分类 cs.CV

Comments EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18886 2025-08-27 cs.CV 79%

Toward Robust Medical Fairness: Debiased Dual-Modal Alignment via Text-Guided Attribute-Disentangled Prompt Learning for Vision-Language Models

Yuexuan Xia, Benteng Ma, Jiang He, Zhiyong Wang, Qi Dou, Yong Xia

机构 * National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology(集成空天地海大数据应用技术国家工程实验室) Northwestern Polytechnical University(西北工业大学) Huiying Medical Technology Company Ltd.(慧影医疗技术有限公司) The School of Computer Science(计算机学院) The University of Sydney(悉尼大学) Department of Computer Science and Engineering(计算机科学与工程系) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17417 2025-08-26 cs.CV 79%

Constrained Prompt Enhancement for Improving Zero-Shot Generalization of Vision-Language Models

Xiaojie Yin, Qilong Wang, Qinghua Hu

机构 * Tianjin University(天津大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17380 2025-08-26 cs.AI 79%

Mimicking the Physicist's Eye:A VLM-centric Approach for Physics Formula Discovery

Jiaqi Liu, Songning Lai, Pengze Li, Di Yu, Wenjie Zhou, Yiyang Zhou, Peng Xia, Zijun Wang, Xi Chen, Shixiang Tang, Lei Bai, Wanli Ouyang, Mingyu Ding, Huaxiu Yao, Aoran Wang

机构 * UNC–Chapel Hill(北卡罗来纳大学教堂山分校) HKUST (Guangzhou)(香港科技大学(广州)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Tsinghua University(清华大学) Nankai University(南开大学) UC Santa Cruz(圣塔克鲁兹大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLM训练与架构 :VLM(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12877 2025-08-19 cs.CV 79%

Preserve and Sculpt: Manifold-Aligned Fine-tuning of Vision-Language Models for Few-Shot Learning

Dexia Chen, Qianjie Zhu, Weibing Li, Yue Yu, Tong Zhang, Ruixuan Wang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12512 2025-08-19 cs.CV 79%

LangVision-LoRA-NAS: Neural Architecture Search for Variable LoRA Rank in Vision Language Models

Krishna Teja Chitty-Venkata, Murali Emani, Venkatram Vishwanath

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.CV

Comments Accepted by ICIP 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12137 2025-08-19 cs.CV 79%

Infusing fine-grained visual knowledge to Vision-Language Models

Nikolaos-Antonios Ypsilantis, Kaifeng Chen, André Araujo, Ondřej Chum

机构 * VRG, FEE, Czech Technical University in Prague(捷克布拉格技术大学)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.CV

Comments ICCVW 2025 accepted paper. Workshop name: "What is Next in Multimodal Foundation Models?"

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11176 2025-08-18 cs.CV 79%

Fine-Grained VLM Fine-tuning via Latent Hierarchical Adapter Learning

Yumiao Zhao, Bo Jiang, Yuhe Ding, Xiao Wang, Jin Tang, Bin Luo

机构 * Information Materials and Intelligent Sensing Laboratory of Anhui Province(安徽省信息材料与智能感知实验室) Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省多模态认知计算重点实验室) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14976 2025-08-15 cs.CV 79%

Hierarchical Cross-modal Prompt Learning for Vision-Language Models

Hao Zheng, Shunzhi Yang, Zhuoxin He, Jinfeng Yang, Zhenhua Huang

机构 * South China Normal University(华南师范大学) Shenzhen Polytechnic University(深圳职业技术大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00332 2025-08-14 cs.AI q-bio.NC 79%

Vision Language Models Know Law of Conservation without Understanding More-or-Less

Dezhi Luo, Haiyun Lyu, Qingying Gao, Haoran Sun, Yijiang Li, Hokin Deng

机构 * University of Michigan(密歇根大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Johns Hopkins University(约翰霍普金斯大学) University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.AI

Comments Published at the ICLR 2025 Workshop on Bidirectional Human-AI Alignment (BiAlign)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06795 2025-08-13 cs.CL cs.CV 79%

From Pixels to Tokens: Revisiting Object Hallucinations in Large Vision-Language Models

Yuying Shang, Xinyi Zeng, Yutao Zhu, Xiao Yang, Zhengwei Fang, Jingyuan Zhang, Jiawei Chen, Zinan Liu, Yu Tian

机构 * University of Chinese Academy of Sciences(中国科学院大学) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学) Gaoling School of Artificial Intelligence, Renmin University of China(人工智能学院,中国人民大学) Kuaishou Technology Inc.(快手科技有限公司) Shanghai Key Laboratory of Multi. Info. Processing, East China Normal University(多信息处理重点实验室,华东师范大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04963 2025-08-08 cs.IR cs.LG 79%

A Metric for MLLM Alignment in Large-scale Recommendation

Yubin Zhang, Yanhua Huang, Haiming Xu, Mingliang Qi, Chang Wang, Jiarui Jin, Xiangyuan Ren, Xiaodan Wang, Ruiwen Xu

机构 * Xiaohongshu Inc.(小红书公司)

专题命中 VLM训练与架构 :MLLM(title);multimodal large language model(abstract);分类 cs.LG

Comments Pre-print.Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01548 2025-08-05 cs.CV 79%

A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models

Quan-Sheng Zeng, Yunheng Li, Qilong Wang, Peng-Tao Jiang, Zuxuan Wu, Ming-Ming Cheng, Qibin Hou

机构 * VCIP, CS, Nankai University(VCIP计算机科学系,南开大学) Shanghai Innovation Institute(上海创新研究院) Tianjin University(天津大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments 15 pages, 10 figures. Project page: https://github.com/HVision-NKU/GlimpsePrune

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15731 2025-08-05 cs.CV 79%

The Inter-Intra Modal Measure: A Predictive Lens on Fine-Tuning Outcomes in Vision-Language Models

Laura Niss, Kevin Vogt-Lowell, Theodoros Tsiligkaridis

机构 * MIT Lincoln Laboratory(麻省理工学院林肯实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00260 2025-08-04 cs.CV cs.MM 79%

Instruction-Grounded Visual Projectors for Continual Learning of Generative Vision-Language Models

Hyundong Jin, Hyung Jin Chang, Eunwoo Kim

机构 * School of Computer Science and Engineering, Chung-Ang University(Chung-Ang 大学计算机科学与工程学院) School of Computer Science, University of Birmingham(布拉德福德大学计算机科学学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13180 2025-08-04 cs.CV 79%

Feather the Throttle: Revisiting Visual Token Pruning for Vision-Language Model Acceleration

Mark Endo, Xiaohan Wang, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments ICCV 2025, project page: https://web.stanford.edu/~markendo/projects/feather

详情

展开后加载摘要…

URL PDF HTML 收藏