arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5067 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5067 篇

2509.15076 2025-09-19 cs.LG cs.CV 84%

Forecasting and Visualizing Air Quality from Sky Images with Vision-Language Models

Mohammad Saleh Vahdatpour, Maryam Eyvazi, Yanqing Zhang

机构 * Georgia State University(佐治亚州立大学) Savannah College of Art and Design(萨凡纳艺术与设计学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Published at ICCVW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09808 2025-09-19 cs.CV cs.AI 84%

Fine-tuning Vision Language Models with Graph-based Knowledge for Explainable Medical Image Analysis

Chenjun Li, Laurin Lux, Alexander H. Berger, Martin J. Menten, Mert R. Sabuncu, Johannes C. Paetzold

机构 * School of Electrical and Computer Engineering, Cornell University(电气与计算机工程学院,康奈尔大学) School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) Cornell Tech(康奈尔科技) Weill Cornell Medicine(韦尔·康奈尔医学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06759 2025-09-09 cs.LG cs.AI 84%

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization

Thanh Thi Nguyen, Campbell Wilson, Janis Dalins

机构 * AiLECS Lab, Monash University Melbourne, Australia(墨尔本大学AiLECS实验室,澳大利亚) AiLECS Lab, Monash University, Australia ICMEC Australia, Sydney, Australia(墨尔本大学AiLECS实验室,澳大利亚 ICMEC澳大利亚,悉尼,澳大利亚)

专题命中 VLM训练与架构 :vision-language model(title,abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG

Comments Accepted for publication in the Proceedings of the 8th International Conference on Algorithms, Computing and Artificial Intelligence (ACAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05703 2025-09-09 cs.CV cs.AI cs.IR 84%

Knowledge-Augmented Vision Language Models for Underwater Bioacoustic Spectrogram Analysis

Ragib Amin Nihal, Benjamin Yen, Takeshi Ashizawa, Kazuhiro Nakadai

机构 * Systems and Control Engineering, Institute of Science Tokyo(科学理工学院东京)

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21430 2025-09-01 cs.CL cs.AI cs.CV 84%

Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models

Meidan Ding, Jipeng Zhang, Wenxuan Wang, Cheng-Yi Li, Wei-Chieh Fang, Hsin-Yu Wu, Haiqin Zhong, Wenting Chen, Linlin Shen

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Renmin University of China(中国人民大学) National Yang Ming Chiao Tung University Taipei Veterans General Hospital(台北荣民总医院) School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 19 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13524 2025-08-20 cs.CV cs.AI 84%

Evaluating Open-Source Vision Language Models for Facial Emotion Recognition against Traditional Deep Learning Models

Vamsi Krishna Mulukutla, Sai Supriya Pavarala, Srinivasa Raju Rudraraju, Sridevi Bonthu

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Journal ref EAI Endorsed Transactions on AI and Robotics, 4, August 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09225 2025-08-14 eess.IV cs.AI cs.CV 84%

AMRG: Extend Vision Language Models for Automatic Mammography Report Generation

Nak-Jun Sung, Donghyun Lee, Bo Hwa Choi, Chae Jung Park

机构 * Research Institute, National Cancer Center Korea(韩国国家癌症中心研究所) Department of Radiology, National Cancer Center Korea(韩国国家癌症中心放射科)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09672 2025-08-06 cs.CV cs.AI 84%

CHIRP: A Fine-Grained Benchmark for Open-Ended Response Evaluation in Vision-Language Models

Alexis Roger, Prateek Humane, Daniel Z. Kaplan, Kshitij Gupta, Qi Sun, George Adamopoulos, Jonathan Siu Chi Lim, Quentin Anthony, Edwin Fennell, Irina Rish

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Tokyo Institute of Technology(东京技术大学) McGill University(麦吉尔大学) EleutherAI University College London(伦敦大学学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02429 2025-08-05 cs.AI cs.LG 84%

Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting

Miaosen Luo, Jiesen Long, Zequn Li, Yunying Yang, Yuncheng Jiang, Sijie Mai

机构 * School of Computer Science, South China Normal University(华南师范大学计算机科学学院) School of Information Technology in Education, South China Normal University(华南师范大学教育信息技术学院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15621 2025-08-01 cs.CV cs.AI cs.CL cs.MM 84%

LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning

Federico Cocchi, Nicholas Moratelli, Davide Caffagni, Sara Sarto, Lorenzo Baraldi, Marcella Cornia, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学) IIT-CNR(意大利国家研究 council(IIT))

专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments ICCV 2025 Workshop on What is Next in Multimodal Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19628 2025-07-28 cs.CV cs.CL cs.LG cs.MM 84%

Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings

Qiong Wu, Wenhao Lin, Yiyi Zhou, Weihao Ye, Zhanpeng Zen, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院)

专题命中 VLM训练与架构 :multimodal large language model(title);LLaVA(abstract);InternVL(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12795 2025-07-18 cs.CV cs.AI 84%

City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning

Penglei Sun, Yaoxian Song, Xiangru Zhu, Xiang Liu, Qiang Wang, Yue Liu, Changqun Xia, Tiefeng Li, Yang Yang, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Zhejiang University(浙江大学) Fudan University(复旦大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Terminus Technologies Co., Ltd. Pengcheng Laboratory(鹏城实验室)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10442 2025-07-15 cs.LG cs.AI 84%

Response Wide Shut? Surprising Observations in Basic Vision Language Model Capabilities

Shivam Chandhok, Wan-Cyuan Fan, Vered Shwartz, Vineeth N Balasubramanian, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(人工智能矢量研究所) IIT Hyderabad(海得拉巴印度理工学院) CIFAR AI Chair(卡尔加里人工智能主席) Microsoft Research India(微软印度研究院)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

Comments Accepted at ACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02948 2025-07-15 cs.CV cs.AI cs.RO 84%

DriveMRP: Enhancing Vision-Language Models with Synthetic Motion Data for Motion Risk Prediction

Zhiyi Hou, Enhui Ma, Fang Li, Zhiyi Lai, Kalok Ho, Zhanqian Wu, Lijun Zhou, Long Chen, Chitian Sun, Haiyang Sun, Bing Wang, Guang Chen, Hangjun Ye, Kaicheng Yu

机构 * Westlake University(西湖大学) Xiaomi EV(小米汽车) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 12 pages, 4 figures. Code available at https://github.com/hzy138/DriveMRP

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07572 2025-07-11 cs.CL cs.AI cs.CV 84%

Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation

Yupu Liang, Yaping Zhang, Zhiyang Zhang, Yang Zhao, Lu Xiang, Chengqing Zong, Yu Zhou

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted by ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06140 2025-07-09 eess.IV cs.AI cs.CV 84%

LangMamba: A Language-driven Mamba Framework for Low-dose CT Denoising with Vision-language Models

Zhihao Chen, Tao Chen, Chenhui Wang, Qi Gao, Huidong Xie, Chuang Niu, Ge Wang, Hongming Shan

机构 * Institute of Science and Technology for Brain-inspired Intelligence, Fudan University(脑启发智能科学与技术研究院,复旦大学) Department of Biomedical Engineering, Yale University(生物医学工程系,耶鲁大学) Biomedical Imaging Center, Center for Biotechnology and Interdisciplinary Studies, Department of Biomedical Engineering, Rensselaer Polytechnic Institute(生物医学成像中心,生物技术与跨学科研究所在生物医学工程系,罗切斯特理工学院) Institute of Science and Technology for Brain-inspired Intelligence, MOE Frontiers Center for Brain Science and Key Laboratory of Computational Neuroscience and Brain-Inspired Intelligence (Ministry of Education), Fudan University(脑启发智能科学与技术研究院,教育部脑科学前沿中心和计算神经科学与脑启发智能重点实验室,复旦大学) Shanghai Center for Brain Science and Brain-inspired Technology(上海脑科学与脑启发技术中心)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17670 2025-07-09 cs.LG cs.AI 84%

Towards General Continuous Memory for Vision-Language Models

Wenyi Wu, Zixuan Song, Kun Zhou, Yifei Shao, Zhiting Hu, Biwei Huang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21862 2025-06-30 cs.CV cs.AI cs.HC cs.MM 84%

LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs

Boyuan Sun, Jiaxing Zhao, Xihan Wei, Qibin Hou

机构 * VCIP, School of Computer Science, Nankai University(南开大学计算机学院) Tongyi Lab, Alibaba Group(阿里巴巴集团 Tongyi 实验室)

专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 21 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17267 2025-06-24 cs.LG cs.AI 84%

CF-VLM:CounterFactual Vision-Language Fine-tuning

Jusheng Zhang, Kaitong Cai, Yijia Fan, Jian Wang, Keze Wang

机构 * Sun Yat-sen University(中山大学) Snap Inc.(Snap公司)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15645 2025-06-19 cs.CV cs.AI 84%

Demystifying the Visual Quality Paradox in Multimodal Large Language Models

Shuo Xing, Lanqing Guo, Hongyuan Hua, Seoyoung Lee, Peiran Li, Yufei Wang, Zhangyang Wang, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Toronto(多伦多大学) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09638 2025-06-12 cs.LG cs.CV 84%

FedVLMBench: Benchmarking Federated Fine-Tuning of Vision-Language Models

Weiying Zheng, Ziyue Lin, Pengxin Guo, Yuyin Zhou, Feifei Wang, Liangqiong Qu

机构 * The University of Hong Kong(香港大学) UC Santa Cruz(圣克拉拉大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03792 2025-06-04 cs.LG cs.AI 84%

Towards Efficient Online Tuning of VLM Agents via Counterfactual Soft Reinforcement Learning

Lang Feng, Weihao Tan, Zhiyi Lyu, Longtao Zheng, Haiyang Xu, Ming Yan, Fei Huang, Bo An

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23043 2025-05-30 cs.CV cs.AI 84%

Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation

Jihai Zhang, Tianle Li, Linjie Li, Zhengyuan Yang, Yu Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) Microsoft(微软公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20405 2025-05-28 cs.CV cs.AI cs.CL cs.MM 84%

What Changed? Detecting and Evaluating Instruction-Guided Image Edits with Multimodal Large Language Models

Lorenzo Baraldi, Davide Bucciarelli, Federico Betti, Marcella Cornia, Lorenzo Baraldi, Nicu Sebe, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学) University of Trento(特伦托大学) IIT-CNR

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17042 2025-05-26 cs.CL cs.CV cs.IR cs.LG 84%

VLM-KG: Multimodal Radiology Knowledge Graph Generation

Abdullah Abdullah, Seong Tae Kim

机构 * Department of Computer Science and Engineering, Kyung Hee University(计算机科学与工程系,庆熙大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14646 2025-05-21 cs.CV cs.AI 84%

CAD-Coder: An Open-Source Vision-Language Model for Computer-Aided Design Code Generation

Anna C. Doris, Md Ferdous Alam, Amin Heyrani Nobari, Faez Ahmed

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22577 2025-05-21 cs.CV cs.AI 84%

Breaking Language Barriers in Visual Language Models via Multilingual Textual Regularization

Iñigo Pikabea, Iñaki Lacunza, Oriol Pareras, Carlos Escolano, Aitor Gonzalez-Agirre, Javier Hernando, Marta Villegas

机构 * Barcelona Supercomputing Center(巴塞罗那超级计算中心) Universitat Politècnica de Catalunya(加泰罗尼亚理工大学)

专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments v2: Expanded model merging experiments. Fix duplicated subsection on limitations

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10526 2025-05-20 cs.LG cs.CL cs.CV 84%

MASSV: Multimodal Adaptation and Self-Data Distillation for Speculative Decoding of Vision-Language Models

Mugilan Ganesan, Shane Segal, Ankur Aggarwal, Nish Sinnadurai, Sean Lie, Vithursan Thangarasa

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Main paper: 11 pages, 4 figures, 3 tables. Supplementary: 1 page

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13797 2025-05-20 cs.LG cs.CV 84%

Bridge the Modality and Capability Gaps in Vision-Language Model Selection

Chao Yi, Yu-Hang He, De-Chuan Zhan, Han-Jia Ye

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments fix typo in figure 2 "Capability Gap"

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09498 2025-05-15 cs.CV cs.AI 84%

Flash-VL 2B: Optimizing Vision-Language Model Performance for Ultra-Low Latency and High Throughput

Bo Zhang, Shuo Li, Runhe Tian, Yang Yang, Jixin Tang, Jinhao Zhou, Lin Ma

机构 * Meituan(美团)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏