arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5084 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5084 篇

2512.10336 2025-12-12 cs.CL cs.AI 79%

Multilingual VLM Training: Adapting an English-Trained VLM to French

多语言视觉语言模型训练:将英语训练的VLM适应到法语

Jules Lahmi, Alexis Roger

机构 * Ecole Polytechnique(巴黎政治学院) Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学)

专题命中 VLM训练与架构 :VLM(title,abstract);分类 cs.AI

AI总结 本文研究了将英语训练的视觉语言模型适应到法语等其他语言的挑战,通过比较不同方法的性能和计算成本,发现数据翻译是多语言VLM性能的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13036 2025-12-09 cs.CV 79%

uCLIP: Parameter-Efficient Multilingual Extension of Vision-Language Models with Unpaired Data

uCLIP: 无配对数据下多语言视觉语言模型的参数高效扩展

Dahyun Chung, Donghyun Shin, Yujin Sung, Seunggi Moon, Jinwoo Jeon, Byung-Jun Lee

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 uCLIP通过无需配对数据的轻量级框架,在低资源语言中实现高效多语言视觉语言对齐。

Comments Our project page can be found at https://dinyudin203.github.io/uCLIP-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06750 2025-12-09 cs.CV 79%

UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement

UARE:面向图像质量评估、修复和增强的统一视觉-语言模型

Weiqi Li, Xuanyu Zhang, Bin Chen, Jingfen Xie, Yan Wang, Kexin Zhang, Junlin Li, Li Zhang, Jian Zhang, Shijie Zhao

机构 * School of Electronic and Computer Engineering, Peking University, 2 ByteDance Inc(1 电子与计算机工程学院,北京大学,2 字节跳动公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 UARE是首个统一视觉-语言模型,通过统一训练框架提升图像质量评估、修复和增强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04058 2025-12-05 cs.CV 79%

EVE: Towards End-to-End Video Subtitle Extraction with Vision-Language Models

EVE:基于视觉-语言模型的端到端视频字幕提取

Haiyang Yu, Mengyang Zhao, Jinghui Lu, Ke Niu, Yanjie Wang, Weijie Yin, Weitao Jia, Teng Fu, Yang Liu, Jun Liu, Hong Chen

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ByteDance Inc.(字节跳动公司) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) School of Computing and Communications, Lancaster University(兰卡斯特大学计算机与通讯学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 EVE提出了一种基于视觉-语言模型的端到端视频字幕提取框架,通过双分支模块高效提取字幕及时间戳,并构建了首个大规模视频字幕数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01629 2025-12-03 cs.CV cs.RO 79%

SPARK: Sim-ready Part-level Articulated Reconstruction with VLM Knowledge

SPARK: 面向模拟的关节化重建与VLK知识

Yumeng He, Ying Jiang, Jiayin Lu, Yin Yang, Chenfanfu Jiang

专题命中 VLM训练与架构 :VLM(title,abstract);分类 cs.CV

AI总结 SPARK通过结合VLK和生成扩散模型,实现从单张图像中生成物理一致的关节化3D物体,提升机器人操作和交互建模的应用效果。

Comments Project page: https://heyumeng.com/SPARK/index.html. 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21106 2025-11-27 cs.CV 79%

EM-KD: Distilling Efficient Multimodal Large Language Model with Unbalanced Vision Tokens

EM-KD: 通过不平衡视觉标记的知识蒸馏提升高效多模态大语言模型

Ze Feng, Sen Yang, Boqiang Duan, Wankou Yang, Jingdong Wang

机构 * Baidu VIS(百度视觉)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 EM-KD通过改进的知识蒸馏方法,有效提升高效多模态大语言模型的视觉理解和效率。

Comments accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20280 2025-11-26 cs.CV 79%

Bootstrapping Physics-Grounded Video Generation through VLM-Guided Iterative Self-Refinement

通过VLM引导的迭代自优化提升物理导向的视频生成

Yang Liu, Xilin Zhao, Peisong Wen, Siran Dai, Qingming Huang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种通过VLM引导的迭代自优化方法,提升视频生成的物理一致性,实验显示在PhyIQ基准上得分提升明显。

Comments ICCV 2025 Physics-IQ Challenge Third Place Solution

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18617 2025-11-26 cs.RO cs.CV 79%

AutoFocus-IL: VLM-based Saliency Maps for Data-Efficient Visual Imitation Learning without Extra Human Annotations

AutoFocus-IL:基于视觉语言模型的数据高效视觉模仿学习中的显著性图

Litian Gong, Fatemeh Bahrani, Yutai Zhou, Amin Banayeeanzade, Jiachen Li, Erdem Bıyık

机构 * Department of Electrical and Computer Engineering, University of California, Riverside, USA(电气与计算机工程系,加州大学河滨分校) Thomas Lord Department of Computer Science, University of Southern California, USA(汤姆斯·劳德计算机科学系,南加州大学)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

AI总结 AutoFocus-IL通过视觉语言模型自动生成显著性图,提升视觉模仿学习的数据效率和泛化能力,无需额外人类标注。

Comments 8 pages, 6 figures. Code and datasets available at http://autofocus-il.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19261 2025-11-25 cs.CV 79%

LAST: LeArning to Think in Space and Time for Generalist Vision-Language Models

LAST: 为通用视觉-语言模型学习在空间和时间中的思考

Shuai Wang, Daoan Zhang, Tianyi Bai, Shitong Shao, Jiebo Luo, Jiaheng Wei

机构 * HKUST(GZ)(香港科技大学(广州)) University of Rochester(罗切斯特大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 LAST通过学习在空间和时间上思考,提升通用视觉-语言模型对3D空间和长视频的理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17945 2025-11-25 cs.CV 79%

Test-Time Temporal Sampling for Efficient MLLM Video Understanding

测试时时间采样用于高效多模态大语言模型视频理解

Kaibin Wang, Mingbao Lin

机构 * SenseTime, China(深睿时代,中国) Rakuten, Singapore(拉结恩,新加坡)

专题命中 VLM训练与架构 :MLLM(title);multimodal large language model(abstract);分类 cs.CV

AI总结 T3S通过测试时时间采样提高多模态大语言模型处理长视频的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16998 2025-11-24 cs.CV 79%

VLM-Augmented Degradation Modeling for Image Restoration Under Adverse Weather Conditions

增强型退化建模用于恶劣天气下的图像修复

Qianyi Shao, Yuanfan Zhang, Renxiang Xiao, Liang Hu

专题命中 VLM训练与架构 :VLM(title,abstract);分类 cs.CV

AI总结 本文提出了一种结合视觉-语言模型和隐式记忆库的统一模型,用于在恶劣天气下高效恢复图像,提升了修复精度和计算效率。

Journal ref Proc. 2025 30th International Conference on Automation and Computing (ICAC), pp. 1-6, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10701 2025-11-19 cs.CV cs.RO 79%

CARScenes: Semantic VLM Dataset for Safe Autonomous Driving

Yuankai He, Weisong Shi

机构 * st Yuankai He(第一作者) nd Weisong Shi(第二作者)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

Comments 8 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12428 2025-11-18 cs.CV 79%

RedVTP: Training-Free Acceleration of Diffusion Vision-Language Models Inference via Masked Token-Guided Visual Token Pruning

Jingqi Xu, Jingxi Lu, Chenghao Li, Sreetama Sarkar, Souvik Kundu, Peter A. Beerel

机构 * University of Southern California(南加州大学) Intel Labs(英特尔实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12331 2025-11-18 cs.CV 79%

SpaceVLM: Sub-Space Modeling of Negation in Vision-Language Models

Sepehr Kazemi Ranjbar, Kumail Alhamoud, Marzyeh Ghassemi

机构 * MIT(麻省理工学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15960 2025-11-18 cs.CV 79%

Glo-VLMs: Leveraging Vision-Language Models for Fine-Grained Diseased Glomerulus Classification

Zhenhao Guo, Rachit Saluja, Tianyuan Yao, Quan Liu, Yuankai Huo, Benjamin Liechty, David J. Pisapia, Kenji Ikemura, Mert R. Sabuncu, Yihe Yang, Ruining Deng

机构 * New York University(纽约大学) Cornell Tech(康奈尔科技) Vanderbilt University(范德比尔特大学) Weill Cornell Medicine(韦尔医学院) Northwell Health(北well健康)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Journal ref Proceedings of SPIE Medical Imaging 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11984 2025-11-18 cs.CV 79%

From Classification to Cross-Modal Understanding: Leveraging Vision-Language Models for Fine-Grained Renal Pathology

Zhenhao Guo, Rachit Saluja, Tianyuan Yao, Quan Liu, Junchao Zhu, Haibo Wang, Daniel Reisenbüchler, Yuankai Huo, Benjamin Liechty, David J. Pisapia, Kenji Ikemura, Steven Salvatoree, Surya Seshane, Mert R. Sabuncu, Yihe Yang, Ruining Deng

机构 * New York University(纽约大学) Cornell Tech(康奈尔科技) Vanderbilt University(范德比大学) Carnegie Mellon University(卡内基梅隆大学) University of Regensburg(莱茵河畔大学) Weill Cornell Medicine(韦尔·科恩医学中心) Northwell Health(北well健康)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10098 2025-11-14 cs.CV 79%

MTAttack: Multi-Target Backdoor Attacks against Large Vision-Language Models

Zihan Wang, Guansong Pang, Wenjun Miao, Jin Zheng, Xiao Bai

专题命中 VLM训练与架构 :vision-language model(title);visual language model(abstract);分类 cs.CV

Comments AAAI2026, with supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09883 2025-11-14 cs.CV 79%

HCC-3D: Hierarchical Compensatory Compression for 98% 3D Token Reduction in Vision-Language Models

Liheng Zhang, Jin Wang, Hui Li, Bingfeng Zhang, Weifeng Liu

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02615 2025-11-13 astro-ph.IM cs.AI 79%

Radio Astronomy in the Era of Vision-Language Models: Prompt Sensitivity and Adaptation

Mariia Drozdova, Erica Lastufka, Vitaliy Kinakh, Taras Holotyak, Daniel Schaerer, Slava Voloshynovskiy

机构 * University of Geneva(日内瓦大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.AI

Comments Machine Learning and the Physical Sciences Workshop, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07812 2025-11-12 cs.CV 79%

Revisiting MLLM Based Image Quality Assessment: Errors and Remedy

Zhenchen Tang, Songlin Yang, Bo Peng, Zichuan Wang, Jing Dong

专题命中 VLM训练与架构 :MLLM(title,abstract);分类 cs.CV

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17088 2025-11-11 cs.CV 79%

FedVLM: Scalable Personalized Vision-Language Models through Federated Learning

Arkajyoti Mitra, Afia Anjum, Paul Agbaje, Mert Pesé, Habeeb Olufowobi

机构 * University of Texas at Arlington(德克萨斯理工大学) Clemson University(克莱姆森大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to ECAI 2025 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20639 2025-10-24 cs.CV 79%

Better Tokens for Better 3D: Advancing Vision-Language Modeling in 3D Medical Imaging

Ibrahim Ethem Hamamci, Sezgin Er, Suprosanna Shit, Hadrien Reynaud, Dong Yang, Pengfei Guo, Marc Edgar, Daguang Xu, Bernhard Kainz, Bjoern Menze

机构 * University of Zurich(苏黎世大学) NVIDIA Imperial College London(伦敦帝国理工学院) FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19802 2025-10-23 cs.CV 79%

Class-Aware Prototype Learning with Negative Contrast for Test-Time Adaptation of Vision-Language Models

Xiaozhen Qiao, Jingkai Zhao, Yuqiu Jiang, Xianda Guo, Zhe Sun, Hongyuan Zhang, Xuelong Li

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Institute of Artificial Intelligence (TeleAI), China Telecom, P. R. China(人工智能研究所(TeleAI),中国电信,中华人民共和国) College of Computer Science, Wuhan University(计算机科学学院,武汉大学) School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院,光学与电子学(iOPEN),西北工业大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14624 2025-10-17 cs.CV 79%

Efficient Video Sampling: Pruning Temporally Redundant Tokens for Faster VLM Inference

Natan Bagrov, Eugene Khvedchenia, Borys Tymchenko, Shay Aharon, Lior Kadoch, Tomer Keren, Ofri Masad, Yonatan Geifman, Ran Zilberstein, Tuomas Rintamaki, Matthieu Le, Andrew Tao

机构 * NVIDIA

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20761 2025-10-14 cs.AI 79%

OmniBal: Towards Fast Instruction-Tuning for Vision-Language Models via Omniverse Computation Balance

Yongqiang Yao, Jingru Tan, Feizhao Zhang, Jiahao Hu, Yazhe Niu, Xin Jin, Bo Li, Pengfei Liu, Ruihao Gong, Dahua Lin, Ningyi Xu

机构 * Shanghai Jiao Tong University(上海交通大学) SenseTime Research(商汤科技研究院) Central South University(中南大学) Tongji University(同济大学) Beihang University(北航) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLM训练与架构 :vision-language model(title);InternVL(abstract);分类 cs.AI

Comments Accepted in ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09867 2025-10-14 cs.CV 79%

Cluster-Aware Prompt Ensemble Learning for Few-Shot Vision-Language Model Adaptation

Zhi Chen, Xin Yu, Xiaohui Tao, Yan Li, Zi Huang

机构 * University of Southern Queensland(昆士兰南方大学) University of Queensland(昆士兰大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted to the journal Pattern Recognition in 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07979 2025-10-13 cs.CV 79%

Visual Representation Alignment for Multimodal Large Language Models

Heeji Yoon, Jaewoo Jung, Junwan Kim, Hyungyu Choi, Heeseong Shin, Sangbeom Lim, Honggyu An, Chaehyun Kim, Jisang Han, Donghyun Kim, Chanho Eom, Sunghwan Hong, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) New York University(纽约大学) Chung-Ang University(Chung-Ang 大学) Korea University(韩国大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

Comments Project Page: https://cvlab-kaist.github.io/VIRAL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06092 2025-10-10 cs.CV 79%

Q-CLIP: Unleashing the Power of Vision-Language Models for Video Quality Assessment through Unified Cross-Modal Adaptation

Yachun Mi, Yu Li, Yanting Li, Chen Hui, Tong Zhang, Zhixuan Li, Chenyue Song, Wei Yang Bryan Lim, Shaohui Liu

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01444 2025-10-10 cs.CR cs.AI 79%

PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization

Aofan Liu, Lulu Tang, Ting Pan, Yuguo Yin, Bin Wang, Ao Yang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.AI

Comments Accepted to IEEE International Conference on Multimedia and Expo (ICME) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00534 2025-10-07 cs.CR cs.AI 79%

The Security Threat of Compressed Projectors in Large Vision-Language Models

Yudong Zhang, Ruobing Xie, Xingwu Sun, Jiansheng Chen, Zhanhui Kang, Di Wang, Yu Wang

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Large Language Model Department, Tencent(腾讯大语言模型部门) School of Computer and Communication Engineering, University of Science and Technology Beijing(北京科技大学计算机与通信工程学院) Faculty of Science and Technology, University of Macau(澳门大学科技学院)

专题命中 VLM训练与架构 :vision-language model(title);visual language model(abstract);分类 cs.AI

Comments Accepted by EMNLP 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏