arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-03 至 2025-09-03 共收录 18 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 18 篇

2509.00676 2025-09-03 cs.CV cs.LG 86%

LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model

Xiyao Wang, Chunyuan Li, Jianwei Yang, Kai Zhang, Bo Liu, Tianyi Xiong, Furong Huang

机构 * University of Maryland College Park(马里兰大学 College Park 分校) The Ohio State University(俄亥俄州立大学) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06794 2025-09-03 cs.CV cs.CL 85%

Does Acceleration Cause Hidden Instability in Vision Language Models? Uncovering Instance-Level Divergence Through a Large-Scale Empirical Study

Yizheng Sun, Hao Li, Chang Xu, Hongpeng Zhou, Chenghua Lin, Riza Batista-Navarro, Jingyuan Sun

机构 * University of Manchester(曼彻斯特大学) Microsoft Research(微软研究院)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);LLaVA(abstract)

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01341 2025-09-03 cs.CV cs.AI 81%

Street-Level Geolocalization Using Multimodal Large Language Models and Retrieval-Augmented Generation

Yunus Serhat Bicakci, Joseph Shingleton, Anahid Basiri

机构 * Vocational School of Social Sciences, Marmara University(马尔马拉大学社会科学职业学校) Geospatial Data Science Group, School of Geographical & Earth Sciences, University of Glasgow(格拉斯哥大学地理与地球科学学院空间数据科学小组)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17243 2025-09-03 cs.CV cs.AI cs.CL 81%

CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models

Zicong Tang, Ziyang Ma, Suqing Wang, Zuchao Li, Lefei Zhang, Hai Zhao, Yun Li, Qianren Wang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机学院) Cognitive AI Lab, Shanghai Huawei Technologies, China(上海华为技术有限公司认知人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20860 2025-09-03 cs.CV 79%

FedMVP: Federated Multimodal Visual Prompt Tuning for Vision-Language Models

Mainak Singha, Subhankar Roy, Sarthak Mehrotra, Ankit Jha, Moloud Abdar, Biplab Banerjee, Elisa Ricci

机构 * University of Trento(特伦托大学) University of Bergamo(贝拉姆奥大学) Indian Institute of Technology Bombay(印度班加罗尔理工学院) LNMIIT Jaipur(斋普尔LNMIIT) The University of Queensland(昆士兰大学) Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15144 2025-09-03 cs.CV 79%

Exploring Primitive Visual Measurement Understanding and the Role of Output Format in Learning in Vision-Language Models

Ankit Yadav, Lingqiao Liu, Yuankai Qi

机构 * The University of Adelaide(阿德莱德大学) Macquarie University(麦考瑞大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

Comments 25 Pages Accepted in DICTA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00039 2025-09-03 cs.CV 74%

AMMKD: Adaptive Multimodal Multi-teacher Distillation for Lightweight Vision-Language Models

Yuqi Li, Chuanguang Yang, Junhao Dong, Zhengtao Yao, Haoyan Xu, Zeyu Dong, Hansheng Zeng, Zhulin An, Yingli Tian

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00210 2025-09-03 cs.CV cs.AI 73%

Beyond Pixels: Introducing Geometric-Semantic World Priors for Video-based Embodied Models via Spatio-temporal Alignment

Jinzhou Tang, Jusheng zhang, Sidi Liu, Waikit Xiu, Qinhan Lv, Xiying Li

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00305 2025-09-03 cs.CV 70%

Language-Aware Information Maximization for Transductive Few-Shot CLIP

Ghassen Baklouti, Maxime Zanella, Ismail Ben Ayed

机构 * École de Technologie Supérieure (ÉTS)(École de Technologie Supérieure) Université Catholique de Louvain (UCLouvain)(Université Catholique de Louvain) Université de Mons (UMons)(Université de Mons)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00351 2025-09-03 cs.CV cs.AI cs.LG 67%

Target-Oriented Single Domain Generalization

Marzi Heidari, Yuhong Guo

机构 * School of Computer Science, Carleton University(计算机科学学院,卡尔顿大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08869 2025-09-03 cs.LG cs.AI cs.CV 67%

Harnessing Vision Models for Time Series Analysis: A Survey

Jingchao Ni, Ziming Zhao, ChengAo Shen, Hanghang Tong, Dongjin Song, Wei Cheng, Dongsheng Luo, Haifeng Chen

机构 * University of Houston(德克萨斯大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Connecticut(康涅狄格大学) NEC Laboratories America(日本 NEC 美国实验室) Florida International University(佛罗里达国际大学)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00664 2025-09-03 cs.CV cs.AI 62%

Fusion to Enhance: Fusion Visual Encoder to Enhance Multimodal Language Model

Yifei She, Huangxuan Wu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02512 2025-09-03 cs.LG 57%

MoPEQ: Mixture of Mixed Precision Quantized Experts

Krishna Teja Chitty-Venkata, Jie Ye, Murali Emani

机构 * Argonne National Laboratory(阿贡国家实验室) Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.LG

Comments Accepted by ICCV Bivision Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02359 2025-09-03 cs.CV 57%

Why Do MLLMs Struggle with Spatial Understanding? A Systematic Analysis from Data to Architecture

Wanyue Zhang, Yibin Huang, Yangbin Xu, JingJing Huang, Helu Zhi, Shuo Ren, Wang Xu, Jiajun Zhang

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments The benchmark MulSeT is available at https://huggingface.co/datasets/WanyueZhang/MulSeT

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01644 2025-09-03 cs.CV 57%

OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning

Yanqing Liu, Xianhang Li, Letian Zhang, Zirui Wang, Zeyu Zheng, Yuyin Zhou, Cihang Xie

机构 * University of California Santa Cruz(加州大学圣克鲁兹分校) Apple(苹果公司) University of California Berkeley(加州大学伯克利分校)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01514 2025-09-03 cs.CL cs.AI 57%

MeVe: A Modular System for Memory Verification and Effective Context Control in Language Models

Andreas Ottem

机构 * Independent Researcher(独立研究者)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

Comments 16 pages, 7 figures, held online presentation at NLPA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09146 2025-09-03 cs.CV cs.MM 57%

Generative Frame Sampler for Long Video Understanding

Linli Yao, Haoning Wu, Kun Ouyang, Yuanxing Zhang, Caiming Xiong, Bei Chen, Xu Sun, Junnan Li

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机学院,北京大学) Peking University(北京大学) Salesforce Research(Salesforce 研究) Independent Researcher(独立研究者)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments ACL 2025 Findings. Code: https://github.com/yaolinli/GenS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00419 2025-09-03 cs.CV 57%

LightVLM: Acceleraing Large Multimodal Models with Pyramid Token Merging and KV Cache Compression

Lianyu Hu, Fanhua Shang, Wei Feng, Liang Wan

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments EMNLP2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏