arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-28 至 2025-10-28 共收录 88 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 24 篇

2510.21794 2025-10-28 cs.CV cs.AI 86%

Token-Level Inference-Time Alignment for Vision-Language Models

Kejia Chen, Jiawen Zhang, Jiacong Hu, Kewei Gao, Jian Lou, Zunlei Feng, Mingli Song

机构 * Zhejiang University(浙江大学) Sun Yat-sen University(中山大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22702 2025-10-28 cs.AI cs.CV cs.ET eess.IV 84%

Atlas Urban Index: A VLM-Based Approach for Spatially and Temporally Calibrated Urban Development Monitoring

Mithul Chander, Sai Pragnya Ranga, Prathamesh Mayekar

机构 * Propheus

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

Comments An abridged version of this paper will be presented at and appear in the Proceedings of ACM IKDD CODS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22571 2025-10-28 cs.CV cs.AI cs.MM 84%

STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models

Mahiro Ukai, Shuhei Kurita, Nakamasa Inoue

机构 * Institute of Science Tokyo(东京科学研究所) National Institute of Informatics(日本信息处理学会)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21740 2025-10-28 cs.CV cs.AI cs.CL 84%

Diagnosing Bottlenecks in Data Visualization Understanding by Vision-Language Models

Alexa R. Tartaglini, Satchel Grant, Daniel Wurgaft, Christopher Potts, Judith E. Fan

机构 * Department of Computer Science(计算机科学系) Department of Psychology(心理学系) Department of Linguistics(语言学系) Stanford University(斯坦福大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21757 2025-10-28 cs.CV 83%

Agro-Consensus: Semantic Self-Consistency in Vision-Language Models for Crop Disease Management in Developing Countries

Mihir Gupta, Pratik Desai, Ross Greer

机构 * The Harker School(哈克尔学校) University of California, Merced(加州大学默塞德分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23566 2025-10-28 cs.CV 83%

Uni-MuMER: Unified Multi-Task Fine-Tuning of Vision-Language Model for Handwritten Mathematical Expression Recognition

Yu Li, Jin Jiang, Jianhua Zhu, Shuai Peng, Baole Wei, Yuxuan Zhou, Liangcai Gao

机构 * Wangxuan Institute of Computer Technology, Peking University(计算机技术研究院,北京大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025 as a spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22641 2025-10-28 cs.LG cs.AI 81%

FastVLM: Self-Speculative Decoding for Fast Vision-Language Model Inference

Divya Jyoti Bajpai, Manjesh Kumar Hanawal

机构 * Dept. of IEOR, IIT Bombay(工业工程与运营研究系,印度理工学院班加罗尔)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.AI、cs.LG

Comments Accepted for presentation at the main Conference IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22127 2025-10-28 cs.CV cs.LG 81%

Mint: A Simple Test-Time Adaptation of Vision-Language Models against Common Corruptions

Wenxuan Bao, Ruxi Deng, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21879 2025-10-28 cs.CV cs.AI 76%

TernaryCLIP: Efficiently Compressing Vision-Language Models with Ternary Weights and Distilled Knowledge

Shu-Hao Zhang, Wei-Cheng Tang, Chen Wu, Peng Hu, Nan Li, Liang-Jie Zhang, Qi Zhang, Shao-Qun Zhang

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(新型软件技术国家重点实验室) Microsoft AI(微软人工智能)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22370 2025-10-28 cs.RO cs.AI cs.CV cs.LG cs.SE 75%

BLIP-FusePPO: A Vision-Language Deep Reinforcement Learning Framework for Lane Keeping in Autonomous Vehicles

Seyed Ahmad Hosseini Miangoleh, Amin Jalal Aghdasian, Farzaneh Abdollahi

机构 * Department of Electrical Engineering, Amirkabir University of Technology (Tehran Polytechnic)(电气工程系,阿米尔卡比尔技术大学(德黑兰理工大学))

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments https://github.com/Amin-A96/BLIP-FusePPO-A-Vision-Language-Deep-Reinforcement-Learning-Framework-for-Lane-Keeping-in-Autonomous.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22443 2025-10-28 cs.CV cs.LG 73%

Benchmarking Egocentric Multimodal Goal Inference for Assistive Wearable Agents

Vijay Veerabadran, Fanyi Xiao, Nitin Kamra, Pedro Matias, Joy Chen, Caley Drooff, Brett D Roads, Riley Williams, Ethan Henderson, Xuanyi Zhao, Kevin Carlberg, Joseph Tighe, Karl Ridgeway

机构 * Meta Reality Labs(Meta 现实实验室) Meta FAIR

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

Comments Accepted as a spotlight paper at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23203 2025-10-28 cs.CV 70%

DecoDINO: 3D Human-Scene Contact Prediction with Semantic Classification

Lukas Bierling, Davide Pasero, Fleur Dolmans, Helia Ghasemi, Angelo Broere

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20819 2025-10-28 cs.CV cs.AI cs.LG 67%

Towards General Modality Translation with Contrastive and Predictive Latent Diffusion Bridge

Nimrod Berman, Omkar Joglekar, Eitan Kosman, Dotan Di Castro, Omri Azencot

机构 * Bosch AI Center(博世人工智能中心) Ben-Gurion University of the Negev(巴伊兰大学) Technical University of Munich(慕尼黑技术大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted as a poster at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21835 2025-10-28 cs.LG cs.AI cs.CL cs.CV 67%

A Multimodal, Multitask System for Generating E Commerce Text Listings from Images

Nayan Kumar Singh

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 24 pages, 10 figures, 11 tables. Code can be found at: https://github.com/SinghNayanKumar/multimodal-product-lister/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21808 2025-10-28 cs.CV cs.AI 62%

Semantic Relation-Enhanced CLIP Adapter for Domain Adaptive Zero-Shot Learning

Jiaao Yu, Mingjie Han, Jinkun Jiang, Junyu Dong, Tao Gong, Man Lan

机构 * School of Computer Science and Technology, East China Normal University, China(东华大学计算机科学与技术学院) College of Computer Science and Technology, Ocean University of China, China(中国海洋大学计算机科学与技术学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21806 2025-10-28 cs.CV cs.AI 62%

Frame-Difference Guided Dynamic Region Perception for CLIP Adaptation in Text-Video Retrieval

Jiaao Yu, Mingjie Han, Tao Gong, Jian Zhang, Man Lan

机构 * School of Computer Science and Technology, East China Normal University, China(上海师范大学计算机科学与技术学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08010 2025-10-28 cs.CV cs.AI 62%

Vision Transformers Don't Need Trained Registers

Nick Jiang, Amil Dravid, Alexei Efros, Yossi Gandelsman

机构 * UC Berkeley(伯克利大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Project page and code: https://avdravid.github.io/test-time-registers. Accepted to NeurIPS '25 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16503 2025-10-28 cs.CV 57%

Noise Diffusion for Enhancing Semantic Faithfulness in Text-to-Image Synthesis

Boming Miao, Chunxiao Li, Xiaoxiao Wang, Andi Zhang, Rui Sun, Zizhe Wang, Yao Zhu

机构 * Beijing Normal University(北京师范大学) University of Chinese Academy of Sciences(中国科学院大学) University of Manchester(曼彻斯特大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Updated author formatting; no substantive changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22994 2025-10-28 cs.CV 57%

SceneDecorator: Towards Scene-Oriented Story Generation with Scene Planning and Scene Consistency

Quanjian Song, Donghao Zhou, Jingyu Lin, Fei Shen, Jiaze Wang, Xiaowei Hu, Cunjian Chen, Pheng-Ann Heng

机构 * Monash University(莫纳什大学) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学) South China University of Technology(华南理工大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025; Project Page: https://lulupig12138.github.io/SceneDecorator

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21864 2025-10-28 cs.CL cs.AI 57%

DeepOmni: Towards Seamless and Smart Speech Interaction with Adaptive Modality-Specific MoE

Hang Shao, Heting Gao, Yunhang Shen, Jiawei Chen, Zuwei Long, Dong Yang, Ke Li, Xing Sun

机构 * Tencent(腾讯) Fudan University(复旦大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16188 2025-10-28 cs.CV 57%

Think or Not Think: A Study of Explicit Thinking in Rule-Based Visual Reinforcement Fine-Tuning

Ming Li, Jike Zhong, Shitian Zhao, Yuxiang Lai, Haoquan Zhang, Wang Bill Zhu, Kaipeng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) University of Southern California(南加州大学) Emory University(埃默里大学) Chinese University of Hong Kong(香港中文大学)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

Comments Neurips 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20625 2025-10-28 cs.CV 57%

T2ICount: Enhancing Cross-modal Understanding for Zero-Shot Counting

Yifei Qian, Zhongliang Guo, Bowen Deng, Chun Tong Lei, Shuai Zhao, Chun Pong Lau, Xiaopeng Hong, Michael P. Pound

机构 * University of Nottingham(诺丁汉大学) University of St Andrews(圣安德鲁大学) City University of Hong Kong(香港城市大学) Nanyang Technology University(南洋理工大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21817 2025-10-28 cs.RO cs.CL cs.LG 57%

VITA-E: Natural Embodied Interaction with Concurrent Seeing, Hearing, Speaking, and Acting

Xiaoyu Liu, Chaoyou Fu, Chi Yan, Chu Wu, Haihan Gao, Yi-Fan Zhang, Shaoqi Dong, Cheng Qian, Bin Luo, Xiuyong Yang, Guanwu Li, Yusheng Cai, Yunhang Shen, Deqiang Jiang, Haoyu Cao, Xing Sun, Caifeng Shan, Ran He

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯云图实验室) CASIA(中国科学院自动化研究所) Fourier Intelligence Inc.(傅里叶智能公司)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.LG

Comments Homepage: https://lxysl.github.io/VITA-E/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07019 2025-10-28 cs.CV 57%

A Vision-Language Foundation Model for Leaf Disease Identification

Khang Nguyen Quoc, Lan Le Thi Thu, Luyl-Da Quach

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 4 篇

2507.22828 2025-10-28 cs.CV cs.AI 81%

CapRecover: A Cross-Modality Feature Inversion Attack Framework on Vision Language Models

Kedong Xiu, Sai Qian Zhang

机构 * New York University(纽约大学)

专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

Comments 9 pages, accepted by the 2025 ACM Multimedia Conference. Code is available at https://jus1mple.github.io/Image2CaptionAttack

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08222 2025-10-28 cs.CV cs.AI cs.CY cs.HC 81%

Refusal as Silence: Gendered Disparities in Vision-Language Model Responses

Sha Luo, Sang Jung Kim, Zening Duan, Kaiping Chen

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22141 2025-10-28 cs.CV cs.CL cs.LG cs.RO eess.IV 62%

LOC: A General Language-Guided Framework for Open-Set 3D Occupancy Prediction

Yuhang Gao, Xiang Xiang, Sheng Zhong, Guoyou Wang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17313 2025-10-28 cs.LG 57%

Disentanglement Beyond Static vs. Dynamic: A Benchmark and Evaluation Framework for Multi-Factor Sequential Representations

Tal Barami, Nimrod Berman, Ilan Naiman, Amos H. Hason, Rotem Ezra, Omri Azencot

机构 * Faculty of Computer and Information Science(计算机与信息科学学院) Ben-Gurion University of the Negev(贝加尔-内盖夫大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

Comments Accepted for the Thirty-ninth Annual Conference on Neural Information Processing Systems Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏