arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5084 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5084 篇

2505.05626 2025-07-03 cs.CV cs.AI 62%

Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models

Aarti Ghatkesar, Ganesh Venkatesh

机构 * AppliedML, Cerebras(应用机器学习,Cerebras)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00469 2025-07-02 cs.CV cs.LG 62%

Bisecle: Binding and Separation in Continual Learning for Video Language Understanding

Yue Tan, Xiaoqian Hu, Hao Xue, Celso De Melo, Flora D. Salim

机构 * School of Computer Science University of New South Wales(计算机科学学院新南威尔士大学) School of Computer Science and Engineering University of New South Wales(计算机科学与工程学院新南威尔士大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments 23 pages, 12 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23044 2025-07-02 cs.CV cs.AI 62%

Ovis-U1 Technical Report

Guo-Hua Wang, Shanshan Zhao, Xinjie Zhang, Liangfu Cao, Pengxin Zhan, Lunhao Duan, Shiyin Lu, Minghao Fu, Xiaohao Chen, Jianshan Zhao, Yang Li, Qing-Guo Chen

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV、cs.AI

Comments An unified model for multimodal understanding, text-to-image generation, and image editing. GitHub: https://github.com/AIDC-AI/Ovis-U1

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13949 2025-07-02 cs.CV cs.AI 62%

SMoLoRA: Exploring and Defying Dual Catastrophic Forgetting in Continual Visual Instruction Tuning

Ziqi Wang, Chang Che, Qi Wang, Yangyang Li, Zenglin Shi, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学) Academy of Cyber(网络学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22494 2025-07-01 cs.RO cs.CV cs.LG 62%

DriveBLIP2: Attention-Guided Explanation Generation for Complex Driving Scenarios

Shihong Ling, Yue Wan, Xiaowei Jia, Na Du

机构 * School of Computing and Information, University of Pittsburgh(计算与信息学院,匹兹堡大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025. 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19225 2025-06-25 cs.CV cs.AI 62%

Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification

Minghao Qin, Xiangrui Liu, Zhengyang Liang, Yan Shu, Huaying Yuan, Juenjie Zhou, Shitao Xiao, Bo Zhao, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Shanghai Jiao Tong University(上海交通大学) University of Trento(特伦特大学) Renmin University of China(中国人民大学) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV、cs.AI

Comments 12 pages, 5 Figure, 3 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11976 2025-06-24 cs.CV cs.LG 62%

How Visual Representations Map to Language Feature Space in Multimodal LLMs

Constantin Venhoff, Ashkan Khakzar, Sonia Joseph, Philip Torr, Neel Nanda

机构 * University of Oxford(牛津大学) McGill University(麦吉尔大学) Meta

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17514 2025-06-18 cs.LG cs.AI cs.CL 62%

SAE-V: Interpreting Multimodal Models for Enhanced Alignment

Hantao Lou, Changye Li, Jiaming Ji, Yaodong Yang

机构 * Institute for AI, Peking University, Beijing, China(人工智能研究院,北京大学,北京,中国) State Key Laboratory of General Artificial Intelligence, Institute for AI, Peking University, Beijing, China(通用人工智能国家重点实验室,人工智能研究院,北京大学,北京,中国)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21264 2025-06-18 cs.CV cs.AI 62%

LARP: Tokenizing Videos with a Learned Autoregressive Generative Prior

Hanyu Wang, Saksham Suri, Yixuan Ren, Hao Chen, Abhinav Shrivastava

机构 * University of Maryland, College Park(马里兰大学 College Park 分校)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments ICLR 2025. Project page: https://hywang66.github.io/larp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13705 2025-06-17 cs.LG cs.AI 62%

TimeMaster: Training Time-Series Multimodal LLMs to Reason via Reinforcement Learning

Junru Zhang, Lang Feng, Xu Guo, Yuhan Wu, Yabo Dong, Duanqing Xu

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13679 2025-06-17 cs.RO cs.AI cs.CV 62%

ROSA: Harnessing Robot States for Vision-Language and Action Alignment

Yuqing Wen, Kefan Gu, Haoxuan Liu, Yucheng Zhao, Tiancai Wang, Haoqiang Fan, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) Dexmal

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01426 2025-06-17 cs.CV cs.CL cs.LG 62%

Unifying Specialized Visual Encoders for Video Language Models

Jihoon Chung, Tyler Zhu, Max Gonzalez Saez-Diez, Juan Carlos Niebles, Honglu Zhou, Olga Russakovsky

机构 * Department of Computer Science, Princeton University, Princeton, NJ, United States(普林斯顿大学计算机科学系) Salesforce Research, Palo Alto, CA, United States(Salesforce研究)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.LG

Comments Accepted to ICML 2025 as a Poster. Project page: https://tylerzhu.com/merv/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10997 2025-06-10 cs.CL cs.AI cs.CV 62%

RONA: Pragmatically Diverse Image Captioning with Coherence Relations

Aashish Anantha Ramakrishnan, Aadarsh Anantha Ramakrishnan, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) National Institute of Technology, Tiruchirappalli(特里奇里帕利理工学院)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted in the NAACL Fourth Workshop on Intelligent and Interactive Writing Assistants (In2Writing), Albuquerque, New Mexico, May 2025, https://in2writing.glitch.me

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00142 2025-06-10 cs.CV cs.AI cs.CL 62%

Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features

Chancharik Mitra, Brandon Huang, Tianning Chai, Zhiqiu Lin, Assaf Arbelle, Rogerio Feris, Leonid Karlinsky, Trevor Darrell, Deva Ramanan, Roei Herzig

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06542 2025-06-09 cs.CV cs.AI 62%

ARMOR: Empowering Multimodal Understanding Model with Interleaved Multimodal Generation Capability

Jianwen Sun, Yukang Feng, Chuanhao Li, Fanrui Zhang, Zizhen Li, Jiaxin Ai, Sizhuo Zhou, Yu Dai, Shenglin Zhang, Kaipeng Zhang

机构 * Nankai University(南开大学) Shanghai Innovation Institute(上海创新研究院) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04706 2025-06-06 cs.CV cs.AI 62%

Line of Sight: On Linear Representations in VLLMs

Achyuta Rajaram, Sarah Schwettmann, Jacob Andreas, Arthur Conmy

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03190 2025-06-05 cs.CV cs.AI 62%

MINT: Memory-Infused Prompt Tuning at Test-time for CLIP

Jiaming Yi, Ruirui Pan, Jishen Yang, Xiulong Yang

机构 * School of Computer, Central China Normal University(中央财经大学计算机学院) Amazon(亚马逊)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02726 2025-06-04 cs.CL cs.AI cs.LG 62%

RACE-Align: Retrieval-Augmented and Chain-of-Thought Enhanced Preference Alignment for Large Language Models

Qihang Yan, Xinyu Zhang, Luming Guo, Qi Zhang, Feifan Liu

机构 * ShanghaiTech University(上海科技大学) Henan University(河南大学) Liaoning University of Traditional Chinese Medicine(辽宁中医药大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00102 2025-06-03 cs.LG cs.AI cs.CL 62%

Curriculum Learning with Quality-Driven Data Selection

Biao Wu, Ling Chen

机构 * Australian Artificial Intelligence Institute(澳大利亚人工智能研究所)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23271 2025-05-30 cs.CV cs.LG 62%

LADA: Scalable Label-Specific CLIP Adapter for Continual Learning

Mao-Lin Luo, Zi-Hao Zhou, Tong Wei, Min-Ling Zhang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Accepted at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07688 2025-05-29 cs.CV cs.AI 62%

ImageRAG: Enhancing Ultra High Resolution Remote Sensing Imagery Analysis with ImageRAG

Zilun Zhang, Haozhan Shen, Tiancheng Zhao, Zian Guan, Bin Chen, Yuhao Wang, Xu Jia, Yuxiang Cai, Yongheng Shang, Jianwei Yin

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Binjiang Research Institute of Zhejiang University(浙江大学滨江研究院) School of Software Engineering of Zhejiang University(浙江大学软件工程学院) Polytechnic Institute of Zhejiang University(浙江大学 polytechnic 院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by IEEE Geoscience and Remote Sensing Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20100 2025-05-27 cs.CV cs.AI 62%

AdaTP: Attention-Debiased Token Pruning for Video Large Language Models

Fengyuan Sun, Leqi Shen, Hui Chen, Sicheng Zhao, Jungong Han, Guiguang Ding

机构 * School of Software, Tsinghua University(清华大学软件学院) BNRist, Tsinghua University(清华大学BNRist) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20029 2025-05-27 q-bio.NC cs.AI cs.LG 62%

Correlating instruction-tuning (in multimodal models) with vision-language processing (in the brain)

Subba Reddy Oota, Akshett Jindal, Ishani Mondal, Khushbu Pahwa, Satya Sai Srinath Namburi, Manish Shrivastava, Maneesh Singh, Bapi S. Raju, Manish Gupta

机构 * Technische Universität Berlin(柏林技术大学) IIIT Hyderabad(海得拉巴国家理工学院) Univ of Maryland(马里兰大学) Rice Univ(Rice 大学) Univ of Wisconsin - Madison(威斯康星大学麦迪逊分校) Spector Inc(Spector 公司) Microsoft(微软公司)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.AI、cs.LG

Comments 30 pages, 22 figures, The Thirteenth International Conference on Learning Representations, ICLR-2025, Singapore. https://openreview.net/pdf?id=xkgfLXZ4e0

Journal ref ICLR-2025, Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18605 2025-05-27 cs.CV cs.AI 62%

Rethinking Causal Mask Attention for Vision-Language Inference

Xiaohuan Pei, Tao Huang, YanXiang Ma, Chang Xu

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00577 2025-05-27 cs.AI cs.CL cs.LG 62%

Understanding Multimodal LLMs Under Distribution Shifts: An Information-Theoretic Approach

Changdae Oh, Zhen Fang, Shawn Im, Xuefeng Du, Yixuan Li

机构 * Changdae Oh Zhen Fang Shawn Im Xuefeng Du Yixuan Li

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

Comments ICML 2025 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18434 2025-05-27 cs.CV cs.AI 62%

TNG-CLIP:Training-Time Negation Data Generation for Negation Awareness of CLIP

Yuliang Cai, Jesse Thomason, Mohammad Rostami

机构 * University of Southern California(南加州大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16363 2025-05-23 cs.LG cs.AI stat.ML 62%

AdamS: Momentum Itself Can Be A Normalizer for LLM Pretraining and Post-training

Huishuai Zhang, Bohan Wang, Luoxin Chen

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王宣计算机技术研究所) University of Science and Technology of China(中国科学技术大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14726 2025-05-22 eess.IV cs.AI cs.CV 62%

MedBLIP: Fine-tuning BLIP for Medical Image Captioning

Manshi Limbu, Diwita Banerjee

机构 * George Mason University(乔治·马歇尔大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14246 2025-05-21 cs.CV cs.AI 62%

Visual Agentic Reinforcement Fine-Tuning

Ziyu Liu, Yuhang Zang, Yushan Zou, Zijian Liang, Xiaoyi Dong, Yuhang Cao, Haodong Duan, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Wuhan University(武汉大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

Comments project url: https://github.com/Liuziyu77/Visual-RFT/tree/main/Visual-ARFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13840 2025-05-21 cs.CL cs.AI cs.LG 62%

EfficientLLM: Efficiency in Large Language Models

Zhengqing Yuan, Weixiang Sun, Yixin Liu, Huichi Zhou, Rong Zhou, Yiyang Li, Zheyuan Zhang, Wei Song, Yue Huang, Haolong Jia, Keerthiram Murugesan, Yu Wang, Lifang He, Jianfeng Gao, Lichao Sun, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) Lehigh University(莱斯大学) Imperial College London(伦敦帝国理工学院) Rutgers University(罗格斯大学) International Business Machines Corporation (IBM)(国际商业机器公司(IBM)) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Microsoft Research(微软研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏