arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5095 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5095 篇

2507.00990 2026-05-14 cs.RO cs.AI cs.CV 79%

Robotic Manipulation by Imitating Generated Videos Without Physical Demonstrations

通过模仿生成视频实现机器人操作

Shivansh Patel, Shraddhaa Mohan, Hanlin Mai, Unnat Jain, Svetlana Lazebnik, Yunzhu Li

机构 * UIUC(伊利诺伊大学香槟分校) UC Irvine(加州大学尔湾分校) Columbia University(哥伦比亚大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出RIGVid系统,通过模仿AI生成视频使机器人完成复杂操作任务,无需物理示范或特定机器人训练。系统利用视频扩散模型生成潜在示范视频,并通过视觉语言模型筛选符合指令的视频,再通过6D姿态跟踪器提取轨迹并映射到机器人。实验表明生成视频效果与真实示范相当,且性能随生成质量提升。

Comments In ICLR 2026. Website: https://rigvid-robot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10762 2026-05-12 cs.CV cs.AI 79%

GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs

GridProbe: 为长视频VLMs中的自适应测试时间计算进行后验探测

Mohamed Eltahir, Lama Ayash, Ali Habibullah, Tanveer Hussain, Naeemullah Khan

机构 * King Abdullah University of Science and Technology (KAUST)(卡尔斯塔德大学科学与技术学院) Department of Computer Science, Edge Hill University(埃奇希尔大学计算机科学系)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.AI

AI总结 GridProbe通过后验探测方法在无需训练的情况下选择相关帧,减少注意力成本,同时保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01402 2026-05-12 cs.CL cs.CV cs.LG 79%

Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression

通过强化学习为深度不平衡回归注入分布意识

Yao Du, Shanshan Song, Xiaomeng Li

机构 * The Hong Kong University of Science(香港科学与技术大学)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出基于组相对策略优化的分布感知强化学习框架,通过一致性相关系数奖励实现跨样本关系监督,提升长尾回归任务的分布对齐能力,在中等和少样本场景下表现优异。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19219 2026-05-12 cs.CV cs.AI 79%

Selective LoRA for Visual Tokens and Attention Heads

选择性LoRA用于视觉标记和注意力头

Tiange Luo, Lajanugen Logeswaran, Jaekyeom Kim, Justin Johnson, Honglak Lee

机构 * University of Michigan(密歇根大学) LG AI Research(LG人工智能研究)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Image-LoRA,通过选择性更新视觉标记和注意力头,减少参数和计算量,同时保持纯文本前向传递不变,在视觉定位任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07019 2026-05-11 cs.CV cs.AI 79%

LensVLM: Selective Context Expansion for Compressed Visual Representation of Text

LensVLM:压缩文本视觉表示的选取性上下文扩展

Roy Xie, Dan Friedman, Donghan Yu, Bowen Pan, Christopher Fifty, Jang-Hyun Kim, Xianzhi Du, Zhe Gan, Vivek Rathod, Bhuwan Dhingra

机构 * Apple(苹果公司) Duke University(杜克大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 LensVLM通过选择性上下文扩展提升压缩视觉表示的准确性,在4.3倍压缩下表现优异,且在多模态任务中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00347 2026-05-04 cs.LG cs.AI cs.CL 79%

Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning

Odysseus:通过强化学习扩展VLMs以实现游戏中的100+回合决策

Chengshuai Shi, Wenzhe Li, Xinran Liang, Yizhou Lu, Wenjia Yang, Ruirong Feng, Seth Karten, Ziran Yang, Zihan Ding, Gabriel Sarch, Danqi Chen, Karthik Narasimhan, Chi Jin

机构 * Princeton Language and Intelligence(普林斯顿语言与智能实验室) Princeton University(普林斯顿大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过强化学习训练VLMs进行长回合决策,提出轻量级回合级批评机改进训练稳定性,利用预训练VLMs提升样本效率,引入Odysseus框架在多个游戏层级取得显著进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27251 2026-03-31 cs.CV cs.AI 79%

Zero-shot Vision-Language Reranking for Cross-View Geolocalization

跨视图地理定位的零样本视觉-语言重排序

Yunus Talha Erzurumlu, John E. Anderson, William J. Shuart, Charles Toth, Alper Yilmaz

机构 * The Ohio State University(俄亥俄州立大学) US Army Corps of Engineers Geospatial Research Lab(美国陆军工程兵团地理空间研究实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出两阶段框架,利用零样本视觉语言模型进行重排序,通过对比实验发现基于成对比较的策略能有效提升跨视图地理定位的Top-1准确率。

Comments 7 pages, 4 figures. Accepted to XXV ISPRS Congress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14493 2026-03-17 cs.CV cs.CL cs.LG 79%

Fine-tuning MLLMs Without Forgetting Is Easier Than You Think

对多模态大语言模型进行微调而不遗忘比你想象的更容易

He Li, Yuhui Zhang, Xiaohan Wang, Kaifeng Lyu, Serena Yeung-Levy

专题命中 VLM训练与架构 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 本文通过实验框架展示,简单调整微调方法可缓解灾难性遗忘,提出数据混合训练策略解决特定任务过拟合问题,并证明该方法可扩展至持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12707 2026-03-16 cs.LG cs.AI cs.DC 79%

Cost-Efficient Multimodal LLM Inference via Cross-Tier GPU Heterogeneity

通过跨层级GPU异构性实现高效的多模态大语言模型推理

Donglin Yu

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过跨层级GPU异构性优化多模态大语言模型推理,减少跨设备传输复杂度,提升吞吐量并降低部署成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21609 2026-03-11 cs.CV cs.LG 79%

VLCE: A Knowledge-Enhanced Framework for Image Description in Disaster Assessment

VLCE:一种用于灾害评估图像描述的知识增强框架

Md. Mahfuzur Rahman, Kishor Datta Gupta, Marufa Kamal, Fahad Rahman, Sunzida Siddique, Ahmed Rafi Hasan, Mohd Ariful Haque, Roy George

机构 * Clark Atlanta University(克拉克亚特兰大大学) BRAC University(布拉克大学) United International University(国际联合大学) Daffodil International University(花王国际大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.LG

AI总结 VLCE通过整合知识图谱提升灾害影像描述的准确性和领域相关性,其在RescueNet上优于QwenVL基线。

Comments 28 pages, 30 figures, 1 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22391 2026-02-17 cs.CV cs.AI 79%

Top-Down Semantic Refinement for Image Captioning

自上而下语义细化用于图像描述生成

Jusheng Zhang, Kaitong Cai, Jing Yang, Jian Wang, Chengpei Tang, Keze Wang

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 自上而下语义细化通过高效MCTS算法提升图像描述生成的性能与质量

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08713 2026-02-10 cs.CV cs.LG 79%

Towards Understanding Multimodal Fine-Tuning: Spatial Features

迈向多模态微调的理解:空间特征

Lachin Naghashyar, Hunar Batra, Ashkan Khakzar, Philip Torr, Ronald Clark, Christian Schroeder de Witt, Constantin Venhoff

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文通过分阶段模型差分技术,揭示了多模态微调过程中视觉特征如何形成及空间关系编码,提升了多模态训练的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17215 2026-01-06 cs.LG cs.AI cs.CR 79%

How to make Medical AI Systems safer? Simulating Vulnerabilities, and Threats in Multimodal Medical RAG System

如何使医疗AI系统更安全?在多模态医疗RAG系统中模拟漏洞和威胁

Kaiwen Zuo, Zelin Liu, Raman Dutt, Ziyang Wang, Zhongtian Sun, Fan Mo, Pietro Liò

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MedThreatRAG框架,通过模拟攻击环境揭示医疗RAG系统漏洞,展示跨模态冲突注入对系统性能的严重影响。

Comments Sumbitted to 2026 ICASSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12701 2025-12-16 cs.CV cs.CL cs.LG 79%

Efficient Vision-Language Reasoning via Adaptive Token Pruning

通过自适应令牌修剪实现高效的视觉语言推理

Xue Li, Xiaonan Song, Henry Hu

机构 * Scholar42(学者42) InfiniPouch LLC(InfiniPouch公司) Labelbox, Inc.(Labelbox公司)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本研究提出自适应令牌修剪方法,通过动态保留关键令牌提升视觉语言模型的推理效率和稳定性,减少计算量并保持精度。

Comments 10 pages, 3 figures. Expanded version of an extended abstract accepted at NeurIPS 2025 Workshop on VLM4RWD. Presents methodology and preliminary experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11350 2025-12-15 cs.CV cs.AI 79%

Surveillance Video-Based Traffic Accident Detection Using Transformer Architecture

基于监控视频的交通事故检测使用变换器架构

Tanu Singh, Pranamesh Chakraborty, Long T. Truong

机构 * Department of Civil Engineering, Indian Institute of Technology Kanpur(印度理工学院坎浦尔分校土木工程系) School of Computing, Engineering and Mathematical Sciences, La Trobe University(拉特罗布大学计算科学与工程数学科学学院)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于变换器架构的交通事故检测模型,利用预提取的空间视频特征和运动线索,通过卷积与变换器结合提升检测准确率至88.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01293 2025-11-19 cs.CV cs.AI 79%

GMAT: Grounded Multi-Agent Clinical Description Generation for Text Encoder in Vision-Language MIL for Whole Slide Image Classification

Ngoc Bui Lam Quang, Nam Le Nguyen Binh, Thanh-Huy Nguyen, Le Thien Phuc Nguyen, Quan Nguyen, Ulas Bagci

机构 * AI VIETNAM(AI越南) Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) PTIT Northwestern University(西北大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

Comments Acccepted in MICCAI Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17047 2025-11-11 cs.CV cs.AI 79%

Controllable Hybrid Captioner for Improved Long-form Video Understanding

Kuleen Sasse, Efsun Sarioglu Kayi, Arun Reddy

机构 * Johns Hopkins University Applied Physics Laboratory(约翰霍普金斯大学应用物理实验室)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24491 2025-09-30 cs.CV cs.AI 79%

Mitigating Visual Hallucinations via Semantic Curriculum Preference Optimization in MLLMs

Yuanshuai Li, Yuping Yan, Junfeng Tang, Yunxuan Li, Zeqi Zheng, Yaochu Jin

机构 * School of Engineering, Westlake University, Hangzhou, China(西湖大学工程学院) School of Cyberspace Security, Nanjing University of Science and Technology, Nanjing, China(南京理工大学网络安全学院)

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18688 2025-06-17 cs.CR cs.AI cs.LG 79%

Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment

Soumya Suvra Ghosal, Souradip Chakraborty, Vaibhav Singh, Tianrui Guan, Mengdi Wang, Alvaro Velasquez, Ahmad Beirami, Furong Huang, Dinesh Manocha, Amrit Singh Bedi

机构 * University of Maryland(马里兰大学) Indian Institute of Technology Bombay(印度班加罗尔理工学院) Princeton University(普林斯顿大学) University of Colorado Boulder(科罗拉多大学博尔德分校) Capital One(Capital One公司) University of Central Florida(佛罗里达中央大学)

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01818 2025-05-13 cs.CV cs.AI 79%

Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs

Qizhe Zhang, Aosong Cheng, Ming Lu, Renrui Zhang, Zhiyong Zhuo, Jiajun Cao, Shaobo Guo, Qi She, Shanghang Zhang

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机科学学院,北京大学) ByteDance(字节跳动) Intel Labs China(英特尔中国实验室) CUHK MMLab(香港中文大学MMLab)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

Comments 18 pages, 9 figures, code: https://github.com/Theia-4869/VisPruner, project page: https://theia-4869.github.io/VisPruner

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12902 2025-04-16 cs.AI cs.CL cs.LG 79%

IAA: Inner-Adaptor Architecture Empowers Frozen Large Language Model with Multimodal Capabilities

Bin Wang, Chunyu Xie, Dawei Leng, Yuhui Yin

专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14672 2025-03-20 cs.CV cs.AI 79%

FiVL: A Framework for Improved Vision-Language Alignment through the Lens of Training, Evaluation and Explainability

Estelle Aflalo, Gabriela Ben Melech Stan, Tiep Le, Man Luo, Shachar Rosenman, Sayak Paul, Shao-Yen Tseng, Vasudev Lal

专题命中 VLM训练与架构 :vision language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01709 2025-03-19 cs.CV cs.AI 79%

MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders

Jiajun Cao, Yuan Zhang, Tao Huang, Ming Lu, Qizhe Zhang, Ruichuan An, Ningning MA, Shanghang Zhang

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09925 2025-02-17 cs.CV cs.AI 79%

TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types

Jiankang Chen, Tianke Zhang, Changyi Liu, Haojie Ding, Yaya Shi, Feng Cheng, Huihui Xiao, Bin Wen, Fan Yang, Tingting Gao, Di Zhang

专题命中 VLM训练与架构 :visual language model(abstract);LLaVA(abstract);InternVL(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19702 2025-02-13 cs.CV cs.AI cs.MM 79%

TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning

Xiangyu Zeng, Kunchang Li, Chenting Wang, Xinhao Li, Tianxiang Jiang, Ziang Yan, Songze Li, Yansong Shi, Zhengrong Yue, Yi Wang, Yali Wang, Yu Qiao, Limin Wang

专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICLR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02268 2025-01-07 cs.CV cs.AI 79%

What Kind of Visual Tokens Do We Need? Training-free Visual Token Pruning for Multi-modal Large Language Models from the Perspective of Graph

Yutao Jiang, Qiong Wu, Wenhao Lin, Wei Yu, Yiyi Zhou

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13800 2024-11-18 cs.CV cs.AI 79%

Dense Connector for MLLMs

Huanjin Yao, Wenhao Wu, Taojiannan Yang, YuXin Song, Mengxi Zhang, Haocheng Feng, Yifan Sun, Zhiheng Li, Wanli Ouyang, Jingdong Wang

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 27 pages, NeurIPS 2024

Journal ref NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20566 2024-10-01 cs.CV cs.CL cs.LG 79%

MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning

Haotian Zhang, Mingfei Gao, Zhe Gan, Philipp Dufter, Nina Wenzel, Forrest Huang, Dhruti Shah, Xianzhi Du, Bowen Zhang, Yanghao Li, Sam Dodge, Keen You, Zhen Yang, Aleksei Timofeev, Mingze Xu, Hong-You Chen, Jean-Philippe Fauconnier, Zhengfeng Lai, Haoxuan You, Zirui Wang, Afshin Dehghan, Peter Grasch, Yinfei Yang

专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16832 2024-07-23 cs.CL cs.AI cs.CV 79%

Cross-Modal Projection in Multimodal LLMs Doesn't Really Project Visual Attributes to Textual Space

Gaurav Verma, Minje Choi, Kartik Sharma, Jamelle Watson-Daniels, Sejoon Oh, Srijan Kumar

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted at ACL 2024 (Main, Short)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.14161 2022-10-26 cs.CV cs.AI 79%

Aligning MAGMA by Few-Shot Learning and Finetuning

Jean-Charles Layoun, Alexis Roger, Irina Rish

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);visual language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by the Montreal AI Symposium conference in 2022

详情

展开后加载摘要…

URL PDF HTML 收藏