arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2603.12659 2026-03-16 cs.CV 57%

AVION: Aerial Vision-Language Instruction from Offline Teacher to Prompt-Tuned Network

AVION:从离线教师到提示调优网络的空域视觉-语言指令

Yu Hu, Jianyang Gu, Hao Liu, Yue Cao, Jozsef Hamari, Zheng Liu, Mohsen Zardadi

机构 * The University of British Columbia, Okanagan(不列颠哥伦比亚大学奥克兰分校) The Ohio State University(俄亥俄州立大学) TerraSense Analytics(TerraSense分析)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 AVION提出一种知识蒸馏框架,通过构建语义丰富的文本原型和轻量级提示,提升视觉语言模型在遥感图像中的适应能力,提升少样本分类和跨模态检索性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05869 2026-03-16 cs.CV 57%

PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues

PatchCue: 通过基于补丁的视觉提示增强视觉语言模型推理

Yukun Qi, Pei Fu, Hang Li, Yuhan Liu, Chao Jiang, Bin Qin, Zhenbo Luo, Jian Luan

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PatchCue,一种基于补丁的视觉提示方法,通过两阶段训练提升VLMs的视觉推理能力,在多项任务中表现优于像素级和点级提示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22645 2026-03-16 cs.CV 57%

GeoZero: Incentivizing Reasoning from Scratch on Geospatial Scenes

GeoZero:从零开始激励地理空间场景的推理

Di Wang, Shunyu Liu, Wentao Jiang, Fengxiang Wang, Yi Liu, Xiaolei Qin, Zhiming Luo, Chaoyang Zhou, Haonan Guo, Jing Zhang, Bo Du, Dacheng Tao, Liangpei Zhang

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 GeoZero通过构建两个数据集和A$^2$GRPO方法,使大语言模型在无预定义推理链监督下实现地理空间推理,提升了遥感任务的推理多样性和准确性。

Comments Code, data, and models are available at https://github.com/MiliLab/GeoZero

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12208 2026-03-13 cs.CV 57%

ForensicZip: More Tokens are Better but Not Necessary in Forensic Vision-Language Models

ForensicZip: 更多令牌更好但并非必要在取证视觉-语言模型中

Yingxin Lai, Zitong Yu, Jun Wang, Linlin Shen, Yong Xu, Xiaochun Cao

机构 * Great Bay University(大湾大学) Shenzhen University(深圳大学) Harbin Institute of Technology(哈尔滨工业大学) School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络安全科学与技术学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 ForensicZip通过引入无需训练的框架,从伪造驱动的角度重新定义令牌压缩,利用最优传输问题量化物理不连续性,实现高压缩率下的取证证据分离与高效检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11441 2026-03-13 cs.CV 57%

Detect Anything in Real Time: From Single-Prompt Segmentation to Multi-Class Detection

实时检测任意目标:从单提示分割到多类检测

Mehmet Kerem Turkcan

机构 * Columbia University(哥伦比亚大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 DART通过共享视觉主干网络计算,实现实时多类检测,无需训练,提升速度达25倍,达到80类检测的55.8 AP。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02421 2026-03-13 cs.CV 57%

Generalizing Vision-Language Models with Dedicated Prompt Guidance

通过专用提示引导泛化视觉语言模型

Xinyao Li, Yinjie Min, Hongbo Chen, Zhekai Du, Fengling Li, Jingjing Li

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出GuiDG框架,通过提示微调和跨模态注意力模块提升视觉语言模型的领域泛化能力,并在ImageNet-DG上验证了其有效性。

Comments Accepted to AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09826 2026-03-11 cs.CV 57%

VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models

基于视觉-语言模型的点云地图定位

Shuhao Kang, Youqi Liao, Peijie Wang, Wenlong Liao, Qilin Zhang, Benjamin Busam, Xieyuanli Chen, Yun Liu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 VLM-Loc通过视觉-语言模型的空间推理能力,实现了更准确的文本到点云定位,提升了复杂环境中的定位鲁棒性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09566 2026-03-11 cs.CV 57%

GeoAlignCLIP: Enhancing Fine-Grained Vision-Language Alignment in Remote Sensing via Multi-Granular Consistency Learning

GeoAlignCLIP: 通过多粒度一致性学习增强遥感中的细粒度视觉-语言对齐

Xiao Yang, Ronghao Fu, Zhuoran Duan, Zhiwen Lin, Xueyan Liu, Bo Yang

机构 * College of Computer Science and Technology, Jilin University, Changchun 130012, China(吉林大学计算机科学与技术学院,长春130012,中国) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education Jilin University(教育部符号计算与知识工程重点实验室,吉林大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 GeoAlignCLIP通过多粒度一致性学习提升遥感中细粒度视觉-语言对齐,构建RSFG-100k数据集并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03930 2026-03-11 cs.CV 57%

N-gram Injection into Transformers for Dynamic Language Model Adaptation in Handwritten Text Recognition

基于N-gram注入的Transformer在手写文本识别中的动态语言模型适应

Florent Meyer, Laurent Guichard, Yann Soullard, Denis Coquenet, Guillaume Gravier, Bertrand Coüasnon

机构 * ANTAI, Rennes, France(ANTAI研究院,法国里昂) Univ Rennes, CNRS, IRISA - UMR 6074, Rennes, France(里昂大学,法国国家科学研究中心,IRISA-UMR 6074,法国里昂)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出N-gram注入方法,用于在手写文本识别中动态调整Transformer的语言模型,以应对目标语料分布偏移问题,提升识别精度。

Comments Fix order of authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08921 2026-03-11 cs.CV cs.LG 57%

Vision-Language Models Encode Clinical Guidelines for Concept-Based Medical Reasoning

视觉-语言模型编码临床指南以实现基于概念的医学推理

Mohamed Harmanani, Bining Long, Zhuoxin Guo, Paul F. R. Wilson, Amirhossein Sabour, Minh Nguyen Nhat To, Gabor Fichtinger, Purang Abolmaesumi, Parvin Mousavi

机构 * Queen’s University(女王大学) University of British Columbia(不列颠哥伦比亚大学) McMaster University(麦马斯特大学) Vector Institute(向量研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 MedCBR通过整合临床指南与视觉-语言模型,提升医学影像诊断的可解释性和决策支持能力。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08347 2026-03-10 cs.CV 57%

Local-Global Prompt Learning via Sparse Optimal Transport

通过稀疏最优传输实现局部-全局提示学习

Deniz Kizaroğlu, Ülku Tuncer Küçüktas, Emre Çakmakyurdu, Alptekin Temizel

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 SOT-GLP通过稀疏最优传输实现局部-全局提示学习,提升少样本分类和分布外检测性能。

Comments 9 pages, 3 figures, 4 tables. Code available at GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11549 2026-03-10 cs.CV 57%

ODI-Bench: Can MLLMs Understand Immersive Omnidirectional Environments?

ODI-Bench: MLLMs能否理解沉浸式全向环境?

Liu Yang, Huiyu Duan, Ran Tao, Juntao Cheng, Sijing Wu, Yunhao Li, Jing Liu, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学) Tianjin University(天津大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 ODI-Bench旨在评估多模态大语言模型对全向图像沉浸环境的理解能力,通过定制基准和Omni-CoT方法提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08124 2026-03-10 cs.RO cs.AI cs.LG 57%

SaiVLA-0: Cerebrum--Pons--Cerebellum Tripartite Architecture for Compute-Aware Vision-Language-Action

SaiVLA-0:基于大脑-脑桥-小脑三元架构的计算感知视觉-语言-动作

Xiang Shi, Wenlong Huang, Menglin Zou, Xinhai Sun

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 SaiVLA-0提出基于大脑-脑桥-小脑三元架构的计算感知视觉-语言-动作系统,通过模块化设计提升效率与稳定性,初步实验显示训练时间减少且成功率显著提升。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10932 2026-03-10 cs.CR cs.AI cs.RO 57%

DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models

DropVLA: 对视觉-语言-动作模型的行动级后门攻击

Zonghuan Xu, Jiayu Li, Yunhan Zhao, Xiang Zheng, Xingjun Ma, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身AI研究院,复旦大学) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身AI重点实验室) City University of Hong Kong(香港城市大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 DropVLA是一种针对视觉-语言-动作模型的行动级后门攻击,通过有限的数据污染实现对特定动作的精准操控,验证了在现实环境中的有效性。

Comments 8 pages, 6 tables, 3 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05202 2026-03-10 cs.CV 57%

SPEX: A Vision-Language Model for Land Cover Extraction on Spectral Remote Sensing Images

SPEX:一种用于光谱遥感图像土地覆盖提取的视觉-语言模型

Dongchen Si, Di Wang, Erzhong Gao, Xiaolei Qin, Liu Zhao, Jing Zhang, Minqiang Xu, Jianbo Zhan, Jianshe Wang, Lin Liu, Bo Du, Liangpei Zhang

机构 * College of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) iFlytek Co., Ltd.(iFlytek公司) National Engineering Research Center of Speech and Language Information Processing(语音与语言信息处理国家工程研究中心) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) National Engineering Research Center for Multimedia Software(多媒体软件国家工程研究中心) Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University(湖北省多媒体与网络通信工程重点实验室,武汉大学) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(测绘遥感信息工程国家重点实验室,武汉大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 SPEX是一种专为光谱遥感图像土地覆盖提取设计的多模态视觉-语言模型,通过多尺度特征聚合和多光谱视觉预训练等技术,实现了精确的像素级解释和可解释的预测生成。

Comments Accepted to IEEE TGRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07343 2026-03-10 cs.LG cs.AI 57%

Learning Concept Bottleneck Models from Mechanistic Explanations

从机制解释学习概念瓶颈模型

Antonio De Santis, Schrasing Tong, Marco Brambilla, Lalana Kagal

机构 * Politecnico di Milano(米兰理工大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出机制CBM模型,通过从黑盒模型自身学习的概念构建瓶颈层,提升模型的可解释性和预测性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06958 2026-03-10 cs.LG cs.CL 57%

Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards

Chart-RL: 通过可验证奖励的强化学习实现通用图表理解

Xin Zhang, Xingyu Li, Rongguang Wang, Ruizhong Miao, Zheng Wang, Dan Roth, Chenyang Li

机构 * Oracle AI

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 Chart-RL通过可验证奖励的强化学习提升图表理解能力,在多个基准测试中超越监督微调,展现强大的泛化和迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05732 2026-03-09 cs.CV 57%

From Phase Grounding to Intelligent Surgical Narratives

从相位接地到智能手术叙述

Ethan Peterson, Huixin Zhan

机构 * New Mexico Institute of Mining and Technology(新墨西哥矿业技术研究所)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出基于CLIP的多模态框架,通过自动创建手术时间线和叙述,减少手动标注的需要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03580 2026-03-05 cs.CV 57%

An Effective Data Augmentation Method by Asking Questions about Scene Text Images

通过提问场景文本图像来实现有效的数据增强方法

Xu Yao, Lei Kang

机构 * Computer Vision Center, Barcelona, Spain(巴塞罗那计算机视觉中心)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出了一种基于问答的场景文本数据增强方法,通过生成字符级问题提升OCR模型的推理能力,实验表明在WordArt和Esposalles数据集上有效降低了CER和WER。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02959 2026-03-04 cs.CV 57%

Semi-Supervised Few-Shot Adaptation of Vision-Language Models

视觉-语言模型的半监督少样本适应

Julio Silva-Rodríguez, Ender Konukoglu

机构 * Computer Vision Lab, ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院计算机视觉实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种半监督方法,通过传播文本引导的伪标签来提升视觉-语言模型在极低样本情况下的适应性能,减少标注工作量超过50%。

Comments Code: https://github.com/jusiro/SS-Text-U

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12678 2026-03-03 cs.CV 57%

$β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment

$β$-CLIP:多粒度视觉-语言对齐的文本条件对比学习

Fatimah Zohra, Chen Zhao, Hani Itani, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(卡布斯大学科学与技术研究院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 $β$-CLIP通过多粒度文本条件对比学习提升视觉-语言对齐,实现从完整描述到短语的层次化对齐,改进细粒度和长文本检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08919 2026-03-03 cs.CV cs.LG 57%

PHyCLIP: $\ell_1$-Product of Hyperbolic Factors Unifies Hierarchy and Compositionality in Vision-Language Representation Learning

PHyCLIP通过$\ell_1$-Product度量结合双曲因子,统一了视觉-语言表示学习中的层次结构与组合性

Daiki Yoshikawa, Takashi Matsubara

机构 * Hokkaido University(北海道大学) CyberAgent

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 PHyCLIP通过$\ell_1$-Product度量结合双曲因子,统一了视觉-语言表示学习中的层次结构与组合性。

Comments 24 pages. Codes are available at https://github.com/tksmatsubara/PHyCLIP

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01029 2026-03-03 cs.CV 57%

Vision-Language Feature Alignment for Road Anomaly Segmentation

视觉-语言特征对齐用于道路异常分割

Zhuolin He, Jiacheng Tang, Jian Pu, Xiangyang Xue

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑启发智能科学与技术研究院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 VL-Anomaly通过结合视觉-语言模型的语义先验,提出了一种新的道路异常分割框架,有效提升异常检测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00842 2026-03-03 cs.CL 57%

MedGPT-oss: Training a General-Purpose Vision-Language Model for Biomedicine

MedGPT-oss: 为生物医学训练一个通用的视觉-语言模型

Kai Zhang, Zhengqing Yuan, Cheng Peng, Songlin Zhao, Mengxian Lyu, Ziyi Chen, Yanfang Ye, Wei Liu, Ying Zhang, Kaleb E Smith, Lifang He, Lichao Sun, Yonghui Wu

机构 * Department of Computer Science and Engineering, Lehigh University(莱斯大学计算机科学与工程系) Department of Computer Science and Engineering, University of Notre Dame(圣母大学计算机科学与工程系) Department of Health Outcomes & Biomedical Informatics, University of Florida(佛罗里达大学健康结果与生物医学信息学系) Department of Radiation Oncology, Mayo Clinic(梅奥诊所放射肿瘤科) Research Computing, University of Florida(佛罗里达大学研究计算中心) AI Technology Center, NVIDIA(NVIDIA人工智能技术中心)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 MEDGPT-oss是一款开放式权重的200亿参数视觉-语言模型,通过优化训练课程实现多模态和文本推理能力,适用于隐私保护的临床AI研究。

Comments Technical report, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23607 2026-03-03 cs.CV 57%

Concerto: Joint 2D-3D Self-Supervised Learning Emerges Spatial Representations

Concerto:联合2D-3D自监督学习产生空间表示

Yujia Zhang, Xiaoyang Wu, Yixing Lao, Chengyao Wang, Zhuotao Tian, Naiyan Wang, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 Concerto通过联合2D-3D自监督学习,产生更连贯的信息空间表示,优于现有SOTA模型并在多个基准上取得新成就。

Comments NeurIPS 2025, produced by Pointcept, project page: https://pointcept.github.io/Concerto

Journal ref Neural Information Processing Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14362 2026-03-03 cs.CV 57%

DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning

DeepEyes: 通过强化学习激励'图像思考'

Ziwei Zheng, Michael Yang, Jack Hong, Chenxiao Zhao, Guohai Xu, Le Yang, Chao Shen, Xing Yu

机构 * Xiaohongshu Inc.(小红书公司) Xi’an Jiaotong University(西安交通大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 DeepEyes通过强化学习实现图像引导的推理,无需预训练数据,提升多模态任务性能。

Comments Accepted by ICLR2026. Ziwei, Michael, Jack, and Chenxiao are equal-contribution. The list order is random

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03566 2026-03-03 cs.CV cs.LG 57%

CLIP Behaves like a Bag-of-Words Model Cross-modally but not Uni-modally

CLIP 表现得像一个词袋模型但不是单模态的

Darina Koishigarina, Arnas Uselis, Seong Joon Oh

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 CLIP表现出词袋模型特性,但其属性-对象绑定信息已单模态编码,通过简单线性变换可提升性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18897 2026-02-27 cs.CV 57%

Thinking Beyond Labels: Vocabulary-Free Fine-Grained Recognition using Reasoning-Augmented LMMs

超越标签:基于推理增强的LMMs的无词汇细粒度识别

Dmitry Demidov, Zaigham Zaheer, Zongyan Han, Omkar Thawakar, Rao Anwer

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 FiNDR通过推理增强的LMMs实现无词汇细粒度识别,提出三步流程生成候选标签、过滤排名并构建轻量级分类器,取得显著性能提升。

Journal ref CVPR 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03594 2026-02-26 cs.CV 57%

TIPS Over Tricks: Simple Prompts for Effective Zero-shot Anomaly Detection

TIPS Over Tricks: 简单提示用于有效的零样本异常检测

Alireza Salehi, Ehsan Karami, Sepehr Noey, Sahand Noey, Makoto Yamada, Reshad Hosseini, Mohammad Sabokrou

机构 * University of Tehran(塔里哈大学) Amirkabir University of Technology(阿米尔卡比尔技术大学) Okinawa Institute of Science and Technology(冲绳科学技术大学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出TIPS模型,通过改进的backbone和解耦提示策略,在无需复杂模块的情况下提升零样本异常检测的图像和像素级性能。

Comments This is the extended version of the paper accepted in ICASSP'26, which will be publicly available in May. Authors' contributions may vary among the versions

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01552 2026-02-26 cs.CV 57%

Variation-aware Vision Token Dropping for Faster Large Vision-Language Models

面向变化的视觉令牌丢弃以加速更大的视觉-语言模型

Junjie Chen, Xuyang Liu, Zichen Wen, Yiyu Wang, Siteng Huang, Honggang Chen

机构 * Sichuan University(四川大学) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Zhejiang University(浙江大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出V²Drop方法,通过动态令牌变化机制在LVLM推理中减少令牌数量,提升计算效率,同时保持任务性能。

Comments Accepted by CVPR 2026. Code is available at \url{https://github.com/xuyang-liu16/V2Drop}

详情

展开后加载摘要…

URL PDF HTML 收藏