Empirical Recipes for Efficient and Compact Vision-Language Models
高效紧凑视觉-语言模型的实证配方
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 本文通过实证分析识别了紧凑视觉-语言模型的瓶颈,提出优化配方显著降低延迟并保持精度,同时引入ArgusVLM模型家族在多种基准上表现优异。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
高效紧凑视觉-语言模型的实证配方
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 本文通过实证分析识别了紧凑视觉-语言模型的瓶颈,提出优化配方显著降低延迟并保持精度,同时引入ArgusVLM模型家族在多种基准上表现优异。
VL-RouterBench:一种用于视觉-语言模型路由的基准测试
机构 * Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(1 图像处理与模式识别研究所,上海交通大学) ; The Hong Kong University of Science and Technology (Guangzhou)(2 香港科学与技术大学(广州)) ; The Hong Kong University of Science and Technology(3 香港科学与技术大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG
AI总结 本文提出VL-RouterBench,用于系统评估视觉-语言模型路由系统的能力,通过构建质量与成本矩阵,评估10种路由方法并发现显著的路由改进空间,揭示了路由架构改进的潜力。
Comments CVPR 2026 Accepted
IOSVLM:一种用于从牙科内窥扫描进行统一牙科诊断的3D视觉-语言模型
机构 * ZJU-UIUC Institute, Zhejiang University, Haining, 314400, China(浙大浙ICU研究所,浙江大学,海宁,314400,中国) ; Stomatology Hospital, School of Stomatology, Zhejiang University School of Medicine, Hangzhou, 310058, China(口腔医院,口腔医学院,浙江大学医学院,杭州,310058,中国) ; Angelalign Research Institute, Angel Align Inc., Shanghai, 200011, China(天使对齐研究院,天使对齐公司,上海,200011,中国)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 本文提出IOSVLM,一种端到端的3D视觉-语言模型,利用点云表示内窥扫描,并结合大规模多源数据集,提升牙科诊断和生成式视觉问答的性能。
通过分布条件扩散解码从预训练视觉-语言模型生成高保真的文本到图像
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) ; Microsoft Research Asia (MSRA)(微软亚洲研究院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG
AI总结 本文提出一种基于扩散解码的框架,通过训练仅需扩散解码器即可提升图像保真度,利用分布加权代码向量增强视觉质量,仅需ImageNet-1K短训练即可改进VQ-VAE重建和文本到图像生成。
GraphVLM:多模态图学习的视觉语言模型基准测试
机构 * NYU Shanghai(纽约大学上海分校) ; New York University(纽约大学) ; Rice University(休斯顿大学) ; East China Normal University(华东师范大学)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG
AI总结 GraphVLM通过三种范式评估视觉语言模型在多模态图学习中的能力,发现VLM-as-Predictor在性能上表现最佳,展示了其在多模态图学习中的潜力。
Comments CVPR 2026
DriveCritic: 向基于情境的、与人类对齐的自动驾驶评估迈进:基于视觉-语言模型
机构 * University of Michigan(密歇根大学) ; NVIDIA(英伟达) ; Fudan University(复旦大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 DriveCritic通过结合视觉-语言模型和情境意识,提升自动驾驶系统评估的准确性与人类对齐性。
Comments Accepted at ICRA 2026; 8 pages, 3 figures
UniWeTok: 一种具有 $2^{128}$ 大小代码本的统一二进制分词器用于统一多模态大语言模型
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 UniWeTok通过大规模二进制代码本和改进的训练框架,实现统一多模态大语言模型的高效视觉表示。
Comments 29 pages, 9 figures, 33 tables
WebAccessVL: 为网页可访问性而设计的违反意识VLM
机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 WebAccessVL通过基于违规的VLM自动修正网页HTML,显著减少可访问性违规,提升网页可访问性与视觉一致性。
VLMQ:基于令牌显著性的后训练量化用于视觉-语言模型
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 VLMQ通过显著性驱动的后训练量化方法,针对视觉-语言模型的激活特性优化量化过程,实现低比特下的高性能压缩。
保持索引的轻量级标记修剪用于视觉-语言模型中的高效文档理解
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种轻量级标记修剪方法,通过过滤非信息性背景区域来降低视觉-语言模型在文档理解任务中的计算成本,同时保持较高的准确性。
Comments Accepted to ICLR 2026 Workshop MM Intelligence
VLM-Pruner: 为高效VLM离心令牌剪枝范式中的空间稀疏性引入缓冲
机构 * Zhejiang University(浙江大学) ; Huawei Technologies(华为技术)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 VLM-Pruner通过平衡冗余与空间稀疏性,提升VLMs的效率和性能。
Comments Accepted by CVPR2026
NoLan: 通过动态抑制语言先验来缓解大视觉-语言模型中的对象幻觉
机构 * National University of Singapore, Singapore(新加坡国立大学) ; Peking University Shenzhen Graduate School, China(北京大学深圳研究生院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI
AI总结 NoLan通过动态抑制语言先验缓解大视觉-语言模型中的对象幻觉问题,有效提升模型准确性。
Comments Code: https://github.com/lingfengren/NoLan
BEAT:通过对比触发学习对基于VLM的具身代理进行视觉后门攻击
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 BEAT通过对比触发学习在基于VLM的具身代理中实现视觉后门攻击,提升后门激活精度至39%。
Comments ICLR 2026. Project Page: https://zqs1943.github.io/BEAT/
通过注意力驱动的自我压缩进行视觉标记减少以提高高效多模态大语言模型的效率
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI
AI总结 通过注意力驱动的自我压缩方法,有效减少多模态大语言模型中的视觉标记,提升计算效率并保持模型性能。
Comments 2025 IEEE International Conference on Big Data (BigData)
弥合道路激光雷达的模态差距:一种无需训练的视觉-语言模型框架用于车辆分类
机构 * Department of Civil Engineering, City College of New York(城市学院土木工程系) ; Department of Computer Science, City College of New York(城市学院计算机科学系)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG
AI总结 本文提出一种无需训练的视觉-语言模型框架,用于解决道路激光雷达中稀疏点云与密集图像之间的模态差距问题,实现细粒度车辆分类。
Comments 12 pages, 10 figures, 4 tables
VidVec:解锁视频MLLM嵌入用于视频-文本检索
专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 VidVec通过利用预训练MLLM的中间层嵌入和校准头部,实现无需训练的视频-文本检索,超越现有方法,达到最佳性能。
Comments Project page: https://iyttor.github.io/VidVec/
探测大型视觉-语言模型中的知觉恒常性
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Emory University(埃默里大学) ; University of Washington(华盛顿大学) ; University of California San Diego(加州大学圣地亚哥分校) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Southern California(南加州大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; Shanghai Jiao Tong University(上海交通大学) ; East China Normal University(华东师范大学) ; Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Michigan(密歇根大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 本文研究了大型视觉-语言模型在颜色、大小和形状恒常性任务中的表现,发现模型在不同任务上的性能存在显著差异。
Comments Under Review
自适应全局与细粒度感知融合用于兼容硬负样本放大的人脸嵌入
机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,智能科学与技术学院,北京大学) ; Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)
专题命中 VLM训练与架构 :MLLM(title,abstract);VLM(abstract);分类 cs.CV、cs.LG
AI总结 本文提出AGFF-Embed方法,通过自适应融合全局和细粒度语义信息,提升多模态嵌入在一般和细粒度理解上的性能。
通过视觉标记修剪实现多模态大语言模型的快慢高效训练
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.LG
AI总结 DualSpeed通过快慢双模式实现多模态大语言模型的高效训练,提升训练速度并保持性能
基于VLM的经验回放
机构 * Nvidia Research(英伟达研究)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出利用VLMs指导经验回放,提升强化学习中样本效率和成功率。
稀疏快捷键:促进多模态大语言模型中的高效融合
机构 * Guangdong-Hong Kong-Macao Joint Laboratory for Emotion Intelligence and Pervasive Computing, Artificial Intelligence Research Institute, Shenzhen MSU-BIT University, Shenzhen(粤港澳大湾区情感智能与 pervasive 计算联合实验室,人工智能研究院,深圳MSU-BIT大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 SparseCut通过稀疏快捷连接和多粒度特征融合模块,提升多模态大语言模型在跨模态融合中的效率和性能。
SocialFusion: 解决预训练视觉-语言模型中的社会退化问题
机构 * Northeastern University(东北大学) ; Amazon.com, Inc.(亚马逊公司)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 SocialFusion通过统一框架解决预训练视觉-语言模型中的社会退化问题,实现跨社会任务的正迁移并提升整体性能。
Comments 22 pages, 10 figures. Published in Transactions on Machine Learning Research (TMLR)
Journal ref Transactions on Machine Learning Research, 2026
LLaVA-PruMerge: 适应性令牌减少用于高效的大多模态模型
机构 * UCF(佛罗里达大学) ; UW-Madison(威斯康星大学麦迪逊分校) ; USC(南加州大学) ; UIC(伊利诺伊大学香槟分校)
专题命中 VLM训练与架构 :LLaVA(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
AI总结 LLaVA-PruMerge通过自适应视觉令牌减少策略,显著降低视觉令牌数量而不影响性能,适用于高效的大多模态模型。
Comments Accepted to ICCV 2025. First Version is released in 2024/03
多模态大语言模型去敏中的视觉引导关键标记正则化
机构 * The University of Melbourne(墨尔本大学) ; Google Research(谷歌研究) ; Hong Kong Baptist University(香港 Baptist 大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.LG
AI总结 本文提出视觉引导的关键标记正则化方法,用于多模态大语言模型的去敏,通过信息熵定义关键标记并利用梯度重新加权提升去敏效果,实验表明能有效减少遗忘并保持响应一致性。
ReVision:一个用于隐私保护任务导向视觉指令重写的数据集和基线VLM
机构 * School of Information(信息学院) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Department of Statistics and Data Science(统计与数据科学系) ; Yale University(耶鲁大学) ; School of Computing and Augmented Intelligence(计算与增强智能学院)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 ReVision提出一个数据集和基线VLM,通过将多模态指令转换为纯文本命令,实现轻量级设备端指令重写,提升隐私保护的多模态AI应用能力。
Comments In Proceedings of the IJCNLP-AACL 2025
子空间对齐用于视觉-语言模型测试时适应
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 SubTTA通过子空间对齐提升视觉-语言模型测试时适应性能,有效解决模态差距和视觉噪声问题。
Comments 17 pages, 10 figures
V-Agent:一种利用视觉-语言模型的交互式视频搜索系统
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 V-Agent通过多智能体协作和视觉-语言模型提升视频搜索性能,实现多模态交互与零样本性能。
Comments CIKM 2025 MMGENSR Workshop
重新思考微调:解锁视觉-语言模型中的隐藏能力
机构 * College of Engineering, Northeastern University(东北大学工程学院) ; Khoury College of Computer Science, Northeastern University(东北大学计算机科学学院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG
AI总结 本文提出基于MFT的结构重参数化方法,通过重新组织VLMs内部子网络实现高效微调,超越LoRA和全微调,无需改变骨干网络。
层级感知的视觉-语言模型微调
机构 * University of Washington(华盛顿大学) ; Intel(英特尔)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种高效的层级感知微调框架,通过结合树路径KL散度和层级兄弟平滑交叉熵,提升视觉-语言模型在结构化分类任务中的性能。
IPCV:信息保留的多模态大语言模型视觉编码器压缩
机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) ; CityU(城市大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; University of Sheffield(谢菲尔德大学) ; SCU(上海科技大学) ; FDU(福建大学) ; SYSU(南方科技大学)
专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 IPCV通过邻居引导重建和注意力稳定化技术,实现无需训练的多模态大语言模型视觉编码器高效压缩,有效降低计算成本并提升性能。
Comments 13 pages, 6 figures