BEV-VLM: Trajectory Planning via Unified BEV Abstraction
BEV-VLM:通过统一的鸟瞰抽象进行轨迹规划
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI
AI总结 BEV-VLM通过统一的BEV抽象与VLMs实现高精度轨迹规划,实验显示其在准确性上比现有方法提升53.1%并实现无碰撞。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
BEV-VLM:通过统一的鸟瞰抽象进行轨迹规划
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI
AI总结 BEV-VLM通过统一的BEV抽象与VLMs实现高精度轨迹规划,实验显示其在准确性上比现有方法提升53.1%并实现无碰撞。
通过动态专家跳过加速混合专家多模态大语言模型
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Beihang University(北航) ; Peking University(北京大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 MoDES通过动态专家跳过机制提升多模态大语言模型的推理效率和准确性。
Comments Accepted by CVPR 2026
初始化在视觉-语言模型少量样本适应中的重要性
机构 * Instituto Universitario de Investigación en Tecnología Centrada en el Ser Humano (HUMAN-Tech)(人类中心技术研究所) ; Universitat Politécnica de Valencia(巴塞罗那理工大学) ; Valencian Graduate School and Research Network for Artificial Intelligence (valgrAI)(瓦伦西亚人工智能研究生院和研究网络)
专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV
AI总结 本文提出ZS-MIL方法,通过利用视觉-语言模型的类级嵌入优化分类器初始化,提升少量样本场景下的病理图像分类性能。
Comments Accepted as oral presentation at CASEIB 2024 held in Sevilla, Spain
See-in-Pairs: 用于医学诊断的参考图像引导的比较视觉-语言模型
机构 * Electrical and Computer Engineering Department, The University of British Columbia(不列颠哥伦比亚大学电气与计算机工程系) ; Vector Institute(向量研究所) ; ETH Zurich(苏黎世联邦理工学院) ; Renmin University of China(中国人民大学) ; National University of Singapore(新加坡国立大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
AI总结 See-in-Pairs通过引入参考图像引导的比较机制,提升医学视觉-语言模型的诊断性能,增强样本效率和视觉-文本对齐。
Comments 25 pages, four figures
VLM-DEWM:动态外部世界模型用于制造中的可验证和抗毁视觉语言规划
机构 * School of Intelligent Engineering and Automation(智能工程与自动化学院)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI
AI总结 VLM-DEWM通过动态外部世界模型提升制造中视觉语言规划的可验证性和抗毁性,显著提高状态跟踪精度和恢复成功率。
LQA: 一种轻量级量化自适应框架,用于边缘设备上的视觉-语言模型
机构 * School of Computing(计算机学院) ; Information Systems, University of Melbourne, Melbourne, Australia(信息系统学院,墨尔本大学,澳大利亚墨尔本) ; Faculty of Science, Auckland, New Zealand(科学学院,新西兰奥克兰) ; School of Computing, University of Macquarie, Sydney, Australia(计算机学院,麦考瑞大学,澳大利亚悉尼)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI
AI总结 LQA提出了一种轻量级量化自适应框架,用于在边缘设备上高效部署视觉-语言模型,通过选择性混合量化和无梯度适应机制,提升适应性能并降低内存使用。
Comments 15 pages, 9 figures ,9 tables, preprint
MLLM-CTBench: 一个用于持续指令微调的基准,包含推理过程诊断
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Southeast University(东南大学) ; School of Computing, National University of Singapore(新加坡国立大学计算机学院)
专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI
AI总结 MLLM-CTBench提出一个用于持续指令微调的基准,通过多维评估框架和强化微调方法,分析跨任务知识保留和灾难性遗忘问题。
Comments under review
评估用于低资源语言放射报告生成的视觉语言模型适应
机构 * Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与介入系,辐射物理,生物医学工程,乌梅大学)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV
AI总结 本研究评估了低资源语言中视觉语言模型在放射报告生成中的适应性,发现语言特定模型和领域特定训练能显著提升报告质量。
局部视觉-语言模型能否在视觉转换器上提高活动识别?——新生儿复苏案例研究
机构 * University of Stavanger, Dept. of electrical eng. and computer science(斯塔万格大学电气工程与计算机科学系)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
AI总结 本研究探讨了局部视觉-语言模型在新生儿复苏视频活动识别中的应用,通过LoRA微调提升性能,达到0.91的F1分数,优于TimeSFormer基线。
Comments Presented at the Satellite Workshop on Workshop 15: Generative AI for World Simulations and Communications & Celebrating 40 Years of Excellence in Education: Honoring Professor Aggelos Katsaggelos, IEEE International Conference on Image Processing (ICIP), 2025
K-Sort Eval: 通过校正VLM作为评判者实现视觉生成的高效偏好评估
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of California, Berkeley(加州大学伯克利分校) ; University of California, Santa Barbara(加州大学圣巴巴拉分校) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
AI总结 K-Sort Eval通过后验校正和动态匹配策略,实现高效可靠的视觉生成模型偏好评估。
Comments ICLR 2026. Code is available at: https://github.com/zkkli/K-Sort-Eval
UniFit: 向基于多模态大语言模型引导的语义对齐的通用虚拟试衣迈进
专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 UniFit通过多模态大语言模型引导的语义对齐模块,解决虚拟试衣中语义差距和数据稀缺问题,实现通用且高性能的试衣框架。
Comments accepted to AAAI-2026
当LLaVA遇见物体:用于视觉-语言模型的标记组成
机构 * Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学) ; Max Planck Institute for Informatics, SIC(马克斯·普朗克信息学院,SIC) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)
专题命中 VLM训练与架构 :LLaVA(title,abstract);vision language model(abstract);分类 cs.CV
AI总结 本文提出Mask-LLaVA框架,通过结合多级视觉特征,实现更高效的视觉语言模型,减少标记数量的同时保持性能。
MaD-Mix: 通过潜在空间耦合实现多模态数据混合用于视觉-语言模型训练
机构 * LIONS, EPFL(EPFL 雷奥尼实验室)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.LG
AI总结 MaD-Mix通过潜在空间耦合实现多模态数据混合,提升视觉-语言模型训练效率,减少训练步骤并增强复杂场景下的性能。
PPE:用于多模态大语言模型中token压缩的位置保持嵌入
机构 * Huawei Technologies(华为技术有限公司)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 PPE通过保持位置信息提升多模态大语言模型的token压缩效率和性能
Comments ICLR 2026
理解视觉退化
机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学与电子学(iOPEN)、西北工业大学) ; Honors College, Northwestern Polytechnical University(荣誉学院、西北工业大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; School of Artificial Intelligence, Shanghai Jiaotong University(人工智能学院、上海交通大学)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 本文提出DU-VLM模型,通过结构化奖励强化学习解决视觉退化理解问题,引入大规模数据集并实现高保真图像恢复。
Comments 17 pages
AppleVLM: 端到端自主驾驶与高级感知和规划增强的视觉语言模型
机构 * Shenzhen Key Lab for Advanced Motion Control and Modern Automation Equipments(深圳先进运动控制系统与现代自动化装备重点实验室) ; Guangdong Provincial Key Laboratory of Intelligent Morphing Mechanisms and Adaptive Robotics(广东省智能变形机制与适应机器人省重点实验室) ; School of Intelligence Science and Engineering(智能科学与工程学院) ; Harbin Institute of Technology(哈尔滨工业大学) ; National Key Laboratory of Smart Farm Technologies and Systems(国家智能农业技术与系统重点实验室) ; Autonomous Driving Center(自动驾驶中心) ; Shanghai Utopilot Technology Co.Ltd.(上海驭目科技有限公司)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI
AI总结 AppleVLM通过引入先进的视觉和规划编码器,提升端到端自动驾驶的感知和决策能力,实现复杂环境下的稳健驾驶性能。
相同还是不同?提升视觉语言模型的视觉感知能力
机构 * California Institute of Technology(加州理工学院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
AI总结 TWIN通过引入大规模图像对数据集提升视觉语言模型的细粒度视觉感知能力,显著提高在艺术、动物等未见领域识别性能。
Comments Project webpage: https://glab-caltech.github.io/twin/
VEAttack: 面向大视觉语言模型的下游任务无关视觉编码器攻击
机构 * City University of Hong Kong(香港城市大学) ; University of Sydney(悉尼大学)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV
AI总结 VEAttack是一种针对大视觉语言模型视觉编码器的简单有效攻击方法,通过优化图像令牌降低计算开销,实现对多种下游任务的泛化攻击。
生成引擎优化:一个面向Pinterest获取增长的VLM和代理框架
机构 * Stanford University(斯坦福大学)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI
AI总结 Pinterest提出GEO框架,通过微调VLM和AI代理预测用户搜索需求,构建语义连贯的集合页面,提升生成搜索时代的视觉平台流量增长。
SGHA-Attack:语义引导的层次对齐用于视觉-语言模型的可迁移定向攻击
机构 * Guangdong Province Key Lab of Information Security Technology, and School of Computer Science and Engineering, Sun Yat-sen University(广东信息安全技术重点实验室,计算机科学与工程学院,中山大学) ; Nanyang Technological University(南洋理工大学) ; School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(网络安全科学与技术学院,深圳校区,中山大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
AI总结 SGHA-Attack通过语义引导的层次对齐框架,提升视觉-语言模型的定向转移攻击效果,增强跨异构模型的鲁棒性。
ConsensusDrop:融合视觉与跨模态显著性以提高视觉语言模型的效率
机构 * University of Southern California(南加州大学) ; DEVCOM Army Research Office(陆军研究办公室)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV
AI总结 ConsensusDrop通过融合视觉与跨模态显著性,提高视觉语言模型的效率和准确性,优于现有token修剪方法。
Comments Technical Report
多模态大语言模型高效性中的标记压缩综述
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Xiamen University(厦门大学) ; National University of Singapore(新加坡国立大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; University of Central Florida(佛罗里达大学) ; Salesforce AI Research(Salesforce AI研究) ; Rice University(德克萨斯大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 本文综述了多模态大语言模型中标记压缩技术,分类讨论了图像、视频和音频三种模态的压缩方法及其机制,旨在推动该领域的发展。
Comments For ongoing updates and to track the latest advances in this promising area, we maintain a public repository: https://github.com/cokeshao/Awesome-Multimodal-Token-Compression
DF-LLaVA: 通过知识注入和冲突驱动的自我反思解锁MLLMs用于合成图像检测
机构 * East China Normal University(东华师范大学) ; Sanming University(三明大学) ; The 27th Research Institute of CETC(中国电子科技集团第27研究所)
专题命中 VLM训练与架构 :LLaVA(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 DF-LLaVA通过知识注入和冲突驱动的自我反思,提升MLLMs在合成图像检测中的准确性和可解释性。
Comments Under review
BlindSight: 利用稀疏性提升视觉-语言模型的效率
机构 * Advanced Micro Devices, Inc. (AMD)(先进微器件公司(AMD))
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
AI总结 BlindSight通过引入输入模板感知的注意力稀疏性掩码,显著提升了视觉-语言模型的推理效率,同时保持较高的准确率。
VScan:重新思考视觉标记减少以提高高效的大视觉-语言模型
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Tencent AI Lab(腾讯AI实验室)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
AI总结 VScan通过两阶段视觉标记减少框架提升大视觉-语言模型的推理效率,实现2.91倍预填充加速和10倍FLOPs减少,性能损失仅0.6%
Comments Accepted at TMLR 2026. Project page: https://zhangce01.github.io/VScan/
通过简单的点预测实现像素级VLM感知
专题命中 VLM训练与架构 :VLM(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 SimpleSeg通过简单点预测实现多模态大语言模型的像素级感知,无需复杂架构即可获得高精度分割性能。
将视觉世界编码:通过视觉语言模型从图像到模拟
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV
AI总结 本文研究了视觉语言模型通过Im2Sim方法从图像生成模拟的能力,发现其在复杂系统建模上表现优异,但对细节复制能力有限。
面向自主网络的基于视觉语言模型的优化驱动意图处理
机构 * School of Computing, Queen's University, Ontario, Canada(计算学院,女王大学,安大略,加拿大)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI
AI总结 本文提出IntentOpt基准测试,评估不同视觉语言模型在生成网络优化代码中的性能,发现视觉参数提取和程序化思维提示显著降低执行成功率,开源模型表现低于闭源模型。
Comments Accepted for presentation at The IEEE International Conference on Communications (ICC) 2026
视觉语言模型中用于标记剪枝的注意力去偏
机构 * School of Communication and Information Engineering, Shanghai University(通信与信息工程学院,上海大学) ; School of Computer Science and Engineering, Shanghai University(计算机科学与工程学院,上海大学) ; School of Computer Science and Engineering, Nankai University(计算机科学与工程学院,南开大学)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 本文提出两种轻量有效的注意力去偏技术,用于改进视觉语言模型中基于注意力的标记剪枝,以提升计算效率和模型性能。
频率才是关键:在文本遮蔽时考虑词频有助于视觉-语言模型预训练
机构 * Institute for Computing and Information Sciences(计算与信息科学研究所) ; Radboud University(拉德堡德大学)
专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV
AI总结 本文提出CLIPF方法,通过考虑词频提升视觉-语言模型预训练效果,实验显示其在减少输入token时表现更优。
Comments Accepted by WACV 2026