BEV-VLM: Trajectory Planning via Unified BEV Abstraction
BEV-VLM:通过统一的鸟瞰抽象进行轨迹规划
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI
AI总结 BEV-VLM通过统一的BEV抽象与VLMs实现高精度轨迹规划,实验显示其在准确性上比现有方法提升53.1%并实现无碰撞。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
BEV-VLM:通过统一的鸟瞰抽象进行轨迹规划
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI
AI总结 BEV-VLM通过统一的BEV抽象与VLMs实现高精度轨迹规划,实验显示其在准确性上比现有方法提升53.1%并实现无碰撞。
量化专家:基于专家混合的令牌感知自适应误差重建用于大视觉-语言模型量化
机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) ; Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) ; Xi’an Jiaotong University(西安交通大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出Quant Experts,通过令牌感知的专家混合方法,提升大视觉-语言模型在量化过程中的任务准确性,保持与全精度模型相当的性能。
Comments 13 pages, 6 figures, including appendix, Accepted at CVPR 2026
pFedMMA: 为视觉-语言模型设计的个性化联邦微调多模态适配器
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG
AI总结 pFedMMA通过多模态适配器实现视觉-语言模型的个性化联邦微调,平衡个性化与泛化能力,优于现有方法。
形状与上下文:考察人类与AI之间的模糊日文字符识别差距
机构 * CyberAgent
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 本研究通过比较人类与VLMs在模糊日文字符识别中的决策模式,揭示了形状上下文对人类与AI对齐的影响。
Comments Accepted to CHI 2026 Poster track
HiDrop:通过晚期注入、凹形金字塔剪枝和早期退出实现MLLM中的层次视觉令牌减少
机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究所,东部技术研究所) ; Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiao Tong University(上海交通大学) ; Munich Center for Machine Learning, LMU Munich(慕尼黑大学机器学习中心,慕尼黑大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 HiDrop通过晚期注入、凹形金字塔剪枝和早期退出机制,实现多模态大语言模型中视觉令牌的高效减少,提升训练效率并保持性能。
Comments Accepted to ICLR 2026
赋能小型视觉语言模型进行动态记忆与探索
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 DyME通过动态选择记忆与探索策略,提升小型视觉语言模型的推理能力。
Comments Accepted by ICLR 2026
足迹引导的无示例持续病理报告生成
机构 * Faculty of Informatics and Data Science, University of Regensburg, Germany(信息学与数据科学学院,雷根萨大学) ; Indian Institute of Information Technology Bhopal, India(比哈尔信息学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出一种无示例的持续学习框架,通过构建紧凑的领域足迹实现WSI到报告的生成,支持生成性重放并适应变化的临床报告规范。
统一的生成与理解模型能否在不同输出模态间保持语义等价性?
机构 * Tencent Youtu Lab(腾讯云图实验室) ; Xiamen University(厦门大学) ; Computing Lab, Department of Artificial Intelligence, School of Informatics(计算实验室,人工智能系,信息学院)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 本研究探讨统一生成与理解模型在不同输出模态间保持语义等价性的能力,发现其在视觉回答任务中存在性能下降问题,原因在于跨模态语义对齐的失效。
Comments Equal contribution by Jie Li
SPATIALALIGN: 视频生成中动态空间关系的对齐
机构 * College of Computing(计算学院) ; Data Science, Nanyang Technological University, 50 Nanyang Avenue, Singapore 639798(数据科学,南洋理工大学,50 Nanyang Avenue,新加坡639798)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
AI总结 SPATIALALIGN通过引入DSR-SCORE和DPO方法,提升文本到视频生成中动态空间关系的对齐能力。
Comments Project page: https://fengming001ntu.github.io/SpatialAlign/
通过跨模态对齐增强CLIP鲁棒性
机构 * University of Science and Technology of China(中国科学技术大学) ; Nanyang Technological University(南洋理工大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 COLA通过跨模态对齐提升CLIP对抗鲁棒性,有效缓解对抗扰动导致的特征不一致问题,提升零样本分类性能。
Comments NeurIPS 2025 Spotlight
稀疏性强制:强化多模态大语言模型的token稀疏性
机构 * AIML, University of Adelaide, Australia(AIML,澳大利亚阿德莱德大学) ; ZIP Lab, Zhejiang University, China(浙江工业大学ZIP实验室) ; University of Sydney, Australia(悉尼大学) ; Monash University, Australia(墨尔本大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG
AI总结 本文提出Sparsity Forcing方法,通过强化学习框架在多模态大语言模型中提升token稀疏性,实现75%的token减少与极小的精度损失。
Comments Accepted by ICLR 2026
FAVLA:一种力适应的快速-慢速VLA模型用于接触丰富的机械臂操作
机构 * University of Science and Technology of China(中国科学技术大学) ; Xi'an Jiaotong University(西安交通大学) ; Central South University(中南大学)
专题命中 VLM训练与架构 :VLM(abstract)
AI总结 FAVLA通过解耦慢感知规划与快速接触感知控制,提升接触丰富任务中的反应性和成功率。