Why are Visually-Grounded Language Models Bad at Image Classification?
专题命中 VLM训练与架构 :VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Published at NeurIPS 2024
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Published at NeurIPS 2024
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project Page: https://choiszt.github.io/Octopus/, Codebase: https://github.com/dongyh20/Octopus
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments ECCV Camera Ready. Code & Data: https://jmiemirza.github.io/Meta-Prompting/
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted at MICCAI 2024, the 27th International Conference on Medical Image Computing and Computer Assisted Intervention
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 8 pages, 4 figures
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
机构 * Project leader(项目负责人)
专题命中 VLM训练与架构 :MLLM(abstract,comments);multimodal large language model(abstract);分类 cs.CV、cs.LG
Comments Accepted by AAAI Conference on Artificial Intelligence (AAAI) 2026. Code available at https://github.com/bcmi/D3ToM-Diffusion-MLLM
机构 * USTC(中国科学技术大学) ; NJU(南京大学) ; THU(清华大学) ; XMU(厦门大学)
专题命中 VLM训练与架构 :MLLM(abstract,comments);multimodal large language model(abstract);分类 cs.CV、cs.LG
Comments Project page: https://github.com/VITA-MLLM/Sparrow
专题命中 VLM训练与架构 :VLM(abstract,comments);vision-language model(abstract);分类 cs.AI、cs.LG
Comments Project page at https://astrazeneca.github.io/vlm/
小型视觉-语言模型在定性力学问题上的评估
机构 * Louisiana State University of New Orleans(新奥尔良路易斯安那州立大学)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.AI
AI总结 本研究评估Gemma-3和Qwen-VL两个多模态模型解读力学问题图像的能力,通过思维链评估其推理过程,对比答案测准确率,为小型视觉-语言模型在定性力学问题上的应用提供评估依据。
Comments 8 pages, 11 figures
Journal ref Proceedings of the IJCAI Workshop on 38th International Workshop on Qualitative Reasoning (QR 2025). 2025
词中结构:用于人类大脑显微镜的弱监督视觉-语言建模
机构 * Institute of Neuroscience and Medicine (INM-1), Research Centre Jülich(神经科学与医学研究所(INM-1),焦耳研究中心) ; Helmholtz AI, Research Centre Jülich(海德堡人工智能研究所,焦耳研究中心) ; Institute for Brain Research, University Hospital Düsseldorf(脑研究所在杜塞尔多夫大学医院) ; Computer Vision, Institute for Computational Visualistics, University of Koblenz(计算机视觉,计算视觉研究所,科布伦茨大学)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
AI总结 本研究提出了一种弱监督视觉-语言建模方法,通过标签介导生成人类大脑显微镜的区域描述,实现了在缺乏配对标注情况下的自然语言生成。
Comments 13 pages, 5 figures, accepted for inclusion at GCPR 2026
SA-GEM:面向高效遥感大视觉语言模型的尺度自适应与地理空间证据调制型令牌剪枝
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
AI总结 本文针对遥感大视觉语言模型高分辨率处理效率低的问题,提出SA-GEM即插即用剪枝框架,通过尺度自适应与地理空间证据调制实现效率与精度提升,在XLRS-Bench上超GeoLLaVA-8K 2.3%且推理提速2.4倍。
门总是关闭:关于向冻结的视觉语言模型注入辅助信号
机构 * University of Doha for Science and Technology(多哈科技大学) ; Pluralis Research(普卢拉利斯研究公司) ; North South University(南北大学)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
AI总结 研究视觉语言模型中辅助信号注入问题,发现优化器常使门控路径关闭。利用抑制现象,通过双曲视觉关系图的几何辅助损失正则化LoRA微调,实验表明该方法能保持关系准确率,还指出嵌入范数对齐及固定注入的必要性。
微调多模态大语言模型用于从短视频中对自闭症行为进行临床级评分
机构 * Stanford University(斯坦福大学) ; University of Hawaii at Manoa(夏威夷大学马诺阿分校) ; University of California San Francisco(加利福尼亚大学旧金山分校)
专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.CV
AI总结 微调Gemini 2.5 Pro模型,从400个临床评分的家庭视频中提取30个行为特征,在99名儿童上实现与临床医生评分的一致性提升40%,并零样本达到53%的自闭症诊断F1提升。
ProactiveBench: 多模态大语言模型主动性的基准测试
机构 * University of Trento(特伦托大学) ; University of Bergamo(贝拉米奥大学) ; Inria Grenoble(格勒诺布尔研究所) ; Bruno Kessler Foundation(布鲁诺·凯斯勒基金会)
专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.CV
AI总结 提出ProactiveBench基准,评估多模态大语言模型在遮挡识别等任务中请求用户干预的主动性,发现模型普遍缺乏主动性且与能力无关,但可通过强化学习微调习得。
Comments Accepted at ECCV 2026
超越当前观测:评估多模态大语言模型在可控非马尔可夫博弈中的表现
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.CV
AI总结 提出RNG-Bench基准套件,通过配对记忆和3D迷宫两个博弈,评估多模态大模型在非马尔可夫环境中重建历史观测并据此行动的能力,发现主要错误源于遗忘而非决策,微调可提升性能。
通过正则化微调实现可域泛化的3D视觉-语言模型适应
机构 * Concordia University(康考迪亚大学)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
AI总结 提出ReFine3D框架,通过选择性层调优、多视图一致性、同义词提示及点渲染视觉监督等正则化策略,提升3D大语言模型在域泛化中的性能。
Comments Accepted at Transactions on Machine Learning Research (TMLR)
在开源视觉语言模型中,什么因素影响杂货产品检索
机构 * AI Graduate Program, University of the Philippines, Diliman, Quezon City(菲律宾大学达林学院人工智能研究生项目) ; EEEI, University of the Philippines, Diliman, Quezon City(菲律宾大学达林学院电子工程系)
专题命中 VLM训练与架构 :vision language model(title);分类 cs.CV
AI总结 本文研究了开源视觉语言模型在杂货产品检索任务中的表现,发现数据质量比规模更重要,高效模型可以胜出,并且存在召回率差距的问题。
Comments Accepted in the 28th International Conference on Pattern Recognition (ICPR 2026)
基于视觉语言模型的指令视频多模态抽象摘要
机构 * Beihang University, Beijing, China(北航大学,北京,中国) ; University of Verona, Italy(威尼斯大学,意大利)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
AI总结 本文提出ClipSum框架,利用冻结的CLIP视觉语言特征进行指令视频摘要,通过显式时间建模和维度自适应融合,实现视觉与语言的语义对齐,实验显示其在YouCook2数据集上表现优于传统方法。
Comments Accepted to ICPR 2026
当否定是在视觉-语言模型中一个几何问题
机构 * ETRO Department, Vrije Universiteit Brussel(布鲁塞尔自由大学ETRO系) ; imec ; Independent Researcher(独立研究员)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
AI总结 本文探讨了视觉-语言模型中否定理解的几何问题,提出基于多模态大语言模型的评估框架,并通过表示工程操控CLIP模型实现否定意识。
Comments Accepted to CVPR (Multimodal Algorithmic Reasoning Workshop) 2026
AutoTraces:通过多模态大语言模型实现自回归轨迹预测
机构 * Southeast University(东南大学)
专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.CV
AI总结 AutoTraces通过多模态大语言模型实现自回归轨迹预测,采用创新的轨迹标记方案和自动链式推理机制,提升长周期预测精度与跨场景泛化能力。
基于扩散模型的人体网格恢复中的群体偏好对齐
机构 * Nanyang Technological University(南洋理工大学) ; HKUST(GZ)(香港科技大学(广州)) ; SenseTime Research(商汤科技研究院) ; A*STAR(新加坡科技研究局)
专题命中 VLM训练与架构 :VLM(title);分类 cs.CV
AI总结 本文提出了一种基于群体偏好的扩散模型微调框架,通过双内存增强的批评代理生成质量评分,提升人体网格恢复的物理合理性和图像一致性。
Comments Accepted to CVPR 2026
从感知到 punchline:通过野生表情包艺术赋能 VLM
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; School of Software Engineering(软件工程学院) ; Columbia Engineering(哥伦比亚工程学院) ; Columbia University(哥伦比亚大学) ; The Chinese University of Hong Kong MMLab(香港中文大学MMLab)
专题命中 VLM训练与架构 :VLM(title);分类 cs.LG
AI总结 HUMOR 通过分层推理和群体偏好对齐,提升 VLM 在多模态生成中的推理多样性与幽默质量。
Comments 46 pages, 20 figures
分支还是层?零阶优化用于视觉-语言模型的持续学习
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
AI总结 本文提出一种基于零阶优化的视觉-语言模型持续学习方法,通过模态感知策略提升模型逃避局部极小值的能力,实验表明在四个基准测试中取得最佳性能。
Comments Published in the Proceedings of the AAAI Conference on Artificial Intelligence (AAAI 2026)
基于视觉大语言模型的新型类别发现
专题命中 VLM训练与架构 :VLM(title);分类 cs.CV
AI总结 基于视觉大语言模型的新型类别发现方法,通过融合视觉-文本语义和原型引导聚类,提升未知类别分类准确率25.3%,并展现对长尾分布的鲁棒性。
Comments 8 pages, 5 figures, conference
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
Comments 16 pages, 6 figures, 15 tables
机构 * Florida Atlantic University(佛罗里达大学) ; University of Southern California(南加州大学) ; University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Utah(犹他大学)
专题命中 VLM训练与架构 :vision language model(title);分类 cs.CV
Comments 10 pages, 6 figures and 4 tables
Journal ref 2025 IEEE International Conference on Big Data (IEEE BigData 2025)
机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) ; ZJU-Angelalign R&D Center for Intelligence Healthcare(浙大天使align智能医疗研发中心) ; Centre for Frontier AI Research (CFAR)(前沿人工智能研究中心) ; Agency for Science, Technology and Research (A*STAR)(科技研究局) ; Institute of High Performance Computing (IHPC)(高性能计算研究所)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) ; Beijing Institute of Technology(北京理工大学) ; Tencent Youtu Lab, Shanghai, China(腾讯优图实验室,中国)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV