CrowdCLIP: Unsupervised Crowd Counting via Vision-Language Model
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted by CVPR 2023
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted by CVPR 2023
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted to CVPR 2023
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted by AAAI23
专题命中 VLM训练与架构 :grounding(title,abstract);分类 cs.CV
Comments 11 pages, 4 figures, accepted by Findings of EMNLP 2021
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
Comments CVPR FGVC9 eBay eProduct Visual Search Challenge Rank 1st solution
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
专题命中 VLM训练与架构 :LLaVA(title,comments);分类 cs.CV、cs.AI、cs.LG
Comments Accepted to CVPR2024. Project page: https://vip-llava.github.io/
仅训练投影器就足够
机构 * Ramen VR(拉面VR公司) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.LG
AI总结 该研究探究多模态大语言模型适配新模态是否需微调主干,经实验发现仅训练投影器即可实现强多模态性能,还能避免联合训练导致的语言模型能力漂移,且训练样本吞吐量约为联合训练的两倍,通过多类基准验证了结论。
CoverPrune:基于最优传输的3D视觉语言模型的覆盖驱动型令牌剪枝
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; LIGHTSPEED
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 针对3D VLMs因大量视觉令牌导致的计算瓶颈,提出CoverPrune框架,将剪枝转化为最优传输问题,结合FST成本与SGS算法,实现高效剪枝且性能优异。
Comments Accepted to ECCV 2026 as an Oral Presentation
多模态代码切换:将视觉对象交织入语言以实现显式对象级对齐
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)
专题命中 VLM训练与架构 :multimodal large language model(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.LG
AI总结 针对现有多模态大语言模型的图像级对齐存在指称歧义的问题,提出多模态代码切换(MMCS)范式,构建含77.3万样本的数据集,仅用5万样本即可匹配或超越60万图像-文本对训练的模型,提升了视觉基础与感知能力。
RoRA:面向角色的区域分配,用于多模态大语言模型中的视觉令牌剪枝
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究针对多模态大语言模型视觉令牌剪枝的高开销问题,提出无训练框架RoRA,通过角色导向的区域分配实现高效剪枝,在多个模型系列上优于基线,大幅降低推理时间且保留高准确率。
Comments 9 pages, 4 figures, 4 tables. Code is available at https://github.com/LukieLuu/RoRA
学习在多模态大语言模型(MLLMs)中预测中间层注意力以进行视觉token剪枝
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对MLLMs视觉token剪枝的固定层非最优及计算成本高的问题,提出MAP方法,实现仅保留5.56%视觉token时维持97.5%性能,获3.09倍端到端加速。
是解码格式,而非扰动:审计视觉语言模型测试时扩展的基于一致性的选择
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究发现视觉语言模型测试时的选择效果由解码格式而非扰动决定,提出的扰动基选择(Pgs)在控制格式后无显著收益,说明其无法作为有效选择信号。
HarMoE:基于数据集解耦专家的多源胸部X射线预训练
机构 * University of Bern(伯尔尼大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出HarMoE框架,通过解耦数据集专家从异构胸部X射线数据集学习,提升了放射学视觉-语言模型的零样本分类、分布外迁移等性能,相关代码与87.3万份数据集将公开。
ScaFE:基于大语言模型生成的临床特征程序实现数据高效的瘢痕分类
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 ScaFE将LLM临床知识转化为本地可执行的特征程序,结合轻量级随机森林,在瘢痕分类任务中实现数据高效、跨站点的高性能,且决策可审计,优于现有基线模型。
解耦视觉处理:通过模态特定Transformer替换实现高效多模态适配
机构 * Tsinghua University(清华大学) ; Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对多模态大语言模型视觉指令微调成本高的问题,提出解耦视觉处理框架,替换预训练大语言模型上层解码器为轻量Transformer块,仅训练该块即可在多个基准上实现竞争力性能,降低了计算成本。
推进前填充:能力差距驱动的场景专用遥感多模态大语言模型的训练后处理
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 针对地球观测应用中遥感多模态大语言模型因高质量数据稀缺和能力覆盖不完整难以实现细粒度场景专业化的问题,提出能力差距驱动的推进前填充(FBA)方法,经实验验证其效果优于其他方法,提升了模型在相关基准上的表现。
用于微调CLIP的移位感知校准:利用图像-文本对齐
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 研究针对微调CLIP时预测置信度与准确性不一致问题,提出无需训练的移位感知校准(SAC)方法,利用原始与微调CLIP输出对数差异作校准信号,经实验验证该方法在多数据集和微调方法上提升了校准效果。
冻结的3D CT视觉编码器中的稀疏概念通道
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究3D医学图像解释中视觉语言模型内部单元对临床发现的编码,提出无训练概念通道探测(CCP)方法,通过实验证明该方法能清晰表征冻结医学编码器对发现的表示,在临床疗效和NLG指标上表现优且延迟低。
AnchorPrune:用于视觉令牌剪枝的相关性锚定上下文扩展
机构 * Chung-Ang University(崇实大学)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对大型视觉语言模型推理成本高、视觉令牌冗余问题,提出无需训练的AnchorPrune框架,通过构建相关性锚点并扩展,自适应确定锚点大小,分配预算恢复上下文,提升了模型的准确率与效率,尤其在严重压缩下效果显著。
Comments ECCV 2026
LatentLens: 揭示大语言模型中高度可解释的视觉标记
机构 * University of Cambridge(剑桥大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出 LatentLens 方法,通过将视觉标记与文本语料库中的上下文标记表示进行最近邻匹配,实现视觉标记的可解释性,发现大多数视觉标记在各层均具有可解释性。
Comments ICML 2026 (Camera Ready)
Embodied-R1.5:通过具身基础模型演化物理智能
机构 * Tianjin University(天津大学) ; Tencent Hunyuan(腾讯混元)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.AI、cs.LG
AI总结 提出统一具身基础模型Embodied-R1.5,通过自动化数据管道和多任务平衡强化学习,在8B参数下实现24项基准中16项最优,并支持微调为VLA模型。
Comments Embodied R1.5 technical report. Project page: https://embodied-r.github.io/
混合探针:通过探针在多模态大语言模型中从特权模态学习
机构 * Sony Group Corporation(索尼集团公司) ; Sony AI(索尼人工智能) ; University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.LG
AI总结 研究多模态大语言模型在特权模态设置下的问题,提出混合探针(MoP)框架及MoP跨模态训练(MoP-X),通过结构化探测机制分离模态信号,经评估在多任务中优于基线,有效利用辅助模态训练可提升性能。
Comments Preprint (16 pages)
通过视觉动作结果推理对齐实现物理推理与任务泛化的桥梁
机构 * National Taiwan University(国立台湾大学) ; The University of California, Merced(加州大学默塞德分校)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对视觉语言模型在物理推理中难以泛化的问题,提出VAORA奖励设计,包括视觉对齐奖励和视觉-动作对齐奖励,通过预训练专家估计概率实现平滑密集奖励,经实验验证可有效提升模型在新任务和未见环境中的物理推理性能。
Comments ICML'26 Workshop RLxF: Reinforcement Learning from World Feedback
对抗文本噪声与冗余:熵感知的密集视觉令牌剪枝
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI
AI总结 提出熵感知密集剪枝(EADP)框架,通过熵过滤文本噪声并利用子模最大化选择令牌,在严格预算下保留细粒度视觉线索,提升VLM精度-效率权衡。
Comments Accepted to ECCV 2026
Interact3D: 交互式物体的组合3D生成
机构 * Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; Westlake University(西湖大学) ; Adobe ; Fudan University(复旦大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出Interact3D框架,通过统一3D引导场景、两阶段组合流水线(全局到局部几何对齐和基于SDF的优化)以及闭环智能体修正策略,从单张图像生成物理合理的交互式3D组合物体,解决遮挡和空间关系保持问题。
Comments Accepted to ECCV 2026
惊喜作为可塑性和元认知的信号
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出预测误差信号可作为可塑性门控和元认知基础,在冻结编码器上实现持续学习与视觉语言模型自适应,实验证明其有效性。
快得足以行动:面向低延迟机器人视觉语言模型和视觉语言动作模型的时空视觉令牌融合
机构 * Department of Computer Science(计算机科学系) ; Department of Data Science(数据科学系) ; William & Mary(威廉玛丽学院)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出ST-Merge框架,在视觉编码阶段通过构建3D时空坐标和多队列并行匹配加权聚合机制高效融合冗余令牌,并引入后融合位置校正消除空间偏差,在Qwen2.5-VL上实现2倍推理加速且精度损失仅1%,在π0.5 VLA策略上实现8.3倍加速。