Shape and Texture Recognition in Large Vision-Language Models
大规模视觉-语言模型中的形状与纹理识别
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
AI总结 研究发现大规模视觉-语言模型在识别抽象形状和纹理时表现不足,而人类和简单网络表现更佳。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
大规模视觉-语言模型中的形状与纹理识别
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
AI总结 研究发现大规模视觉-语言模型在识别抽象形状和纹理时表现不足,而人类和简单网络表现更佳。
看不见的偏见:预规范MLLM中规范差异如何导致视觉信息丢失
机构 * Peking University(北京大学) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Xi’an Jiaotong University(西安交通大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队)
专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 本文揭示了预规范MLLM中规范差异导致的视觉信息丢失问题,并提出通过插入层规范层来解决这一问题,提升模型整体能力。
使基于VLM微调的鲁棒少样本识别得以验证
机构 * University of Macau(澳门大学) ; Texas A&M University(德克萨斯A&M大学) ; Institute of Collaborative Innovation(协同创新研究所)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 本文提出VEST框架,通过验证启用的分阶段微调策略,解决少样本识别中验证数据不足的问题,提升模型在ID和OOD数据上的泛化能力。
Comments Project website: https://hannawang09.github.io/projects/vest/
MiniGPT-5:通过生成性vokens实现交错的视觉-语言生成
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) ; University of California, Santa Barbara(加州大学圣芭芭拉分校)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 MiniGPT-5通过生成性vokens实现交错的视觉-语言生成,显著提升多模态生成任务的性能。
轨迹密集化与基于视角的模糊深度估计
机构 * College of Optical Science and Engineering(光学科学与工程学院) ; Zhejiang University(浙江大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出了一种基于视角模糊和密集轨迹的深度估计方法,利用视觉-语言模型和光学设计算法实现大范围深度的高精度重建。
超越真实权重:用于稳定量化 的超复数表示
机构 * Artificial Intelligence Department, RobotBulls Labs(机器人bulls实验室人工智能部门) ; Machine Intelligence Lab (MILab), North South University(北南大学机器智能实验室)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出了一种基于超复数乘法的渐进式重新参数化策略,用于压缩多模态语言模型,实现参数和计算量的显著减少,同时保持模型性能。
Comments Accepted in Winter Conference on Applications of Computer Vision (WACV) 2026
CATP:面向高效增强多模态上下文学习的上下文自适应令牌剪枝
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 CATP通过上下文自适应令牌剪枝方法,提升多模态上下文学习的效率和性能,减少冗余令牌带来的影响。
Comments 14 pages, 12 figures, 6 tables