arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-10 至 2025-12-10 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 7 篇

2503.23062 2025-12-10 cs.CV 83%

Shape and Texture Recognition in Large Vision-Language Models

大规模视觉-语言模型中的形状与纹理识别

Sagi Eppel, Mor Bismut, Alona Faktor-Strugatski

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 研究发现大规模视觉-语言模型在识别抽象形状和纹理时表现不足,而人类和简单网络表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08374 2025-12-10 cs.CV 70%

The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss

看不见的偏见:预规范MLLM中规范差异如何导致视觉信息丢失

Bozhou Li, Xinda Xue, Sihan Yang, Yang Shi, Xinlong Chen, Yushuo Guan, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Xi’an Jiaotong University(西安交通大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文揭示了预规范MLLM中规范差异导致的视觉信息丢失问题,并提出通过插入层规范层来解决这一问题,提升模型整体能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04713 2025-12-10 cs.CV 70%

Enabling Validation for Robust Few-Shot Recognition

使基于VLM微调的鲁棒少样本识别得以验证

Hanxin Wang, Tian Liu, Shu Kong

机构 * University of Macau(澳门大学) Texas A&M University(德克萨斯A&M大学) Institute of Collaborative Innovation(协同创新研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出VEST框架,通过验证启用的分阶段微调策略,解决少样本识别中验证数据不足的问题,提升模型在ID和OOD数据上的泛化能力。

Comments Project website: https://hannawang09.github.io/projects/vest/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02239 2025-12-10 cs.CV cs.AI 62%

MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens

MiniGPT-5:通过生成性vokens实现交错的视觉-语言生成

Kaizhi Zheng, Xuehai He, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 MiniGPT-5通过生成性vokens实现交错的视觉-语言生成,显著提升多模态生成任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08627 2025-12-10 cs.CV 57%

Trajectory Densification and Depth from Perspective-based Blur

轨迹密集化与基于视角的模糊深度估计

Tianchen Qiu, Qirun Zhang, Jiajian He, Zhengyue Zhuge, Jiahui Xu, Yueting Chen

机构 * College of Optical Science and Engineering(光学科学与工程学院) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出了一种基于视角模糊和密集轨迹的深度估计方法,利用视觉-语言模型和光学设计算法实现大范围深度的高精度重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08524 2025-12-10 cs.CV cs.CL 57%

Beyond Real Weights: Hypercomplex Representations for Stable Quantization

超越真实权重:用于稳定量化 的超复数表示

Jawad Ibn Ahad, Maisha Rahman, Amrijit Biswas, Muhammad Rafsan Kabir, Robin Krambroeckers, Sifat Momen, Nabeel Mohammed, Shafin Rahman

机构 * Artificial Intelligence Department, RobotBulls Labs(机器人bulls实验室人工智能部门) Machine Intelligence Lab (MILab), North South University(北南大学机器智能实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出了一种基于超复数乘法的渐进式重新参数化策略,用于压缩多模态语言模型,实现参数和计算量的显著减少,同时保持模型性能。

Comments Accepted in Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07871 2025-12-10 cs.CV 57%

CATP: Contextually Adaptive Token Pruning for Efficient and Enhanced Multimodal In-Context Learning

CATP:面向高效增强多模态上下文学习的上下文自适应令牌剪枝

Yanshu Li, Jianjiang Yang, Zhennan Shen, Ligong Han, Haoyan Xu, Ruixiang Tang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 CATP通过上下文自适应令牌剪枝方法,提升多模态上下文学习的效率和性能,减少冗余令牌带来的影响。

Comments 14 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏