arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-21 至 2025-11-21 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 7 篇

2511.16229 2025-11-21 cs.CR cs.AI 88%

Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security

Q-MLLM:向量量化用于鲁棒多模态大语言模型安全

Wei Zhao, Zhe Li, Yige Li, Jun Sun

机构 * Singapore Management University(新加坡管理大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(title,abstract);分类 cs.AI

AI总结 Q-MLLM通过两级向量量化提升多模态大语言模型的安全性,有效防御对抗性攻击并保持模型实用性。

Comments Accepted by NDSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16454 2025-11-21 cs.CV 87%

LLaVA$^3$: Representing 3D Scenes like a Cubist Painter to Boost 3D Scene Understanding of VLMs

LLaVA$^3$:像立体主义画家一样表示3D场景以提升VLM的3D场景理解

Doriand Petit, Steve Bourgeois, Vincent Gay-Bellile, Florian Chabot, Loïc Barthe

专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(abstract);VLM(abstract);grounding(abstract)

AI总结 LLaVA$^3$通过立体主义方法提升VLM对3D场景的理解能力,利用多视角2D图像无需微调实现更优的3D场景理解。

Comments Accepted at AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02584 2025-11-21 cs.CV cs.AI cs.CL cs.LG 82%

Efficient Architectures for High Resolution Vision-Language Models

高效高分辨率视觉-语言模型架构

Miguel Carvalho, Bruno Martins

机构 * INESC-ID and Instituto Superior Técnico, University of Lisbon(INESC-ID 和 里斯本大学技术学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Pheye是一种高效处理高分辨率图像的视觉-语言模型架构,通过减少参数数量实现高效率和强性能,尤其在细粒度图像理解和场景文本处理任务中表现突出。

Comments Accepted at COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19072 2025-11-21 cs.CV cs.AI cs.CL 81%

HAWAII: Hierarchical Visual Knowledge Transfer for Efficient Vision-Language Models

HAWAII:层次化视觉知识转移用于高效的视觉-语言模型

Yimu Wang, Mozhgan Nasr Azadani, Sean Sedwards, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 HAWAII通过层次化视觉知识转移,高效整合多个视觉专家的知识,提升视觉-语言模型性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00236 2025-11-21 cs.RO 71%

Sim2Real Diffusion: Leveraging Foundation Vision Language Models for Adaptive Automated Driving

Sim2Real Diffusion:利用基础视觉语言模型实现自适应自动驾驶

Chinmay Vilas Samak, Tanmay Vilas Samak, Bing Li, Venkat Krovi

机构 * Department of Automotive Engineering, Clemson University International Center for Automotive Research (CU-ICAR)(汽车工程系,克莱姆森大学国际汽车研究中心(CU-ICAR))

专题命中 VLM训练与架构 :vision language model(title)

AI总结 本文提出Sim2Real Diffusion框架,利用基础视觉语言模型实现自动驾驶的跨领域适应,通过条件潜在扩散提升sim2real转换性能。

Comments Accepted in IEEE Robotics and Automation Letters (RA-L)

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 1, pp. 177-184, Jan. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15923 2025-11-21 cs.CV 70%

RB-FT: Rationale-Bootstrapped Fine-Tuning for Video Classification

RB-FT:基于理由的视频分类微调

Meilong Xu, Di Fu, Jiaxing Zhang, Gong Yu, Jiayu Zheng, Xiaoling Hu, Dongdi Zhao, Feiyang Li, Chao Chen, Yong Cao

机构 * Stony Brook University(石溪大学) ByteDance Inc.(字节跳动公司) Harvard Medical School(哈佛医学院)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 RB-FT通过自动生成的理由提升视频分类性能,无需额外标注,有效提升模型对领域特定视频内容的理解能力。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09540 2025-11-21 cs.CV 57%

vMFCoOp: Towards Equilibrium on a Unified Hyperspherical Manifold for Prompting Biomedical VLMs

vMFCoOp:在统一超球面流形上实现平衡的提示生物医学VLMs

Minye Shao, Sihan Guo, Xinrun Li, Xingyu Miao, Haoran Duan, Yang Long

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 vMFCoOp通过统一超球面流形上的vMF分布估计,实现LLM与CLIP主干间的语义对齐,提升生物医学VLMs的提示效果和少样本分类性能。

Comments Accepted as an Oral Presentation at AAAI 2026 Main Technical Track (this version is not peer-reviewed; it is the extended version)

详情

展开后加载摘要…

URL PDF HTML 收藏