arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-18 至 2025-12-18 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5 篇

2412.09603 2025-12-18 cs.CV 83%

Do MLLMs Exhibit Human-like Perceptual Behaviors? HVSBench: A Benchmark for MLLM Alignment with Human Perceptual Behavior

多模态大语言模型是否表现出类人感知行为?HVSBench:一个用于多模态大语言模型对齐人类视觉行为的基准测试

Jiaying Lin, Shuquan Ye, Dan Xu, Wanli Ouyang, Rynson W. H. Lau

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 HVSBench通过测试多模态大语言模型与人类视觉行为的对齐性,揭示了其在感知任务上的显著差距,并强调了开发更符合人类认知的AI的重要性。

Comments Project page: https://jiaying.link/HVSBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14757 2025-12-18 cs.CV cs.RO 83%

SocialNav-MoE: A Mixture-of-Experts Vision Language Model for Socially Compliant Navigation with Reinforcement Fine-Tuning

SocialNav-MoE: 一种用于社交合规导航的混合专家视觉语言模型,结合强化微调

Tomohito Kawabata, Xinyu Zhang, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(信息科学与技术研究生院,北海道大学)

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 SocialNav-MoE通过混合专家模型和强化微调提升机器人社交合规导航的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09172 2025-12-18 cs.CV cs.AI 73%

Prompt-Based Continual Compositional Zero-Shot Learning

基于提示的持续组成零样本学习

Sauda Maryam, Sara Nadeem, Faisal Qureshi, Mohsen Ali

机构 * Intelligent Machines Lab(智能机器实验室) Information Technology University(信息技术大学) Visual Computing Lab(视觉计算实验室) Ontario Tech University(安大略技术大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 PromptCCZSL通过多教师蒸馏和正交投影损失,实现持续组成零样本学习中的知识保留与泛化提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15611 2025-12-18 cs.CV 70%

If you can describe it, they can see it: Cross-Modal Learning of Visual Concepts from Textual Descriptions

如果你能描述它,他们就能看到它:从文本描述中跨模态学习视觉概念

Carlo Alberto Barbano, Luca Molinaro, Massimiliano Ciranni, Emanuele Aiello, Vito Paolo Pastore, Marco Grangetto

机构 * University of Turin(都灵大学) University of Genoa(热那亚大学) Politecnico di Torino(都灵理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出通过文本描述跨模态学习视觉概念的方法,利用知识迁移技术提升视觉-语言模型的零样本性能。

Comments 27 pages. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15531 2025-12-18 cs.CV 57%

An Efficient and Effective Encoder Model for Vision and Language Tasks in the Remote Sensing Domain

一种用于遥感领域的高效且有效的编码器模型

João Daniel Silva, Joao Magalhaes, Devis Tuia, Bruno Martins

机构 * INESC-ID, Instituto Superior Técnico, University of Lisbon(INESC-ID,理工学院,里斯本大学) Department of Computer Science, Faculty of Science and Technology, Universidade NOVA de Lisboa(计算机科学系,科学与技术学院,诺瓦大学) School of Architecture, Civil and Environmental Engineering, EPFL(建筑、土木和环境工程学院,EPFL)

专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV

AI总结 本文提出了一种高效且紧凑的编码器模型,用于处理遥感领域的多任务学习,包括图像文本生成和跨模态检索。

详情

展开后加载摘要…

URL PDF HTML 收藏