arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-25 至 2025-12-25 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2512.21126 2025-12-25 cs.CV cs.DB 83%

MarineEval: Assessing the Marine Intelligence of Vision-Language Models

MarineEval: 评估视觉-语言模型的海洋智能

YuK-Kwan Wong, Tuan-An To, Jipeng Zhang, Ziqiang Zheng, Sai-Kit Yeung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉问答 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 MarineEval首次构建大规模海洋VLM数据集和基准,评估现有VLM在回答海洋领域问题上的能力与局限性。

Comments Accepted by The IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20735 2025-12-25 cs.CV 79%

VL4Gaze: Unleashing Vision-Language Models for Gaze Following

VL4Gaze:释放视觉-语言模型用于追随目光

Shijing Wang, Chaoqun Cui, Yaping Huang, Hyung Jin Chang, Yihua Cheng

机构 * Beijing Jiaotong University(北京交通大学) MAIS, Institute of Automation, Chinese Academy of Sciences(MAIS,自动化研究所,中国科学院) University of Birmingham(伯明翰大学)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV

AI总结 VL4Gaze通过四个互补任务统一目光理解为VQA问题,系统评估VLMs在目光解读上的表现,揭示了针对性多任务监督对提升VLMs目光理解能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14368 2025-12-25 cs.CV cs.CL cs.LG 73%

O3SLM: Open Weight, Open Data, and Open Vocabulary Sketch-Language Model

O3SLM:开放权重、开放数据和开放词汇草图-语言模型

Rishi Gupta, Mukilan Karuppasamy, Shyam Marjit, Aditay Tripathi, Anirban Chakraborty

机构 * IISc(印度理工学院)

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 O3SLM通过构建大规模图像-草图-指令三元组数据集和训练模型,实现了对草图理解和推理的突破性进展。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏