arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-07-31 至 2025-07-31 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 4 篇

2507.12060 2025-07-31 cs.CV cs.AI cs.MM 81%

InstructFLIP: Exploring Unified Vision-Language Model for Face Anti-spoofing

Kun-Hsiang Lin, Yu-Wen Tseng, Kang-Yang Huang, Jhih-Ciang Wu, Wen-Huang Cheng

机构 * National Taiwan University(国立台湾大学) National Taiwan Normal University(国立台湾师范大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by MM'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07076 2025-07-31 cs.CV cs.AI 73%

StoryTeller: Improving Long Video Description through Global Audio-Visual Character Identification

Yichen He, Yuan Lin, Jianchao Wu, Hanchong Zhang, Yuchen Zhang, Ruicheng Le

专题命中 其他VLM :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14200 2025-07-31 cs.CV cs.AI 62%

Enhancing Multimodal In-Context Learning for Image Classification through Coreset Optimization

Huiyi Chen, Jiawei Peng, Kaihua Tang, Xin Geng, Xu Yang

机构 * Southeast University(东南大学) Huawei Singapore Research Center(华为新加坡研究中心)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22075 2025-07-31 cs.LG 57%

Prototype-Guided Pseudo-Labeling with Neighborhood-Aware Consistency for Unsupervised Adaptation

Eman Ali, Chetan Arora, Muhammad Haris Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Indian Institute of Technology Delhi(印度德里理工学院) Alexandria University(亚历山大大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏