arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-03 至 2026-02-03 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 6 篇

2403.00068 2026-02-03 cs.CV 79%

Towards Artwork Explanation in Large-scale Vision Language Models

迈向大规模视觉语言模型中的艺术作品解释

Kazuki Hayashi, Yusuke Sakai, Hidetaka Kamigaito, Katsuhiko Hayashi, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术大学) The University of Tokyo(东京大学)

专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出艺术作品解释生成任务,评估大规模视觉语言模型在整合语言和视觉信息以及从图像中获取知识的能力。

Comments Accepted to ACL 2024 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01127 2026-02-03 cs.CV 74%

Koo-Fu CLIP: Closed-Form Adaptation of Vision-Language Models via Fukunaga-Koontz Linear Discriminant Analysis

Koo-Fu CLIP:通过Fukunaga-Koontz线性判别分析实现视觉语言模型的闭式适应

Matej Suchanek, Klara Janouskova, Ondrej Vasatko, Jiri Matas

机构 * Visual Recognition Group(视觉识别组) Department of Cybernetics(cybernetics系) Faculty of Electrical Engineering(电气工程系) Czech Technical University in Prague(布拉格捷克技术大学)

专题命中 其他VLM :vision-language model(title);分类 cs.CV

AI总结 Koo-Fu CLIP通过Fukunaga-Koontz线性判别分析实现视觉语言模型的闭式适应,提升类别分离性和降维效率,实现高效的大规模分类与检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01683 2026-02-03 cs.CV cs.AI 62%

FreshMem: Brain-Inspired Frequency-Space Hybrid Memory for Streaming Video Understanding

FreshMem: 基于大脑的频率-空间混合内存用于流视频理解

Kangcong Li, Peng Ye, Lin Zhang, Chao Wang, Huafeng Qin, Tao Chen

机构 * College of Future Information Technology, Fudan University, Shanghai, China(复旦大学未来信息科技学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 FreshMem通过频率-空间混合内存网络,提升流视频理解的连续感知能力,实现短期保真与长期一致性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01059 2026-02-03 cs.CV cs.MM 57%

DRFormer: A Dual-Regularized Bidirectional Transformer for Person Re-identification

DRFormer: 一种双正则化双向变换器用于人重识别

Ying Shu, Pujian Zhan, Huiqi Yang, Hehe Fan, Youfang Lin, Kai Lv

机构 * Institute of Network Science and Intelligent Systems, Beijing Jiaotong University, Beijing, China(网络科学与智能系统研究所,北京交通大学,北京,中国) Zhejiang University, Hangzhou, Zhejiang, China(浙江大学,杭州,浙江,中国)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 DRFormer通过双正则化双向变换器融合视觉基础模型和视觉-语言模型的优势,提升人重识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13653 2026-02-03 cs.LG 57%

Dual-Phase Continual Learning: Supervised Adaptation Meets Unsupervised Retention

双相持续学习:监督适应与无监督保留的结合

Vaibhav Singh, Rahaf Aljundi, Eugene Belilovsky

机构 * Mila, Concordia University(蒙特利尔大学米尔人工智能实验室) Concordia University(蒙特利尔大学) Toyota Motor Europe(丰田欧洲公司)

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

AI总结 本文提出了一种基于无监督方法的双相持续学习框架,通过利用测试时间数据提升先前任务性能,无需存储或重播数据,有效缓解VLMs中的遗忘问题。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00762 2026-02-03 cs.CL cs.HC 50%

WordCraft: Scaffolding the Keyword Method for L2 Vocabulary Learning with Multimodal LLMs

WordCraft: 通过多模态大语言模型 scaffolding 关键词方法用于L2词汇学习

Yuheng Shao, Junjie Xiong, Chaoran Wu, Xiyuan Wang, Ziyu Zhou, Yang Ouyang, Qinyi Tao, Quan Li

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) School of Creativity and Art, ShanghaiTech University(创意与艺术学院,上海科技大学) Shanghai Fengxian Dai Wen Middle School(上海奉贤戴文中学)

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 WordCraft通过多模态大语言模型辅助L2词汇学习,提升关键词方法的使用效果和学习者参与度。

Comments Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI' 26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏