arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-21 至 2026-01-21 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 2 篇

2503.09949 2026-01-21 cs.CV 70%

UVE: Are MLLMs Unified Evaluators for AI-Generated Videos?

UVE: MLLMs是否能作为AI生成视频的统一评估器?

Yuanxin Liu, Rui Zhu, Shuhuai Ren, Jiacong Wang, Haoyuan Guo, Xu Sun, Lu Jiang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) ByteDance Seed(字节跳动种子) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文探讨使用多模态大语言模型作为AI生成视频的统一评估器的可行性,并通过UVE-Bench基准测试评估了18种MLLMs的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13133 2026-01-21 cs.CV 57%

CLIP-Guided Adaptable Self-Supervised Learning for Human-Centric Visual Tasks

面向人类的视觉任务的CLIP引导自监督学习

Mingshuang Luo, Ruibing Hou, Bo Chao, Hong Chang, Zimo Liu, Yaowei Wang, Shiguang Shan

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS), and University of Chinese Academy of Sciences(智能信息处理重点实验室,计算技术研究所(ICT),中国科学院(CAS)及中国科学院大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 CLASP通过CLIP生成多级语义伪标签,并结合Prompt-Controlled MoE模块提升迁移性,实现人类中心视觉任务的高效预训练。

Comments Accepted by TMM (IEEE Transactions on Multimedia), 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏