arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-11-04 至 2025-11-04 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 2 篇

2508.06350 2025-11-04 cs.CV 57%

Aligning Effective Tokens with Video Anomaly in Large Language Models

Yingxian Chen, Jiahui Liu, Ruidi Fan, Yanwei Li, Chirui Chang, Shizhen Zhao, Wilton W. T. Fok, Xiaojuan Qi, Yik-Chung Wu

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22810 2025-11-04 cs.CV 57%

VidText: Towards Comprehensive Evaluation for Video Text Understanding

Zhoufaran Yang, Yan Shu, Jing Wang, Zhifei Yang, Yan Zhang, Yu Li, Keyang Lu, Gangyan Zeng, Shaohui Liu, Yu Zhou, Nicu Sebe

机构 * UNITN HIT(哈尔滨工业大学) SEU(上海电子大学) PKU(北京大学) IIE, CAS(中国科学院信息工程研究所) UCAS(中国科学院大学) BUAA(北京航空航天大学) NJUST(南京理工大学) NKU(宁夏大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏