arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-10-14 至 2025-10-14 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 5 篇

2504.09282 2025-10-14 cs.CV 74%

VideoAds for Fast-Paced Video Understanding

Zheyuan Zhang, Monica Dou, Linkai Peng, Hongyi Pan, Ulas Bagci, Boqing Gong

机构 * Northwestern University(西北大学) Boston University(波士顿大学)

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10986 2025-10-14 cs.CV 57%

Mixup Helps Understanding Multimodal Video Better

Xiaoyu Ma, Ding Ding, Hao Chen

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(计算机科学与工程学院,东南大学,南京,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其跨学科应用关键实验室(东南大学),教育部,中国)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09073 2025-10-14 cs.CV 57%

Open Vocabulary Multi-Label Video Classification

Rohit Gupta, Mamshad Nayeem Rizve, Jayakrishnan Unnikrishnan, Ashish Tawari, Son Tran, Mubarak Shah, Benjamin Yao, Trishul Chilimbi

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学) Amazon(亚马逊)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10395 2025-10-14 cs.CV 57%

AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration

Xinlong Chen, Yue Ding, Weihong Lin, Jingyun Hua, Linli Yao, Yang Shi, Bozhou Li, Yuanxing Zhang, Qiang Liu, Pengfei Wan, Liang Wang, Tieniu Tan

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别新实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Peking University(北京大学) Nanjing University(南京大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Project webpage: https://avocado-captioner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10022 2025-10-14 cs.CV 57%

Q-Adapter: Visual Query Adapter for Extracting Textually-related Features in Video Captioning

Junan Chen, Trung Thanh Nguyen, Takahiro Komamizu, Ichiro Ide

机构 * Nagoya University(名古屋大学)

专题命中 视频理解 :video-language(abstract);分类 cs.CV

Comments ACM Multimedia Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏