arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-10-14 至 2025-10-14 共收录 14 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 5 篇

2504.09282 2025-10-14 cs.CV 74%

VideoAds for Fast-Paced Video Understanding

Zheyuan Zhang, Monica Dou, Linkai Peng, Hongyi Pan, Ulas Bagci, Boqing Gong

机构 * Northwestern University(西北大学) Boston University(波士顿大学)

专题命中 视频理解 :video understanding(title);分类 cs.CV

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10986 2025-10-14 cs.CV 57%

Mixup Helps Understanding Multimodal Video Better

Xiaoyu Ma, Ding Ding, Hao Chen

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(计算机科学与工程学院,东南大学,南京,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其跨学科应用关键实验室(东南大学),教育部,中国)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09073 2025-10-14 cs.CV 57%

Open Vocabulary Multi-Label Video Classification

Rohit Gupta, Mamshad Nayeem Rizve, Jayakrishnan Unnikrishnan, Ashish Tawari, Son Tran, Mubarak Shah, Benjamin Yao, Trishul Chilimbi

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学) Amazon(亚马逊)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10395 2025-10-14 cs.CV 57%

AVoCaDO: An Audiovisual Video Captioner Driven by Temporal Orchestration

Xinlong Chen, Yue Ding, Weihong Lin, Jingyun Hua, Linli Yao, Yang Shi, Bozhou Li, Yuanxing Zhang, Qiang Liu, Pengfei Wan, Liang Wang, Tieniu Tan

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别新实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Peking University(北京大学) Nanjing University(南京大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Project webpage: https://avocado-captioner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10022 2025-10-14 cs.CV 57%

Q-Adapter: Visual Query Adapter for Extracting Textually-related Features in Video Captioning

Junan Chen, Trung Thanh Nguyen, Takahiro Komamizu, Ichiro Ide

机构 * Nagoya University(名古屋大学)

专题命中 视频理解 :video-language(abstract);分类 cs.CV

Comments ACM Multimedia Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2510.08789 2025-10-14 cs.CV 57%

Q-Router: Agentic Video Quality Assessment with Expert Model Routing and Artifact Localization

Shuo Xing, Soumik Dey, Mingyang Wu, Ashirbad Mishra, Naveen Ravipati, Binbin Li, Hansi Wu, Zhengzhong Tu

机构 * Department of Computer Science(计算机科学系) Cranberry-Lemon University(Cranberry-Lemon 大学) Texas A&M University(德克萨斯A&M大学) eBay Inc.(eBay公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08561 2025-10-14 cs.CV 57%

MultiCOIN: Multi-Modal COntrollable Video INbetweening

Maham Tanveer, Yang Zhou, Simon Niklaus, Ali Mahdavi Amiri, Hao Zhang, Krishna Kumar Singh, Nanxuan Zhao

机构 * Simon Fraser University(西蒙弗雷泽大学) Adobe Research(Adobe研究院)

专题命中 视频生成 :long video(abstract);分类 cs.CV

Comments Project website: https://multicoinx.github.io/multicoin/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 4 篇

2510.10670 2025-10-14 cs.CV 83%

AdaViewPlanner: Adapting Video Diffusion Models for Viewpoint Planning in 4D Scenes

Yu Li, Menghan Xia, Gongye Liu, Jianhong Bai, Xintao Wang, Conglang Zhang, Yuxuan Lin, Ruihang Chu, Pengfei Wan, Yujiu Yang

机构 * Tsinghua University(清华大学) HUST(华中科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) HKUST(香港科技大学) Zhejiang University(浙江大学) Wuhan University(武汉大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24695 2025-10-14 cs.CV cs.AI 83%

SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer

Junsong Chen, Yuyang Zhao, Jincheng Yu, Ruihang Chu, Junyu Chen, Shuai Yang, Xianbang Wang, Yicheng Pan, Daquan Zhou, Huan Ling, Haozhe Liu, Hongwei Yi, Hao Zhang, Muyang Li, Yukang Chen, Han Cai, Sanja Fidler, Ping Luo, Song Han, Enze Xie

机构 * NVIDIA HKU(香港大学) MIT(麻省理工学院) THU(清华大学) PKU(北京大学) KAUST(国王 Abdullah 基础研究科学研究院)

专题命中 视频扩散模型 :video generation(title,abstract);long video(abstract);分类 cs.CV

Comments 21 pages, 15 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18809 2025-10-14 cs.CV 83%

VORTA: Efficient Video Diffusion via Routing Sparse Attention

Wenhao Sun, Rong-Cheng Tu, Yifu Ding, Zhao Jin, Jingyi Liao, Shunyu Liu, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025. The code is available at https://github.com/wenhao728/VORTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08632 2025-10-14 cs.CV 74%

RoboSwap: A GAN-driven Video Diffusion Framework For Unsupervised Robot Arm Swapping

Yang Bai, Liudi Yang, George Eskandar, Fengyi Shen, Dong Chen, Mohammad Altillawi, Ziyuan Liu, Gitta Kutyniok

机构 * Ludwig-Maximilians-Universität München (LMU Munich)(慕尼黑路德维希-马克西米利安大学) Huawei Heisenberg Research Center(华为海森堡研究中心) Technische Universität München (TUM)(慕尼黑技术大学) Albert-Ludwigs-Universität Freiburg(弗赖堡阿尔伯特-路易斯-大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频数据与评测 2 篇

2510.07249 2025-10-14 cs.CV 79%

TalkCuts: A Large-Scale Dataset for Multi-Shot Human Speech Video Generation

Jiaben Chen, Zixin Wang, Ailing Zeng, Yang Fu, Xueyang Yu, Siyuan Cen, Julian Tanke, Yihang Chen, Koichi Saito, Yuki Mitsufuji, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿姆赫斯特分校) Sony AI(索尼人工智能) UC San Diego(加州大学圣地亚哥分校)

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV

Comments Project page: https://talkcuts.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11606 2025-10-14 cs.CV 74%

ExpVid: A Benchmark for Experiment Video Understanding & Reasoning

Yicheng Xu, Yue Wu, Jiashuo Yu, Ziang Yan, Tianxiang Jiang, Yinan He, Qingsong Zhao, Kai Chen, Yu Qiao, Limin Wang, Manabu Okumura, Yi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Institute of Science Tokyo(东京科学研究所) Nanjing University(南京大学)

专题命中 视频数据与评测 :video understanding(title);分类 cs.CV

Comments Data & Code: https://github.com/OpenGVLab/ExpVid

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他视频模型 1 篇

2510.10104 2025-10-14 cs.CV 57%

Answer-Consistent Chain-of-thought Reinforcement Learning For Multi-modal Large Langauge Models

Minbin Huang, Runhui Huang, Chuanyang Zheng, Jingyao Li, Guoxuan Chen, Han Shi, Hong Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 其他视频模型 :video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏