arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-21 至 2026-01-21 共收录 10 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2511.19529 2026-01-21 cs.CV 79%

Vidi2.5: Large Multimodal Models for Video Understanding and Creation

Vidi2.5:大型多模态模型用于视频理解和创作

Vidi Team, Chia-Wen Kuo, Chuang Huang, Dawei Du, Fan Chen, Fanding Lei, Feng Gao, Guang Chen, Haoji Zhang, Haojun Zhao, Jin Liu, Jingjing Zhuge, Lili Fang, Lingxi Zhang, Longyin Wen, Lu Guo, Lu Xu, Lusha Li, Qihang Fan, Rachel Deng, Shaobo Fang, Shu Zhang, Sijie Zhu, Stuart Siew, Weiyan Tao, Wen Zhong, Xiaohui Shen, Xin Gu, Ye Yuan, Yicheng He, Yiming Cui, Zhenfang Chen, Zhihua Wu, Zuhua Lin

机构 * ByteDance Inc.(字节跳动公司)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 Vidi2.5通过细粒度时空定位和复杂情节推理模型,提升了视频理解和创作的多模态能力,同时在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2507.16869 2026-01-21 cs.GR cs.CV 85%

Controllable Video Generation: A Survey

可控视频生成:综述

Yue Ma, Kunyu Feng, Zhongyuan Hu, Xinyu Wang, Yucheng Wang, Mingzhe Zheng, Bingyuan Wang, Qinghe Wang, Xuanhua He, Hongfa Wang, Chenyang Zhu, Hongyu Liu, Yingqing He, Zeyu Wang, Zhifeng Li, Xiu Li, Sirui Han, Yike Guo, Wei Liu, Dan Xu, Linfeng Zhang, Qifeng Chen

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology(Guang Zhou)(香港科技大学(广州)) Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Tencent(腾讯)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文综述了可控视频生成领域,探讨了视频扩散模型中的控制机制及不同控制信号类型的方法分类。

Comments project page: https://github.com/mayuelala/Awesome-Controllable-Video-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10671 2026-01-21 cs.CV cs.AI 70%

Image-to-Video Transfer Learning based on Image-Language Foundation Models: A Comprehensive Survey

基于图像-语言基础模型的图像到视频迁移学习:全面综述

Jinxuan Li, Chaolei Tan, Haoxuan Chen, Jianxin Ma, Jian-Fang Hu, Jianhuang Lai, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学)

专题命中 视频生成 :video understanding(abstract);video-language(abstract);分类 cs.CV

AI总结 本文综述了基于图像-语言基础模型的图像到视频迁移学习,系统分类了现有技术并分析了其在视频-文本任务中的应用与挑战。

Comments Updated version, github repository is available at https://github.com/YuriPreisdent/awesome-image-to-video-transfer

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14250 2026-01-21 cs.CV 57%

OmniTransfer: All-in-one Framework for Spatio-temporal Video Transfer

OmniTransfer: 一种用于时空视频转换的综合框架

Pengze Zhang, Yanze Wu, Mengtian Li, Xu Bai, Songtao Zhao, Fulong Ye, Chong Mou, Xinghui Li, Zhuowei Chen, Qian He, Mingyuan Gao

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 OmniTransfer通过统一框架实现灵活的高保真视频生成,结合多视角和时间线索提升转换性能。

Comments Github Page: https://pangzecheung.github.io/OmniTransfer/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2601.12761 2026-01-21 cs.CV 83%

Moaw: Unleashing Motion Awareness for Video Diffusion Models

Moaw:释放视频扩散模型中的运动感知

Tianqi Zhang, Ziyi Wang, Wenzhao Zheng, Weiliang Chen, Yuanhui Huang, Zhengyang Huang, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) Beihang University(北航)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 Moaw通过训练视频扩散模型进行运动感知,实现零样本运动迁移,推动生成建模与运动理解的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14255 2026-01-21 cs.CV cs.AI 57%

VideoMaMa: Mask-Guided Video Matting via Generative Prior

VideoMaMa: 通过生成先验进行掩码引导的视频磨皮

Sangbeom Lim, Seoung Wug Oh, Jiahui Huang, Heeji Yoon, Seungryong Kim, Joon-Young Lee

机构 * Korea University(韩国大学) Adobe Research(Adobe研究) KAIST AI(韩国科学技术院人工智能)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 VideoMaMa通过生成先验和分割提示,实现从粗糙掩码到精确磨皮的转换,并构建大规模伪标签数据集提升视频磨皮研究

Comments Project page: https://cvlab-kaist.github.io/VideoMaMa/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2601.14086 2026-01-21 cs.CV cs.AI cs.LG 57%

Two-Stream temporal transformer for video action classification

双流时间转换器用于视频动作分类

Nattapong Kurpukdee, Adrian G. Bors

机构 * Department of Computer Science, University of York, York YO10 5GH, UK(约克大学计算机科学系)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出双流时间转换器模型,通过提取时空信息和光流特征,实现视频动作的高效分类。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 1 篇

2503.09098 2026-01-21 cs.CV 57%

Causal-Ex: Causal Graph-based Micro and Macro Expression Spotting

Causal-Ex: 基于因果图的微表情和宏观表情定位

Pei-Sze Tan, Sailaja Rajanala, Arghya Pal, Raphaël C. -W. Phan, Huey-Fang Ong

机构 * CyPhi AI Lab, Monash University, Malaysia campus(CyPhi AI实验室,墨尔本大学,马来西亚校区)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 Causal-Ex通过构建面部动作单元的因果图,有效消除训练中的偏见,提升情绪定位的F1分数。

Comments 7 pages, 6 figures. The paper is under consideration at Pattern Recognition Letters

Journal ref Pattern Recognition Letters 200, 52--59 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 2 篇

2601.13974 2026-01-21 cs.CV 57%

STEC: A Reference-Free Spatio-Temporal Entropy Coverage Metric for Evaluating Sampled Video Frames

STEC:一种无参考的时空熵覆盖度量,用于评估采样视频帧

Shih-Yao Lin

机构 * Independent Researcher(独立研究者)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 STEC是一种无参考的时空熵覆盖度量,用于评估视频帧采样的有效性,通过联合建模空间信息强度、时间分散性和非冗余性,提供一种轻量且原则性的采样质量度量。

Comments This paper corresponds to the camera-ready version of a WACV 2026 Workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10054 2026-01-21 q-bio.OT 50%

SurgPub-Video: A Comprehensive Surgical Video Dataset for Enhanced Surgical Intelligence in Vision-Language Model

SurgPub-Video: 一个全面的外科视频数据集,用于增强视觉-语言模型中的外科智能

Yaoqian Li, Xikai Yang, Dunyuan Xu, Yang Yu, Litao Zhao, Xiaowei Hu, Jinpeng Li, Pheng-Ann Heng

专题命中 视频数据与评测 :video understanding(abstract)

AI总结 SurgPub-Video数据集和SurgLLaVA-Video模型通过提供高质量外科视频数据和专门的视觉-语言模型,提升了手术场景分析的智能水平。

Journal ref AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏