Vidi2.5: Large Multimodal Models for Video Understanding and Creation
Vidi2.5:大型多模态模型用于视频理解和创作
机构 * ByteDance Inc.(字节跳动公司)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 Vidi2.5通过细粒度时空定位和复杂情节推理模型,提升了视频理解和创作的多模态能力,同时在多个基准测试中表现出色。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
Vidi2.5:大型多模态模型用于视频理解和创作
机构 * ByteDance Inc.(字节跳动公司)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 Vidi2.5通过细粒度时空定位和复杂情节推理模型,提升了视频理解和创作的多模态能力,同时在多个基准测试中表现出色。
可控视频生成:综述
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Hong Kong University of Science and Technology(Guang Zhou)(香港科技大学(广州)) ; Tsinghua University(清华大学) ; Dalian University of Technology(大连理工大学) ; Tencent(腾讯)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 本文综述了可控视频生成领域,探讨了视频扩散模型中的控制机制及不同控制信号类型的方法分类。
Comments project page: https://github.com/mayuelala/Awesome-Controllable-Video-Generation
基于图像-语言基础模型的图像到视频迁移学习:全面综述
机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学)
专题命中 视频生成 :video understanding(abstract);video-language(abstract);分类 cs.CV
AI总结 本文综述了基于图像-语言基础模型的图像到视频迁移学习,系统分类了现有技术并分析了其在视频-文本任务中的应用与挑战。
Comments Updated version, github repository is available at https://github.com/YuriPreisdent/awesome-image-to-video-transfer
OmniTransfer: 一种用于时空视频转换的综合框架
机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 OmniTransfer通过统一框架实现灵活的高保真视频生成,结合多视角和时间线索提升转换性能。
Comments Github Page: https://pangzecheung.github.io/OmniTransfer/
Moaw:释放视频扩散模型中的运动感知
机构 * Tsinghua University(清华大学) ; Beihang University(北航)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV
AI总结 Moaw通过训练视频扩散模型进行运动感知,实现零样本运动迁移,推动生成建模与运动理解的结合。
VideoMaMa: 通过生成先验进行掩码引导的视频磨皮
机构 * Korea University(韩国大学) ; Adobe Research(Adobe研究) ; KAIST AI(韩国科学技术院人工智能)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 VideoMaMa通过生成先验和分割提示,实现从粗糙掩码到精确磨皮的转换,并构建大规模伪标签数据集提升视频磨皮研究
Comments Project page: https://cvlab-kaist.github.io/VideoMaMa/
双流时间转换器用于视频动作分类
机构 * Department of Computer Science, University of York, York YO10 5GH, UK(约克大学计算机科学系)
专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV
AI总结 本文提出双流时间转换器模型,通过提取时空信息和光流特征,实现视频动作的高效分类。
Causal-Ex: 基于因果图的微表情和宏观表情定位
机构 * CyPhi AI Lab, Monash University, Malaysia campus(CyPhi AI实验室,墨尔本大学,马来西亚校区)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV
AI总结 Causal-Ex通过构建面部动作单元的因果图,有效消除训练中的偏见,提升情绪定位的F1分数。
Comments 7 pages, 6 figures. The paper is under consideration at Pattern Recognition Letters
Journal ref Pattern Recognition Letters 200, 52--59 (2026)
STEC:一种无参考的时空熵覆盖度量,用于评估采样视频帧
机构 * Independent Researcher(独立研究者)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 STEC是一种无参考的时空熵覆盖度量,用于评估视频帧采样的有效性,通过联合建模空间信息强度、时间分散性和非冗余性,提供一种轻量且原则性的采样质量度量。
Comments This paper corresponds to the camera-ready version of a WACV 2026 Workshop paper
SurgPub-Video: 一个全面的外科视频数据集,用于增强视觉-语言模型中的外科智能
专题命中 视频数据与评测 :video understanding(abstract)
AI总结 SurgPub-Video数据集和SurgLLaVA-Video模型通过提供高质量外科视频数据和专门的视觉-语言模型,提升了手术场景分析的智能水平。
Journal ref AAAI-2026