arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-15 至 2025-12-15 共收录 14 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 6 篇

2512.05103 2025-12-15 cs.LG cs.AI cs.CL cs.CV 79%

TV2TV: A Unified Framework for Interleaved Language and Video Generation

TV2TV:一种用于交错语言和视频生成的统一框架

Xiaochuang Han, Youssef Emad, Melissa Hall, John Nguyen, Karthik Padthe, Liam Robbins, Amir Bar, Delong Chen, Michal Drozdzal, Maha Elbayad, Yushi Hu, Shang-Wen Li, Sreya Dutta Roy, Jakob Verbeek, XuDong Wang, Marjan Ghazvininejad, Luke Zettlemoyer, Emily Dinan

机构 * Meta FAIR

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 TV2TV通过统一框架实现语言与视频生成的交错过程,提升视频生成的视觉质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24379 2025-12-15 cs.CV cs.AI 79%

Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation

Any2Caption:任何条件到字幕以实现可控视频生成

Shengqiong Wu, Weicai Ye, Jiahao Wang, Quande Liu, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Shuicheng Yan, Hao Fei, Tat-Seng Chua

机构 * Kuaishou Technology(快手科技) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Any2Caption通过多模态大语言模型实现任何条件到字幕的可控视频生成,提升视频生成的可控性和质量。

Comments Project Page: https://sqwu.top/Any2Cap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05046 2025-12-15 cs.CV 74%

FlowDirector: Training-Free Flow Steering for Precise Text-to-Video Editing

FlowDirector: 无需训练的流引导文本到视频编辑

Guangzhao Li, Yanming Yang, Chenxi Song, Chi Zhang

机构 * AGI Lab, Westlake University(西湖大学AGI实验室) Central South University(中南大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :text-to-video(title);分类 cs.CV

AI总结 FlowDirector通过直接在数据空间中建模编辑过程,无需训练和倒置步骤,实现了更精确的文本到视频编辑。

Comments Project Page is https://flowdirector-edit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11799 2025-12-15 cs.CV 57%

V-RGBX: Video Editing with Accurate Controls over Intrinsic Properties

V-RGBX:具有精确内在属性控制的视频编辑

Ye Fang, Tong Wu, Valentin Deschaintre, Duygu Ceylan, Iliyan Georgiev, Chun-Hao Paul Huang, Yiwei Hu, Xuelin Chen, Tuanfeng Yang Wang

机构 * Fudan University(复旦大学) Adobe Research(Adobe研究院) Stanford University(斯坦福大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 V-RGBX通过端到端框架实现基于内在属性的视频编辑,支持直观且物理合理的视频修改,适用于物体外观和场景重照明等应用。

Comments Project Page: https://aleafy.github.io/vrgbx

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11293 2025-12-15 cs.CV 57%

Autoregressive Video Autoencoder with Decoupled Temporal and Spatial Context

具有解耦时间和空间上下文的自回归视频自编码器

Cuifeng Shen, Lumin Xu, Xingguo Zhu, Gengdai Liu

机构 * Zoom Communications(Zoom公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 ARVAE通过解耦时间和空间上下文,实现高效视频压缩与重建,具备轻量模型和小数据优势,适用于视频生成等下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01004 2025-12-15 cs.CV cs.AI 57%

MoCA-Video: Motion-Aware Concept Alignment for Consistent Video Editing

MoCA-Video:面向一致视频编辑的运动感知概念对齐

Tong Zhang, Juan C Leon Alcazar, Victor Escorcia, Bernard Ghanem

机构 * Department of Computer Science(计算机科学系) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学科学与技术学院)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 MoCA-Video通过在冻结的视频扩散模型潜在空间中进行语义混合,实现无需训练的高质量视频编辑,通过动量修正和伽马残差模块提升时间稳定性和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频扩散模型 6 篇

2506.00996 2025-12-15 cs.CV 85%

Temporal In-Context Fine-Tuning with Temporal Reasoning for Versatile Control of Video Diffusion Models

具有时间推理的上下文微调用于视频扩散模型的多功能控制

Kinam Kim, Junha Hyung, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究中心)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 TIC-FT通过时间推理实现视频扩散模型的多功能控制,无需架构修改,仅需少量样本即可实现高质量视频生成。

Comments project page: https://kinam0252.github.io/TIC-FT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07500 2025-12-15 cs.CV 74%

MultiMotion: Multi Subject Video Motion Transfer via Video Diffusion Transformer

多主体视频动作迁移:通过视频扩散变换器实现

Penghui Liu, Jiangshan Wang, Yutong Shen, Shanhui Mo, Chenyang Qi, Yue Ma

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 MultiMotion通过视频扩散变换器实现多主体视频动作迁移,引入AMF和RectPC提升动作解纠缠与生成效率,构建首个专用基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11645 2025-12-15 cs.CV 57%

FactorPortrait: Controllable Portrait Animation via Disentangled Expression, Pose, and Viewpoint

FactorPortrait: 通过解耦的表情、姿态和视角实现可控的肖像动画

Jiapeng Tang, Kai Li, Chengxiang Yin, Liuhao Ge, Fei Jiang, Jiu Xu, Matthias Nießner, Christian Häne, Timur Bagautdinov, Egor Zakharov, Peihong Guo

机构 * Meta Reality Labs(Meta现实实验室) Technical University of Munich(慕尼黑技术大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 FactorPortrait通过解耦表情、姿态和视角实现可控肖像动画,利用预训练编码器和3D网格跟踪生成逼真动态效果。

Comments Project page: https://tangjiapeng.github.io/FactorPortrait/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11274 2025-12-15 cs.CV 57%

FilmWeaver: Weaving Consistent Multi-Shot Videos with Cache-Guided Autoregressive Diffusion

FilmWeaver: 通过缓存引导自回归扩散编织一致的多镜头视频

Xiangyang Luo, Qingyu Li, Xiaokun Liu, Wenyu Qin, Miao Yang, Meng Wang, Pengfei Wan, Di Zhang, Kun Gai, Shao-Lun Huang

机构 * Kling Team, Kuaishou Technology(快手科技 Kling Team)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 FilmWeaver通过缓存引导自回归扩散模型实现多镜头视频的一致性生成,支持灵活交互和多任务应用。

Comments AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11253 2025-12-15 cs.CV 57%

PersonaLive! Expressive Portrait Image Animation for Live Streaming

PersonaLive! 用于直播的 expressive 人物图像动画

Zhiyuan Li, Chi-Man Pun, Chen Fang, Jue Wang, Xiaodong Cun

机构 * University of Macau(澳门大学) GVC Lab, Great Bay University(大湾大学GVC实验室)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 PersonaLive通过多阶段训练方法实现了实时面部动画生成,提升了效率和稳定性,达到7-22倍的速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11225 2025-12-15 cs.CV cs.AI cs.LG 57%

VFMF: World Modeling by Forecasting Vision Foundation Model Features

VFMF:通过预测视觉基础模型特征进行世界建模

Gabrijel Boduljak, Yushi Lan, Christian Rupprecht, Andrea Vedaldi

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出了一种基于VFM特征的生成预测器,通过自回归流匹配在潜在空间中实现更准确的预测,提升世界建模的效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 动作与事件理解 2 篇

2512.11792 2025-12-15 cs.CV 79%

Structure From Tracking: Distilling Structure-Preserving Motion for Video Generation

从跟踪中获取结构:从自回归视频跟踪模型中蒸馏保持结构的运动用于视频生成

Yang Fei, George Stoica, Jingyuan Liu, Qifeng Chen, Ranjay Krishna, Xiaojuan Wang, Benlin Liu

机构 * HKUST(香港科技大学) University of Washington(华盛顿大学) Georgia Tech(佐治亚理工学院) Adobe(Adobe公司)

专题命中 动作与事件理解 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 通过蒸馏自回归视频跟踪模型中的结构保持运动先验,SAM2VideoX在视频生成任务中实现了更高的保真度和一致性。

Comments Project Website: https://sam2videox.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01543 2025-12-15 cs.CV 57%

Efficient Action Counting with Dynamic Queries

高效动态查询动作计数

Xiaoxuan Ma, Zishi Li, Qiuyan Shang, Wentao Zhu, Hai Ci, Yu Qiao, Yizhou Wang

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

AI总结 本文提出了一种基于动态查询表示的高效动作计数方法,通过动态更新和跨查询对比学习,显著提升了长视频和未见过动作的计数性能。

Comments code: https://github.com/lizishi/DeTRC, proj page: https://shirleymaxx.github.io/DeTRC/

详情

展开后加载摘要…

URL PDF HTML 收藏