arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1306 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1306 篇

2512.14095 2025-12-17 cs.CV 57%

AnchorHOI: Zero-shot Generation of 4D Human-Object Interaction via Anchor-based Prior Distillation

AnchorHOI: 通过基于锚点的先验蒸馏实现零样本4D人-物交互生成

Sisi Dai, Kai Xu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 AnchorHOI通过基于锚点的先验蒸馏策略,结合视频扩散模型提升4D人-物交互生成的多样性和泛化能力。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13690 2025-12-16 cs.CV cs.AI cs.GR cs.LG 57%

DiffusionBrowser: Interactive Diffusion Previews via Multi-Branch Decoders

DiffusionBrowser: 通过多分支解码器实现交互式扩散预览

Susung Hong, Chongjian Ge, Zhifei Zhang, Jui-Hsien Wang

机构 * University of Washington(华盛顿大学) Adobe Research(Adobe研究)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 DiffusionBrowser通过多分支解码器实现交互式视频生成预览,提升生成效率与可控性。

Comments Project page: https://susunghong.github.io/DiffusionBrowser

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13290 2025-12-16 cs.CV cs.AI cs.LG 57%

LINA: Learning INterventions Adaptively for Physical Alignment and Generalization in Diffusion Models

LINA: 为扩散模型中的物理对齐和泛化学习适应性干预

Shu Yu, Chaochao Lu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 LINA通过学习适应性干预,提升扩散模型在物理对齐和超出分布指令跟随方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12508 2025-12-16 cs.CV cs.LG 57%

Generative Spatiotemporal Data Augmentation

生成性时空数据增强

Jinfan Zhou, Lixin Luo, Sungmin Eum, Heesung Kwon, Jeong Joon Park

机构 * University of Chicago(芝加哥大学) University of Michigan, Ann Arbor(安娜堡大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出利用视频扩散模型生成时空数据以增强模型性能,尤其在数据稀缺情况下提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11645 2025-12-15 cs.CV 57%

FactorPortrait: Controllable Portrait Animation via Disentangled Expression, Pose, and Viewpoint

FactorPortrait: 通过解耦的表情、姿态和视角实现可控的肖像动画

Jiapeng Tang, Kai Li, Chengxiang Yin, Liuhao Ge, Fei Jiang, Jiu Xu, Matthias Nießner, Christian Häne, Timur Bagautdinov, Egor Zakharov, Peihong Guo

机构 * Meta Reality Labs(Meta现实实验室) Technical University of Munich(慕尼黑技术大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 FactorPortrait通过解耦表情、姿态和视角实现可控肖像动画,利用预训练编码器和3D网格跟踪生成逼真动态效果。

Comments Project page: https://tangjiapeng.github.io/FactorPortrait/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11274 2025-12-15 cs.CV 57%

FilmWeaver: Weaving Consistent Multi-Shot Videos with Cache-Guided Autoregressive Diffusion

FilmWeaver: 通过缓存引导自回归扩散编织一致的多镜头视频

Xiangyang Luo, Qingyu Li, Xiaokun Liu, Wenyu Qin, Miao Yang, Meng Wang, Pengfei Wan, Di Zhang, Kun Gai, Shao-Lun Huang

机构 * Kling Team, Kuaishou Technology(快手科技 Kling Team)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 FilmWeaver通过缓存引导自回归扩散模型实现多镜头视频的一致性生成,支持灵活交互和多任务应用。

Comments AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11253 2025-12-15 cs.CV 57%

PersonaLive! Expressive Portrait Image Animation for Live Streaming

PersonaLive! 用于直播的 expressive 人物图像动画

Zhiyuan Li, Chi-Man Pun, Chen Fang, Jue Wang, Xiaodong Cun

机构 * University of Macau(澳门大学) GVC Lab, Great Bay University(大湾大学GVC实验室)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 PersonaLive通过多阶段训练方法实现了实时面部动画生成,提升了效率和稳定性,达到7-22倍的速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11225 2025-12-15 cs.CV cs.AI cs.LG 57%

VFMF: World Modeling by Forecasting Vision Foundation Model Features

VFMF:通过预测视觉基础模型特征进行世界建模

Gabrijel Boduljak, Yushi Lan, Christian Rupprecht, Andrea Vedaldi

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出了一种基于VFM特征的生成预测器,通过自回归流匹配在潜在空间中实现更准确的预测,提升世界建模的效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09418 2025-12-11 cs.CV 57%

Label-free Motion-Conditioned Diffusion Model for Cardiac Ultrasound Synthesis

无标签的运动条件化扩散模型用于心脏超声合成

Zhe Li, Hadrien Reynaud, Johanna P Müller, Bernhard Kainz

机构 * Department AIBE, FAU Erlangen-Nürnberg(AIBE部门,埃尔朗根-纽伦堡大学) Department of Computing, Imperial College London(计算系,伦敦帝国理工学院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出无标签的运动条件化扩散模型,通过自监督运动特征生成逼真的心脏超声视频,无需手动标注。

Comments Accepted at MICAD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09417 2025-12-11 cs.CV 57%

DirectSwap: Mask-Free Cross-Identity Training and Benchmarking for Expression-Consistent Video Head Swapping

DirectSwap: 无掩码跨身份训练与基准测试用于表情一致的视频头部交换

Yanan Wang, Shengcai Liao, Panwen Hu, Xin Li, Fan Yang, Xiaodan Liang

机构 * MBZUAI(马克斯·普朗克智能研究院) UAEU(阿拉伯联合酋长国大学) AIQ(人工智能量子研究所) SYSU(南方大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 DirectSwap通过无掩码直接视频头部交换框架,结合运动和表情感知重建损失,实现了跨身份视频头部交换的高质量和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09406 2025-12-11 cs.RO cs.AI cs.CV 57%

H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos

H2R-Grounder:一种无需配对数据的视频到物理 grounded 机器人视频翻译范式

Hai Ci, Xiaokang Liu, Pei Yang, Yiren Song, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学显示实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 H2R-Grounder通过无需配对数据的方法,将人类交互视频转换为物理 grounded 的机器人视频,提升机器人学习的现实感和扩展性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06670 2025-12-10 cs.CV 57%

Video Dataset Condensation with Diffusion Models

视频数据集压缩与扩散模型

Zhe Li, Hadrien Reynaud, Mischa Dombrowski, Sarah Cechnicka, Franciskus Xaverius Erick, Bernhard Kainz

机构 * Department AIBE FAU Erlangen-Nürnberg(FAU埃尔朗根-纽伦堡AIBE部门) Department of Computing Imperial College London(伦敦帝国理工学院计算系)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出基于扩散模型和VST-UNet的视频数据集压缩方法,结合训练免费聚类算法,有效提升视频数据集蒸馏性能,达到10.61%的性能提升。

Comments Accepted at BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05952 2025-12-09 cs.CV 57%

Coefficients-Preserving Sampling for Reinforcement Learning with Flow Matching

为流匹配强化学习中的系数保持采样

Feng Wang, Zihao Yu

机构 * CreateAI

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 通过系数保持采样方法,减少流匹配强化学习中的噪声伪影,提升奖励建模精度和优化器收敛稳定性。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10963 2025-12-09 cs.CV 57%

EVCtrl: Efficient Control Adapter for Visual Generation

EVCtrl: 用于视觉生成的高效控制适配器

Zixiang Yang, Yue Ma, Yinhan Zhang, Shanhui Mo, Dongrui Liu, Linfeng Zhang

机构 * UESTC(电子科技大学) HKUST(香港科技大学) SJTU(上海交通大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 EVCtrl通过轻量级控制适配器提升视觉生成效率,实现高效可控生成,无需重新训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01686 2025-12-02 cs.CV 57%

DreamingComics: A Story Visualization Pipeline via Subject and Layout Customized Generation using Video Models

DreamingComics: 通过主体和布局定制生成实现故事可视化管道

Patrick Kwon, Chen Chen

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 DreamingComics通过结合视频模型和布局生成技术,实现了基于主体和布局定制的高效故事可视化方法,提升了角色一致性和风格相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01481 2025-12-02 cs.CV 57%

ChronosObserver: Taming 4D World with Hyperspace Diffusion Sampling

ChronosObserver: 用超空间扩散采样驯服4D世界

Qisen Wang, Yifan Zhao, Peisen Shen, Jialu Li, Jia Li

机构 * State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 ChronosObserver通过超空间表示和引导采样,实现无需训练的高质量多视角时间同步视频生成,解决4D世界生成难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00532 2025-12-02 cs.CV cs.RO 57%

Image Generation as a Visual Planner for Robotic Manipulation

图像生成作为机器人操作的视觉规划器

Ye Pang

机构 * Southern China University of Technology(华南理工大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出利用图像生成模型作为机器人视觉规划器,通过轻度微调实现时间连贯的机器人操作视频生成。

Comments 11 pages 9 figures Under review at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23886 2025-12-02 cs.CV 57%

Generating Fit Check Videos with a Handheld Camera

使用手持相机生成符合检查的视频

Bowei Chen, Brian Curless, Ira Kemelmacher-Shlizerman, Steven M. Seitz

机构 * University of Washington(华盛顿大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于视频扩散模型的方法,利用手持设备和静态照片生成逼真的全身视频,通过多参考注意力机制和图像微调策略提升视频真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18255 2025-11-27 cs.CV 57%

Sequence-Adaptive Video Prediction in Continuous Streams using Diffusion Noise Optimization

基于扩散噪声优化的连续流序列适应视频预测

Sina Mokhtarzadeh Azar, Emad Bahrami, Enrico Pallotta, Gianpiero Francesca, Radu Timofte, Juergen Gall

机构 * University of Bonn(波恩大学) Toyota Motor Europe(丰田欧洲公司) University of Wuerzburg(乌尔姆大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究所)

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散噪声优化的连续流序列适应视频预测方法,通过在推理过程中细化扩散噪声以提升视频预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16565 2025-11-26 cs.CV 57%

M2SVid: End-to-End Inpainting and Refinement for Monocular-to-Stereo Video Conversion

M2SVid:单目到立体视频转换的端到端修复与细化

Nina Shvetsova, Goutam Bhat, Prune Truong, Hilde Kuehne, Federico Tombari

机构 * Google(谷歌) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学) Goethe University Frankfurt(法兰克福歌德大学) MPI for Informatics, Saarland Informatics Campus(信息研究所,萨尔兰信息校区) Technical University of Munich(慕尼黑技术大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 M2SVid通过端到端修复和细化技术,实现单目到立体视频转换,生成高质量右视图并提升效率。

Comments To be published at 3DV 2026, project webpage https://m2svid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18786 2025-11-25 cs.CV 57%

STCDiT: Spatio-Temporally Consistent Diffusion Transformer for High-Quality Video Super-Resolution

STCDiT:一种时空一致的扩散变换器用于高质量视频超分辨率

Junyang Chen, Jiangxin Dong, Long Sun, Yixin Yang, Jinshan Pan

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 STCDiT通过结合运动感知的VAE重建和锚帧指导方法,实现了高质量视频超分辨率,提升了结构保真度和时间一致性。

Comments Project page: https://jychen9811.github.io/STCDiT_page

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14208 2025-11-25 cs.CV 57%

InstantViR: Real-Time Video Inverse Problem Solver with Distilled Diffusion Prior

InstantViR: 基于蒸馏扩散先验的实时视频逆问题求解器

Weimin Bai, Suzhe Xu, Yiwei Ren, Jinhua Hao, Ming Sun, Wenzheng Chen, He Sun

机构 * Peking University(北京大学) Huaqiao University(华侨大学) Kuaishou Technology(快手科技)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 InstantViR通过蒸馏扩散先验实现高效实时视频重建,以35 FPS速度在NVIDIA A100 GPU上达到与基线相当的重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23584 2025-11-21 cs.CV 57%

VividFace: High-Quality and Efficient One-Step Diffusion For Video Face Enhancement

VividFace: 高质量和高效的一步扩散用于视频面部增强

Shulian Zhang, Yong Guo, Long Peng, Ziyang Wang, Ye Chen, Wenbo Li, Xiao Zhang, Yulun Zhang, Jian Chen

机构 * South China University of Technology(华南理工大学) Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Nanjing University of Science and Technology(南京理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 VividFace通过单步扩散框架和联合训练策略,高效提升视频面部增强的高质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24006 2025-11-20 cs.LG cs.AI cs.CV 57%

SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attention

Jintao Zhang, Haoxu Wang, Kai Jiang, Shuo Yang, Kaiwen Zheng, Haocheng Xi, Ziteng Wang, Hongzhou Zhu, Min Zhao, Ion Stoica, Joseph E. Gonzalez, Jun Zhu, Jianfei Chen

机构 * Tsinghua University(清华大学) UC Berkeley(伯克利大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13121 2025-11-18 cs.CV 57%

CloseUpShot: Close-up Novel View Synthesis from Sparse-views via Point-conditioned Diffusion Model

Yuqi Zhang, Guanying Chen, Jiaxing Chen, Chuanyu Fu, Chuan Huang, Shuguang Cui

机构 * Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来网络智能研究院(FNii-深圳)) Chinese University of Hong Kong at Shenzhen (CUHKSZ)(香港中文大学(深圳)) Sun Yat-sen University(中山大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Link: https://zyqz97.github.io/CloseUpShot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03457 2025-11-18 cs.GR cs.CV cs.SD eess.AS 57%

READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation

Haotian Wang, Yuzhe Weng, Jun Du, Haoran Xu, Xiaoyan Wu, Shan He, Bing Yin, Cong Liu, Jianqing Gao, Qingfeng Liu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project page: https://readportrait.github.io/READ/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01895 2025-11-18 cs.RO cs.CV cs.LG 57%

EnerVerse: Envisioning Embodied Future Space for Robotics Manipulation

Siyuan Huang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Zhengkai Jiang, Yue Hu, Yue Liao, Peng Gao, Hongsheng Li, Maoqing Yao, Guanghui Ren

机构 * SJTU(上海交通大学) AgiBot Shanghai AI Lab(上海人工智能实验室) CUHK MMLab(香港大学多模态实验室) LV-NUS Lab(南洋理工大学-立陶宛实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025. Website: https://sites.google.com/view/enerverse

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11213 2025-11-17 cs.CV 57%

RealisticDreamer: Guidance Score Distillation for Few-shot Gaussian Splatting

Ruocheng Wu, Haolan He, Yufei Wang, Zhihao Li, Bihan Wen

机构 * University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05314 2025-11-14 cs.RO cs.AI cs.CV 57%

ManipDreamer3D : Synthesizing Plausible Robotic Manipulation Video with Occupancy-aware 3D Trajectory

Ying Li, Xiaobao Wei, Xiaowei Chi, Yuming Li, Zhongyu Zhao, Hao Wang, Ningning Ma, Ming Lu, Sirui Han, Shanghang Zhang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments 7pages; 7figures; 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20756 2025-11-11 cs.CV 57%

StereoDiff: Stereo-Diffusion Synergy for Video Depth Estimation

Haodong Li, Chen Wang, Jiahui Lei, Kostas Daniilidis, Lingjie Liu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Pennsylvania(宾夕法尼亚大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Work done in Nov 2024, during an internship at the University of Pennsylvania. Project page: https://stereodiff.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏