arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1306 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1306 篇

2504.17253 2025-04-25 cs.CV cs.MM 62%

DIVE: Inverting Conditional Diffusion Models for Discriminative Tasks

Yinqi Li, Hong Chang, Ruibing Hou, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, 100190, China, and University of Chinese Academy of Sciences, Beijing 100049, China(中国科学院信息处理重点实验室,计算技术研究所,北京,100190,中国,以及中国科学院大学,北京100049,中国)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、cs.MM

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14226 2025-02-21 cs.CV eess.IV 62%

Designing Parameter and Compute Efficient Diffusion Transformers using Distillation

Vignesh Sundaresha

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、eess.IV

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06997 2025-02-21 eess.IV cs.CV 62%

Conditional diffusion model with spatial attention and latent embedding for medical image segmentation

Behzad Hejrati, Soumyanil Banerjee, Carri Glide-Hurst, Ming Dong

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、eess.IV

Comments 13 pages, 5 figures, 3 tables, Accepted in MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01235 2025-01-06 cs.CV cs.LG eess.IV 62%

SVFR: A Unified Framework for Generalized Video Face Restoration

Zhiyao Wang, Xu Chen, Chengming Xu, Junwei Zhu, Xiaobin Hu, Jiangning Zhang, Chengjie Wang, Yuqi Liu, Yiyi Zhou, Rongrong Ji

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00093 2024-10-04 cs.CV cs.AI cs.GR cs.LG cs.MM 62%

Bootstrap3D: Improving Multi-view Diffusion Model with Synthetic Data

Zeyi Sun, Tong Wu, Pan Zhang, Yuhang Zang, Xiaoyi Dong, Yuanjun Xiong, Dahua Lin, Jiaqi Wang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、cs.MM

Comments Project Page: https://sunzey.github.io/Bootstrap3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15525 2024-09-25 eess.IV cs.CV cs.SD eess.AS 62%

Speech2rtMRI: Speech-Guided Diffusion Model for Real-time MRI Video of the Vocal Tract during Speech

Hong Nguyen, Sean Foley, Kevin Huang, Xuan Shi, Tiantian Feng, Shrikanth Narayanan

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、eess.IV

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05416 2024-08-13 cs.CV cs.AI cs.MM 62%

High-fidelity and Lip-synced Talking Face Synthesis via Landmark-based Diffusion Model

Weizhi Zhong, Junfan Lin, Peixin Chen, Liang Lin, Guanbin Li

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、cs.MM

Comments submitted to IEEE Transactions on Image Processing(TIP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06537 2024-06-12 eess.IV cs.AI cs.CV cs.LG 62%

Interactive Generation of Laparoscopic Videos with Diffusion Models

Ivan Iliash, Simeon Allmendinger, Felix Meissen, Niklas Kühl, Daniel Rückert

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、eess.IV

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05737 2024-04-01 cs.CV cs.AI cs.MM 62%

Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation

Lijun Yu, José Lezama, Nitesh B. Gundavarapu, Luca Versari, Kihyuk Sohn, David Minnen, Yong Cheng, Vighnesh Birodkar, Agrim Gupta, Xiuye Gu, Alexander G. Hauptmann, Boqing Gong, Ming-Hsuan Yang, Irfan Essa, David A. Ross, Lu Jiang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、cs.MM

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14863 2023-07-17 cs.CV cs.AI cs.LG cs.MM 62%

DiffTAD: Temporal Action Detection with Proposal Denoising Diffusion

Sauradip Nag, Xiatian Zhu, Jiankang Deng, Yi-Zhe Song, Tao Xiang

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV、cs.MM

Comments ICCV 2023; Code available at https://github.com/sauradip/DiffusionTAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.05233 2023-04-12 eess.IV cs.CV cs.LG 62%

Mask-conditioned latent diffusion for generating gastrointestinal polyp images

Roman Macháček, Leila Mozaffari, Zahra Sepasdar, Sravanthi Parasa, Pål Halvorsen, Michael A. Riegler, Vajira Thambawita

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27364 2025-11-03 cs.CV cs.AI 61%

Fine-Tuning Open Video Generators for Cinematic Scene Synthesis: A Small-Data Pipeline with LoRA and Wan2.1 I2V

Meftun Akarsu, Kerem Catay, Sedat Bin Vedat, Enes Kutay Yarkan, Ilke Senturk, Arda Sar, Dafne Eksioglu

机构 * AI Yapım Hagia Labs Singapore(AI Yapım 赫亚实验室新加坡) AI Engineer Hagia Labs İstanbul(AI工程师 赫亚实验室伊斯坦布尔) Full Stack Engineer Hagia Labs İstanbul(全栈工程师 赫亚实验室伊斯坦布尔) Chief Creator Hagia Labs İstanbul(首席创作者 赫亚实验室伊斯坦布尔)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV;video generation(comments)

Comments video generation, image-to-video, dif- fusion transformer, LoRA, fine-tuning, cinematic scene synthesis, multi-GPU inference, fully sharded data parallelism, computational efficiency

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20335 2026-08-21 cs.CV 新提交 57%

4DAnyone: Create Anyone in 4D from a Casual Monocular Video

4DAnyone:从随意的单目视频中创建4D虚拟人物

Yudong Jin, Tao Xie, Qihang Zhang, Zehong Shen, Zhen Xu, Yujun Shen, Hujun Bao, Xiaowei Zhou, Yinghao Xu

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Robbyant Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 4DAnyone是一种从单目视频重建4D人体的框架,通过RCP和TCR解决多视图一致性问题,在相关数据集上优于现有方法且泛化性好。

Comments Project page: https://4danyone.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19900 2026-08-21 cs.CV 新提交 57%

AvatarDynamizer: From Static to Dynamic Human Avatars via Generative Dynamic Textures

AvatarDynamizer:通过生成式动态纹理从静态化身到动态人类化身

Guoxing Sun, Heming Zhu, Linjie Lyu, Pascal Fua, Christian Theobalt, Marc Habermann

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) EPFL(洛桑联邦理工学院) VIA Research Center(VIA研究中心)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 AvatarDynamizer是一种生成式方法,可将现成静态3D化身转为可控多视角一致4D化身,通过纹理空间动态嵌入实现真实表面动态,在视觉保真度上优于通用方法。

Comments Project page: https://vcai.mpi-inf.mpg.de/projects/AvatarDynamizer

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19556 2026-08-21 cs.CV cs.AI 新提交 57%

Stream4D: 4D-Consistency for Streaming Autoregressive Diffusion Video Models

Stream4D:面向流式自回归扩散视频模型的4D一致性

Yuanhao Ban, Jiaqi Feng, Hengguang Zhou, Xiaohuan Pei, Justin Cui, Cho-Jui Hsieh

机构 * UCLA(加州大学洛杉矶分校) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 Stream4D用显式建模场景动力学的前馈4D重建奖励替代静态评判器,结合运动先验与感知锚,提升流式自回归扩散视频模型的4D重建质量、运动保留效果及人类对齐偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01590 2026-08-20 cs.CV cs.GR 版本更新 57%

Effective Multi-sensor Conditioning for Street-view Novel-view Synthesis

面向街景新视角合成的有效多传感器条件控制

Zhengfei Kuang, Adam Sun, Liyuan Zhu, Tong Wu, Shengqu Cai, Jonathan Tremblay, Iro Armeni, Ehsan Adeli, Lior Yariv, Gordon Wetzstein

机构 * Stanford Univerity(斯坦福大学) NVIDIA

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出StreetNVS视频扩散框架,通过参考增强相机注意力模块和相对射线级位置编码联合利用LiDAR、环视图像和相机位姿,实现稀疏LiDAR条件下的高质量街景新视角合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17973 2026-08-19 cs.CV 新提交 57%

LinCa: Accelerating Diffusion Models via Learnable Decomposed Feature Caching

LinCa:基于可学习分解特征缓存的扩散模型加速方法

Jinshan Liu, Haoran Qin, Xiaobing Tu, Jiacheng Liu, Jiahui Hu, Zhengan Yan, Yukun Xie, Kerui Shen, Jinkui Ren, Yuqi Lin, Xiantao Zhang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Terminal Intelligent Computing Division, Alibaba Cloud(阿里云终端智能计算事业部) South China University of Technology(华南理工大学) Jilin University(吉林大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出LinCa框架,通过可学习可逆网络分解缓存特征并差异化预测,仅需少量额外参数即可在5-7倍加速下使扩散模型保持近无损质量,性能优于现有方法。

Comments Accepted to ECCV 2026. 28 pages including appendix. Code: https://github.com/QHR69/LinCa

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17420 2026-08-19 cs.CV 新提交 57%

SPVC: Structured and Panoptic Video Fixing for Cross-Dataset Driving Scene Rendering

SPVC:面向跨数据集驾驶场景渲染的结构化全景视频修复

Gen Li, Shu Han, Yun Xi Qiao, Hua Chen, Xuyang Dai, Bohan Li, Hao Zhao, Chaojian Li

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Zhejiang University(浙江大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Great Wall Motor Company Limited(长城汽车股份有限公司) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出SPVC框架,通过结构化、全景、视频及跨数据集修复原则,训练两阶段可控视频扩散模型,解决驾驶场景渲染的伪影问题,实现跨数据集的高效修复。

Comments Project page: https://li00147.github.io/SPVC-Project-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15690 2026-08-18 cs.SD cs.AI cs.LG cs.MM 新提交 57%

Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer

为文本-音频-视频模型添加带单个零初始化层的语音克隆功能

Ivan Mikheev, Viacheslav Vasilev, Anna Dmitrienko, Alexey Letunovskiy, Ivan Kirillov, Kirill Chernyshev, Denis Dimitrov

机构 * Kandinsky Lab(坎丁斯基实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.MM

AI总结 本文在基础文本-音频-视频模型上添加单个零初始化线性层,经微调后实现语音克隆,在674个说话人-文本对基准上优于5个基线,且推理时可跳过视频路径提速约30倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18911 2026-08-18 cs.LG cs.AI cs.CV 版本更新 57%

Rethinking Token-wise Feature Caching: Accelerating Diffusion Transformers with Dual Feature Caching

重新思考逐令牌特征缓存:通过双特征缓存加速扩散Transformer

Chang Zou, Shikang Zheng, Evelyn Zhang, Runlin Guo, Haohang Xu, Zhengyi Shi, Conghui He, Xuming Hu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(南方科技大学) Beihang University(北航) Huawei Technologies Ltd(华为技术有限公司) Shanghai AI Lab(上海人工智能实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文针对逐令牌特征缓存的核心问题提出质疑,提出双特征缓存方法DuCa,在DiT等生成模型上实现了优于现有逐令牌特征缓存的性能。

Journal ref IEEE Transactions on Image Processing, vol. 35, pp. 6211-6220, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07546 2026-08-18 cs.CV 版本更新 57%

PickStyle: Video-to-Video Style Transfer with Context-Style Adapters

PickStyle:基于上下文-风格适配器的视频到视频风格迁移

Soroush Mehraban, Vida Adeli, Jacob Rommann, Kyryl Truskovskyi, Harrison Sanborn, Babak Taati, Cole Clifford

机构 * Pickford AI University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 PickStyle是一种视频到视频风格迁移框架,通过在预训练视频扩散骨干中插入低秩适配器、构建合成训练片段并提出CS-CFG,实现了优于现有基线的视频风格迁移效果。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31109 2026-08-17 cs.CV 版本更新 57%

InfiniVerse: Occupancy Guided Unbounded Scene Generation for Autonomous Driving

InfiniVerse: 面向自动驾驶的占用引导无界场景生成

Xiaoyu Ye, Leheng Li, Xinyu Ji, Yingjie Cai, Hongda He, Xu Yan, Guanyi Zhao, Ying-Cong Chen, Bingbing Liu, Shuguang Cui, Zhen Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanyang Technological University(南洋理工大学) Huawei Technologies Ltd.(华为技术有限公司) University of New South Wales(新南威尔士大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出InfiniVerse统一框架,通过3D占用表示和视频扩散模型实现从单帧到长距离、2D-3D对齐的动态城市场景可控生成,在Waymo和nuScenes上达到SOTA。

Comments Paper accepted as poster at ECCV workshop SPAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13460 2026-08-14 cs.CV 新提交 57%

SNM-VFI: Symmetric Nonlinear Motion-Guided Generative Video Frame Interpolation

SNM-VFI:对称非线性运动引导的生成式视频帧插值

Jisoo Jeong, Hong Cai, Jamie Menjay Lin, Hanno Ackermann, Hyeonjun Sim, Yinhao Zhu, Yunxiao Shi, Fatih Porikli

机构 * Qualcomm(高通公司)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出无需训练的SNM-VFI框架,结合预训练光流与视频扩散模型,用对称非线性运动模型引导生成过程,经多基准评估实现了优质视频帧插值效果。

Comments ECCVW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13043 2026-08-14 cs.AI cs.CV cs.LG 新提交 57%

From Local Mismatch to Global Impact: Optimizing Cache Reuse Policy for Efficient Diffusion

从局部失配到全局影响:优化缓存重用策略以实现高效扩散模型

Xichen Ye, Yifan Wu, Zhikang Xie, Xiangyu Yue, Cheng Jin, Weizhong Zhang

机构 * Faculty of Engineering, The Chinese University of Hong Kong(香港中文大学工程学院) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 针对扩散模型缓存策略与生成质量失配问题,提出GCache双层优化框架,在Wan2.1模型上实现2.17倍加速且LPIPS降至0.0316,性能优于现有缓存策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11745 2026-08-14 cs.CV 版本更新 57%

LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time

LiveAnimate:稳定的长时长流驱动人体动画实时生成系统

Yuxuan Zhang, Haozhong Xiong, Yubo Huang, Jiayi Song, Jinpeng Yu, Haofan Wang, Jiaming Liu, Ruihua Huang, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Qwen Applications Business Group of Alibaba(阿里巴巴通义千问应用业务组) Liblib AI

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 LiveAnimate基于14B参数视频DiT,经两阶段训练结合PR-Sink等设计,实现19.63 FPS长时长流人体动画生成,兼顾实时性、质量与稳定性,优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11618 2026-08-13 cs.CV 新提交 57%

Generative Video Compression Based on Hierarchical Referencing

基于分层参考的生成式视频压缩

Daowen Li, Ding Ding, Zifu Zhang, Kai Li, Ying Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出基于分层参考的生成式视频压缩方法GVCHR,通过分层结构优化潜在编码与生成重建,在多个基准数据集上较现有最优方法实现LPIPS和DISTS指标下50.5%、54.0%的BD-rate增益,视觉质量显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10479 2026-08-13 cs.CV 版本更新 57%

Bridging Event Streams and DiT: Event-Guided Video Frame Interpolation

连接事件流与DiT:事件引导的视频帧插值

Guixu Lin, Yuyang Yu, Xiang Ji, Linyao Chen, Zhengwei Yin, Mengshun Hu, Mingdeng Cao, Shengfeng He, Yinqiang Zheng

机构 * The University of Tokyo(东京大学) South China University of Technology(华南理工大学) Wuhan University(武汉大学) Singapore Management University(新加坡管理大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出基于适配器的框架,将事件衍生提示融入预训练图像转视频扩散模型,利用IWEs与双向稀疏光流引导生成,提升视频帧插值质量,效果优于现有SOTA方法。

Comments https://joseph-lin-tech.github.io/BridgeEventDiT-VFI/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02943 2026-08-13 cs.CV 版本更新 57%

TC-Padé: Trajectory-Consistent Padé Approximation for Diffusion Acceleration

TC-Padé:轨迹一致的Padé近似用于扩散加速

Benlei Cui, Shaoxuan He, Bukun Huang, Zhizeng Ye, Yunyun Sun, Longtao Huang, Hui Xue, Yang Yang, Jingqun Tang, Zhou Zhao, Haiwen Hong

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Zhejiang Gongshang University(浙江工商大学) ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 提出轨迹一致的Padé近似方法,通过有理函数建模特征演变,实现低步数下的高效扩散模型加速。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10744 2026-08-12 cs.CV 新提交 57%

Beyond Pixels: From Video Priors to 4D Worlds

超越像素:从视频先验到4D世界

Zihao Liu, Xiaolong Shen, Zhenglin Zhou, Ruijie Quan, Yi Yang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出Latent-to-4D方法,利用共享VAE的视频模型去噪潜在变量作为接口实现4D生成,在两个数据集上的DINO-F1指标优于对比方法,且受人类评估者认可。

Comments Project page: https://hayd-zju.github.io/Beyond-Pixels

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09926 2026-08-11 cs.CV 新提交 57%

Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning

学习世界如何演化:基于潜动态推理的外推视频世界模型

Haodong Li, Shaoteng Liu, Tianyu Wang, Chongjian Ge, Sihui Ji, Jiahan Zhang, Xin Lin, Haolin Lu, Zhe Lin, Manmohan Chandraker

机构 * UCSD(加利福尼亚大学圣迭戈分校) Adobe(奥多比公司)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 针对主流视频扩散模型未建模像素时间转换的问题,提出LDR方法,在PhyWorld基准上实现更优动态外推,参数更少、速度更快,是首个能泛化至训练分布外的视频世界模型

Comments Project page: https://lat-dyn-reason.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏