arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1308 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1308 篇

2602.22486 2026-04-10 stat.ML cs.LG math.ST stat.TH 50%

Flow Matching is Adaptive to Manifold Structures

流匹配适应于流形结构

Shivam Kumar, Yixin Wang, Lizhen Lin

机构 * Booth School of Business, University of Chicago(芝加哥大学布斯商学院) Department of Statistics, University of Michigan(密歇根大学统计系) Department of Mathematics, University of Maryland, College Park(马里兰大学帕克分校数学系)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文研究流匹配在流形支持下的收敛性,证明其在高维数据中适应数据几何并避免维度灾难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01552 2026-04-03 cs.LG 50%

ZEUS: Accelerating Diffusion Models with Only Second-Order Predictor

ZEUS:仅使用二阶预测器加速扩散模型

Yixiao Wang, Ting Jiang, Zishan Shao, Hancheng Ye, Jingwei Sun, Mingyuan Ma, Jianyi Zhang, Yiran Chen, Hai Li

机构 * Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系) Department of Computer Science, Duke University(杜克大学计算机科学系) Department of Statistical Science, Duke University(杜克大学统计科学系)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文提出ZEUS方法,通过二阶预测器减少去噪器调用,结合交错方案稳定连续跳过,实现高效加速,提升速度-保真度性能,达到3.2倍端到端提速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06623 2026-03-10 cs.LG 50%

Advances in GRPO for Generation Models: A Survey

生成模型中GRPO的进展:综述

Zexiang Liu, Xianglong He, Yangguang Li

机构 * SJTU(上海交通大学) THU(清华大学) CUHK(香港大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文综述了流GRPO在生成模型中的应用与进展,探讨了方法论改进和跨模态扩展,强调其作为通用对齐框架的重要性及未来挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02646 2026-03-04 cs.RO 50%

Compositional Visual Planning via Inference-Time Diffusion Scaling

通过推理时扩散缩放进行组合式视觉规划

Yixin Zhang, Yunhao Luo, Utkarsh Aashu Mishra, Woo Chul Shin, Yongxin Chen, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Michigan(密歇根大学)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 本文提出通过推理时扩散缩放进行组合式视觉规划,利用Tweedie估计强制边界一致,实现长时间范围的稳定规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06597 2026-02-09 cs.LG 50%

DiTS: Multimodal Diffusion Transformers Are Time Series Forecasters

DiTS:多模态扩散变换器是时间序列预测器

Haoran Zhang, Haixuan Liu, Yong Liu, Yunzhong Qiu, Yuxuan Wang, Jianmin Wang, Mingsheng Long

机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 DiTS通过双流Transformer块处理时间序列的内生和外生变量依赖,实现高效生成预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16163 2026-01-23 cs.AI cs.RO 50%

Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning

Cosmos Policy: 为视觉运动控制和规划微调视频模型

Moo Jin Kim, Yihuai Gao, Tsung-Yi Lin, Yen-Chen Lin, Yunhao Ge, Grace Lam, Percy Liang, Shuran Song, Ming-Yu Liu, Chelsea Finn, Jinwei Gu

机构 * NVIDIA Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 Cosmos Policy通过单阶段后训练将预训练视频模型转化为高效机器人策略,实现视觉运动控制与规划的先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04332 2025-12-25 cs.LG 50%

Data-regularized Reinforcement Learning for Diffusion Models at Scale

大规模扩散模型中的数据正则化强化学习

Haotian Ye, Kaiwen Zheng, Jiashu Xu, Puheng Li, Huayu Chen, Jiaqi Han, Sheng Liu, Qinsheng Zhang, Hanzi Mao, Zekun Hao, Prithvijit Chattopadhyay, Dinghao Yang, Liang Feng, Maosheng Liao, Junjie Bai, Ming-Yu Liu, James Zou, Stefano Ermon

机构 * Stanford University(斯坦福大学) NVIDIA Tsinghua University(清华大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 DDRL通过数据正则化方法提升扩散模型的奖励表现,有效缓解奖励黑客问题,实现高分辨率视频生成中的高人偏好和可扩展训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14133 2025-12-17 cs.GR 50%

AnimaMimic: Imitating 3D Animation from Video Priors

AnimaMimic:从视频先验模仿3D动画

Tianyi Xie, Yunuo Chen, Yaowei Guo, Yin Yang, Bolei Zhou, Demetri Terzopoulos, Ying Jiang, Chenfanfu Jiang

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 AnimaMimic通过视频扩散模型学习的运动先验,实现静态3D网格的自动动画生成,结合物理模拟提升真实感,整合进标准动画流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15979 2025-11-18 cs.GR cs.AI 50%

Dream, Lift, Animate: From Single Images to Animatable Gaussian Avatars

Marcel C. Bühler, Ye Yuan, Xueting Li, Yangyi Huang, Koki Nagano, Umar Iqbal

机构 * ETH Zurich(苏黎世联邦理工学院) NVIDIA(英伟达) Chinese University of Hong Kong(香港中文大学)

专题命中 视频扩散模型 :video diffusion(abstract)

Comments Accepted to 3DV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02608 2025-11-04 cs.LG physics.flu-dyn 50%

Lost in Latent Space: An Empirical Study of Latent Diffusion Models for Physics Emulation

François Rozet, Ruben Ohana, Michael McCabe, Gilles Louppe, François Lanusse, Shirley Ho

机构 * Polymathic AI Flatiron Institute University of Liège(列日大学) New York University(纽约大学) Princeton University(普林斯顿大学) Université Paris-Saclay, Université Paris Cité, CEA, CNRS, AIM(巴黎-萨克莱大学、巴黎-cite大学、CEA、CNRS、AIM)

专题命中 视频扩散模型 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25319 2025-10-30 cs.GR cs.AI 50%

4-Doodle: Text to 3D Sketches that Move!

Hao Chen, Jiaqi Wang, Yonggang Qi, Ke Li, Kaiyue Pang, Yi-Zhe Song

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) SketchX, CVSSP, University of Surrey(Surrey大学)

专题命中 视频扩散模型 :video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21991 2025-10-28 cs.RO cs.AI 50%

Two-Steps Diffusion Policy for Robotic Manipulation via Genetic Denoising

Mateo Clemente, Leo Brunswic, Rui Heng Yang, Xuan Zhao, Yasser Khalil, Haoyu Lei, Amir Rasouli, Yinchuan Li

机构 * Huawei Technologies Canada(华为技术加拿大)

专题命中 视频扩散模型 :video generation(abstract)

Comments 16 pages, 11 figure, 2 tables, accepted at Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03886 2025-10-07 cs.AI 50%

Rare Text Semantics Were Always There in Your Diffusion Transformer

Seil Kang, Woojung Han, Dayun Ju, Seong Jae Hwang

专题命中 视频扩散模型 :text-to-video(abstract)

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22199 2025-09-30 cs.RO cs.AI 50%

MimicDreamer: Aligning Human and Robot Demonstrations for Scalable VLA Training

Haoyun Li, Ivan Zhang, Runqi Ouyang, Xiaofeng Wang, Zheng Zhu, Zhiqin Yang, Zhentao Zhang, Boyuan Wang, Chaojun Ni, Wenkang Qin, Xinze Chen, Yun Ye, Guan Huang, Zhenbo Song, Xingang Wang

机构 * GigaAI CASIA NJUST(南京工业大学) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01442 2025-09-19 cs.RO 50%

Physically-based Lighting Generation for Robotic Manipulation

Shutong Jin, Lezhong Wang, Ben Temming, Florian T. Pokorny

机构 * KTH Royal Institute of Technology(皇家理工学院) Technical University of Denmark(丹麦技术大学)

专题命中 视频扩散模型 :video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06573 2025-09-09 cs.GR 50%

From Rigging to Waving: 3D-Guided Diffusion for Natural Animation of Hand-Drawn Characters

Jie Zhou, Linzi Qu, Miu-Ling Lam, Hongbo Fu

专题命中 视频扩散模型 :video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15843 2025-08-25 cs.NI 50%

xDiff: Online Diffusion Model for Collaborative Inter-Cell Interference Management in 5G O-RAN

Peihao Yan, Huacheng Zeng, Y. Thomas Hou

专题命中 视频扩散模型 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15260 2025-07-22 cs.LG 50%

CHORDS: Diffusion Sampling Accelerator with Multi-core Hierarchical ODE Solvers

Jiaqi Han, Haotian Ye, Puheng Li, Minkai Xu, James Zou, Stefano Ermon

机构 * Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video diffusion(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08438 2025-07-15 cs.RO stat.ML 50%

Diffusion Models for Robotic Manipulation: A Survey

Rosa Wolf, Yitian Shi, Sheng Liu, Rania Rayyes

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 视频扩散模型 :video generation(abstract)

Comments 26 pages, 2 figure, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07050 2025-07-10 cs.CL cs.LG stat.ML 50%

Discrete Diffusion Models for Language Generation

Ashen Weligalle

机构 * Department of Computer and Information Science(计算机与信息科学系)

专题命中 视频扩散模型 :video generation(abstract)

Comments pdfLaTeX, 69 pages with 21 figures, Licentiate Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01309 2025-07-03 cs.AR 50%

SD-Acc: Accelerating Stable Diffusion through Phase-aware Sampling and Hardware Co-Optimizations

Zhican Wang, Guanghui He, Hongxiang Fan

专题命中 视频扩散模型 :video generation(abstract)

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17301 2025-07-03 cs.GR 50%

FramePrompt: In-context Controllable Animation with Zero Structural Changes

Guian Fang, Yuchao Gu, Mike Zheng Shou

专题命中 视频扩散模型 :video diffusion(abstract)

Comments Project page: https://frameprompt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21478 2025-06-27 cs.SD cs.AI 50%

SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture

Kehan Sui, Jinxu Xiang, Fang Jin

机构 * George Washington University(乔治华盛顿大学)

专题命中 视频扩散模型 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13497 2025-06-17 cs.DC 50%

DDiT: Dynamic Resource Allocation for Diffusion Transformer Model Serving

Heyang Huang, Cunchen Hu, Jiaqi Zhu, Ziyuan Gao, Liangliang Xu, Yizhou Shan, Yungang Bao, Sun Ninghui, Tianwei Zhang, Sa Wang

专题命中 视频扩散模型 :text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03099 2025-06-04 cs.SD cs.AI cs.GR 50%

TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models

Chetwin Low, Weimin Wang

机构 * Character AI

专题命中 视频扩散模型 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10510 2025-05-23 cs.LG 50%

SmoothCache: A Universal Inference Acceleration Technique for Diffusion Transformers

Joseph Liu, Joshua Geddes, Ziyu Guo, Haomiao Jiang, Mahesh Kumar Nandwana

机构 * Roblox(Roblox公司) Queen’s University(女王大学)

专题命中 视频扩散模型 :text-to-video(abstract)

Comments Code can be found at https://github.com/Roblox/SmoothCache. Accepted at CVPR eLVM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09286 2025-05-22 cs.RO cs.AI cs.LG 50%

Learning Novel Skills from Language-Generated Demonstrations

Ao-Qun Jin, Tian-Yu Xiang, Xiao-Hu Zhou, Mei-Jiang Gui, Xiao-Liang Xie, Shi-Qi Liu, Shuang-Yi Wang, Yue Cao, Sheng-Bin Duan, Fu-Chao Xie, Zeng-Guang Hou

机构 * Institute of Automation Chinese Academy of Sciences(自动化研究所,中国科学院)

专题命中 视频扩散模型 :video diffusion(abstract)

Comments 10 pages, International Conference on Learning Representations (ICLR) 2025 Workshop on Generative Models for Robot Learning (GenBot)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21314 2025-05-01 cs.LG stat.ML 50%

Capturing Conditional Dependence via Auto-regressive Diffusion Models

Xunpeng Huang, Yujin Han, Difan Zou, Yian Ma, Tong Zhang

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 视频扩散模型 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20754 2025-04-30 cs.LG 50%

DDPS: Discrete Diffusion Posterior Sampling for Paths in Layered Graphs

Hao Luan, See-Kiong Ng, Chun Kai Ling

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所)

专题命中 视频扩散模型 :video generation(abstract)

Comments To appear at Frontiers in Probabilistic Inference: Sampling meets Learning (FPI) workshop at ICLR 2025. https://openreview.net/forum?id=DBdkU0Ikzy

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07566 2025-04-21 cs.LG cs.AI 50%

Diffusion Transformers for Tabular Data Time Series Generation

Fabrizio Garuti, Enver Sangineto, Simone Luetto, Lorenzo Forni, Rita Cucchiara

专题命中 视频扩散模型 :video generation(abstract)

Comments Accepted at ICLR 2025. 26 pages, 19 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏