arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1306 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1306 篇

2505.08239 2025-11-11 cs.GR cs.CV 57%

ACT-R: Adaptive Camera Trajectories for Single View 3D Reconstruction

Yizhi Wang, Mingrui Zhao, Hao Zhang

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments 3DV 2026, Project Page: https://mingrui-zhao.github.io/ACT-R/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16239 2025-11-07 cs.CV 57%

DOVE: Efficient One-Step Diffusion Model for Real-World Video Super-Resolution

Zheng Chen, Zichen Zou, Kewei Zhang, Xiongfei Su, Xin Yuan, Yong Guo, Yulun Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫阳学院) China Mobile Research Institute(中国移动研究院) Westlake University(西湖大学) Huawei Consumer Business Group(华为消费者业务集团)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025. Code is available at: https://github.com/zhengchen1999/DOVE

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05635 2025-11-05 cs.RO cs.CV 57%

Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation

Yue Liao, Pengfei Zhou, Siyuan Huang, Donglin Yang, Shengcong Chen, Yuxin Jiang, Yue Hu, Jingbin Cai, Si Liu, Jianlan Luo, Liliang Chen, Shuicheng Yan, Maoqing Yao, Guanghui Ren

机构 * AgiBot Genie Team(AgiBot Genie团队) LV-NUS Lab(LV-NUS实验室) BUAA(北京航空航天大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments https://genie-envisioner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24448 2025-11-04 cs.CV cs.AI 57%

Rethinking Visual Intelligence: Insights from Video Pretraining

Pablo Acuaviva, Aram Davtyan, Mariam Hassan, Sebastian Stapf, Ahmad Rahimi, Alexandre Alahi, Paolo Favaro

机构 * Computer Vision Group, University of Bern(伯尔尼大学计算机视觉组) VITA Lab, EPFL(苏黎世联邦理工学院VITA实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Updated version from preprint arXiv:2506.07280 (Gen2Gen) focused on visual intelligence. This work can be considered as v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08271 2025-11-04 cs.GR cs.CV cs.LG 57%

SViM3D: Stable Video Material Diffusion for Single Image 3D Generation

Andreas Engelhardt, Mark Boss, Vikram Voleti, Chun-Han Yao, Hendrik P. A. Lensch, Varun Jampani

机构 * Stability AI University of Tübingen(图宾根大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by International Conference on Computer Vision (ICCV 2025). Project page: http://svim3d.aengelhardt.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23402 2025-10-17 cs.CV 57%

WorldSplat: Gaussian-Centric Feed-Forward 4D Scene Generation for Autonomous Driving

Ziyue Zhu, Zhanqian Wu, Zhenxin Zhu, Lijun Zhou, Haiyang Sun, Bing Wan, Kun Ma, Guang Chen, Hangjun Ye, Jin Xie, jian Yang

机构 * Nankai University(南开大学) Nanjing University, Suzhou(南京大学苏州校区)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13678 2025-10-16 cs.CV 57%

FlashWorld: High-quality 3D Scene Generation within Seconds

Xinyang Li, Tengfei Wang, Zixiao Gu, Shengchuan Zhang, Chunchao Guo, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Tencent(腾讯) Yes Lab, Fudan University(复旦大学Yes实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://imlixinyang.github.io/FlashWorld-Project-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07654 2025-10-10 cs.CV 57%

Once Is Enough: Lightweight DiT-Based Video Virtual Try-On via One-Time Garment Appearance Injection

Yanjie Pan, Qingdong He, Lidong Wang, Bo Peng, Mingmin Chi

机构 * School of computer science, Shanghai key laboratory of data science, Fudan University, China(计算机学院、数据科学重点实验室、复旦大学) Tencent Youtu Lab, China(腾讯优图实验室) Shanghai Ocean University, China(上海海洋大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 5 pages (including references), 4 figures. Code and models will be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15742 2025-10-10 cs.CV 57%

Uncertainty-Aware Diffusion Guided Refinement of 3D Scenes

Sarosij Bose, Arindam Dutta, Sayak Nag, Junge Zhang, Jiachen Li, Konstantinos Karydis, Amit K. Roy Chowdhury

机构 * University of California, Riverside, USA(加州大学河滨分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07344 2025-10-09 cs.CV cs.AI 57%

Generative Pre-trained Autoregressive Diffusion Transformer

Yuan Zhang, Jiacheng Jiang, Guoqing Ma, Zhiying Lu, Haoyang Huang, Jianlong Yuan, Nan Duan, Daxin Jiang

机构 * University of Science and Technology of China(中国科学技术大学) StepFun, China(StepFun)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24210 2025-10-02 cs.CV cs.NA math.NA 57%

STORK: Faster Diffusion And Flow Matching Sampling By Resolving Both Stiffness And Structure-Dependence

Zheng Tan, Weizhen Wang, Andrea L. Bertozzi, Ernest K. Ryu

机构 * Department of Mathematics, University of California, Los Angeles(数学系,加州大学洛杉矶分校) Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24416 2025-09-30 cs.CV cs.AI 57%

CLQ: Cross-Layer Guided Orthogonal-based Quantization for Diffusion Transformers

Kai Liu, Shaoqiu Zhang, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 10 pages, 5 figures. Code is released at https://github.com/Kai-Liu001/CLQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06040 2025-09-30 cs.CV cs.AI cs.LG 57%

BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models

Yuming Li, Yikai Wang, Yuying Zhu, Zhongyu Zhao, Ming Lu, Qi She, Shanghang Zhang

机构 * Peking University(北京大学) Beijing Normal University(北京师范大学) ByteDance(字节跳动)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19838 2025-09-30 cs.CV 57%

SimpleGVR: A Simple Baseline for Latent-Cascaded Video Super-Resolution

Liangbin Xie, Yu Li, Shian Du, Menghan Xia, Xintao Wang, Fanghua Yu, Ziyan Chen, Pengfei Wan, Jiantao Zhou, Chao Dong

机构 * State Key Laboratory of Internet of Things for Smart City, University of Macau(澳门大学物联网智能城市国家重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Tsinghua University(清华大学) Kuaishou Technology(快手科技) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12053 2025-09-30 cs.CV cs.AI 57%

VFRTok: Variable Frame Rates Video Tokenizer with Duration-Proportional Information Assumption

Tianxiong Zhong, Xingye Tian, Boyuan Jiang, Xuebo Wang, Xin Tao, Pengfei Wan, Zhiwei Zhang

机构 * Beijing Institute of Technology(北京理工大学) Kling Team(Kling团队)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00639 2025-09-30 cs.CV cs.AI cs.LG stat.ML 57%

Half-order Fine-Tuning for Diffusion Model: A Recursive Likelihood Ratio Optimizer

Tao Ren, Zishi Zhang, Jingyang Jiang, Zehao Li, Shentao Qin, Yi Zheng, Guanghao Li, Qianyou Sun, Yan Li, Jiafeng Liang, Xinping Li, Yijie Peng

机构 * Peking University(北京大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.00796 2025-09-30 cs.LG cs.AI cs.CV 57%

Diffusion Models: A Comprehensive Survey of Methods and Applications

Ling Yang, Zhilong Zhang, Yang Song, Shenda Hong, Runsheng Xu, Yue Zhao, Wentao Zhang, Bin Cui, Ming-Hsuan Yang

机构 * Peking University(北京大学) OpenAI University of California, Los Angeles(加州大学洛杉矶分校) Carnegie Mellon University(卡内基梅隆大学) University of California at Merced(加州大学默塞德分校)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 59 pages, 19 figures, citing 396 (up-to-date) papers, project: https://github.com/YangLing0818/Diffusion-Models-Papers-Survey-Taxonomy, accepted by ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06028 2025-09-24 cs.CV 57%

SparseDiT: Token Sparsification for Efficient Diffusion Transformer

Shuning Chang, Pichao Wang, Jiasheng Tang, Fan Wang, Yi Yang

机构 * Zhejiang University(浙江大学) Damo Academy, Alibaba Group(阿里达摩院) Hupan Lab(虎斑实验室)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01799 2025-09-17 cs.CV 57%

WorldExplorer: Towards Generating Fully Navigable 3D Scenes

Manuel-Andreas Schneider, Lukas Höllein, Matthias Nießner

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted to SIGGRAPH Asia 2025. Project page: see https://mschneider456.github.io/world-explorer, video: see https://youtu.be/N6NJsNyiv6I, code: https://github.com/mschneider456/WorldExplorer

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21070 2025-08-29 cs.CV cs.LG 57%

Dress&Dance: Dress up and Dance as You Like It - Technical Preview

Jun-Kun Chen, Aayush Bansal, Minh Phuoc Vo, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) SpreeAI

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://immortalco.github.io/DressAndDance/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19852 2025-08-29 cs.CV 57%

Ego-centric Predictive Model Conditioned on Hand Trajectories

Binjie Zhang, Mike Zheng Shou

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Code: github.com/showlab/Ego-PM

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19204 2025-08-27 cs.CV cs.AI cs.GR 57%

LSD-3D: Large-Scale 3D Driving Scene Generation with Geometry Grounding

Julian Ost, Andrea Ramazzina, Amogh Joshi, Maximilian Bömer, Mario Bijelic, Felix Heide

机构 * Julian Ost(未知) Andrea Ramazzina(未知) Amogh Joshi(未知) Maximilian Bömer(未知) Mario Bijelic(未知) Felix Heide(未知)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project webpage: https://light.princeton.edu/LSD-3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16930 2025-08-26 eess.AS cs.CV cs.SD 57%

HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation

Sizhe Shan, Qiulin Li, Yutao Cui, Miles Yang, Yuehai Wang, Qun Yang, Jin Zhou, Zhao Zhong

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16212 2025-08-26 cs.CV cs.AI cs.LG 57%

OmniCache: A Trajectory-Oriented Global Perspective on Training-Free Cache Reuse for Diffusion Transformer Models

Huanpeng Chu, Wei Wu, Guanyu Fen, Yutao Zhang

机构 * Zhipu AI(智谱AI)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16211 2025-08-25 cs.CV 57%

Forecast then Calibrate: Feature Caching as ODE for Efficient Diffusion Transformers

Shikang Zheng, Liang Feng, Xinyu Wang, Qinming Zhou, Peiliang Cai, Chang Zou, Jiacheng Liu, Yuqi Lin, Junjie Chen, Yue Ma, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Fudan University(复旦大学) Tsinghua University(清华大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08170 2025-08-22 cs.CV 57%

ReconDreamer-RL: Enhancing Reinforcement Learning via Diffusion-based Scene Reconstruction

Chaojun Ni, Guosheng Zhao, Xiaofeng Wang, Zheng Zhu, Wenkang Qin, Xinze Chen, Guanghong Jia, Guan Huang, Wenjun Mei

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14811 2025-08-21 cs.CV 57%

Tinker: Diffusion's Gift to 3D--Multi-View Consistent Editing From Sparse Inputs without Per-Scene Optimization

Canyu Zhao, Xiaoman Li, Tianjian Feng, Zhiyue Zhao, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project webpage: https://aim-uofa.github.io/Tinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13300 2025-08-20 cs.CV cs.AI 57%

GaitCrafter: Diffusion Model for Biometric Preserving Gait Synthesis

Sirshapan Mitra, Yogesh S. Rawat

机构 * CRCV, University of Central Florida(CRCV,中央佛罗里达大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13154 2025-08-19 cs.CV 57%

4DNeX: Feed-Forward 4D Generative Modeling Made Easy

Zhaoxi Chen, Tianqi Liu, Long Zhuo, Jiawei Ren, Zeng Tao, He Zhu, Fangzhou Hong, Liang Pan, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://4dnex.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10905 2025-08-19 cs.CV cs.HC 57%

InterAnimate: Taming Region-aware Diffusion Model for Realistic Human Interaction Animation

Yukang Lin, Yan Hong, Zunnan Xu, Xindi Li, Chao Xu, Chuanbiao Song, Ronghui Li, Haoxing Chen, Jun Lan, Huijia Zhu, Weiqiang Wang, Jianfu Zhang, Xiu Li

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Accept to ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏