arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2160 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2160 篇

2507.07978 2025-12-08 cs.CV 57%

Martian World Model: Controllable Video Synthesis with Physically Accurate 3D Reconstructions

火星世界模型:可控视频合成与物理准确的3D重建

Longfei Li, Zhiwen Fan, Wenyan Cong, Xinhang Liu, Yuyang Yin, Matt Foutter, Panwang Pan, Chenyu You, Yue Wang, Zhangyang Wang, Yao Zhao, Marco Pavone, Yunchao Wei

机构 * BJTU(北京工业大学) UT Austin(德克萨斯大学奥斯汀分校) HKUST(香港科技大学) Stanford University(斯坦福大学) XMU(厦门大学) SBU(雪城大学) USC(南加州大学) NVIDIA(英伟达)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出M3arsSynth和MarsGen,通过物理准确的3D重建生成逼真的火星视频,提升任务模拟与机器人训练的可视化效果。

Comments Project Page: https://marsgenai.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04483 2025-12-05 cs.CV 57%

DeRA: Decoupled Representation Alignment for Video Tokenization

DeRA: 解耦表示对齐用于视频标记化

Pengbo Guo, Junke Wang, Zhen Xing, Chengxu Liu, Daoguo Dong, Xueming Qian, Zuxuan Wu

机构 * Xi’an Jiaotong University(西安交通大学) Shanghai Innovation Institute(上海创新研究院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 DeRA通过解耦时空表示学习,提升视频标记化效率和性能,并在视频生成任务中取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25998 2025-12-05 cs.CV cs.AI 57%

VRWKV-Editor: Reducing quadratic complexity in transformer-based video editing

VRWKV-Editor: 降低基于变换器的视频编辑中的二次复杂度

Abdelilah Aitrouga, Youssef Hmamouche, Amal El Fallah Seghrouchni

机构 * International Artificial Intelligence Center of Morocco University Mohammed VI Polytechnic Rabat, Morocco(摩洛哥国际人工智能中心摩洛哥穆莱·伊沙克·穆莱·阿卜杜勒阿齐兹 polytechnic 大学拉巴特分校) University Mohammed VI Polytechnic Rabat, Morocco(摩洛哥穆莱·伊沙克·穆莱·阿卜杜勒阿齐兹 polytechnic 大学拉巴特分校) Sorbonne University, LIP6 - UMR 7606 CNRS, France(索邦大学,LIP6 - UMR 7606 CNRS,法国)

专题命中 视频生成 :long video(abstract);分类 cs.CV

AI总结 VRWKV-Editor通过引入线性时空聚合模块,降低基于变换器的视频编辑模型的计算复杂度,实现3.7倍加速和60%内存节省,同时保持高质量的帧一致性和文本对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03013 2025-12-03 cs.CV cs.AI cs.GR 57%

In-Context Sync-LoRA for Portrait Video Editing

上下文同步LoRA用于肖像视频编辑

Sagi Polaczek, Or Patashnik, Ali Mahdavi-Amiri, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学) Simon Fraser University(Simon Fraser大学)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 Sync-LoRA通过上下文LoRA实现肖像视频编辑,保持帧同步和身份一致性,支持多样化的修改如外观变化和物体添加。

Comments Project page: https://sagipolaczek.github.io/Sync-LoRA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23172 2025-12-02 cs.CV 57%

Fast Multi-view Consistent 3D Editing with Video Priors

快速多视角一致3D编辑与视频先验

Liyi Chen, Ruihuang Li, Guowen Zhang, Pengfei Wang, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出ViP3DE方法,利用视频生成模型的时间一致性先验,实现多视角一致的3D编辑,提升编辑质量和速度。

Comments accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00762 2025-12-02 cs.CV 57%

Seeing the Wind from a Falling Leaf

从飘落的树叶中看到风

Zhiyuan Gao, Jiageng Mao, Hong-Xing Yu, Haozhe Lou, Emily Yue-Ting Jia, Jernej Barbic, Jiajun Wu, Yue Wang

机构 * University of Southern California(南加州大学) Stanford University(斯坦福大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出一种端到端可微逆图形框架,通过视频恢复不可见的物理力,应用于风场估计和基于物理的视频生成与编辑。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21475 2025-11-27 cs.CV 57%

MobileI2V: Fast and High-Resolution Image-to-Video on Mobile Devices

MobileI2V: 一种适用于移动设备的快速高分辨率图像到视频生成方法

Shuai Zhang, Bao Tang, Siyuan Yu, Yueting Zhu, Jingfeng Yao, Ya Zou, Shanglin Yuan, Li Yu, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 MobileI2V通过轻量级扩散模型和优化策略,在移动设备上实现快速高分辨率图像到视频生成,生成速度提升10倍,质量与现有模型相当。

Comments Our Demo and code:https://github.com/hustvl/MobileI2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20426 2025-11-26 cs.CV cs.AI 57%

Block Cascading: Training Free Acceleration of Block-Causal Video Models

块级级联:无训练加速块因果视频模型

Hmrishav Bandyopadhyay, Nikhil Pinnaparaju, Rahim Entezari, Jim Scott, Yi-Zhe Song, Varun Jampani

机构 * Stability AI SketchX, University of Surrey(SketchX, Surrey大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 块级级联通过无训练并行化技术,显著提升块因果视频模型的推理速度,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19435 2025-11-26 cs.CV 57%

Are Image-to-Video Models Good Zero-Shot Image Editors?

图像到视频模型是否是良好的零样本图像编辑器?

Zechuan Zhang, Zhenyuan Chen, Zongxin Yang, Yi Yang

机构 * Zhejiang University(浙江大学) Harvard University(哈佛大学)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 IF-Edit通过无需微调的框架,利用预训练图像到视频扩散模型实现指令驱动的图像编辑,解决提示错位、冗余时间潜在特征和模糊后期帧问题,展现强大的推理能力和通用编辑竞争力。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14993 2025-11-26 cs.AI cs.CV 57%

Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification

多模态生成式AI:多模态大语言模型、扩散模型与统一

Xin Wang, Yuwei Zhou, Bin Huang, Hong Chen, Wenwu Zhu

机构 * Department of Computer Science, Beijing Information Science and Technology National Research Center, Tsinghua University(计算机系,北京信息科学与技术国家研究中心,清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文综述了多模态生成式AI,涵盖多模态LLMs、扩散模型及统一模型的设计与应用,探讨了统一理解和生成的方法及未来研究方向。

Comments 21 pages, 10 figures, 3 tables

Journal ref IEEE Transactions on Circuits and Systems for Video Technology 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16655 2025-11-26 cs.CV 57%

MovieDreamer: Hierarchical Generation for Coherent Long Visual Sequence

MovieDreamer:用于生成连贯长视觉序列的分层生成

Canyu Zhao, Mingyu Liu, Wen Wang, Weihua Chen, Fan Wang, Hao Chen, Bo Zhang, Chunhua Shen

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 MovieDreamer通过结合自回归模型与扩散渲染,实现长时长视频生成,提升叙事连贯性和视觉质量。

Comments 30 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19401 2025-11-25 cs.CV cs.AI 57%

In-Video Instructions: Visual Signals as Generative Control

视频中的指令:将视觉信号作为生成控制

Gongfan Fang, Xinyin Ma, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本研究提出通过视频中嵌入的视觉信号作为指令,实现可控的图像到视频生成,通过空间感知的指令分配提升多对象场景下的生成可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18919 2025-11-25 cs.CV cs.AI 57%

Learning What to Trust: Bayesian Prior-Guided Optimization for Visual Generation

学习信任什么:基于贝叶斯先验引导的视觉生成优化

Ruiying Liu, Yuanzhi Liang, Haibin Huang, Tianshu Yu, Chi Zhang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出贝叶斯先验引导优化方法,通过建模奖励不确定性提升视觉生成模型的语义对齐和感知保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20840 2025-11-25 cs.RO cs.AI cs.MM 57%

Learning Primitive Embodied World Models: Towards Scalable Robotic Learning

学习原始具身世界模型:迈向可扩展的机器人学习

Qiao Sun, Liujia Yang, Wei Tang, Wei Huang, Kaixin Xu, Yongchao Chen, Mingyu Liu, Jiange Yang, Haoyi Zhu, Yating Wang, Tong He, Yilun Chen, Xili Dai, Nanyang Ye, Qinying Gu

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan(复旦大学) SJTU(上海交通大学) NJUST(南京理工大学) THU(清华大学) Harvard(哈佛大学) ZJU(浙江大学) NJU(南京大学) USTC(中国科学技术大学) Tongji(同济大学) HKUST (GZ)(香港科技大学(广州))

专题命中 视频生成 :video generation(abstract);分类 cs.MM

AI总结 提出原始具身世界模型(PEWM)以解决具身数据稀疏和高维问题,通过短视界视频生成实现细粒度对齐、降低学习复杂度并提高数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18277 2025-11-25 cs.CV 57%

Point-to-Point: Sparse Motion Guidance for Controllable Video Editing

点到点:用于可控视频编辑的稀疏运动引导

Yeji Song, Jaehyun Lee, Mijin Koo, JunHoo Lee, Nojun Kwak

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 Point-to-Point通过引入锚点标记,利用视频扩散模型的先验知识,实现可控视频编辑中运动与编辑的高质量保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16783 2025-11-24 cs.HC cs.AI cs.CV 57%

Generative Augmented Reality: Paradigms, Technologies, and Future Applications

生成增强现实:范式、技术与未来应用

Chen Liang, Jiawen Zheng, Yufeng Zeng, Yi Tan, Hengye Lyu, Yuhui Zheng, Zisu Li, Yueting Weng, Jiaxin Shi, Hanwang Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Nanyang Technological University(南洋理工大学) XMax.AI Ltd.(XMax.AI有限公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出生成增强现实(GAR)作为下一代AR范式,通过统一生成模型实现环境再合成,提升真实感与沉浸感,同时引发技术、内容生态及伦理挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18137 2025-11-20 cs.LG cs.AI cs.CV cs.PF 57%

SpargeAttention: Accurate and Training-free Sparse Attention Accelerating Any Model Inference

Jintao Zhang, Chendong Xiang, Haofeng Huang, Jia Wei, Haocheng Xi, Jun Zhu, Jianfei Chen

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究所,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学) Institute for Interdisciplinary Information Sciences, Tsinghua University(交叉信息学院,清华大学) EECS, University of California, Berkeley(电子工程与计算机科学系,加州大学伯克利分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments @inproceedings{zhang2025spargeattn, title={Spargeattn: Accurate sparse attention accelerating any model inference}, author={Zhang, Jintao and Xiang, Chendong and Huang, Haofeng and Wei, Jia and Xi, Haocheng and Zhu, Jun and Chen, Jianfei}, booktitle={International Conference on Machine Learning (ICML)}, year={2025} }

Journal ref Proceedings of the 42 nd International Conference on Machine Learning, PMLR 267, 2025 (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15874 2025-11-19 cs.RO cs.AI cs.CV 57%

Spatial Policy: Guiding Visuomotor Robotic Manipulation with Spatial-Aware Modeling and Reasoning

Yijun Liu, Yuwei Liu, Yuan Meng, Jieheng Zhang, Yuwei Zhou, Ye Li, Jiacheng Jiang, Kangye Ji, Shijia Ge, Zhi Wang, Wenwu Zhu

机构 * Tsinghua University(清华大学) Beijing University of Technology(北京理工大学) Guangzhou University(广州大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01711 2025-11-19 cs.CV cs.AI 57%

GAIS: Frame-Level Gated Audio-Visual Integration with Semantic Variance-Scaled Perturbation for Text-Video Retrieval

Bowen Yang, Yun Cao, Chen He, Xiaosu Su

机构 * School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17685 2025-11-12 cs.CV 57%

FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving

Shuang Zeng, Xinyuan Chang, Mengwei Xie, Xinran Liu, Yifan Bai, Zheng Pan, Mu Xu, Xing Wei, Ning Guo

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba Group(阿里巴巴集团) DAMO Academy, Alibaba Group(阿里巴巴达摩院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025 as Spotlight Presentation. Code: https://github.com/MIV-XJTU/FSDrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07416 2025-11-11 cs.RO cs.AI cs.CV 57%

Robot Learning from a Physical World Model

Jiageng Mao, Sicheng He, Hao-Ning Wu, Yang You, Shuyang Sun, Zhicheng Wang, Yanan Bao, Huizhong Chen, Leonidas Guibas, Vitor Guizilini, Howard Zhou, Yue Wang

机构 * Google DeepMind(谷歌DeepMind) USC(美国斯克利普斯大学) Stanford(斯坦福大学) Toyota Research Institute(丰田研究机构)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project page: https://pointscoder.github.io/PhysWorld_Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05682 2025-11-11 cs.CV cs.LG 57%

VMDT: Decoding the Trustworthiness of Video Foundation Models

Yujin Potter, Zhun Wang, Nicholas Crispino, Kyle Montgomery, Alexander Xiong, Ethan Y. Chang, Francesco Pinto, Yuqi Chen, Rahul Gupta, Morteza Ziyadi, Christos Christodoulopoulos, Bo Li, Chenguang Wang, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克ruz分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Chicago(芝加哥大学) Amazon(亚马逊) Information Commissioner’s Office(信息专员办公室)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments NeurIPS 2025 Datasets & Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16802 2025-11-07 cs.CV 57%

Seeing What Matters: Generalizable AI-generated Video Detection with Forensic-Oriented Augmentation

Riccardo Corvi, Davide Cozzolino, Ekta Prashnani, Shalini De Mello, Koki Nagano, Luisa Verdoliva

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14799 2025-11-06 cs.CV cs.AI 57%

A Survey on Text-Driven 360-Degree Panorama Generation

Hai Wang, Xiaoyu Xiang, Weihao Xia, Jing-Hao Xue

机构 * Department of Statistical Science, University College London(统计科学系,伦敦大学学院) Core AI team at Meta Reality Labs(Meta Reality Labs人工智能核心团队)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Accepted by IEEE TCSVT, Code: https://github.com/littlewhitesea/Text-Driven-Pano-Gen

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00248 2025-11-04 cs.CV cs.GR 57%

Object-Aware 4D Human Motion Generation

Shurui Gui, Deep Anil Patel, Xiner Li, Martin Renqiang Min

机构 * Texas A&M University(德克萨斯A&M大学) NEC Laboratories America(NEC美国实验室)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25772 2025-10-30 cs.CV 57%

VFXMaster: Unlocking Dynamic Visual Effect Generation via In-Context Learning

Baolu Li, Yiming Zhang, Qinghe Wang, Liqian Ma, Xiaoyu Shi, Xintao Wang, Pengfei Wan, Zhenfei Yin, Yunzhi Zhuge, Huchuan Lu, Xu Jia

机构 * Dalian University of Technology(大连理工大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) ZMO AI Inc.(ZMO人工智能公司) Oxford University(牛津大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project Page URL:https://libaolu312.github.io/VFXMaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24904 2025-10-30 cs.CV 57%

VividCam: Learning Unconventional Camera Motions from Virtual Synthetic Videos

Qiucheng Wu, Handong Zhao, Zhixin Shu, Jing Shi, Yang Zhang, Shiyu Chang

机构 * UC, Santa Barbara(加州大学圣芭芭拉分校) Adobe Research(Adobe研究院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03520 2025-10-29 cs.CV 57%

Is Sora a World Simulator? A Comprehensive Survey on General World Models and Beyond

Zheng Zhu, Xiaofeng Wang, Wangbo Zhao, Chen Min, Bohan Li, Nianchen Deng, Min Dou, Yuqi Wang, Botian Shi, Kai Wang, Chi Zhang, Yang You, Zhaoxiang Zhang, Dawei Zhao, Liang Xiao, Jian Zhao, Jiwen Lu, Guan Huang

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments This survey will be regularly updated at: https://github.com/GigaAI-research/General-World-Models-Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24211 2025-10-29 cs.CV 57%

MC-SJD : Maximal Coupling Speculative Jacobi Decoding for Autoregressive Visual Generation Acceleration

Junhyuk So, Hyunho Kook, Chaeyeon Jang, Eunhyeok Park

机构 * Department of Computer Science(计算机科学系) Graduate School of Artificial Intelligence, POSTECH, South Korea(人工智能研究生院,POSTECH,韩国)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14350 2025-10-28 cs.CV cs.AI cs.CL 57%

VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation

Shoubin Yu, Difan Liu, Ziqiao Ma, Yicong Hong, Yang Zhou, Hao Tan, Joyce Chai, Mohit Bansal

机构 * Adobe Research(Adobe研究机构) University of Michigan(密歇根大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

Comments ICCV 2025; First three authors contributed equally. Project page: https://veggie-gen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏