arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2160 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2160 篇

2506.18901 2025-06-24 cs.CV 57%

From Virtual Games to Real-World Play

Wenqiang Sun, Fangyun Wei, Jinjing Zhao, Xi Chen, Zilong Chen, Hongyang Zhang, Jun Zhang, Yan Lu

机构 * HKUST(香港科技大学) Microsoft Research(微软研究院) University of Sydney(悉尼大学) Tsinghua University(清华大学) University of Waterloo(滑铁卢大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project page: https://wenqsun.github.io/RealPlay/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18899 2025-06-24 cs.CV 57%

FilMaster: Bridging Cinematic Principles and Generative AI for Automated Film Generation

Kaiyi Huang, Yukun Huang, Xintao Wang, Zinan Lin, Xuefei Ning, Pengfei Wan, Di Zhang, Yu Wang, Xihui Liu

机构 * The University of Hong Kong(香港大学) Kuaishou Technology(快手科技) Microsoft Research(微软研究院) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project Page: https://filmaster-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18701 2025-06-24 cs.CV cs.AI 57%

Matrix-Game: Interactive World Foundation Model

Yifan Zhang, Chunli Peng, Boyang Wang, Puyi Wang, Qingcheng Zhu, Fei Kang, Biao Jiang, Zedong Gao, Eric Li, Yang Liu, Yahui Zhou

机构 * Skywork AI

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19637 2025-06-24 cs.CV 57%

ReNeg: Learning Negative Embedding with Reward Guidance

Xiaomin Li, Yixuan Liu, Takashi Isobe, Xu Jia, Qinpeng Cui, Dong Zhou, Dong Li, You He, Huchuan Lu, Zhongdao Wang, Emad Barsoum

机构 * Advanced Micro Devices Inc.(先进微器件公司) Dalian University of Technology(大连理工大学) Tsinghua University(清华大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments Code: https://github.com/AMD-AIG-AIMA/ReNeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16054 2025-06-23 cs.CV cs.GR 57%

PAROAttention: Pattern-Aware ReOrdering for Efficient Sparse and Quantized Attention in Visual Generation Models

Tianchen Zhao, Ke Hong, Xinhao Yang, Xuefeng Xiao, Huixia Li, Feng Ling, Ruiqi Xie, Siqi Chen, Hongyu Zhu, Yichong Zhang, Yu Wang

机构 * Tsinghua University(清华大学) ByteDance Seed(字节跳动种子)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments project page: https://a-suozhang.xyz/paroattn.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14168 2025-06-19 cs.CV cs.AI 57%

VideoMAR: Autoregressive Video Generatio with Continuous Tokens

Hu Yu, Biao Gong, Hangjie Yuan, DanDan Zheng, Weilong Chai, Jingdong Chen, Kecheng Zheng, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09042 2025-06-19 cs.CV 57%

Cosmos-Drive-Dreams: Scalable Synthetic Driving Data Generation with World Foundation Models

Xuanchi Ren, Yifan Lu, Tianshi Cao, Ruiyuan Gao, Shengyu Huang, Amirmojtaba Sabour, Tianchang Shen, Tobias Pfaff, Jay Zhangjie Wu, Runjian Chen, Seung Wook Kim, Jun Gao, Laura Leal-Taixe, Mike Chen, Sanja Fidler, Huan Ling

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Only the core contributors are listed. The full list of contributors can be found in Appendix A of this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21264 2025-06-18 cs.CV cs.AI 57%

LARP: Tokenizing Videos with a Learned Autoregressive Generative Prior

Hanyu Wang, Saksham Suri, Yixuan Ren, Hao Chen, Abhinav Shrivastava

机构 * University of Maryland, College Park(马里兰大学 College Park 分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments ICLR 2025. Project page: https://hywang66.github.io/larp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04746 2025-06-16 cs.CV 57%

Taming Rectified Flow for Inversion and Editing

Jiangshan Wang, Junfu Pu, Zhongang Qi, Jiayi Guo, Yue Ma, Nisha Huang, Yuxin Chen, Xiu Li, Ying Shan

机构 * Tsinghua University(清华大学) ARC Lab, Tencent PCG(腾讯ARC实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments ICML 2025; GitHub: https://github.com/wangjiangshan0725/RF-Solver-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10975 2025-06-13 cs.CV 57%

GenWorld: Towards Detecting AI-generated Real-world Simulation Videos

Weiliang Chen, Wenzhao Zheng, Yu Zheng, Lei Chen, Jie Zhou, Jiwen Lu, Yueqi Duan

机构 * Department of Automation, Tsinghua University, China(自动化系,清华大学) Department of Electronic Engineering, Tsinghua University, China(电子工程系,清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08279 2025-06-11 cs.CV cs.AI cs.LG 57%

Seeing Voices: Generating A-Roll Video from Audio with Mirage

Aditi Sundararaman, Amogh Adishesha, Andrew Jaegle, Dan Bigioi, Hyoung-Kyu Song, Jon Kyl, Justin Mao, Kevin Lan, Mojtaba Komeili, ShahRukh Athar, Sheila Babayan, Stanislau Beliasau, William Buchwalter

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Technical report website: mirage.app/research/seeing-voices, product website: mirage.app

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07205 2025-06-10 cs.CV 57%

TV-LiVE: Training-Free, Text-Guided Video Editing via Layer Informed Vitality Exploitation

Min-Jung Kim, Dongjin Kim, Seokju Yun, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所) University of Seoul(首尔大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21136 2025-06-09 cs.LG cs.AI cs.AR cs.CV 57%

SageAttention2++: A More Efficient Implementation of SageAttention2

Jintao Zhang, Xiaoming Xu, Jia Wei, Haofeng Huang, Pengle Zhang, Chendong Xiang, Jun Zhu, Jianfei Chen

机构 * Department of Computer Science, Tsinghua University(清华大学计算机科学系)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04590 2025-06-06 cs.CV 57%

Follow-Your-Creation: Empowering 4D Creation through Video Inpainting

Yue Ma, Kunyu Feng, Xinhua Zhang, Hongyu Liu, David Junhao Zhang, Jinbo Xing, Yinhan Zhang, Ayden Yang, Zeyu Wang, Qifeng Chen

机构 * HKUST(香港科技大学) HKUST(GZ)(香港科技大学(广州)) NUS(国立新加坡大学) Tsinghua Univerisity(清华大学) CUHK(香港中文大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project Page: https://follow-your-creation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02444 2025-06-06 cs.CV 57%

SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios

Lingwei Dang, Ruizhi Shao, Hongwen Zhang, Wei Min, Yebin Liu, Qingyao Wu

机构 * School of Software Engineering, South China University of Technology(华南理工大学软件工程学院) Department of Automation, Tsinghua University(清华大学自动化系) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02875 2025-06-04 cs.CV 57%

NTIRE 2025 XGC Quality Assessment Challenge: Methods and Results

Xiaohong Liu, Xiongkuo Min, Qiang Hu, Xiaoyun Zhang, Jie Guo, Guangtao Zhai, Shushi Wang, Yingjie Zhou, Lu Liu, Jingxin Li, Liu Yang, Farong Wen, Li Xu, Yanwei Jiang, Xilei Zhu, Chunyi Li, Zicheng Zhang, Huiyu Duan, Xiele Wu, Yixuan Gao, Yuqin Cao, Jun Jia, Wei Sun, Jiezhang Cao, Radu Timofte, Baojun Li, Jiamian Huang, Dan Luo, Tao Liu, Weixia Zhang, Bingkun Zheng, Junlin Chen, Ruikai Zhou, Meiya Chen, Yu Wang, Hao Jiang, Xiantao Li, Yuxiang Jiang, Jun Tang, Yimeng Zhao, Bo Hu, Zelu Qi, Chaoyang Zhang, Fei Zhao, Ping Shi, Lingzhi Fu, Heng Cong, Shuai He, Rongyu Zhang, Jiarong He, Zongyao Hu, Wei Luo, Zihao Yu, Fengbin Guan, Yiting Lu, Xin Li, Zhibo Chen, Mengjing Su, Yi Wang, Tuo Chen, Chunxiao Li, Shuaiyu Zhao, Jiaxin Wen, Chuyi Lin, Sitong Liu, Ningxin Chu, Jing Wan, Yu Zhou, Baoying Chen, Jishen Zeng, Jiarui Liu, Xianjin Liu, Xin Chen, Lanzhi Zhou, Hangyu Li, You Han, Bibo Xiang, Zhenjie Liu, Jianzhang Lu, Jialin Gui, Renjie Lu, Shangfei Wang, Donghao Zhou, Jingyu Lin, Quanjian Song, Jiancheng Huang, Yufeng Yang, Changwei Wang, Shupeng Zhong, Yang Yang, Lihuo He, Jia Liu, Yuting Xing, Tida Fang, Yuchun Jin

机构 * The organizers of the NTIRE 2025 XGC Quality Challenge(NTIRE 2025 XGC质量评估挑战的组织者)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments NTIRE 2025 XGC Quality Assessment Challenge Report. arXiv admin note: text overlap with arXiv:2404.16687

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05902 2025-06-03 cs.CV cs.CL 57%

Autoregressive Models in Vision: A Survey

Jing Xiong, Gongye Liu, Lun Huang, Chengyue Wu, Taiqiang Wu, Yao Mu, Yuan Yao, Hui Shen, Zhongwei Wan, Jinfa Huang, Chaofan Tao, Shen Yan, Huaxiu Yao, Lingpeng Kong, Hongxia Yang, Mi Zhang, Guillermo Sapiro, Jiebo Luo, Ping Luo, Ngai Wong

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学) Duke University(杜克大学) University of Rochester(罗切斯特大学) The Ohio State University(俄亥俄州立大学) Bytedance(字节跳动) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Apple(苹果公司) The Hong Kong Polytechnic University(香港理工大学) Princeton University(普林斯顿大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments The paper is accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24733 2025-06-02 cs.CV 57%

DreamDance: Animating Character Art via Inpainting Stable Gaussian Worlds

Jiaxu Zhang, Xianfang Zeng, Xin Chen, Wei Zuo, Gang Yu, Guosheng Lin, Zhigang Tu

机构 * Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) StepFun ByteDance(字节跳动)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24156 2025-06-02 cs.CV cs.RO 57%

Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction

Chenyou Fan, Fangzheng Yan, Chenjia Bai, Jiepeng Wang, Chi Zhang, Zhen Wang, Xuelong Li

机构 * Institute of Artificial intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Northwestern Polytechnical University(西北工业大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17359 2025-05-30 cs.CV 57%

Position: Interactive Generative Video as Next-Generation Game Engine

Jiwen Yu, Yiran Qin, Haoxuan Che, Quande Liu, Xintao Wang, Pengfei Wan, Di Zhang, Xihui Liu

机构 * HKU(香港大学) HKUST(香港理工大学) Kuaishou Technology(快手科技)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14135 2025-05-29 cs.CV 57%

Hunyuan-Game: Industrial-grade Intelligent Game Creation Model

Ruihuang Li, Caijin Zhou, Shoujian Zheng, Jianxiang Lu, Jiabin Huang, Comi Chen, Junshu Tang, Guangzheng Xu, Jiale Tao, Hongmei Wang, Donghao Li, Wenqing Yu, Senbo Wang, Zhimin Li, Yetshuan Shi, Haoyu Yang, Yukun Wang, Wenxun Dai, Jiaqi Li, Linqing Wang, Qixun Wang, Zhiyong Xu, Yingfang Zhang, Jiangfeng Xiong, Weijie Kong, Chao Zhang, Hongxin Zhang, Qiaoling Zheng, Weiting Guo, Xinchi Deng, Yixuan Li, Renjia Wei, Yulin Jian, Duojun Huang, Xuhua Ren, Junkun Yuan, Zhengguang Zhou, Jiaxiang Cheng, Bing Ma, Shirui Huang, Jiawang Bai, Chao Li, Sihuan Lin, Yifu Sun, Yuan Zhou, Joey Wang, Qin Lin, Tianxiang Zheng, Jingmiao Yu, Jihong Zhang, Caesar Zhong, Di Wang, Yuhong Liu, Linus, Jie Jiang, Longhuang Wu, Shuai Shao, Qinglin Lu

机构 * Tencent(腾讯)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02492 2025-05-27 cs.CV 57%

VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models

Hila Chefer, Uriel Singer, Amit Zohar, Yuval Kirstain, Adam Polyak, Yaniv Taigman, Lior Wolf, Shelly Sheynin

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19692 2025-05-27 cs.CV 57%

DriveCamSim: Generalizable Camera Simulation via Explicit Camera Modeling for Autonomous Driving

Wenchao Sun, Xuewu Lin, Keyu Chen, Zixiang Pei, Yining Shi, Chuang Zhang, Sifa Zheng

机构 * Tsinghua University(清华大学) Horizon Horizon Continental Technology

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19017 2025-05-27 cs.RO cs.CV cs.LG 57%

WorldEval: World Model as Real-World Robot Policies Evaluator

Yaxuan Li, Yichen Zhu, Junjie Wen, Chaomin Shen, Yi Xu

机构 * Midea Group(美的集团) East China Normal University(华东师范大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments The project page is available at https://worldeval.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18650 2025-05-27 cs.CV 57%

ProphetDWM: A Driving World Model for Rolling Out Future Actions and Videos

Xiaodong Wang, Peixi Peng

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15863 2025-05-23 cs.CV cs.AI cs.RO 57%

Generative AI for Autonomous Driving: A Review

Katharina Winter, Abhishek Vivekanandan, Rupert Polley, Yinzhe Shen, Christian Schlauch, Mohamed-Khalil Bouzidi, Bojan Derajic, Natalie Grabowsky, Annajoyce Mariani, Dennis Rochau, Giovanni Lucente, Harsh Yadav, Firas Mualla, Adam Molin, Sebastian Bernhard, Christian Wirth, Ömer Şahin Taş, Nadja Klein, Fabian B. Flohr, Hanno Gottschalk

机构 * Munich University of Applied Sciences, Intelligent Vehicles Lab (IVL)(慕尼黑应用技术大学,智能车辆实验室) FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究中心) Continental Automotive Technologies GmbH(大陆汽车技术有限公司) Technical University of Berlin, Institute of Mathematics(柏林技术大学,数学系) German Aerospace Center (DLR), Institute of Transportation Systems(德国航空航天中心(DLR),交通运输系统研究所) Aptiv Services Deutschland GmbH(Aptiv 德国服务有限公司) AI Lab, ZF Friedrichshafen AG(ZF弗劳恩霍夫汽车有限公司人工智能实验室) DENSO AUTOMOTIVE Deutschland GmbH(DENSO 汽车德国有限公司) Karlsruhe Institute of Technology, Scientific Computing Center(卡尔斯鲁厄理工学院,科学计算中心)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12237 2025-05-20 cs.CV 57%

From Shots to Stories: LLM-Assisted Video Editing with Unified Language Representations

Yuzhi Li, Haojun Xu, Feng Tian

机构 * Shanghai University(上海大学)

专题命中 视频生成 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07057 2025-05-13 cs.CV 57%

DAPE: Dual-Stage Parameter-Efficient Fine-Tuning for Consistent Video Editing with Diffusion Models

Junhao Xia, Chaoyang Zhang, Yecheng Zhang, Chengyang Zhou, Zhichang Wang, Bochun Liu, Dongshuo Yin

机构 * Tsinghua University(清华大学) Duke University(杜克大学) Peking University(北京大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00975 2025-05-05 cs.CV 57%

Generating Animated Layouts as Structured Text Representations

Yeonsang Shin, Jihwan Kim, Yumin Song, Kyungseung Lee, Hyunhee Chung, Taeyoung Na

机构 * Seoul National University(首尔国立大学) SK telecom(SK电信)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments AI for Content Creation (AI4CC) Workshop at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20995 2025-04-30 cs.CV cs.RO 57%

TesserAct: Learning 4D Embodied World Models

Haoyu Zhen, Qiao Sun, Hongxin Zhang, Junyan Li, Siyuan Zhou, Yilun Du, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) HKUST(香港科技大学) Harvard University(哈佛大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project Page: https://tesseractworld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏