arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2160 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2160 篇

2505.22141 2025-08-28 cs.CV cs.AI 57%

FaceEditTalker: Controllable Talking Head Generation with Facial Attribute Editing

Guanwen Feng, Zhiyuan Ma, Yunan Li, Jiahao Yang, Junwei Jing, Qiguang Miao

机构 * Xi’an Key Laboratory of Big Data and Intelligent Vision, Xidian University, Xi’an 710071, China(西安大数据与智能视觉重点实验室,西安电子科技大学,西安710071,中国) Key Laboratory of Collaborative Intelligence Systems, Ministry of Education, Xidian University, Xi’an 710071, China(协同智能系统重点实验室,教育部,西安电子科技大学,西安710071,中国) School of Computer Science and Technology, Xidian University, Xi’an 710071, China(计算机科学与技术学院,西安电子科技大学,西安710071,中国)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15774 2025-08-22 cs.CV 57%

CineScale: Free Lunch in High-Resolution Cinematic Visual Generation

Haonan Qiu, Ning Yu, Ziqi Huang, Paul Debevec, Ziwei Liu

机构 * Nanyang Technological University(南洋理工大学) Netflix Eyeline Studios

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments CineScale is an extended work of FreeScale (ICCV 2025). Project Page: https://eyeline-labs.github.io/CineScale/, Code Repo: https://github.com/Eyeline-Labs/CineScale

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15773 2025-08-22 cs.CV cs.GR cs.LG 57%

Scaling Group Inference for Diverse and High-Quality Generation

Gaurav Parmar, Or Patashnik, Daniil Ostashev, Kuan-Chieh Wang, Kfir Aberman, Srinivasa Narasimhan, Jun-Yan Zhu

机构 * Carnegie Mellon University(卡内基梅隆大学) Snap Research(Snap研究公司) Tel Aviv University(特拉维夫大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project website: https://www.cs.cmu.edu/~group-inference, GitHub: https://github.com/GaParmar/group-inference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12415 2025-08-22 cs.CV 57%

TiP4GEN: Text to Immersive Panorama 4D Scene Generation

Ke Xing, Hanwen Liang, Dejia Xu, Yuyang Yin, Konstantinos N. Plataniotis, Yao Zhao, Yunchao Wei

机构 * Institute of Information Science, Beijing Jiaotong University(信息科学研究院,北京交通大学) Visual Intelligence + X International Joint Laboratory(视觉智能+X国际联合实验室) University of Toronto(多伦多大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Accepted In Proceedings of the 33rd ACM International Conference on Multimedia (MM' 25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14465 2025-08-21 cs.CV 57%

DreamSwapV: Mask-guided Subject Swapping for Any Customized Video Editing

Weitao Wang, Zichen Wang, Hongdeng Shen, Yulei Lu, Xirui Fan, Suhui Wu, Jun Zhang, Haoqian Wang, Hao Zhang

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13797 2025-08-20 cs.GR cs.CV 57%

Sketch3DVE: Sketch-based 3D-Aware Scene Video Editing

Feng-Lin Liu, Shi-Yang Li, Yan-Pei Cao, Hongbo Fu, Lin Gao

机构 * Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Hong Kong University of Science(香港科学大学)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

Comments SIGGRAPH 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13013 2025-08-19 cs.CV 57%

EgoTwin: Dreaming Body and View in First Person

Jingqiao Xiu, Fangzhou Hong, Yicong Li, Mengze Li, Wentao Wang, Sirui Han, Liang Pan, Ziwei Liu

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科学与技术大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11049 2025-08-18 cs.RO cs.CV 57%

GenFlowRL: Shaping Rewards with Generative Object-Centric Flow in Visual Reinforcement Learning

Kelin Yu, Sheng Zhang, Harshit Soora, Furong Huang, Heng Huang, Pratap Tokekar, Ruohan Gao

机构 * University of Maryland, College Park(马里兰大学 College Park分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Published at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12341 2025-08-14 cs.MM 57%

Multimodal LLM-based Query Paraphrasing for Video Search

Jiaxin Wu, Chong-Wah Ngo, Wing-Kwong Chan, Sheng-Hua Zhong, Xiong-Yong Wei, Qing Li

专题命中 视频生成 :text-to-video(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06080 2025-08-11 cs.CV 57%

DreamVE: Unified Instruction-based Image and Video Editing

Bin Xia, Jiyang Liu, Yuechen Zhang, Bohao Peng, Ruihang Chu, Yitong Wang, Xinglong Wu, Bei Yu, Jiaya Jia

机构 * CUHK(香港中文大学) ByteDance Inc(字节跳动公司) HKUST(香港理工大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06364 2025-08-11 cs.CV cs.GR 57%

Generative Video Bi-flow

Chen Liu, Tobias Ritschel

机构 * University College London(伦敦大学学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments ICCV 2025. Project Page at https://ryushinn.github.io/ode-video

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00701 2025-08-06 cs.CV cs.AI 57%

D3: Training-Free AI-Generated Video Detection Using Second-Order Features

Chende Zheng, Ruiqi suo, Chenhao Lin, Zhengyu Zhao, Le Yang, Shuai Liu, Minghui Yang, Cong Wang, Chao Shen

机构 * Xi’an Jiaotong University(西安交通大学) Guangdong OPPO Mobile Communications Co., Ltd.(广东OPPO移动通信有限公司) City University of Hong Kong(香港城市大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00299 2025-08-04 cs.CV cs.AI cs.RO 57%

Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence

Danzhen Fu, Jiagao Hu, Daiguo Zhou, Fei Wang, Zepeng Wang, Wenhua Liao

机构 * MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments ICCV 2025 Workshop (HiGen)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12024 2025-07-31 cs.CV 57%

SteerX: Creating Any Camera-Free 3D and 4D Scenes with Geometric Steering

Byeongjun Park, Hyojun Go, Hyelin Nam, Byung-Hoon Kim, Hyungjin Chung, Changick Kim

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project page: https://byeongjun-park.github.io/SteerX/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09631 2025-07-30 cs.GR eess.IV 57%

V2M4: 4D Mesh Animation Reconstruction from a Single Monocular Video

Jianqi Chen, Biao Zhang, Xiangjun Tang, Peter Wonka

专题命中 视频生成 :video generation(abstract);分类 eess.IV

Comments Accepted by ICCV 2025. Project page: https://windvchen.github.io/V2M4/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20855 2025-07-29 cs.CV 57%

Compositional Video Synthesis by Temporal Object-Centric Learning

Adil Kaan Akan, Yucel Yemez

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 12+21 pages, submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18945 2025-07-29 cs.CV cs.AI cs.LG cs.RO 57%

Aether: Geometric-Aware Unified World Modeling

Aether Team, Haoyi Zhu, Yifan Wang, Jianjun Zhou, Wenzheng Chang, Yang Zhou, Zizun Li, Junyi Chen, Chunhua Shen, Jiangmiao Pang, Tong He

机构 * USTC Shanghai AI Lab(USTC上海人工智能实验室) SII SJTU(SJTU信息研究所) ZJU FDU(浙江大学福州大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project Page: https://aether-world.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06438 2025-07-29 cs.CV 57%

Qffusion: Controllable Portrait Video Editing via Quadrant-Grid Attention Learning

Maomao Li, Lijian Lin, Yunfei Liu, Ye Zhu, Yu Li

机构 * International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 19 pages

Journal ref TVCG 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12789 2025-07-29 cs.CV 57%

Efficient Physics Simulation for 3D Scenes via MLLM-Guided Gaussian Splatting

Haoyu Zhao, Hao Wang, Xingyue Zhao, Hao Fei, Hongqiu Wang, Chengjiang Long, Hua Zou

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Wuhan National Laboratory for Optoelectronics, Huazhong University of Science and Technology(华中科技大学光电研究院) Meta Reality Lab(Meta现实实验室) Xi’an Jiao Tong University(西安交通大学) National University of Singapore(新加坡国立大学) The Department of Systems Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学系统枢纽部门(广州))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14475 2025-07-28 cs.CV cs.AI 57%

MagicDrive3D: Controllable 3D Generation for Any-View Rendering in Street Scenes

Ruiyuan Gao, Kai Chen, Zhihao Li, Lanqing Hong, Zhenguo Li, Qiang Xu

机构 * CUHK(香港中文大学) HKUST(香港理工大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project Page: https://flymin.github.io/magicdrive3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01729 2025-07-21 cs.CV 57%

PosePilot: Steering Camera Pose for Generative World Models with Self-supervised Depth

Bu Jin, Weize Li, Baihan Yang, Zhenxin Zhu, Junpeng Jiang, Huan-ang Gao, Haiyang Sun, Kun Zhan, Hengtong Hu, Xueyang Zhang, Peng Jia, Hao Zhao

机构 * The Hong Kong University of Science and Technology(香港科技大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Li Auto BAAI(北京人工智能研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Accepted at IEEE/RSJ IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08917 2025-07-15 cs.CV 57%

Detecting Deepfake Talking Heads from Facial Biometric Anomalies

Justin D. Norman, Hany Farid

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 10 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06739 2025-07-10 cs.CV 57%

PromptTea: Let Prompts Tell TeaCache the Optimal Threshold

Zishen Huang, Chunyu Yang, Mengyuan Ren

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04559 2025-07-08 cs.CV 57%

MambaVideo for Discrete Video Tokenization with Channel-Split Quantization

Dawit Mureja Argaw, Xian Liu, Joon Son Chung, Ming-Yu Liu, Fitsum Reda

机构 * NVIDIA KAIST(韩国科学技术院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project website: https://research.nvidia.com/labs/dir/mamba-tokenizer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14151 2025-07-03 cs.CV cs.AI 57%

Concat-ID: Towards Universal Identity-Preserving Video Synthesis

Yong Zhong, Zhuoyi Yang, Jiayan Teng, Xiaotao Gu, Chongxuan Li

机构 * Gaoling School of AI, Renmin University of China(中国人民大学人工智能学院) Tsinghua University(清华大学) Zhipu AI(智谱AI)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23135 2025-07-01 cs.CV cs.RO 57%

RoboScape: Physics-informed Embodied World Model

Yu Shang, Xin Zhang, Yinzhou Tang, Lei Jin, Chen Gao, Wei Wu, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22868 2025-07-01 cs.CV cs.AI 57%

STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing

Junsung Lee, Junoh Kang, Bohyung Han

机构 * Seoul National University(首尔国立大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments 15 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01061 2025-07-01 cs.CV 57%

OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models

Gaojie Lin, Jianwen Jiang, Jiaqi Yang, Zerong Zheng, Chao Liang

机构 * ByteDance(字节跳动)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments ICCV 2025, Homepage: https://omnihuman-lab.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10718 2025-07-01 cs.CV 57%

Grid: Omni Visual Generation

Cong Wan, Xiangyang Luo, Hao Luo, Zijian Cai, Yiren Song, Yunlong Zhao, Yifan Bai, Fan Wang, Yuhang He, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Tsinghua University(清华大学) DAMO Academy, Alibaba Group(阿里云实验室) Chinese Academy of Sciences(中国科学院) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments Codes: https://github.com/Should-AI-Lab/GRID

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20601 2025-06-26 cs.CV 57%

Video Perception Models for 3D Scene Synthesis

Rui Huang, Guangyao Zhai, Zuria Bauer, Marc Pollefeys, Federico Tombari, Leonidas Guibas, Gao Huang, Francis Engelmann

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏