arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2158 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2158 篇

2502.10059 2025-07-15 cs.CV 79%

RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control

Teng Li, Guangcong Zheng, Rui Jiang, Shuigen Zhan, Tao Wu, Yehao Lu, Yining Lin, Chuanyun Deng, Yepan Xiong, Min Chen, Lin Cheng, Xi Li

机构 * College of Computer Science & Technology, Zhejiang University(浙江大学计算机科学与技术学院) Central Media Technology Institute, 2012 Lab, Huawei(华为2012实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04189 2025-07-15 cs.CV 79%

HANDI: Hand-Centric Text-and-Image Conditioned Video Generation

Yayuan Li, Zhi Cao, Jason J. Corso

机构 * University of Michigan(密歇根大学) Voxel51 Project Page(Voxel51项目页面)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments 16 pages, 7 figures and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06830 2025-07-10 cs.CV cs.AI 79%

Physics-Grounded Motion Forecasting via Equation Discovery for Trajectory-Guided Image-to-Video Generation

Tao Feng, Xianbing Zhao, Zhenhua Chen, Tien Tsin Wong, Hamid Rezatofighi, Gholamreza Haffari, Lizhen Qu

机构 * Monash University(墨尔本大学) Harbin Institute of Technology(哈尔滨工业大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗quentcourt研究所) Rajiv Gandhi University(拉朱·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05963 2025-07-10 cs.CV 79%

Tora2: Motion and Appearance Customized Diffusion Transformer for Multi-Entity Video Generation

Zhenghao Zhang, Junchao Liao, Xiangyu Meng, Long Qin, Weizhi Wang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments ACM MM25 Conference Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05675 2025-07-09 cs.CV cs.AI 79%

MedGen: Unlocking Medical Video Generation by Scaling Granularly-annotated Medical Videos

Rongsheng Wang, Junying Chen, Ke Ji, Zhenyang Cai, Shunian Chen, Yunjin Yang, Benyou Wang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02862 2025-07-04 cs.CV 79%

RefTok: Reference-Based Tokenization for Video Generation

Xiang Fan, Xiaohang Sun, Kushan Thakkar, Zhu Liu, Vimal Bhat, Ranjay Krishna, Xiang Hao

机构 * University of Washington(华盛顿大学) Amazon(亚马逊)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23513 2025-07-01 cs.CV 79%

ViewPoint: Panoramic Video Generation with Pretrained Diffusion Models

Zixun Fang, Kai Zhu, Zhiheng Liu, Yu Liu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * USTC(中国科学技术大学) TongYi Lab(通义实验室) HKU(香港大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments https://becauseimbatman0.github.io/ViewPoint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21287 2025-06-27 cs.CV 79%

HieraSurg: Hierarchy-Aware Diffusion Model for Surgical Video Generation

Diego Biagini, Nassir Navab, Azade Farshad

机构 * Chair for Computer Aided Medical Procedures (CAMP), TU Munich, Germany(计算机辅助医疗程序研究所(CAMP),慕尼黑技术大学,德国) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Accepted at MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19833 2025-06-25 cs.CV 79%

Bind-Your-Avatar: Multi-Talking-Character Video Generation with Dynamic 3D-mask-based Embedding Router

Yubo Huang, Weiqiang Wang, Sirui Zhao, Tong Xu, Lin Liu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Monash University(墨尔本大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10044 2025-06-25 cs.CV 79%

Aligning Anime Video Generation with Human Feedback

Bingwen Zhu, Yudong Jiang, Baohan Xu, Siqian Yang, Mingyu Yin, Yidi Wu, Huyang Sun, Zuxuan Wu

机构 * Fudan University(复旦大学) Bilibili Inc(哔哩哔哩公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments 10 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18851 2025-06-24 cs.CV 79%

Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset

Zhuowei Chen, Bingchuan Li, Tianxiang Ma, Lijie Liu, Mingcong Liu, Yi Zhang, Gen Li, Xinghui Li, Siyu Zhou, Qian He, Xinglong Wu

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project page:https://phantom-video.github.io/Phantom-Data/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18655 2025-06-24 cs.CV 79%

RDPO: Real Data Preference Optimization for Physics Consistency Video Generation

Wenxu Qian, Chaoyue Wang, Hou Peng, Zhiyu Tan, Hao Li, Anxiang Zeng

机构 * Fudan University(复旦大学) Shopee Inc(Shopee公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17383 2025-06-24 cs.CV 79%

AnchorCrafter: Animate Cyber-Anchors Selling Your Products via Human-Object Interacting Video Generation

Ziyi Xu, Ziyao Huang, Juan Cao, Yong Zhang, Xiaodong Cun, Qing Shuai, Yuchen Wang, Linchao Bao, Jintao Li, Fan Tang

机构 * Institute of Computing Technique, Chinese Academy of Sciences(中国科学院计算技术研究所) Meituan(美团) Great Bay University(大湾区大学) Tencent AI Lab(腾讯人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02385 2025-06-24 cs.CV cs.AI 79%

How Far is Video Generation from World Model: A Physical Law Perspective

Bingyi Kang, Yang Yue, Rui Lu, Zhijie Lin, Yang Zhao, Kaixin Wang, Gao Huang, Jiashi Feng

机构 * ByteDance Research(字节跳动研究团队) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17201 2025-06-23 cs.CV 79%

Hunyuan-GameCraft: High-dynamic Interactive Game Video Generation with Hybrid History Condition

Jiaqi Li, Junshu Tang, Zhiyong Xu, Longhuang Wu, Yuan Zhou, Shuai Shao, Tianbao Yu, Zhiguo Cao, Qinglin Lu

机构 * Tencent Hunyuan(腾讯 Hunyuan)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project page: https://hunyuan-gamecraft.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06679 2025-06-18 cs.CV 79%

T2V-OptJail: Discrete Prompt Optimization for Text-to-Video Jailbreak Attacks

Jiayang Liu, Siyuan Liang, Shiqian Zhao, Rongcheng Tu, Wenbo Zhou, Aishan Liu, Dacheng Tao, Siew Kei Lam

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15371 2025-06-17 cs.CV cs.AI cs.LG 79%

FrameBridge: Improving Image-to-Video Generation with Bridge Models

Yuji Wang, Zehua Chen, Xiaoyu Chen, Yixiang Wei, Jun Zhu, Jianfei Chen

机构 * Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07713 2025-06-16 cs.CV cs.AI 79%

Consistent Video Editing as Flow-Driven Image-to-Video Generation

Ge Wang, Songlin Fan, Hangxu Liu, Quanjian Song, Hewei Wang, Jinfeng Xu

机构 * Fudan University(复旦大学) Xiamen University(厦门大学) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10096 2025-06-16 cs.CV 79%

A Self-supervised Motion Representation for Portrait Video Generation

Qiyuan Zhang, Chenyu Wu, Wenzhang Sun, Huaize Liu, Donglin Di, Wei Chen, Changqing Zou

机构 * Zhejiang University(浙江大学) Li Auto(利汽车) Zhejiang Lab(浙江实验室) Hangzhou Institute for Advanced Study,University of Chinese Academy of Sciences(杭州高等研究 institute, 中国科学院大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22944 2025-06-11 cs.CV cs.AI 79%

ATI: Any Trajectory Instruction for Controllable Video Generation

Angtian Wang, Haibin Huang, Jacob Zhiyuan Fang, Yiding Yang, Chongyang Ma

机构 * ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19009 2025-06-11 cs.CV cs.IR 79%

Video-ColBERT: Contextualized Late Interaction for Text-to-Video Retrieval

Arun Reddy, Alexander Martin, Eugene Yang, Andrew Yates, Kate Sanders, Kenton Murray, Reno Kriz, Celso M. de Melo, Benjamin Van Durme, Rama Chellappa

机构 * Johns Hopkins Applied Physics Laboratory(约翰霍普金斯应用物理实验室) Johns Hopkins University(约翰霍普金斯大学) Human Language Technology Center of Excellence(人类语言技术卓越中心) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments Accepted at CVPR 2025. 13 pages, 4 figures. Approved for public release: distribution unlimited

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08003 2025-06-10 cs.CV cs.AI 79%

Audio-Sync Video Generation with Multi-Stream Temporal Control

Shuchen Weng, Haojie Zheng, Zheng Chang, Si Li, Boxin Shi, Xinlong Wang

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Nat’l Key Lab of General AI, School of Intelligence Science and Technology, Peking University(国家通用人工智能实验室,北京大学智能科学与技术学院) Nat’l Eng. Research Ctr. of Visual Tech., School of Computer Science, Peking University(国家视觉技术工程研究中心,北京大学计算机学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07848 2025-06-10 cs.CV cs.AI 79%

PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement

Teng Hu, Zhentao Yu, Zhengguang Zhou, Jiangning Zhang, Yuan Zhou, Qinglin Lu, Ran Yi

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯文英) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21036 2025-06-10 cs.CV cs.AI 79%

RainFusion: Adaptive Video Generation Acceleration via Multi-Dimensional Visual Redundancy

Aiyue Chen, Bin Dong, Jingru Li, Jing Lin, Kun Tian, Yiwu Yao, Gongyi Wang

机构 * Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06173 2025-06-10 cs.CV 79%

VideoAuteur: Towards Long Narrative Video Generation

Junfei Xiao, Feng Cheng, Lu Qi, Liangke Gui, Jiepeng Cen, Zhibei Ma, Alan Yuille, Lu Jiang

机构 * Johns Hopkins University(约翰霍普金斯大学) ByteDance Project(字节跳动项目)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Preprint, https://videoauteur.github.io/; V2: Method is updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05806 2025-06-09 cs.CV 79%

LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models

Haojie Yu, Zhaonian Wang, Yihan Pan, Meng Cheng, Hao Yang, Chao Wang, Tao Xie, Xiaoming Xu, Xiaoming Wei, Xunliang Cai

机构 * Meituan Inc.(美团公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19901 2025-06-04 cs.CV 79%

Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM

Peng Liu, Xiaoming Ren, Fengkai Liu, Qingsong Xie, Quanlong Zheng, Yanhao Zhang, Haonan Lu, Yujiu Yang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16506 2025-06-03 cs.CV 79%

Alignment is All You Need: A Training-free Augmentation Strategy for Pose-guided Video Generation

Xiaoyu Jin, Zunnan Xu, Mingwen Ou, Wenming Yang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Accepted to CVG@ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23952 2025-06-02 cs.CV 79%

Leveraging Auxiliary Information in Text-to-Video Retrieval: A Review

Adriano Fragomeni, Dima Damen, Michael Wray

机构 * University of Bristol(布里斯托大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22647 2025-05-29 cs.CV 79%

Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation

Zhe Kong, Feng Gao, Yong Zhang, Zhuoliang Kang, Xiaoming Wei, Xunliang Cai, Guanying Chen, Wenhan Luo

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Meituan(美团) AMC and Department of ECE, HKUST(香港科技大学AMC及电子与计算机工程系)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Homepage: https://meigen-ai.github.io/multi-talk Github: https://github.com/MeiGen-AI/MultiTalk

详情

展开后加载摘要…

URL PDF HTML 收藏