arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2160 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2160 篇

2512.19048 2025-12-23 cs.CV 70%

WaTeRFlow: Watermark Temporal Robustness via Flow Consistency

WaTeRFlow:通过流一致性实现水印时间鲁棒性

Utae Jeong, Sumin In, Hyunju Ryu, Jaewan Choi, Feng Yang, Jongheon Jeong, Seungryong Kim, Sangpil Kim

机构 * Korea University(韩国大学) Google DeepMind(谷歌DeepMind) KAIST AI(韩国科学技术院人工智能)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 WaTeRFlow通过流一致性提升I2V场景下的水印鲁棒性,结合FUSE引擎、时间一致性损失和语义保持损失,实现跨模态水印恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18614 2025-12-23 cs.CV cs.AI 70%

PTTA: A Pure Text-to-Animation Framework for High-Quality Creation

PTTA: 一种用于高质量动画创作的纯文本到动画框架

Ruiqi Chen, Kaitong Cai, Yijia Fan, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 PTTA是一种纯文本到动画框架,通过微调HunyuanVideo模型实现高质量动画生成,优于现有基线方法。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16954 2025-12-22 cs.CV cs.AI 70%

Lights, Camera, Consistency: A Multistage Pipeline for Character-Stable AI Video Stories

灯光,摄像机,一致性:一种多阶段管道用于角色稳定的AI视频故事

Chayan Jain, Rishant Sharma, Archit Garg, Ishan Bhanuka, Pratik Narang, Dhruv Kumar

机构 * BITS Pilani, Pilani Campus, India(印度比斯汉尼学院帕利尼校区)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出了一种多阶段管道,通过生成详细剧本并利用视觉锚点来提升AI生成视频故事中角色的一致性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13015 2025-12-16 cs.CV 70%

What Happens Next? Next Scene Prediction with a Unified Video Model

接下来会发生什么?一种统一的视频模型用于下一场景预测

Xinjie Li, Zhimin Chen, Rui Zhao, Florian Schiffers, Zhenyu Liao, Vimal Bhat

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出Next Scene Prediction任务,通过联合框架结合Qwen-VL和LTX,利用预训练、监督微调和强化学习提升视频模型的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04675 2025-12-01 cs.CV 70%

InfinityStar: Unified Spacetime AutoRegressive Modeling for Visual Generation

InfinityStar: 一种统一的时空自回归模型用于视觉生成

Jinlai Liu, Jian Han, Bin Yan, Hui Wu, Fengda Zhu, Xing Wang, Yi Jiang, Bingyue Peng, Zehuan Yuan

机构 * ByteDance(字节跳动)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 InfinityStar是一种统一的时空自回归模型,能够高效生成高分辨率图像和动态视频,其在VBench上的表现优于现有自回归模型,且生成速度显著快于扩散方法。

Comments NeurIPS 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07769 2025-12-01 cs.CV 70%

Dream4D: Lifting Camera-Controlled I2V towards Spatiotemporally Consistent 4D Generation

Dream4D: 通过可控视频生成与神经4D重建提升I2V向时空一致4D生成

Xiaoyan Liu, Kangrui Li, Yuehao Song, Jiaxin Liu

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学) Huazhong University of Science and Technology(华中科技大学) The University of New South Wales(新南威尔士大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 Dream4D通过可控视频生成与神经4D重建的协同,实现高质量的时空一致4D内容生成。

Comments Project Page: https://wanderer7-sk.github.io/Dream4D.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20462 2025-11-27 cs.CV cs.LG 70%

STARFlow-V: End-to-End Video Generative Modeling with Normalizing Flows

STARFlow-V:基于归一化流的端到端视频生成模型

Jiatao Gu, Ying Shen, Tianrong Chen, Laurent Dinh, Yuyang Wang, Miguel Angel Bautista, David Berthelot, Josh Susskind, Shuangfei Zhai

机构 * Apple(苹果公司)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 STARFlow-V基于归一化流提出端到端视频生成模型,具备端到端学习、鲁棒因果预测和原生似然估计等优势,实现了高质量自回归视频生成。

Comments 21 pages, 9 figures. Code and samples are available at https://github.com/apple/ml-starflow

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18870 2025-11-26 cs.CV 70%

HunyuanVideo 1.5 Technical Report

HunyuanVideo 1.5 技术报告

Bing Wu, Chang Zou, Changlin Li, Duojun Huang, Fang Yang, Hao Tan, Jack Peng, Jianbing Wu, Jiangfeng Xiong, Jie Jiang, Linus, Patrol, Peizhen Zhang, Peng Chen, Penghao Zhao, Qi Tian, Songtao Liu, Weijie Kong, Weiyan Wang, Xiao He, Xin Li, Xinchi Deng, Xuefei Zhe, Yang Li, Yanxin Long, Yuanbo Peng, Yue Wu, Yuhong Liu, Zhenyu Wang, Zuozhuo Dai, Bo Peng, Coopers Li, Gu Gong, Guojian Xiao, Jiahe Tian, Jiaxin Lin, Jie Liu, Jihong Zhang, Jiesong Lian, Kaihang Pan, Lei Wang, Lin Niu, Mingtao Chen, Mingyang Chen, Mingzhe Zheng, Miles Yang, Qiangqiang Hu, Qi Yang, Qiuyong Xiao, Runzhou Wu, Ryan Xu, Rui Yuan, Shanshan Sang, Shisheng Huang, Siruis Gong, Shuo Huang, Weiting Guo, Xiang Yuan, Xiaojia Chen, Xiawei Hu, Wenzhi Sun, Xiele Wu, Xianshun Ren, Xiaoyan Yuan, Xiaoyue Mi, Yepeng Zhang, Yifu Sun, Yiting Lu, Yitong Li, You Huang, Yu Tang, Yixuan Li, Yuhang Deng, Yuan Zhou, Zhichao Hu, Zhiguang Liu, Zhihe Yang, Zilin Yang, Zhenzhi Lu, Zixiang Zhou, Zhao Zhong

机构 * Tencent Hunyuan Foundation Model Team(腾讯文心一言基础模型团队)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 HunyuanVideo 1.5通过轻量级模型和先进架构实现高质量视频生成,提供开源框架和资源,推动视频生成技术的普及与研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05573 2025-11-11 cs.CV cs.AI 70%

Video Text Preservation with Synthetic Text-Rich Videos

Ziyang Liu, Kevin Valencia, Justin Cui

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08826 2025-09-11 cs.CV 70%

RewardDance: Reward Scaling in Visual Generation

Jie Wu, Yu Gao, Zilyu Ye, Ming Li, Liang Li, Hanzhong Guo, Jie Liu, Zeyue Xue, Xiaoxia Hou, Wei Liu, Yan Zeng, Weilin Huang

机构 * ByteDance Seed(字节跳动种子)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Bytedance Seed Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00397 2025-08-04 cs.CV 70%

Video Forgery Detection with Optical Flow Residuals and Spatial-Temporal Consistency

Xi Xue, Kunio Suzuki, Nabarun Goswami, Takuya Shintate

机构 * NABLAS Inc.(NABLAS公司)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17963 2025-07-25 cs.GR cs.CV cs.LG 70%

Zero-Shot Dynamic Concept Personalization with Grid-Based LoRA

Rameen Abdal, Or Patashnik, Ekaterina Deyneka, Hao Chen, Aliaksandr Siarohin, Sergey Tulyakov, Daniel Cohen-Or, Kfir Aberman

机构 * Snap Research(Snap研究)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Project Page and Video : https://snap-research.github.io/zero-shot-dynamic-concepts/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13224 2025-07-18 cs.CV 70%

Leveraging Pre-Trained Visual Models for AI-Generated Video Detection

Keerthi Veeramachaneni, Praveen Tirupattur, Amrit Singh Bedi, Mubarak Shah

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11647 2025-07-10 cs.CV 70%

ReCamMaster: Camera-Controlled Generative Rendering from A Single Video

Jianhong Bai, Menghan Xia, Xiao Fu, Xintao Wang, Lianrui Mu, Jinwen Cao, Zuozhu Liu, Haoji Hu, Xiang Bai, Pengfei Wan, Di Zhang

机构 * Zhejiang University(浙江大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) CUHK(香港中文大学) HUST(华中科技大学)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://jianhongbai.github.io/ReCamMaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20967 2025-06-30 cs.CV cs.AI 70%

DFVEdit: Conditional Delta Flow Vector for Zero-shot Video Editing

Lingling Cai, Kang Zhao, Hangjie Yuan, Xiang Wang, Yingya Zhang, Kejie Huang

机构 * Zhejiang University(浙江大学) Tongyi Lab(通义实验室) DAMO Academy(达摩院) Huazhong University of Science and Technology(华中科技大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Zero-shot video editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18564 2025-06-24 cs.CV 70%

VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning

Xuanyu Zhang, Weiqi Li, Shijie Zhao, Junlin Li, Li Zhang, Jian Zhang

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05554 2025-06-09 cs.CV 70%

EX-4D: EXtreme Viewpoint 4D Video Synthesis via Depth Watertight Mesh

Tao Hu, Haoyang Peng, Xiao Liu, Yuewen Ma

机构 * Pico, Bytedance(字节跳动)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04216 2025-06-05 cs.CV 70%

UNIC: Unified In-Context Video Editing

Zixuan Ye, Xuanhua He, Quande Liu, Qiulin Wang, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Qifeng Chen, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Kuaishou Technology(快手科技)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments The project page is at \href{https://zixuan-ye.github.io/UNIC}{https://zixuan-ye.github.io/UNIC}

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11784 2025-06-05 cs.AI cs.CV cs.LG 70%

Data-Juicer Sandbox: A Feedback-Driven Suite for Multimodal Data-Model Co-development

Daoyuan Chen, Haibin Wang, Yilun Huang, Ce Ge, Yaliang Li, Bolin Ding, Jingren Zhou

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted by ICML 2025 (Spotlight). 33 pages, 16 tables, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24873 2025-06-02 cs.CV 70%

MiniMax-Remover: Taming Bad Noise Helps Video Object Removal

Bojia Zi, Weixuan Peng, Xianbiao Qi, Jianan Wang, Shihao Zhao, Rong Xiao, Kam-Fai Wong

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00135 2025-05-02 cs.CV 70%

Eye2Eye: A Simple Approach for Monocular-to-Stereo Video Synthesis

Michal Geyer, Omer Tov, Linyi Jin, Richard Tucker, Inbar Mosseri, Tali Dekel, Noah Snavely

机构 * Google DeepMind(谷歌DeepMind) Weizmann Institute of Science(魏茨曼科学研究院) University of Michigan(密歇根大学)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06666 2025-04-10 cs.CV 70%

Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception

Ruotian Peng, Haiying He, Yake Wei, Yandong Wen, Di Hu

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04471 2025-04-01 cs.CV cs.AI 70%

PaintScene4D: Consistent 4D Scene Generation from Text Prompts

Vinayak Gupta, Yunze Man, Yu-Xiong Wang

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Preprint. Project page: https://paintscene4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21824 2025-03-31 cs.CV cs.CR 70%

Protecting Your Video Content: Disrupting Automated Video-based LLM Annotations

Haitong Liu, Kuofeng Gao, Yang Bai, Jinmin Li, Jinxiao Shan, Tao Dai, Shu-Tao Xia

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19907 2025-03-26 cs.CV 70%

FullDiT: Multi-Task Video Generative Foundation Model with Full Attention

Xuan Ju, Weicai Ye, Quande Liu, Qiulin Wang, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Qiang Xu

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Project Page: https://fulldit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08601 2025-03-25 cs.SD cs.MM eess.AS 70%

STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment

Yong Ren, Chenxing Li, Manjie Xu, Wei Liang, Yu Gu, Rilin Chen, Dong Yu

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.MM

Comments ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17048 2025-03-18 cs.CV 70%

PersonalVideo: High ID-Fidelity Video Customization without Dynamic and Semantic Degradation

Hengjia Li, Haonan Qiu, Shiwei Zhang, Xiang Wang, Yujie Wei, Zekun Li, Yingya Zhang, Boxi Wu, Deng Cai

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03758 2025-02-27 cs.CV 70%

ARCON: Advancing Auto-Regressive Continuation for Driving Videos

Ruibo Ming, Jingwei Wu, Zhewei Huang, Zhuoxuan Ju, Jianming HU, Lihui Peng, Shuchang Zhou

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04896 2025-02-11 cs.CV 70%

Goku: Flow Based Video Generative Foundation Models

Shoufa Chen, Chongjian Ge, Yuqi Zhang, Yida Zhang, Fengda Zhu, Hao Yang, Hongxiang Hao, Hui Wu, Zhichao Lai, Yifei Hu, Ting-Che Lin, Shilong Zhang, Fu Li, Chuan Li, Xing Wang, Yanghua Peng, Peize Sun, Ping Luo, Yi Jiang, Zehuan Yuan, Bingyue Peng, Xiaobing Liu

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Demo: https://saiyan-world.github.io/goku/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13190 2025-01-09 cs.CV 70%

MotionBridge: Dynamic Video Inbetweening with Flexible Controls

Maham Tanveer, Yang Zhou, Simon Niklaus, Ali Mahdavi Amiri, Hao Zhang, Krishna Kumar Singh, Nanxuan Zhao

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV

Comments Project website: [https://motionbridge.github.io/]

详情

展开后加载摘要…

URL PDF HTML 收藏