arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6823 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2160 篇

2310.00868 2025-05-14 cs.CV eess.IV 62%

RT-GAN: Recurrent Temporal GAN for Adding Lightweight Temporal Consistency to Frame-Based Domain Translation Approaches

Shawn Mathew, Saad Nadeem, Alvin C. Goh, Arie Kaufman

机构 * Stony Brook University(石溪布鲁克大学) Memorial Sloan Kettering Cancer Center(纪念斯隆凯特琳癌症中心)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

Comments MICCAI 2025 Early Accept. First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12831 2025-03-28 cs.CV cs.AI cs.MM 62%

VIA: Unified Spatiotemporal Video Adaptation Framework for Global and Local Video Editing

Jing Gu, Yuwei Fang, Ivan Skorokhodov, Peter Wonka, Xinya Du, Sergey Tulyakov, Xin Eric Wang

专题命中 视频生成 :long video(abstract);分类 cs.CV、cs.MM

Comments 18 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13501 2025-03-19 cs.CV cs.AI cs.LG cs.MM 62%

VSTAR: Generative Temporal Nursing for Longer Dynamic Video Synthesis

Yumeng Li, William Beluch, Margret Keuper, Dan Zhang, Anna Khoreva

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM

Comments Accepted at ICLR 2025. Code: https://github.com/boschresearch/VSTAR and project page: https://yumengli007.github.io/VSTAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10696 2025-03-17 cs.CV eess.IV 62%

Neighboring Autoregressive Modeling for Efficient Visual Generation

Yefei He, Yuanyu He, Shaoxuan He, Feng Chen, Hong Zhou, Kaipeng Zhang, Bohan Zhuang

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14468 2024-11-05 cs.CV cs.AI cs.MM 62%

AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks

Max Ku, Cong Wei, Weiming Ren, Harry Yang, Wenhu Chen

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

Comments Published in Transactions on Machine Learning Research (TMLR 2024) (11/2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21061 2024-10-29 cs.CV cs.AI cs.MM 62%

Kandinsky 3: Text-to-Image Synthesis for Multifunctional Generative Framework

Vladimir Arkhipkin, Viacheslav Vasilev, Andrei Filatov, Igor Pavlov, Julia Agafonova, Nikolai Gerasimenko, Anna Averchenkova, Evelina Mironova, Anton Bukashkin, Konstantin Kulikov, Andrey Kuznetsov, Denis Dimitrov

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM

Comments Accepted for EMNLP 2024 (Demo track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08534 2024-10-22 cs.CV eess.IV 62%

Quality Prediction of AI Generated Images and Videos: Emerging Trends and Opportunities

Abhijay Ghildyal, Yuanhan Chen, Saman Zadtootaghaj, Nabajeet Barman, Alan C. Bovik

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

Comments "The abstract field cannot be longer than 1,920 characters", the abstract appearing here is slightly shorter than that in the PDF file

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03340 2024-08-08 cs.MM cs.CV 62%

An Empirical Comparison of Video Frame Sampling Methods for Multi-Modal RAG Retrieval

Mahesh Kandhare, Thibault Gisselbrecht

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM

Comments 19 pages, 24 figures (65 images)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03511 2024-07-01 cs.CV cs.LG cs.MM 62%

Kandinsky 3.0 Technical Report

Vladimir Arkhipkin, Andrei Filatov, Viacheslav Vasilev, Anastasia Maltseva, Said Azizov, Igor Pavlov, Julia Agafonova, Andrey Kuznetsov, Denis Dimitrov

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

Comments Project page: https://ai-forever.github.io/Kandinsky-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16728 2024-05-28 cs.CV cs.AI cs.LG cs.MM 62%

Towards Multi-Task Multi-Modal Models: A Video Generative Perspective

Lijun Yu

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15944 2024-03-26 cs.CV cs.AI eess.IV 62%

Adaptive Super Resolution For One-Shot Talking-Head Generation

Luchuan Song, Pinxin Liu, Guojun Yin, Chenliang Xu

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07952 2024-03-14 cs.CV cs.AI cs.MM 62%

AesopAgent: Agent-driven Evolutionary System on Story-to-Video Production

Jiuniu Wang, Zehua Du, Yuyuan Zhao, Bo Yuan, Kexiang Wang, Jian Liang, Yaxi Zhao, Yihen Lu, Gengliang Li, Junlong Gao, Xin Tu, Zhenyu Guo

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

Comments 22 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00028 2024-02-02 cs.GR cs.CV eess.IV 62%

Neural Rendering and Its Hardware Acceleration: A Review

Xinkai Yan, Jieting Xu, Yuchi Huo, Hujun Bao

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.04429 2022-10-11 eess.IV cs.CV 62%

DeepHS-HDRVideo: Deep High Speed High Dynamic Range Video Reconstruction

Zeeshan Khan, Parth Shettiwar, Mukul Khanna, Shanmuganathan Raman

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

Comments ICPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.08795 2022-09-20 cs.MM cs.CV cs.SD eess.AS 62%

AutoLV: Automatic Lecture Video Generator

Wenbin Wang, Yang Song, Sanjay Jha

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

Comments 4 pages, 4 figures, ICIP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.06180 2022-04-14 cs.CV cs.GR cs.MM 62%

Dynamic Neural Textures: Generating Talking-Face Videos with Continuously Controllable Expressions

Zipeng Ye, Zhiyao Sun, Yu-Hui Wen, Yanan Sun, Tian Lv, Ran Yi, Yong-Jin Liu

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.01866 2021-11-04 eess.IV cs.CV cs.LG physics.med-ph 62%

3-D PET Image Generation with tumour masks using TGAN

Robert V Bergen, Jean-Francois Rajotte, Fereshteh Yousefirizi, Ivan S Klyuzhin, Arman Rahmim, Raymond T. Ng

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.03120 2021-07-08 cs.CV cs.MM 62%

Cross-View Exocentric to Egocentric Video Synthesis

Gaowen Liu, Hao Tang, Hugo Latapie, Jason Corso, Yan Yan

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

Comments ACM MM 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.16078 2020-12-03 cs.CV eess.IV 62%

LIFI: Towards Linguistically Informed Frame Interpolation

Aradhya Neeraj Mathur, Devansh Batra, Yaman Kumar, Rajiv Ratn Shah, Roger Zimmermann

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

Comments 9 pages, 7 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.05018 2020-11-25 eess.IV cs.CV 62%

Source Camera Verification from Strongly Stabilized Videos

Enes Altinisik, Husrev Taha Sencar

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.10704 2020-06-20 cs.CV cs.LG eess.IV 62%

Latent Video Transformer

Ruslan Rakhimov, Denis Volkhonskiy, Alexey Artemov, Denis Zorin, Evgeny Burnaev

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08487 2026-01-27 cs.CV cs.AI cs.MA 61%

MAViS: A Multi-Agent Framework for Long-Sequence Video Storytelling

MAViS:一个用于长序列视频叙事的多智能体框架

Qian Wang, Ziqi Huang, Ruoxi Jia, Paul Debevec, Ning Yu

机构 * Virginia Tech(弗吉尼亚理工大学) Nanyang Technological University(南洋理工大学) Eyeline Studios(Eyeline工作室)

专题命中 视频生成 :video generation(abstract,comments);分类 cs.CV

AI总结 MAViS通过多智能体协作框架提升长序列视频生成的辅助能力、视觉质量和表达性,支持多模态输出。

Comments Video Generation Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15564 2025-09-23 cs.CV 61%

Show-o2: Improved Native Unified Multimodal Models

Jinheng Xie, Zhenheng Yang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) ByteDance(字节跳动)

专题命中 视频生成 :video generation(abstract);分类 cs.CV;video understanding(comments)

Comments NeurIPS 2025. (v3: update to include video understanding, OneIG, and more ablation study results)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15138 2025-03-21 cs.CV 61%

VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention

Mingzhe Zheng, Yongqi Xu, Haojian Huang, Xuran Ma, Yexin Liu, Wenjie Shu, Yatian Pang, Feilong Tang, Qifeng Chen, Harry Yang, Ser-Nam Lim

专题命中 视频生成 :video generation(abstract,comments);分类 cs.CV

Comments This paper should be a refined version of arXiv:2412.02259, "VideoGen-of-Thought: A Collaborative Framework for Multi-Shot Video Generation", but I mistakenly submit it as a new paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20809 2026-08-26 cs.CV 版本更新 57%

Layer-Aware Video Composition via Split-then-Merge

通过分割后再融合的分层视频合成

Ozgur Kara, Yujia Chen, Ming-Hsuan Yang, James M. Rehg, Wen-Sheng Chu, Du Tran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 StM通过分割未标注视频并融合动态前景与背景层,提升生成视频合成的控制能力和数据效率。

Comments Project Webpage: https://split-then-merge.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23090 2026-08-25 cs.CV 新提交 57%

Loopy: Seamless Video Loop Generation via Anchored Looping Shift of Positional Embedding

Loopy:通过位置嵌入的锚定循环偏移实现无缝视频生成

Haotian Dong, Wenjing Wang, Chen Li, Jing Lyu, Xin Wang, Di Lin

机构 * Tianjin University(天津大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 该研究针对现有循环视频生成质量差的问题,提出Loopy框架,通过锚定DiT的位置嵌入偏移策略,实现高质量、支持多格式及高级AIGC功能的循环视频生成,提升了时间一致性与视觉保真度。

Comments 15 pages, 21 figures, accepted by ACM TOG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23070 2026-08-25 cs.AI cs.CV 新提交 57%

From Generation to Simulation: How Far Are World Models from Being True Simulators?

从生成到模拟:世界模型距离真正的模拟器还有多远?

Tong Wang, Huan Deng, Mucheng Yang, Yang He, Xiaohui Kuang, Gang Zhao

机构 * Institute of Systems Engineering, Academy of Military Sciences(军事科学院系统工程研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本研究通过系统评估200篇相关成果,分析了潜在动力学等3条技术路线的世界模型在传统模拟器8项能力上的表现,指出其在状态反馈等方面的缺陷并提出6个研究方向。

Comments 42 pages, 23 figures, 2 tables. Project page: https://github.com/AtongWang/world-model-simulators

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11421 2026-08-25 cs.CV 版本更新 57%

ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation

ShotVerse: 提升文本驱动多镜头视频创作的电影级摄像机控制

Songlin Yang, Zhe Wang, Xuyi Yang, Songchun Zhang, Xianghao Kong, Taiyi Wu, Xiaotong Zhao, Ran Zhang, Alan Zhao, Anyi Rao

机构 * Tencent Video AI Center, PCG, Tencent(腾讯视频AI中心)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 ShotVerse通过'计划然后控制'框架,结合视觉语言模型和摄像机适配器,实现多镜头视频创作中精准的摄像机控制与高保真电影效果。

Comments SIGGRAPH Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20770 2026-08-24 cs.CV 新提交 57%

MotionPhys: Detecting AI-Generated Videos via Physical Consistency of Optical-Flow Trajectories

MotionPhys:基于光流轨迹物理一致性检测AI生成视频

Haojin He, Hao Tan, Zichang Tan, Ajian Liu, Jun Wan

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 MotionPhys是基于光流轨迹物理一致性的轻量可解释框架,可检测AI生成视频的物理运动不一致性,且对不同视频生成器泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14790 2026-08-24 cs.CV 版本更新 57%

Instruction-Based Video Editing by Repurposing an Image Editing Model

Qwen-Video-Edit:通过复用图像编辑模型实现基于指令的视频编辑

Yunpeng Bai, Yossi Gandelsman, Michaël Gharbi, Qixing Huang

机构 * UT Austin(德克萨斯大学奥斯汀分校) Reve(Reve公司)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 该研究提出Qwen-Video-Edit,通过复用Qwen-Image-Edit图像编辑模型,经少量适配实现基于指令的视频编辑,证明图像编辑先验可迁移至视频编辑任务。

Comments Project Page: https://yunpeng1998.github.io/Qwen-Video-Edit-Page Code: https://github.com/yunpeng1998/Qwen-Video-Edit Model: https://huggingface.co/yunpeng1998/Qwen-Video-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏