arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6840 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2171 篇

2312.06699 2023-12-13 cs.CV cs.LG 83%

Leveraging Generative Language Models for Weakly Supervised Sentence Component Analysis in Video-Language Joint Learning

Zaber Ibn Abdul Hakim, Najibul Haque Sarker, Rahul Pratap Singh, Bishmoy Paul, Ali Dabouei, Min Xu

专题命中 视频生成 :video-language(title,abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02919 2023-12-06 cs.CV 83%

Fine-grained Controllable Video Generation via Object Appearance and Context

Hsin-Ping Huang, Yu-Chuan Su, Deqing Sun, Lu Jiang, Xuhui Jia, Yukun Zhu, Ming-Hsuan Yang

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://hhsinping.github.io/factor

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15813 2023-11-28 cs.CV cs.AI 83%

FlowZero: Zero-Shot Text-to-Video Synthesis with LLM-Driven Dynamic Scene Syntax

Yu Lu, Linchao Zhu, Hehe Fan, Yi Yang

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV

Comments Project page: https://flowzero-video.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13608 2023-11-27 cs.CV cs.GR cs.LG 83%

Breathing Life Into Sketches Using Text-to-Video Priors

Rinon Gal, Yael Vinker, Yuval Alaluf, Amit H. Bermano, Daniel Cohen-Or, Ariel Shamir, Gal Chechik

专题命中 视频生成 :text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments Project page: https://livesketch.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10982 2023-11-21 cs.CV 83%

Make Pixels Dance: High-Dynamic Video Generation

Yan Zeng, Guoqiang Wei, Jiani Zheng, Jiaxin Zou, Yang Wei, Yuchen Zhang, Hang Li

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19512 2023-10-31 cs.CV 83%

VideoCrafter1: Open Diffusion Models for High-Quality Video Generation

Haoxin Chen, Menghan Xia, Yingqing He, Yong Zhang, Xiaodong Cun, Shaoshu Yang, Jinbo Xing, Yaofang Liu, Qifeng Chen, Xintao Wang, Chao Weng, Ying Shan

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

Comments Tech Report; Github: https://github.com/AILab-CVC/VideoCrafter Homepage: https://ailab-cvc.github.io/videocrafter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14494 2023-09-27 cs.CV 83%

Free-Bloom: Zero-Shot Text-to-Video Generator with LLM Director and LDM Animator

Hanzhuo Huang, Yufan Feng, Cheng Shi, Lan Xu, Jingyi Yu, Sibei Yang

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV

Comments NeurIPS 2023; Project available at: https://github.com/SooLab/Free-Bloom

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09710 2023-08-21 cs.CV cs.AI 83%

SimDA: Simple Diffusion Adapter for Efficient Video Generation

Zhen Xing, Qi Dai, Han Hu, Zuxuan Wu, Yu-Gang Jiang

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06940 2023-07-14 cs.CV 83%

Animate-A-Story: Storytelling with Retrieval-Augmented Video Generation

Yingqing He, Menghan Xia, Haoxin Chen, Xiaodong Cun, Yuan Gong, Jinbo Xing, Yong Zhang, Xintao Wang, Chao Weng, Ying Shan, Qifeng Chen

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

Comments Github: https://github.com/VideoCrafter/Animate-A-Story Project page: https://videocrafter.github.io/Animate-A-Story

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00943 2023-06-02 cs.CV 83%

Make-Your-Video: Customized Video Generation Using Textual and Structural Guidance

Jinbo Xing, Menghan Xia, Yuxin Liu, Yuechen Zhang, Yong Zhang, Yingqing He, Hanyuan Liu, Haoxin Chen, Xiaodong Cun, Xintao Wang, Ying Shan, Tien-Tsin Wong

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

Comments 13 pages, 8 figures. Project page: https://doubiiu.github.io/projects/Make-Your-Video/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05845 2023-05-11 cs.CV cs.AI 83%

Sketching the Future (STF): Applying Conditional Control Techniques to Text-to-Video Models

Rohan Dhesikan, Vignesh Rajmohan

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.07483 2023-04-18 cs.CV 83%

Video Generation Beyond a Single Clip

Hsin-Ping Huang, Yu-Chuan Su, Ming-Hsuan Yang

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.01953 2023-03-10 cs.CV 83%

Learning Trajectory-Word Alignments for Video-Language Tasks

Xu Yang, Zhangzikang Li, Haiyang Xu, Hanwang Zhang, Qinghao Ye, Chenliang Li, Ming Yan, Yu Zhang, Fei Huang, Songfang Huang

专题命中 视频生成 :video-language(title,abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.02399 2022-10-06 cs.CV cs.AI 83%

Phenaki: Variable Length Video Generation From Open Domain Textual Description

Ruben Villegas, Mohammad Babaeizadeh, Pieter-Jan Kindermans, Hernan Moraldo, Han Zhang, Mohammad Taghi Saffar, Santiago Castro, Julius Kunze, Dumitru Erhan

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.10337 2022-07-11 cs.CV 83%

Advancing High-Resolution Video-Language Representation with Large-Scale Video Transcriptions

Hongwei Xue, Tiankai Hang, Yanhong Zeng, Yuchong Sun, Bei Liu, Huan Yang, Jianlong Fu, Baining Guo

专题命中 视频生成 :video-language(title,abstract);text-to-video(abstract);分类 cs.CV

Journal ref published in CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.10314 2017-10-24 cs.CV 83%

Sync-DRAW: Automatic Video Generation using Deep Recurrent Attentive Architectures

Gaurav Mittal, Tanya Marwah, Vineeth N. Balasubramanian

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09111 2026-08-11 cs.AI 新提交 82%

RAVEN-Eval: Rubric-Guided Automatic Evaluation for AI Video Generation Models Based on LMM Preference Judgement

RAVEN-Eval:基于大语言多模态模型(LMM)偏好判断的、采用评分准则引导的AI视频生成模型自动评估框架

Ziheng Jia, Jiaying Qian, Zicheng Zhang, Xiaorong Zhu, Lancheng Gao, Xiongkuo Min

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract)

AI总结 本文提出RAVEN-Eval框架,基于LMM偏好判断与评分准则引导,可自动评估AI视频生成模型,已筛选任务、收集数据、评估模型与LMM并建立排行榜,为AIVGMs评估提供可扩展路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13471 2026-07-16 cs.CV cs.MM cs.SD eess.AS eess.IV 新提交 82%

Bring Music The Horizon: Music-Driven 360$^\circ$ Video Generation

将音乐带入视野:音乐驱动的360°视频生成

Kai Hsu Tsai, Yong Wei Fu, Hung I Yang, Yu-Chih Chen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV、cs.MM

AI总结 【一句话总结】该研究针对音乐可视化问题,提出情感感知的音乐驱动360°视频生成流程,先预估歌曲情感轨迹,再转化为视觉引导,经SEGA框架生成关键帧,最后合成视频,能反映歌曲情感与结构。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01477 2026-05-05 cs.RO 82%

Action Agent: Agentic Video Generation Meets Flow-Constrained Diffusion

动作代理:代理视频生成与流约束扩散的结合

Jeffrin Sam, Nguyen Khang, Yara Mahmoud, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skoltech(斯克里普切尔技术大学智能空间机器人实验室)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract)

AI总结 本文提出Action Agent框架,结合代理导航视频生成与流约束扩散控制,通过两阶段方法提升多体机器人导航性能,实现从语言和图像输入生成物理合理的第一人称导航视频,并在真实和仿真环境中取得高成功率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13190 2026-02-17 cs.LG physics.flu-dyn 82%

LAViG-FLOW: Latent Autoregressive Video Generation for Fluid Flow Simulations

LAViG-FLOW:用于流体流动模拟的潜在自回归视频生成

Vittoria De Pellegrini, Tariq Alkhalifah

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract)

AI总结 LAViG-FLOW通过潜在自回归视频生成框架高效模拟流体流动,实现比传统方法快百倍的饱和度和压力场生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01277 2025-09-03 cs.AI 82%

Communicative Agents for Slideshow Storytelling Video Generation based on LLMs

Jingxing Fan, Jinrong Shen, Yusheng Yao, Shuangqing Wang, Qian Wang, Yuling Wang

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract)

Comments 8 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01872 2023-06-06 cs.AI 82%

Probabilistic Adaptation of Text-to-Video Models

Mengjiao Yang, Yilun Du, Bo Dai, Dale Schuurmans, Joshua B. Tenenbaum, Pieter Abbeel

专题命中 视频生成 :text-to-video(title,abstract);video diffusion(abstract)

Comments Project website https://video-adapter.github.io/. First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00367 2024-07-02 cs.CV 81%

SVG: 3D Stereoscopic Video Generation via Denoising Frame Matrix

Peng Dai, Feitong Tan, Qiangeng Xu, David Futschik, Ruofei Du, Sean Fanello, Xiaojuan Qi, Yinda Zhang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV;video diffusion(comments)

Comments 3D stereoscopic video generation, video diffusion, inpainting

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26971 2026-08-28 cs.CV cs.MM 新提交 81%

TempJail: Temporal Jailbreak Attacks against Image-to-Video Generation Models

TempJail:针对图像到视频生成模型的时序越狱攻击

Qi Lu, Zehui Guo, David Yuanda Gan, Zijing Li, Hengda Zhang, Weijun Xu, Qiankun Zhang

机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间科学与工程学院) School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件学院) School of Computer Science, Nanjing University(南京大学计算机学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出TempJail时序越狱框架,针对图像到视频生成模型的时序漏洞,通过分解恶意提示、受控潜在扰动等方式提升攻击成功率,在Kling等模型上获显著效果。

Comments Accepted by ACM Multimedia 2026 (ACM MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26336 2026-08-28 cs.SD cs.CV cs.MM 新提交 81%

StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation

StreamAV-Bench:面向流式音视频生成的综合基准测试集

Kaiqi Liu, Haoxuan Zeng, Jingqi Liu, Jiacong Fang, Ziqi Cai, Yunyao Mao, Henglin Liu, Yu Sheng, Shuchen Weng, Boxin Shi

机构 * BAAI(北京智源人工智能研究院) PKU(北京大学) Kling THU(清华大学) USTC(中国科学技术大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 该研究针对现有基准无法捕捉流式音视频生成特性的问题,推出首个综合基准StreamAV-Bench,构建含双赛道的评估框架并评估13个系统,揭示当前模型的缺陷并给出模型开发见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16154 2026-08-18 cs.CV cs.GR cs.MM 新提交 81%

KeyID: Decoupled Drafting and Keyframe Editing for Identity-Preserving Video Generation

KeyID:用于身份保留视频生成的解耦草稿生成与关键帧编辑

Jianjie Luo, Yiming Zhong, Haoming Shen, Yupeng Xiao, Zhenguo Yang

机构 * Guangdong University of Technology(广东工业大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 KeyID是无需训练的IPVG框架,通过解耦视频动态合成与身份注入,解决身份一致性问题,在ACM MM 2026 IPVG挑战赛获亚军,可扩展至多主体参考及复杂序列动作生成。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14382 2026-08-11 cs.CV cs.GR cs.MM 版本更新 81%

Delta Forcing: Trust Region Steering for Interactive Autoregressive Video Generation

Delta Forcing:交互式自回归视频生成中的信任区域引导

Yuheng Wu, Xiangbo Gao, Tianhao Chen, Xinghao Chen, Qing Yin, Zhengzhong Tu, Dongman Lee

机构 * Texas A\&M University(德克萨斯A&M大学) University of Washington(华盛顿大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出Delta Forcing方法,通过约束不可靠的教师监督在适应性信任区域中,以提高自回归视频生成的一致性并保持对新事件的响应性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08633 2026-08-06 cs.CV cs.AI cs.GR cs.LG cs.MM 81%

Time-to-Move: Training-Free Motion Controlled Video Generation via Dual-Clock Denoising

Assaf Singer, Noam Rotstein, Amir Mann, Ron Kimmel, Or Litany

机构 * Technion – Israel Institute of Technology(技术ion – 以色列理工学院) NVIDIA(NVIDIA公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23586 2026-08-05 cs.CV cs.CL cs.MM cs.SD eess.AS 版本更新 81%

Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

Talker-T2AV:基于自回归扩散模型的联合说话音频视频生成

Zhen Ye, Xu Tan, Aoxiong Yin, Hongzhan Lin, Guangyan Zhang, Peiwen Sun, Yiming Li, Chi-Min Chan, Wei Ye, Shikun Zhang, Wei Xue

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Independent Researcher(独立研究者)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出Talker-T2AV,通过共享骨干和模态特定解码器实现音频视频联合生成,提升跨模态一致性与生成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28489 2026-07-07 eess.IV cs.CV 版本更新 81%

Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms

视频生成模型作为世界模型:高效的范式、架构和算法

Muyang He, Hanzhong Guo, Junxiong Lin, Yizhou Yu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与开发中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

AI总结 本文系统回顾了考虑效率的世界模拟视频生成框架,提出三维分类方法,展示提升效率对自动驾驶等应用的重要性,并指出高效视频生成向通用世界模拟器演进的关键性。

详情

展开后加载摘要…

URL PDF HTML 收藏