arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6823 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2160 篇

1910.09139 2019-10-22 cs.CV cs.LG 74%

DwNet: Dense warp-based network for pose-guided human video generation

Polina Zablotskaia, Aliaksandr Siarohin, Bo Zhao, Leonid Sigal

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments Accepted to BMVC 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.06571 2019-09-26 cs.CV cs.LG stat.ML 74%

Adversarial Video Generation on Complex Datasets

Aidan Clark, Jeff Donahue, Karen Simonyan

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.12245 2019-05-30 cs.MM 74%

Automatic Realistic Music Video Generation from Segments of Youtube Videos

Sarah Gross, Xingxing Wei, Jun Zhu

专题命中 视频生成 :video generation(title);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.11521 2019-04-29 cs.CV 74%

Face Video Generation from a Single Image and Landmarks

Kritaphat Songsri-in, Stefanos Zafeiriou

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.00913 2019-03-05 cs.CV 74%

Unsupervised Bi-directional Flow-based Video Generation from one Snapshot

Lu Sheng, Junting Pan, Jiaming Guo, Jing Shao, Xiaogang Wang, Chen Change Loy

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments 11 pages, 12 figures. Technical report for a project in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.11384 2019-02-01 cs.CV cs.LG stat.ML 74%

Learning to navigate image manifolds induced by generative adversarial networks for unsupervised video generation

Isabela Albuquerque, João Monteiro, Tiago H. Falk

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.11152 2018-07-31 cs.CV 74%

Pose Guided Human Video Generation

Ceyuan Yang, Zhe Wang, Xinge Zhu, Chen Huang, Jianping Shi, Dahua Lin

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments Accepted to ECCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.09951 2018-07-27 cs.CV 74%

Learning to Forecast and Refine Residual Motion for Image-to-Video Generation

Long Zhao, Xi Peng, Yu Tian, Mubbasir Kapadia, Dimitris Metaxas

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments 17 pages, 8 figures, 4 tables, accepted by ECCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1710.00421 2017-10-03 cs.MM 74%

Video Generation From Text

Yitong Li, Martin Renqiang Min, Dinghan Shen, David Carlson, Lawrence Carin

专题命中 视频生成 :video generation(title);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16184 2026-06-16 cs.CV cs.MM 新提交 73%

Closed-Loop Triplet Synergistic Generation for Long-Form Video

闭环三元组协同生成用于长视频

Xinlei Yin, Xiulian Peng, Xiao Li, Zhiwei Xiong, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV、cs.MM

AI总结 提出CoTriSyGen框架,通过闭环视觉-文本-记忆协同过程,结合分析器进行镜头内和镜头间修正,解决长视频生成中的身份漂移和不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05290 2026-06-05 cs.CV cs.AI cs.MM 73%

Do Models Share Safety Representations? Cross-Model Steering for Safe Visual Generation

模型是否共享安全表示?面向安全视觉生成的跨模型引导

Tobia Poppi, Silvia Cappelletti, Sara Sarto, Florian Schiffers, Garin Kessler, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学) Amazon Prime Video(亚马逊prime视频)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 本文提出首个跨模型安全引导框架,通过源语言模型估计安全方向并迁移至目标生成器,无需目标侧不安全数据即可实现安全控制,且不牺牲生成质量。

Comments Project page: https://aimagelab.github.io/cross-model-safety-representations/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23325 2026-04-28 cs.CV cs.AI eess.IV 73%

EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal Coherence

EAD-Net:具有空间细化和时间一致性的情感感知说话头生成

Yahui Li, Yinfeng Yu, Liejun Wang, Shengjie Shen

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV、eess.IV

AI总结 EAD-Net通过引入同步网络监督和时空方向注意力机制,提升情感感知说话头生成的唇同步精度和时间一致性,同时利用大语言模型增强情感语义控制。

Comments Main paper (10 pages). Accepted for publication by ICMR(International Conference on Multimedia Retrieval) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14476 2025-09-22 cs.CV cs.AI cs.MM 73%

AToken: A Unified Tokenizer for Vision

Jiasen Lu, Liangchen Song, Mingze Xu, Byeongjoo Ahn, Yanjun Wang, Chen Chen, Afshin Dehghan, Yinfei Yang

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

Comments 30 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20109 2025-03-24 cs.CV cs.AI cs.MM 73%

GiVE: Guiding Visual Encoder to Perceive Overlooked Information

Junjie Li, Jianghong Ma, Xiaofeng Zhang, Yuhang Li, Jianyang Shi

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

Comments This paper was accepted by ICME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07464 2025-03-12 cs.SD cs.CV cs.MM eess.AS 73%

Video-to-Audio Generation with Hidden Alignment

Manjie Xu, Chenxing Li, Xinyi Tu, Yong Ren, Rilin Chen, Yu Gu, Wei Liang, Dong Yu

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

Comments https://sites.google.com/view/vta-ldm

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13720 2025-02-27 cs.CV cs.AI cs.LG eess.IV 73%

Movie Gen: A Cast of Media Foundation Models

Adam Polyak, Amit Zohar, Andrew Brown, Andros Tjandra, Animesh Sinha, Ann Lee, Apoorv Vyas, Bowen Shi, Chih-Yao Ma, Ching-Yao Chuang, David Yan, Dhruv Choudhary, Dingkang Wang, Geet Sethi, Guan Pang, Haoyu Ma, Ishan Misra, Ji Hou, Jialiang Wang, Kiran Jagadeesh, Kunpeng Li, Luxin Zhang, Mannat Singh, Mary Williamson, Matt Le, Matthew Yu, Mitesh Kumar Singh, Peizhao Zhang, Peter Vajda, Quentin Duval, Rohit Girdhar, Roshan Sumbaly, Sai Saketh Rambhatla, Sam Tsai, Samaneh Azadi, Samyak Datta, Sanyuan Chen, Sean Bell, Sharadh Ramaswamy, Shelly Sheynin, Siddharth Bhattacharya, Simran Motwani, Tao Xu, Tianhe Li, Tingbo Hou, Wei-Ning Hsu, Xi Yin, Xiaoliang Dai, Yaniv Taigman, Yaqiao Luo, Yen-Cheng Liu, Yi-Chiao Wu, Yue Zhao, Yuval Kirstain, Zecheng He, Zijian He, Albert Pumarola, Ali Thabet, Artsiom Sanakoyeu, Arun Mallya, Baishan Guo, Boris Araya, Breena Kerr, Carleigh Wood, Ce Liu, Cen Peng, Dimitry Vengertsev, Edgar Schonfeld, Elliot Blanchard, Felix Juefei-Xu, Fraylie Nord, Jeff Liang, John Hoffman, Jonas Kohler, Kaolin Fire, Karthik Sivakumar, Lawrence Chen, Licheng Yu, Luya Gao, Markos Georgopoulos, Rashel Moritz, Sara K. Sampson, Shikai Li, Simone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petrovic, Yuming Du

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08093 2025-02-17 cs.CV cs.MM 73%

When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding

Pingping Zhang, Jinlong Li, Kecheng Chen, Meng Wang, Long Xu, Haoliang Li, Nicu Sebe, Sam Kwong, Shiqi Wang

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11621 2024-12-17 cs.CV cs.MM 73%

VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting

Muhammet Furkan Ilaslan, Ali Koksal, Kevin Qinhong Lin, Burak Satar, Mike Zheng Shou, Qianli Xu

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

Comments Accepted for The 39th Annual AAAI Conference on Artificial Intelligence 2025 in Main Track, 19 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20500 2024-10-01 cs.CV cs.MM 73%

FreeMask: Rethinking the Importance of Attention Masks for Zero-Shot Video Editing

Lingling Cai, Kang Zhao, Hangjie Yuan, Yingya Zhang, Shiwei Zhang, Kejie Huang

专题命中 视频生成 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

Comments Video Editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09191 2026-07-13 cs.RO cs.LG 新提交 71%

GenVid2Robot: From Video Generation to Robot Manipulation via Rigid-Geometric Consistency

GenVid2Robot:通过刚性几何一致性从视频生成到机器人操作

Haohui Huang, Xi Yuan, Panpan Liao, Tao Teng, Chenguang Yang, Jing Guo, Yi Guo

机构 * School of Automation, Guangdong University of Technology(广东工业大学自动化学院) University of Liverpool(利物浦大学) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) State Key Laboratory of Submarine Geoscience, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学海洋地球科学国家重点实验室,自动化与智能感知学院)

专题命中 视频生成 :video generation(title)

AI总结 研究旨在将生成视频转换为机器人可执行操作轨迹。核心方法是GenVid2Robot框架,通过采样语义锚点、跟踪验证运动等步骤实现。主要贡献是提高了生成视频引导操作的可靠性,通过多种手段建立视觉运动先验。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23994 2026-05-19 cs.SD cs.AI 71%

PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation

PhyAVBench: 一个具有挑战性的音频物理敏感性基准,用于物理基础的文本到音频视频生成

Tianxin Xie, Wentao Lei, Kai Jiang, Guanjie Huang, Pengfei Zhang, Chunhui Zhang, Fengji Ma, Haoyu He, Han Zhang, Jiangshan He, Jinting Wang, Linghan Fang, Lufei Gao, Orkesh Ablet, Peihua Zhang, Ruolin Hu, Shengyu Li, Weilin Lin, Xiaoyang Feng, Xinyue Yang, Yan Rong, Yanyun Wang, Zihang Shao, Zelin Zhao, Chenxing Li, Shan Yang, Wenfu Wang, Meng Yu, Dong Yu, Li Liu

机构 * HKUST(GZ)(香港科技大学(广州)) Tencent(腾讯)

专题命中 视频生成 :video generation(title)

AI总结 本文提出PhyAVBench,一个用于评估文本到音频视频生成、图像到音频视频生成和视频到音频生成模型中音频-物理基础能力的基准,通过引入新的数据集和评估方法,揭示了当前模型在物理合理音频生成方面的不足。

Comments 6 major physical dimensions, 41 fine-grained test points, 337 groups of variable-controlled test samples, 11,605 newly recorded videos

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09195 2026-04-13 cs.AI 71%

Camera Artist: A Multi-Agent Framework for Cinematic Language Storytelling Video Generation

Camera Artist: 一种多智能体框架用于电影语言叙事视频生成

Haobo Hu, Qi Mao, Yuanhang Li, Libiao Jin

机构 * School of Information and Communication Engineering, Communication University of China(中国传媒大学信息与通信工程学院) State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)

专题命中 视频生成 :video generation(title)

AI总结 Camera Artist通过引入专门的 cinematography shot agent,增强了镜头间叙事连贯性和电影语言表达,提升了视频叙事的连贯性和表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05757 2026-03-09 cs.RO 71%

EmboAlign: Aligning Video Generation with Compositional Constraints for Zero-Shot Manipulation

EmboAlign:通过组合约束对齐视频生成以实现零样本操控

Gehao Zhang, Zhenyang Ni, Payal Mohapatra, Han Liu, Ruohan Zhang, Qi Zhu

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学)

专题命中 视频生成 :video generation(title)

AI总结 EmboAlign通过视觉语言模型生成组合约束,对齐视频生成模型输出,提升零样本机器人操控的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17937 2026-02-27 cs.SD cs.AI cs.CL eess.AS 71%

Bob's Confetti: Phonetic Memorization Attacks in Music and Video Generation

Bob的彩纸:音乐和视频生成中的语音记忆攻击

Jaechul Roh, Zachary Novack, Yuefeng Peng, Niloofar Mireshghallah, Taylor Berg-Kirkpatrick, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频生成 :video generation(title)

AI总结 研究揭示了生成音乐和视频AI系统中语音记忆攻击的漏洞,通过同音替代词绕过版权过滤,展示语音结构对跨模态检索的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15512 2025-04-29 cs.CR cs.LG 71%

T2VShield: Model-Agnostic Jailbreak Defense for Text-to-Video Models

Siyuan Liang, Jiayang Liu, Jiecheng Zhai, Tianmeng Fang, Rongcheng Tu, Aishan Liu, Xiaochun Cao, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) Beijing Jiaotong University(北京交通大学) National University of Singapore(国立新加坡大学) Beihang University(北航) Sun Yat-sen University(中山大学)

专题命中 视频生成 :text-to-video(title)

Comments 33 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05242 2025-03-10 cs.CL 71%

MM-StoryAgent: Immersive Narrated Storybook Video Generation with a Multi-Agent Paradigm across Text, Image and Audio

Xuenan Xu, Jiahao Mei, Chenliang Li, Yuning Wu, Ming Yan, Shaopeng Lai, Ji Zhang, Mengyue Wu

专题命中 视频生成 :video generation(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06159 2026-08-24 cs.CV 版本更新 70%

Driving with DINO: Vision Foundation Features as a Unified Bridge for Sim-to-Real Generation in Autonomous Driving

驾驶用DINO:作为自动驾驶仿真到现实生成的统一桥梁的视觉基础特征

Xuyang Chen, Conglang Zhang, Chuanheng Fu, Zihao Yang, Kaixuan Zhou, Yizhi Zhang, Yanfeng Zhang, Mingwei Sun, Zhen Dong, Xiaoxiao Long, Zengmao Wang, Liqiu Meng

机构 * Technical University of Munich(慕尼黑技术大学) Huawei Hilbert Research Center(华为希利伯特研究中心) Huawei Riemann Lab(华为里曼实验室) Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 DwD通过利用视觉基础模块特征作为统一桥梁,解决自动驾驶仿真到现实生成中的现实性与真实性困境,提升控制精度与时间稳定性。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10519 2026-08-21 cs.CV 版本更新 70%

SparSTAR: Sparse Attention for SpaceTime AutoRegressive Video Synthesis

SparSTAR:用于时空自回归视频合成的稀疏注意力机制

Jongbeom Lee, Hyunwoo Yu, Jincheol Yang, Jaemin Choi, Suk-Ju Kang

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 针对InfinityStar视频合成中高成本注意力与不可靠稀疏模式问题,提出无需训练的SparSTAR块稀疏注意力,在720p生成任务中实现约1.6倍加速且保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15522 2026-08-18 cs.CV 新提交 70%

Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention

基于同步感知跨模态稀疏注意力的高效视听生成

Shengchuan Gao, Teng Hu, Bohao Feng, Luchen Li, Wenqiang Wang, Hongqian Deng, Ran Yi

机构 * Alibaba Group(阿里巴巴集团) Alibaba Cloud Computing(阿里巴巴云计算) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出同步感知加速框架,通过受保护的稀疏注意力策略在保留视听生成质量与同步性的同时提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13391 2026-08-14 cs.CV 新提交 70%

Context-Matched Distillation: Teacher Causality for Autoregressive Video Distillation

上下文匹配蒸馏:用于自回归视频蒸馏的教师因果性

Hmrishav Bandyopadhyay, Xuanchi Ren, Zijian Huang, Jay Zhangjie Wu, Tianshi Cao, Ruilong Li, Bryan Chu, Sanja Fidler, Yi-Zhe Song, Zian Wang

机构 * NVIDIA(英伟达) University of Surrey(萨里大学)

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出上下文匹配蒸馏(CMD)框架,解决现有视频蒸馏中教师监督与学生因果信息集不一致的问题,实现了自回归视频生成的最先进性能及对相机控制的更好依从性。

Comments Project Page: https://hmrishavbandy.github.io/cmd-site/

详情

展开后加载摘要…

URL PDF HTML 收藏