arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2158 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2158 篇

2407.02873 2024-07-04 cs.RO 78%

Robot Shape and Location Retention in Video Generation Using Diffusion Models

Peng Wang, Zhihao Guo, Abdul Latheef Sait, Minh Huy Pham

专题命中 视频生成 :video generation(title,abstract)

Comments 8 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16155 2024-06-25 cs.SD cs.GR eess.AS 78%

Listen and Move: Improving GANs Coherency in Agnostic Sound-to-Video Generation

Rafael Redondo

专题命中 视频生成 :video generation(title,abstract)

Comments Full paper of the homonym paper published in the ICCV 2023 workshop "AV4D: Visual Learning of Sounds in Spaces"

Journal ref Abstract version published in the ICCV 2023 workshop "AV4D: Visual Learning of Sounds in Spaces"

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11859 2024-06-19 cs.CY cs.AI cs.ET cs.HC 78%

"Sora is Incredible and Scary": Emerging Governance Challenges of Text-to-Video Generative AI Models

Kyrie Zhixuan Zhou, Abhinav Choudhry, Ece Gumusel, Madelyn Rose Sanfilippo

专题命中 视频生成 :text-to-video(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14665 2024-03-27 cs.CY cs.HC 78%

Sora OpenAI's Prelude: Social Media Perspectives on Sora OpenAI and the Future of AI Video Generation

Reza Hadi Mogavi, Derrick Wang, Joseph Tu, Hilda Hadan, Sabrina A. Sgandurra, Pan Hui, Lennart E. Nacke

专题命中 视频生成 :video generation(title,abstract)

Journal ref Workshop at ACM CHI 2024 (HCI and Human Factors Joining Forces to Meet the AI Interaction Challenge)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.00111 2023-11-21 cs.AI 78%

Learning Universal Policies via Text-Guided Video Generation

Yilun Du, Mengjiao Yang, Bo Dai, Hanjun Dai, Ofir Nachum, Joshua B. Tenenbaum, Dale Schuurmans, Pieter Abbeel

专题命中 视频生成 :video generation(title,abstract)

Comments NeurIPS 2023, Project Website: https://universal-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06287 2026-04-30 cs.CV 77%

Perception Test 2025: Challenge Summary and a Unified VQA Extension

2025感知测试挑战:挑战总结及统一视觉问答扩展

Joseph Heyward, Nikhil Parthasarathy, Tyler Zhu, Aravindh Mahendran, João Carreira, Dima Damen, Andrew Zisserman, Viorica Pătrăucean

机构 * Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学) University of Bristol(布里斯托大学) University of Oxford(牛津大学)

专题命中 视频生成 :video generation(abstract);video-language(abstract);long video(abstract);分类 cs.CV

AI总结 2025年感知测试挑战旨在评估最新视频模型并衡量多模态感知的进步,通过统一任务测试揭示现有模型在统一接口下处理多样化感知任务的困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12887 2026-04-15 cs.CV cs.LG 77%

VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization

VideoFlexTok: 可变长度粗到细视频标记化

Andrei Atanov, Jesse Allardice, Roman Bachmann, Oğuzhan Fatih Kar, R Devon Hjelm, David Griffiths, Peter Fu, Afshin Dehghan, Amir Zamir

机构 * Apple(苹果公司) Swiss Federal Institute of Technology Lausanne (EPFL)(瑞士联邦理工学院洛桑分校(EPFL))

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);long video(abstract);分类 cs.CV

AI总结 VideoFlexTok通过可变长度粗到细标记化结构,实现更高效的视频生成,相比传统3D网格标记化,模型更小且生成质量相近。

Comments project page at https://videoflextok.epfl.ch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18359 2026-04-08 cs.CV 77%

TRANSPORTER: Transferring Visual Semantics from VLM Manifolds

TRANSPORTER:从VLM流形转移视觉语义

Alexandros Stergiou

机构 * University of Twente, NL(荷兰特温特大学)

专题命中 视频生成 :video generation(abstract);video understanding(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出TRANSPORTER方法,通过logits-to-video任务生成视频,揭示VLM预测背后的规则,为模型可解释性提供新方向。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, Project page: https://alexandrosstergiou.github.io/TRANSPORTER

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12090 2026-04-02 cs.CV cs.CR cs.LG 77%

SPDMark: Selective Parameter Displacement for Robust Video Watermarking

SPDMark:基于选择性参数位移的鲁棒视频水印技术

Samar Fares, Nurbek Tastan, Karthik Nandakumar

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Michigan State University (MSU)(密歇根州立大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 SPDMark通过在视频扩散模型中选择性位移参数,在生成视频时嵌入不可见水印,实现高鲁棒性和计算效率的平衡。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00978 2026-03-03 cs.CV cs.AI 77%

EraseAnything++: Enabling Concept Erasure in Rectified Flow Transformers Leveraging Multi-Object Optimization

EraseAnything++: 通过多对象优化实现Rectified Flow Transformers中的概念擦除

Zhaoxin Fan, Nanxiang Jiang, Daiheng Gao, Shiji Zhou, Wenjun Wu

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北航) University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 EraseAnything++通过多目标优化实现图像和视频扩散模型中的概念擦除,提升生成质量与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03233 2026-01-07 cs.CV 77%

LTX-2: Efficient Joint Audio-Visual Foundation Model

LTX-2:高效的音频-视觉联合基础模型

Yoav HaCohen, Benny Brazowski, Nisan Chiprut, Yaki Bitterman, Andrew Kvochko, Avishai Berkowitz, Daniel Shalem, Daphna Lifschitz, Dudu Moshe, Eitan Porat, Eitan Richardson, Guy Shiran, Itay Chachy, Jonathan Chetboun, Michael Finkelson, Michael Kupchick, Nir Zabari, Nitzan Guetta, Noa Kotler, Ofir Bibi, Ori Gordon, Poriya Panet, Roi Benita, Shahar Armon, Victor Kulikov, Yaron Inger, Yonatan Shiftan, Zeev Melumian, Zeev Farbman

机构 * Lightricks(利光科技)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 LTX-2是一种高效的音频-视觉联合基础模型,通过统一的双流变压器架构生成高质量的音频视觉内容,支持多语言提示和模态感知的可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06271 2025-11-11 cs.CV 77%

RelightMaster: Precise Video Relighting with Multi-plane Light Images

Weikang Bian, Xiaoyu Shi, Zhaoyang Huang, Jianhong Bai, Qinghe Wang, Xintao Wang, Pengfei Wan, Kun Gai, Hongsheng Li

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Kling Team, Kuaishou Technology(快手技术 Kling 团队) CPII under InnoHK(创新香港 CPII) Zhejiang University(浙江大学) Dalian University of Technology(大连理工大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project Page: https://wkbian.github.io/Projects/RelightMaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22200 2025-10-29 cs.CV 77%

LongCat-Video Technical Report

Meituan LongCat Team, Xunliang Cai, Qilong Huang, Zhuoliang Kang, Hongyu Li, Shijun Liang, Liya Ma, Siyu Ren, Xiaoming Wei, Rixu Xie, Tong Zhang

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08143 2025-10-10 cs.CV 77%

UniMMVSR: A Unified Multi-Modal Framework for Cascaded Video Super-Resolution

Shian Du, Menghan Xia, Chang Liu, Quande Liu, Xintao Wang, Pengfei Wan, Xiangyang Ji

机构 * Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23263 2025-07-01 cs.CV 77%

Causal-Entity Reflected Egocentric Traffic Accident Video Synthesis

Lei-lei Li, Jianwu Fang, Junbin Xiao, Shanmin Pang, Hongkai Yu, Chen Lv, Jianru Xue, Tat-Seng Chua

机构 * Xi’an Jiaotong University(西安交通大学) National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) Cleveland State University(克利夫兰州立大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11190 2025-03-17 cs.SD cs.AI cs.CL cs.MM eess.AS 77%

Cross-Modal Learning for Music-to-Music-Video Description Generation

Zhuoyuan Mao, Mengjie Zhao, Qiyu Wu, Zhi Zhong, Wei-Hsiang Liao, Hiromi Wakaki, Yuki Mitsufuji

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.MM

Comments Accepted by RepL4NLP 2025 @ NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07701 2025-02-18 cs.CV 77%

Magic 1-For-1: Generating One Minute Video Clips within One Minute

Hongwei Yi, Shitong Shao, Tian Ye, Jiantong Zhao, Qingyu Yin, Michael Lingelbach, Li Yuan, Yonghong Tian, Enze Xie, Daquan Zhou

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);long video(abstract);分类 cs.CV

Comments Serious updates are needed

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17225 2024-12-05 cs.CV 77%

4DGen: Grounded 4D Content Generation with Spatial-temporal Consistency

Yuyang Yin, Dejia Xu, Zhangyang Wang, Yao Zhao, Yunchao Wei

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://vita-group.github.io/4DGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02095 2024-12-02 cs.CV cs.AI cs.GR 77%

DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos

Wenbo Hu, Xiangjun Gao, Xiaoyu Li, Sijie Zhao, Xiaodong Cun, Yong Zhang, Long Quan, Ying Shan

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

Comments Project webpage: https://depthcrafter.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07944 2024-03-14 cs.CV cs.AI 77%

WorldGPT: A Sora-Inspired Video AI Agent as Rich World Models from Text and Image Inputs

Deshun Yang, Luhui Hu, Yu Tian, Zihao Li, Chris Kelly, Bang Yang, Cindy Yang, Yuexian Zou

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments 11 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09057 2026-08-26 cs.CV cs.MM cs.SD 版本更新 76%

Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence

Tora3:基于轨迹的音频视频生成与物理一致性

Junchao Liao, Zhenghao Zhang, Xiangyu Meng, Litao Li, Ziying Zhang, Siyu Zhu, Long Qin, Weizhi Wang

机构 * Alibaba Cloud Computing(阿里巴巴云 computing) Fudan University(复旦大学)

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

AI总结 Tora3通过引入轨迹作为共享的运动先验,提升音频视频生成的物理一致性,采用轨迹对齐的运动表示和混合流匹配方案,改进运动真实性和运动-声音同步性。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07531 2026-06-18 cs.CV cs.AI cs.LG cs.MM 版本更新 76%

VidCRAFT3: Camera, Object, and Lighting Control for Image-to-Video Generation

VidCRAFT3: 面向图像到视频生成的相机、物体与光照控制

Sixiao Zheng, Zimian Peng, Yanpeng Zhou, Yi Zhu, Hang Xu, Xiangru Huang, Yanwei Fu

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Westlake University(西湖大学) School of Data Science and MOE Frontiers Center for Brain Science, Fudan University(复旦大学数据科学学院和脑科学前沿中心) Fudan ISTBI–ZJNU Algorithm Centre for Brain-inspired Intelligence, Zhejiang Normal University(复旦大学-浙江师范大学脑启发智能算法中心)

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

AI总结 提出VidCRAFT3框架,通过显式建模几何、运动与光照的跨因素交互,实现对相机运动、物体运动和光照方向的独立或联合控制,在控制精度和视觉一致性上达到最优。

Comments Accepted to TVCG 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12196 2025-12-16 cs.MM cs.CV cs.SD eess.AS 76%

AutoMV: An Automatic Multi-Agent System for Music Video Generation

AutoMV: 一种自动多智能体系统用于音乐视频生成

Xiaoxuan Tang, Xinping Lei, Chaoran Zhu, Shiyun Chen, Ruibin Yuan, Yizhi Li, Changjae Oh, Ge Zhang, Wenhao Huang, Emmanouil Benetos, Yang Liu, Jiaheng Liu, Yinghao Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanjing University(南京大学) Queen Mary University of London(伦敦大学女王学院) Hong Kong University of Science and Technology(香港科技大学) University of Manchester(曼彻斯特大学)

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

AI总结 AutoMV通过多智能体协作生成完整音乐视频,优于现有方法并接近专业水准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03603 2025-06-13 cs.CV cs.MM 76%

A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation

S. Z. Zhou, Y. B. Wang, J. F. Wu, T. Hu, J. N. Zhang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

Comments revised

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20287 2025-05-27 cs.CV cs.MM 76%

MotionPro: A Precise Motion Controller for Image-to-Video Generation

Zhongwei Zhang, Fuchen Long, Zhaofan Qiu, Yingwei Pan, Wu Liu, Ting Yao, Tao Mei

机构 * University of Science and Technology of China(中国科学技术大学) HiDream.ai Inc.(HiDream.ai公司)

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

Comments CVPR 2025. Project page: https://zhw-zhang.github.io/MotionPro-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18552 2025-05-27 cs.CV cs.AI cs.MM 76%

EvAnimate: Event-conditioned Image-to-Video Generation for Human Animation

Qiang Qu, Ming Li, Xiaoming Chen, Tongliang Liu

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09266 2024-12-02 cs.CV cs.AI cs.MM cs.SD eess.AS 76%

Dance Any Beat: Blending Beats with Visuals in Dance Video Generation

Xuanchen Wang, Heng Wang, Dongnan Liu, Weidong Cai

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

Comments WACV2025, 11 pages, 7 figures, demo page: https://DabFusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09787 2024-08-20 cs.CL cs.CV cs.MM 76%

Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation Video Generation

Yunxin Li, Haoyuan Shi, Baotian Hu, Longyue Wang, Jiashun Zhu, Jinyi Xu, Zhen Zhao, Min Zhang

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

Comments Accepted by SIGGRAPH Asia 2024, Project and Codes: https://github.com/HITsz-TMG/Anim-Director

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.10922 2024-03-18 cs.CV cs.LG eess.AS eess.IV 76%

StyleTalker: One-shot Style-based Audio-driven Talking Head Video Generation

Dongchan Min, Minyoung Song, Eunji Ko, Sung Ju Hwang

专题命中 视频生成 :video generation(title);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.07931 2023-08-15 cs.CV eess.IV 76%

DialogueNeRF: Towards Realistic Avatar Face-to-Face Conversation Video Generation

Yichao Yan, Zanwei Zhou, Zi Wang, Jingnan Gao, Xiaokang Yang

专题命中 视频生成 :video generation(title);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏