arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2160 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2160 篇

2608.06732 2026-08-10 cs.AI cs.CV cs.MM 新提交 62%

From Cheap Fakes to Pure Synthesis: Addressing the New Era of T2V Fake News Videos

从廉价伪造到纯合成:应对文本生成视频(T2V)假新闻视频的新时代

Yifeng Luo, Yupeng Li, Liang Lan, Tian Wang

机构 * Hong Kong Baptist University(香港浸会大学) Beijing Normal University(北京师范大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 该研究针对纯合成T2V假新闻视频带来的新威胁,构建了首个纯合成假新闻视频数据集,提出R-T2V框架,在10种主流基准上取得最优检测性能。

Comments Accepted at ACM Multimedia (ACM MM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19474 2026-07-08 cs.CV cs.AI cs.MM 62%

Pistachio: Towards Synthetic, Balanced, and Long-Form Video Anomaly Benchmarks

Pistachio: 向合成、平衡和长形式视频异常基准迈进

Jie Li, Hongyi Cai, Mingkang Dong, Muxin Pu, Shan You, Fei Wang, Tao Huang

机构 * Universiti Malaya(马来亚大学) Monash University(莫纳什大学) SenseTime Research(商汤科技研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Pistachio基准,通过生成式流程构建,提供可控场景、异常类型和时间叙事,减少人工标注依赖,验证了现有方法的挑战并推动动态多事件异常理解研究。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18993 2026-04-22 cs.CV cs.AI cs.MM 62%

AutoAWG: Adverse Weather Generation with Adaptive Multi-Controls for Automotive Videos

AutoAWG:用于自动驾驶视频的自适应多控逆境天气生成

Jiagao Hu, Daiguo Zhou, Danzhen Fu, Fuhao Li, Zepeng Wang, Fei Wang, Wenhua Liao, Jiayi Xie, Haiyang Sun

机构 * MiLM Plus, Xiaomi Inc.(小米 MiLM Plus) Xiaomi Inc.(小米公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 本文提出AutoAWG,通过自适应多控生成逆境天气视频,提升自动驾驶感知鲁棒性,实验表明其在FID和FVD指标上显著优于现有方法。

Comments Accepted by ICMR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04953 2026-04-08 cs.CV cs.AI cs.HC cs.IR cs.MM 62%

Generative AI for Video Trailer Synthesis: From Extractive Heuristics to Autoregressive Creativity

生成AI用于视频预告片合成:从提取启发式方法到自回归创造力

Abhishek Dharmaratnakar, Srivaths Ranganathan, Debanshu Das, Anushree Sinha

机构 * Google LLC(谷歌有限责任公司)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 本文综述了自动视频预告片生成领域从启发式提取到深度生成合成的转变,探讨了自回归Transformer、LLM协同流程和文本到视频基础模型等生成技术,并讨论了高保真神经合成的伦理挑战。

Comments 7 pages, 3 figures, accepted in WSDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01418 2026-03-03 cs.CV cs.MM cs.SD 62%

UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation

UniTalking: 一种统一的音频-视频框架用于说话肖像生成

Hebeizi Li, Zihao Liang, Benyuan Sun, Zihao Yin, Xiao Sha, Chenliang Wang, Yi Yang

机构 * Central Media Technology Institute, Huawei(华为中央媒体技术研究所) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 UniTalking提出了一种统一的端到端扩散框架,用于生成高质量的语音和唇同步视频,通过多模态Transformer块和个性化语音克隆技术,提升了视觉保真度和训练效率。

Comments Accepted at CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06593 2026-02-26 cs.CV eess.IV 62%

Capturing Stable HDR Videos Using a Dual-Camera System

利用双摄像头系统捕捉稳定HDR视频

Qianyu Zhang, Bolun Zheng, Lingyu Zhu, Hangjia Pan, Zunjie Zhu, Zongpeng Li, Shiqi Wang

机构 * School of Automation, Hangzhou Dianzi University(杭州电子科技大学自动化学院) Hangzhou Dianzi University(杭州电子科技大学) Lishui Institute of Hangzhou Dianzi University(杭州电子科技大学丽水学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

AI总结 本文提出了一种双摄像头系统和曝光自适应融合网络,用于解决HDR视频中时间闪烁问题,提升视频重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21365 2026-02-26 cs.CV cs.AI cs.LG eess.IV 62%

Towards Controllable Video Synthesis of Routine and Rare OR Events

面向常规和罕见OR事件可控视频合成

Dominik Schneider, Lalithkumar Seenivasan, Sampath Rapuri, Vishalroshan Anil, Aiza Maksutova, Yiqing Shen, Jan Emily Mangulabnan, Hao Ding, Jose L. Porras, Masaru Ishii, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) Technical University Munich(慕尼黑技术大学) Johns Hopkins Medical Institutions(约翰霍普金斯医学机构)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV、eess.IV

AI总结 本文提出了一种可控视频合成框架,用于生成手术室中常规和罕见事件,以支持环境智能模型的发展。

Comments Accepted to IPCAI 2026 and submitted to IJCARs

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17650 2025-12-22 cs.CV cs.MM 62%

Region-Constraint In-Context Generation for Instructional Video Editing

区域约束的上下文生成用于教学视频编辑

Zhongwei Zhang, Fuchen Long, Wei Li, Zhaofan Qiu, Wu Liu, Ting Yao, Tao Mei

机构 * University of Science and Technology of China(中国科学技术大学) HiDream.ai Inc.(HiDream.ai公司)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 ReCo通过引入区域约束建模,提升基于指令的视频编辑中编辑区域的准确性和去噪效果,提出新的正则化方法和大规模数据集。

Comments Project page: https://zhw-zhang.github.io/ReCo-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17735 2025-12-02 cs.MM cs.CV 62%

RDTF: Resource-efficient Dual-mask Training Framework for Multi-frame Animated Sticker Generation

RDTF:面向多帧动画贴纸生成的资源高效双掩码训练框架

Zhiqiang Yuan, Ting Zhang, Peixiang Luo, Ying Deng, Jiapei Zhang, Zexi Jia, Jinchao Zhang, Jie Zhou

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc(腾讯人工智能图案识别中心) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 RDTF通过三种核心设计,为多帧动画贴纸生成任务提供资源高效的解决方案,优于现有PEFT方法。

Comments Submitted to TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07633 2025-11-12 cs.CV cs.MM 62%

T-GVC: Trajectory-Guided Generative Video Coding at Ultra-Low Bitrates

Zhitao Wang, Hengyu Man, Wenrui Li, Xingtao Wang, Xiaopeng Fan, Debin Zhao

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.12510 2025-10-10 cs.CV cs.MM 62%

PRVR: Partially Relevant Video Retrieval

Xianke Chen, Daizong Liu, Xun Yang, Xirong Li, Jianfeng Dong, Meng Wang, Xun Wang

机构 * School of Computer Science and Technology(计算机科学与技术学院) School of Statistics and Mathematics(统计学与数学学院) Zhejiang Gongshang University(浙江工商大学) Zhejiang Key Laboratory of Big Data and Future E-Commerce Technology(大数据与未来电子商务技术重点实验室) Wangxuan Institute of Computer Technology(王萱计算机技术研究所) School of Information Science and Technology(信息科学与技术学院) University of Science and Technology of China(中国科学技术大学) School of Information(信息学院) Renmin University of China(中国人民大学) School of Computer Science and Information Engineering(计算机科学与信息工程学院)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM

Comments Accepted by TPAMI. The paper's homepage is https://github.com/HuiGuanLab/ms-sl-pp

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05661 2025-10-08 cs.CV cs.MM 62%

When and How to Cut Classical Concerts? A Multimodal Automated Video Editing Approach

Daniel Gonzálbez-Biosca, Josep Cabacas-Maso, Carles Ventura, Ismael Benito-Altamirano

机构 * eHealth Center, Faculty of Computer Science, Multimedia and Telecommunications, Universitat Oberta de Catalunya(eHealth中心,计算机科学、多媒体与电信学院,开放大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00050 2025-10-02 cs.MM cs.AI cs.CV cs.SD eess.AS 62%

Object-AVEdit: An Object-level Audio-Visual Editing Model

Youquan Fu, Ruiyang Si, Hongfa Wang, Dongzhan Zhou, Jiacheng Sun, Ping Luo, Di Hu, Hongyuan Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究院) China Telecom(中国电信) Gaoling School of Artificial Intelligence(东城区人工智能学院) Renmin University of China(中国人民大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tencent Data Platform(腾讯数据平台) Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Huawei Noah’s Ark Lab(华为诺亚实验室) The University of Hong Kong(香港大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13126 2025-07-08 cs.CR cs.AI cs.CV cs.LG eess.IV 62%

VGMShield: Mitigating Misuse of Video Generative Models

Yan Pang, Baicheng Chen, Yang Zhang, Tianhao Wang

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12601 2025-07-03 cs.CV cs.GR cs.MM 62%

DreamCinema: Cinematic Transfer with Free Camera and 3D Character

Weiliang Chen, Fangfu Liu, Diankun Wu, Haowen Sun, Jiwen Lu, Yueqi Duan

机构 * Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学) Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

Comments Project page: https://liuff19.github.io/DreamCinema

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15461 2025-06-11 cs.CV cs.MM cs.RO 62%

EVA: An Embodied World Model for Future Video Anticipation

Xiaowei Chi, Chun-Kai Fan, Hengyuan Zhang, Xingqun Qi, Rongyu Zhang, Anthony Chen, Chi-min Chan, Wei Xue, Qifeng Liu, Shanghang Zhang, Yike Guo

机构 * Hong Kong University of Science(香港科学与技术大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00868 2025-05-14 cs.CV eess.IV 62%

RT-GAN: Recurrent Temporal GAN for Adding Lightweight Temporal Consistency to Frame-Based Domain Translation Approaches

Shawn Mathew, Saad Nadeem, Alvin C. Goh, Arie Kaufman

机构 * Stony Brook University(石溪布鲁克大学) Memorial Sloan Kettering Cancer Center(纪念斯隆凯特琳癌症中心)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

Comments MICCAI 2025 Early Accept. First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12831 2025-03-28 cs.CV cs.AI cs.MM 62%

VIA: Unified Spatiotemporal Video Adaptation Framework for Global and Local Video Editing

Jing Gu, Yuwei Fang, Ivan Skorokhodov, Peter Wonka, Xinya Du, Sergey Tulyakov, Xin Eric Wang

专题命中 视频生成 :long video(abstract);分类 cs.CV、cs.MM

Comments 18 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13501 2025-03-19 cs.CV cs.AI cs.LG cs.MM 62%

VSTAR: Generative Temporal Nursing for Longer Dynamic Video Synthesis

Yumeng Li, William Beluch, Margret Keuper, Dan Zhang, Anna Khoreva

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM

Comments Accepted at ICLR 2025. Code: https://github.com/boschresearch/VSTAR and project page: https://yumengli007.github.io/VSTAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10696 2025-03-17 cs.CV eess.IV 62%

Neighboring Autoregressive Modeling for Efficient Visual Generation

Yefei He, Yuanyu He, Shaoxuan He, Feng Chen, Hong Zhou, Kaipeng Zhang, Bohan Zhuang

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14468 2024-11-05 cs.CV cs.AI cs.MM 62%

AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks

Max Ku, Cong Wei, Weiming Ren, Harry Yang, Wenhu Chen

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

Comments Published in Transactions on Machine Learning Research (TMLR 2024) (11/2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21061 2024-10-29 cs.CV cs.AI cs.MM 62%

Kandinsky 3: Text-to-Image Synthesis for Multifunctional Generative Framework

Vladimir Arkhipkin, Viacheslav Vasilev, Andrei Filatov, Igor Pavlov, Julia Agafonova, Nikolai Gerasimenko, Anna Averchenkova, Evelina Mironova, Anton Bukashkin, Konstantin Kulikov, Andrey Kuznetsov, Denis Dimitrov

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM

Comments Accepted for EMNLP 2024 (Demo track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08534 2024-10-22 cs.CV eess.IV 62%

Quality Prediction of AI Generated Images and Videos: Emerging Trends and Opportunities

Abhijay Ghildyal, Yuanhan Chen, Saman Zadtootaghaj, Nabajeet Barman, Alan C. Bovik

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

Comments "The abstract field cannot be longer than 1,920 characters", the abstract appearing here is slightly shorter than that in the PDF file

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03340 2024-08-08 cs.MM cs.CV 62%

An Empirical Comparison of Video Frame Sampling Methods for Multi-Modal RAG Retrieval

Mahesh Kandhare, Thibault Gisselbrecht

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM

Comments 19 pages, 24 figures (65 images)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03511 2024-07-01 cs.CV cs.LG cs.MM 62%

Kandinsky 3.0 Technical Report

Vladimir Arkhipkin, Andrei Filatov, Viacheslav Vasilev, Anastasia Maltseva, Said Azizov, Igor Pavlov, Julia Agafonova, Andrey Kuznetsov, Denis Dimitrov

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

Comments Project page: https://ai-forever.github.io/Kandinsky-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16728 2024-05-28 cs.CV cs.AI cs.LG cs.MM 62%

Towards Multi-Task Multi-Modal Models: A Video Generative Perspective

Lijun Yu

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15944 2024-03-26 cs.CV cs.AI eess.IV 62%

Adaptive Super Resolution For One-Shot Talking-Head Generation

Luchuan Song, Pinxin Liu, Guojun Yin, Chenliang Xu

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07952 2024-03-14 cs.CV cs.AI cs.MM 62%

AesopAgent: Agent-driven Evolutionary System on Story-to-Video Production

Jiuniu Wang, Zehua Du, Yuyuan Zhao, Bo Yuan, Kexiang Wang, Jian Liang, Yaxi Zhao, Yihen Lu, Gengliang Li, Junlong Gao, Xin Tu, Zhenyu Guo

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

Comments 22 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00028 2024-02-02 cs.GR cs.CV eess.IV 62%

Neural Rendering and Its Hardware Acceleration: A Review

Xinkai Yan, Jieting Xu, Yuchi Huo, Hujun Bao

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.04429 2022-10-11 eess.IV cs.CV 62%

DeepHS-HDRVideo: Deep High Speed High Dynamic Range Video Reconstruction

Zeeshan Khan, Parth Shettiwar, Mukul Khanna, Shanmuganathan Raman

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

Comments ICPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏