arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2160 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2160 篇

2209.08795 2022-09-20 cs.MM cs.CV cs.SD eess.AS 62%

AutoLV: Automatic Lecture Video Generator

Wenbin Wang, Yang Song, Sanjay Jha

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

Comments 4 pages, 4 figures, ICIP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.06180 2022-04-14 cs.CV cs.GR cs.MM 62%

Dynamic Neural Textures: Generating Talking-Face Videos with Continuously Controllable Expressions

Zipeng Ye, Zhiyao Sun, Yu-Hui Wen, Yanan Sun, Tian Lv, Ran Yi, Yong-Jin Liu

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.01866 2021-11-04 eess.IV cs.CV cs.LG physics.med-ph 62%

3-D PET Image Generation with tumour masks using TGAN

Robert V Bergen, Jean-Francois Rajotte, Fereshteh Yousefirizi, Ivan S Klyuzhin, Arman Rahmim, Raymond T. Ng

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.03120 2021-07-08 cs.CV cs.MM 62%

Cross-View Exocentric to Egocentric Video Synthesis

Gaowen Liu, Hao Tang, Hugo Latapie, Jason Corso, Yan Yan

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

Comments ACM MM 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.16078 2020-12-03 cs.CV eess.IV 62%

LIFI: Towards Linguistically Informed Frame Interpolation

Aradhya Neeraj Mathur, Devansh Batra, Yaman Kumar, Rajiv Ratn Shah, Roger Zimmermann

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

Comments 9 pages, 7 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.05018 2020-11-25 eess.IV cs.CV 62%

Source Camera Verification from Strongly Stabilized Videos

Enes Altinisik, Husrev Taha Sencar

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.10704 2020-06-20 cs.CV cs.LG eess.IV 62%

Latent Video Transformer

Ruslan Rakhimov, Denis Volkhonskiy, Alexey Artemov, Denis Zorin, Evgeny Burnaev

专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08487 2026-01-27 cs.CV cs.AI cs.MA 61%

MAViS: A Multi-Agent Framework for Long-Sequence Video Storytelling

MAViS:一个用于长序列视频叙事的多智能体框架

Qian Wang, Ziqi Huang, Ruoxi Jia, Paul Debevec, Ning Yu

机构 * Virginia Tech(弗吉尼亚理工大学) Nanyang Technological University(南洋理工大学) Eyeline Studios(Eyeline工作室)

专题命中 视频生成 :video generation(abstract,comments);分类 cs.CV

AI总结 MAViS通过多智能体协作框架提升长序列视频生成的辅助能力、视觉质量和表达性,支持多模态输出。

Comments Video Generation Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15564 2025-09-23 cs.CV 61%

Show-o2: Improved Native Unified Multimodal Models

Jinheng Xie, Zhenheng Yang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) ByteDance(字节跳动)

专题命中 视频生成 :video generation(abstract);分类 cs.CV;video understanding(comments)

Comments NeurIPS 2025. (v3: update to include video understanding, OneIG, and more ablation study results)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15138 2025-03-21 cs.CV 61%

VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention

Mingzhe Zheng, Yongqi Xu, Haojian Huang, Xuran Ma, Yexin Liu, Wenjie Shu, Yatian Pang, Feilong Tang, Qifeng Chen, Harry Yang, Ser-Nam Lim

专题命中 视频生成 :video generation(abstract,comments);分类 cs.CV

Comments This paper should be a refined version of arXiv:2412.02259, "VideoGen-of-Thought: A Collaborative Framework for Multi-Shot Video Generation", but I mistakenly submit it as a new paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20809 2026-08-26 cs.CV 版本更新 57%

Layer-Aware Video Composition via Split-then-Merge

通过分割后再融合的分层视频合成

Ozgur Kara, Yujia Chen, Ming-Hsuan Yang, James M. Rehg, Wen-Sheng Chu, Du Tran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 StM通过分割未标注视频并融合动态前景与背景层,提升生成视频合成的控制能力和数据效率。

Comments Project Webpage: https://split-then-merge.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23090 2026-08-25 cs.CV 新提交 57%

Loopy: Seamless Video Loop Generation via Anchored Looping Shift of Positional Embedding

Loopy:通过位置嵌入的锚定循环偏移实现无缝视频生成

Haotian Dong, Wenjing Wang, Chen Li, Jing Lyu, Xin Wang, Di Lin

机构 * Tianjin University(天津大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 该研究针对现有循环视频生成质量差的问题,提出Loopy框架,通过锚定DiT的位置嵌入偏移策略,实现高质量、支持多格式及高级AIGC功能的循环视频生成,提升了时间一致性与视觉保真度。

Comments 15 pages, 21 figures, accepted by ACM TOG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23070 2026-08-25 cs.AI cs.CV 新提交 57%

From Generation to Simulation: How Far Are World Models from Being True Simulators?

从生成到模拟:世界模型距离真正的模拟器还有多远?

Tong Wang, Huan Deng, Mucheng Yang, Yang He, Xiaohui Kuang, Gang Zhao

机构 * Institute of Systems Engineering, Academy of Military Sciences(军事科学院系统工程研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本研究通过系统评估200篇相关成果,分析了潜在动力学等3条技术路线的世界模型在传统模拟器8项能力上的表现,指出其在状态反馈等方面的缺陷并提出6个研究方向。

Comments 42 pages, 23 figures, 2 tables. Project page: https://github.com/AtongWang/world-model-simulators

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11421 2026-08-25 cs.CV 版本更新 57%

ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation

ShotVerse: 提升文本驱动多镜头视频创作的电影级摄像机控制

Songlin Yang, Zhe Wang, Xuyi Yang, Songchun Zhang, Xianghao Kong, Taiyi Wu, Xiaotong Zhao, Ran Zhang, Alan Zhao, Anyi Rao

机构 * Tencent Video AI Center, PCG, Tencent(腾讯视频AI中心)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 ShotVerse通过'计划然后控制'框架,结合视觉语言模型和摄像机适配器,实现多镜头视频创作中精准的摄像机控制与高保真电影效果。

Comments SIGGRAPH Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20770 2026-08-24 cs.CV 新提交 57%

MotionPhys: Detecting AI-Generated Videos via Physical Consistency of Optical-Flow Trajectories

MotionPhys:基于光流轨迹物理一致性检测AI生成视频

Haojin He, Hao Tan, Zichang Tan, Ajian Liu, Jun Wan

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 MotionPhys是基于光流轨迹物理一致性的轻量可解释框架,可检测AI生成视频的物理运动不一致性,且对不同视频生成器泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14790 2026-08-24 cs.CV 版本更新 57%

Instruction-Based Video Editing by Repurposing an Image Editing Model

Qwen-Video-Edit:通过复用图像编辑模型实现基于指令的视频编辑

Yunpeng Bai, Yossi Gandelsman, Michaël Gharbi, Qixing Huang

机构 * UT Austin(德克萨斯大学奥斯汀分校) Reve(Reve公司)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 该研究提出Qwen-Video-Edit,通过复用Qwen-Image-Edit图像编辑模型,经少量适配实现基于指令的视频编辑,证明图像编辑先验可迁移至视频编辑任务。

Comments Project Page: https://yunpeng1998.github.io/Qwen-Video-Edit-Page Code: https://github.com/yunpeng1998/Qwen-Video-Edit Model: https://huggingface.co/yunpeng1998/Qwen-Video-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13971 2026-08-24 cs.CV 版本更新 57%

Prompt2Effect: Training-Free Image-to-Video Model Specialization via LoRA Generation

Prompt2Effect: 通过LoRA生成实现免训练图像到视频模型特化

Xiaomeng Yang, Yanyu Li, Gordon Guocheng Qian, Ivan Skorokhodov, Viacheslav Ivanov, Avalon Vinella, Xuan Zhang, Yanzhi Wang, Sergey Tulyakov, Anil Kag

机构 * Northeastern University(东北大学) Snap Inc.(Snap公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出Prompt2Effect,一种权重驱动超网络,通过单次前向传播直接合成效果特定的LoRA权重,无需训练,在保持视频质量的同时将计算成本从56 GPU小时降至3.3秒。

Comments Accepted to ECCV 2026, project page: https://xiaomeng-yang.github.io/Prompt2Effect

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10931 2026-08-24 cs.CV cs.GR 57%

VSF: Simple, Efficient, and Effective Negative Guidance in Few-Step Image Generation Models By Value Sign Flip

VSF: 在少步图像生成模型中通过值符号翻转实现简单、高效且有效的负引导

Wenqi Guo, Shan Du

机构 * Department of CMPS University of British Columbia(计算机科学与工程系,不列颠哥伦比亚大学) Department of MEOW, Weathon Software(MEOW系,Weathon软件公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 VSF通过值符号翻转在少步图像生成模型中实现高效负提示引导,提升生成质量与稳定性。

Journal ref Guo, Wenqi, and Shan Du. "VSF: Simple, Efficient, and Effective Negative Guidance in Few-Step Image Generation Models By Value Sign Flip." In International Conference on Learning Representations, vol. 2026, pp. 83005-83018. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07468 2026-08-18 cs.CV 版本更新 57%

SimWAM: A Simple World Action Model for End-to-End Autonomous Driving

SimWAM:一种用于端到端自动驾驶的简单世界动作模型

Zongchuang Zhao, Xin Zhou, Tianyang Xu, Zhengyang Sun, Kaixuan Zhou, Honglin Li, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science & Technology(华中科技大学) Dongfeng Research & Development Institute(东风研发院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 SimWAM是一种仅将视频生成用作训练信号的简单WAM,通过联合流匹配协同训练视频与动作专家,在NAVSIM上达91.5 PDMS且延迟更低,可零样本迁移至nuScenes,为高效自动驾驶提供可靠基线。

Comments The code and model weights are available at https://github.com/H-EmbodVis/SimWAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19505 2026-08-18 cs.CV 版本更新 57%

DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT

DrivingWorld:通过视频GPT构建自动驾驶领域的世界模型

Xiaotao Hu, Mingkai Jia, Xiaoyang Guo, Qian Zhang, Xiao-xiao Long, Wei Yin

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出名为DrivingWorld的自动驾驶GPT风格世界模型,通过时空融合等策略提升视频生成质量与时长,实现更优的可控未来视频生成效果。

Journal ref ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13556 2026-08-14 cs.CV 新提交 57%

V-RAE: Rethinking Video Latent Spaces for Generation

V-RAE:重新思考用于生成的视频隐空间

Minghui Guo, Shengqiong Wu, Hao Fei

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本研究提出V-RAE视频表示自动编码器,基于冻结视觉基础模型构建生成隐空间,在多项视频任务上优于现有模型,还引入tFVD指标,证明冻结语义表示可支持多种视频建模任务。

Comments 26 pages, 8 tables, 13 figures, project page: https://v-rae.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17492 2026-08-14 cs.CV 版本更新 57%

EvDiff: Event-Based Video Reconstruction using One-Step Diffusion Models

EvDiff:高质视频与事件相机

Weilun Li, Lei Sun, Ruixi Gao, Qi Jiang, Yuqin Ma, Kaiwei Wang, Ming-Hsuan Yang, Luc Van Gool, Danda Pani Paudel

机构 * Zhejiang University(浙江大学) INSAIT UC Merced(加州大学默塞德分校) Google DeepMind(谷歌DeepMind)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 EvDiff通过基于事件的扩散模型和替代训练框架,从单色事件流生成高质量彩色视频,提升视频生成的保真度和现实感。

Comments Replacement note: This manuscript has been transferred from the CVPR format to the ECCV 2026 format, with the corresponding title and template updated accordingly. The technical content remains largely unchanged from the previous version. (Current version: 21 pages, 6 figures, and 3 tables.) Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11201 2026-08-12 cs.CV 新提交 57%

VidForensics-M1: Meta-Detection Reinforcement Learning with Verifiable Temporal Grounding for AI-Generated Video Forensics

VidForensics-M1:用于AI生成视频取证的、具备可验证时间定位的元检测强化学习

Bowei Liu, Zheng Lu, Yuhan Bian, Xinchen Zhang, Xingming Shui, Yuesheng Huang, Xuhuan Li, Zihao Liu, Yifan Yang, Jun Zhou, Xiu Li

机构 * Tsinghua University(清华大学) Peking University(北京大学) Renmin University of China(中国人民大学) Microsoft(微软公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 该研究针对AI生成视频检测泛化性不足的问题,首次将元检测引入该领域,提出结合可验证时间证据的VidForensics-M1模型及相关机制,实现了鲁棒可泛化的检测。

Comments 27 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25810 2026-08-12 cs.CV cs.HC 57%

Data-driven Head Motion Generation through Natural Gaze-Head Coordination

数据驱动的自然注视-头部协调头部运动生成

Xiaohan Liu, Yilin Wen, Yusuke Sugano

机构 * Institute of Industrial Science, The University of Tokyo(东京大学工业科学研究所)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出首个数据驱动方法,通过自动提取自然注视和头部运动,利用条件变分自编码器生成与注视相关的头部运动,并应用于注视控制的视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14556 2026-08-11 cs.CV cs.AI 版本更新 57%

Controllable Video Object Insertion via Multi-View Priors

通过多视角先验实现可控的视频物体插入

Qi Xia, Peishan Cong, Yichen Yao, Ziyi Wang, Yaoqin Ye, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出一种通过多视角先验解决视频物体插入中外观不一致和遮挡问题的新方法,采用双路径视图一致条件机制和质量感知加权机制,提升插入物体的稳定性和真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01720 2026-08-10 cs.CV cs.AI cs.CL 版本更新 57%

SignVerse-2M: A Two-Million-Clip Pose-Native Universe of 55+ Sign Languages

SignVerse-2M:包含55+种手语的两百万片段姿态原生数据集

Sen Fang, Hongbin Zhong, Yanxin Zhang, Dimitris N. Metaxas

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出SignVerse-2M,这是一个包含55+种手语、约200万片段的大规模多语言姿态原生手语数据集,适配现代姿态驱动的生成与识别范式,兼具真实场景适配性,可支撑多语言手语姿态建模与评估。

Comments Fix some typos. 13 pages. Project Page at: https://signerx.github.io/SignVerse-2M/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08260 2026-08-10 cs.CV 版本更新 57%

TIDE: Task-Isolated Diffusion for Unified Video Editing and Generation

TIDE: 任务隔离扩散模型用于统一视频编辑与生成

Qi Liu, Gang Yue, Mingyu Yin, Lisai Zhang, Yidi Wu, Yaole Wang, Yaohui Wang, Chang Yao, Jingyuan Chen, Lin Ma

机构 * Zhejiang University(浙江大学) Bilibili Inc.(哔哩哔哩股份有限公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出TIDE统一框架,通过逐token任务嵌入和双路径条件机制,实现指令编辑、参考编辑和多参考生成,在多任务渐进训练下达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05803 2026-08-07 cs.CV 新提交 57%

Vorch-Omni: Multi-Task Orchestration of Sight and Sound

Vorch-Omni:视觉与听觉的多任务编排

Vorch Team, Xiaoyu Chen, Yang Ding, Cong Han, Menglin Han, Yuxin Hong, Jiebo Hou, Zequn Jie, Xiang Li, Jing Liu, Qi Liu, Yulei Lu, Siyuan Luo, Lin Ma, Xin Ma, Yinlong Qian, Peng Shi, Fang Wan, Siqi Wang, Yaohui Wang, Yaole Wang, Yidi Wu, Siqian Yang, Mingyu Yin, Haoran Yu, Gang Yue, Lisai Zhang, Yuting Zhang

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 Vorch-Omni是基于流匹配扩散Transformer的统一多任务视听合成框架,支持10余项视听相关任务,为通用视听生成与操作提供可扩展基础。

Comments Project Page: https://vorch-project.github.io/Vorch-Omni-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05776 2026-08-07 cs.CV 新提交 57%

Vorch-Director: Interactive World Story Model via Noise-Aware Error Rectification

Vorch-Director:基于噪声感知误差校正的交互式世界故事模型

Lisai Zhang, Yidi Wu, Qi Liu, Xin Ma, Yang Ding, Gang Yue, Siqian Yang, Jingyuan Chen, Lin Ma, Yaohui Wang

机构 * Vorch Team(Vorch团队) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Vorch-Director是一种噪声感知残差校正策略,基于LTX-2扩散Transformer,可提升视听长视频生成的稳定性与保真度,支持多镜头、多主体的参考引导生成。

Comments Project page: https://vorch-project.github.io/Vorch-Director-project

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05745 2026-08-07 cs.CV cs.AI 新提交 57%

UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on

UniVVT:用于高保真视频虚拟试穿的统一端到端框架

Yushe Cao, Shikun Feng, Fei Shen, Haikuo Peng, Jianqiang Xia, Yiheng Zhu, Dianxi Shi, Chun Yu

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 UniVVT是一种统一端到端视频虚拟试穿框架,以多模态大语言模型为核心,采用三阶段渐进训练策略,在多基准上实现了优于主流方法的高保真试穿效果。

Comments 17 pages,21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏