arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6840 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2171 篇

2605.27891 2026-05-28 cs.CV cs.AI 79%

SmartDirector: Keyframe-Conditioned Cinematic Video Generation with Narrative Pacing Control

SmartDirector: 基于关键帧的叙事节奏可控电影视频生成

Zhida Zhang, Jie Ma, Zhan Peng, Haoxue Wu, Yang Han, Jun Liang, Jie Cao, Jing Li

机构 * Youku Moku-Lab(优酷莫酷实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出SmartDirector框架,通过多关键帧条件控制视频生成中的叙事结构和时间节奏,采用两阶段方法(Director-Gen生成低分辨率视频,Director-SR利用高分辨率关键帧细化细节),显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17737 2026-05-28 cs.CV cs.AI 79%

The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation

脚本即一切:一个用于长程对话到电影视频生成的智能体框架

Chenyu Mu, Xin He, Qu Yang, Wanshun Chen, Jiadi Yao, Huang Liu, Zihao Yi, Bo Zhao, Xingyu Chen, Ruotian Ma, Fanghua Ye, Erkun Yang, Cheng Deng, Zhaopeng Tu, Xiaolong Li, Linus

机构 * Tencent(腾讯)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出一个端到端智能体框架,通过训练ScripterAgent将对话转化为精细脚本,并利用DirectorAgent跨场景连续生成策略,实现长程对话到电影视频的连贯生成,显著提升脚本忠实度和时间保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25801 2026-05-26 cs.CV 79%

PixelWizard: Towards Efficient High-Fidelity Video Generation at Ultra-Large Spatial Resolution

PixelWizard: 迈向高效高保真超大规模空间分辨率视频生成

Wenxue Li, Jingjing Ren, Peng Zhang, Tian Ye, Daiguo Zhou, Jian Luan, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MiLM Plus, Xiaomi Inc(小米公司MiLM Plus部门) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出PixelWizard框架,通过分层解耦全局结构建模与细节合成,并引入噪声跨度对齐捷径训练,实现超大规模分辨率视频的高效高保真生成,加速超过10倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25659 2026-05-26 cs.CV 79%

StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration

StreamChar: 基于解耦编排的长时程流式角色音频-视频生成

Linrui Tian, Qi Wang, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出StreamChar流式框架,通过LLM编排器与联合音频-视频DiT解耦长时程编排与短窗去噪,实现实时、稳定、高质量的角色动画生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23903 2026-05-25 cs.CV 79%

Geo-Align: Video Generation Alignment via Metric Geometry Reward

Geo-Align: 通过度量几何奖励实现视频生成对齐

Zizun Li, Haoyu Guo, Runzhe Teng, Chunhua Shen, Tong He

机构 * USTC(中国科学技术大学) Shanghai AI Lab(上海人工智能实验室) ZJU(浙江大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出首个基于强化学习的框架Geo-Align,通过度量3D估计器提取相机轨迹并惩罚偏差,利用真实条件视频和合成目标轨迹消除配对数据依赖,提升相机控制精度和视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23878 2026-05-25 cs.CV 79%

LaMo: Self-Supervised Latent Motion Priors for Physical Realism in Video Generation

LaMo: 视频生成中物理真实性的自监督潜在运动先验

Bo Jiang, Depu Meng, Yihan Hu, Yichen Xie, Tianshuo Xu, Wei Zhan

机构 * Applied Intuition University of California, Berkeley(加州大学伯克利分校)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 提出LaMo,通过自监督方式从无标签视频中提取运动先验,包括宏运动漂移损失和微运动场引导,无需外部监督即可提升视频扩散模型的物理一致性。

Comments Project Page: https://lamo-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23610 2026-05-25 cs.CV cs.AI 79%

EM-Vid: Training-Free Entity-Centric Memory for Efficient and Consistent Multi-Shot Video Generation

EM-Vid:无需训练的以实体为中心的记忆,用于高效且一致的多镜头视频生成

Jente Vandersanden, Matheus Gadelha, Chun-Hao P. Huang, Hyeonho Jeong, Yulia Gryaditskaya

机构 * Max Planck Institute for Informatics(马克斯·普朗克研究所) Adobe Research(Adobe研究)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出一种以实体为中心的潜在补丁记忆机制,通过稀疏令牌条件化和预算更新策略,实现多镜头视频生成中实体外观一致性与计算效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23458 2026-05-25 cs.CV cs.AI 79%

One-Forcing: Towards Stable One-Step Autoregressive Video Generation

One-Forcing: 迈向稳定的一步自回归视频生成

Jiaqi Feng, Justin Cui, Yuanhao Ban, Cho-Jui Hsieh

机构 * Tsinghua University(清华大学) UCLA(加州大学洛杉矶分校)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对现有少步自回归视频生成方法在一步设置下质量严重下降的问题,提出One-Forcing方法,通过向DMD目标添加辅助GAN损失,实现高质量高效的一步视频生成,在VBench上达到83.76总分,成为一步因果视频生成中的最优方法。

Comments Work in Progress. Project Page: https://aurora-edu.github.io/one-forcing/, Code: https://github.com/Aurora-edu/One-Forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23445 2026-05-25 cs.CV 79%

DFSAttn: Dynamic Fine-grained Sparse Attention for Efficient Video Generation

DFSAttn:面向高效视频生成的动态细粒度稀疏注意力

Jie Hu, Zixiang Gao, Yutong He, Kun Yuan

机构 * Peking University(北京大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对扩散变换器中注意力二次复杂度导致计算成本高的问题,提出一种无需训练的稀疏注意力框架DFSAttn,通过希尔伯特曲线重排序、分层块评分和稀疏掩码缓存实现动态细粒度稀疏化,在保持生成质量的同时实现高达2.1倍端到端加速。

Comments ICML 2026; 17 pages, 8 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23271 2026-05-25 cs.CV cs.AI 79%

EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

EvalVerse:面向专业电影级视频生成的流水线感知与专家校准基准测试

Songlin Yang, Haobin Zhong, Ruilin Zhang, Xiaotong Zhao, Shuai Li, Kai Zheng, Xuyi Yang, Zhe Wang, Zhenchen Tang, Yang Li, Bohai Gu, Zhengwei Peng, Yidan Huang, Mengzhou Luo, Yihang Bo, Dalu Feng, Yujia Zhang, Juntao Ma, Ruiqi Wang, Lvmin Zhang, Yuwei Guo, Frank Guan, Maneesh Agrawala, Hongbo Fu, Alan Zhao, Anyi Rao

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tencent(腾讯) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Film Academy(北京电影学院) Stanford University(斯坦福大学) The Chinese University of Hong Kong(香港中文大学) Singapore Institute of Technology(新加坡理工学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出EvalVerse框架,通过将电影制作专业知识系统化为评估分类法、构建专家标注数据集并微调视觉语言模型进行链式推理,解决了现有基准忽视电影质量、缺乏领域特异性指标的问题,实现了对生成视频“正确性”与“优良性”的全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22996 2026-05-25 cs.CV 79%

CoMoGen: COntrollable MOtion Dynamics and Interactions with Mask-Guided Video GENeration

CoMoGen: 基于掩码引导的视频生成的可控运动动力学与交互

Adil Meric, Lin Geng Foo, Mert Kiray, Benjamin Busam, Rishabh Dabral, Christian Theobalt

机构 * Technical University of Munich(慕尼黑技术大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息校园) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Obsphera

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出CoMoGen框架,通过轻量级MaskAdapter将二进制掩码序列编码为潜在残差信号注入MMDiT模型,并利用LoRA微调运动层,实现从单张图像和掩码序列生成逼真的交互运动,在运动保真度和感知真实性上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22818 2026-05-22 cs.CV 79%

MotiMotion: Motion-Controlled Video Generation with Visual Reasoning

MotiMotion: 基于视觉推理的运动控制视频生成

Lee Hsin-Ying, Hanwen Jiang, Yiqun Mei, Jing Shi, Ming-Hsuan Yang, Zhixin Shu

机构 * University of California, Merced(加州大学梅尔茨分校) Adobe Research(Adobe研究)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出MotiMotion框架,通过将运动控制转化为推理生成问题,改进视频生成中因果关系和常识一致性,引入免训练视觉语言推理器和置信度感知控制方案,通过MotiBench基准测试验证其生成视频的合理性与交互性。

Comments ICML 2026. Project page: https://motimotion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08403 2026-05-22 cs.CV 79%

SPIRAL: Self-Evolving Action-Conditioned Video Generation via Reflective Planning Agents

SPIRAL:通过反思规划代理实现自演化动作条件视频生成

Yu Yang, Yue Liao, Jianbiao Mei, Baisen Wang, Xuemeng Yang, Licheng Wen, Jiangning Zhang, Xiangtai Li, Liang Lv, Hanlin Chen, Botian Shi, Yong Liu, Shuicheng Yan, Gim Hee Lee

机构 * Zhejiang University(浙江大学) KnowledgeXLab at Shanghai AI Lab(上海人工智能实验室知识X实验室) National University of Singapore(新加坡国立大学) Chinese Academy of Sciences(中国科学院) Tencent Youtu Lab(腾讯优设实验室) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出SPIRAL框架,通过反思规划代理实现长时域动作条件视频生成,解决传统方法在长时间视频生成中的不足,通过闭环设计和自演化机制提升视频生成的一致性和准确性。

Comments 42 Pages, 21 Figures, Project page at https://yuyang-cloud.github.io/spiral

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05094 2026-05-22 cs.CV 79%

VChain: Chain-of-Visual-Thought for Reasoning in Video Generation

VChain:用于视频生成中推理的视觉思维链

Ziqi Huang, Ning Yu, Gordon Chen, Haonan Qiu, Paul Debevec, Ziwei Liu

机构 * eyeline-labs(Eyeline Labs)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出VChain,一种在视频生成中引入多模态模型视觉推理信号的新型推理时间视觉思维链框架,通过生成关键帧来指导预训练视频生成器的稀疏推理时间视觉状态适应,从而提升视频生成质量。

Comments ACL 2026 (Findings Paper), ICCV 2025 Workshop Outstanding Paper Award, Project page: https://eyeline-labs.github.io/VChain

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15003 2026-05-22 cs.CV 79%

Flow of Truth: Proactive Temporal Forensics for Image-to-Video Generation

流之真相:面向图像到视频生成的主动时间鉴伪

Yuzhuo Chen, Zehua Ma, Han Fang, Hengyi Wang, Guanjie Wang, Weiming Zhang

机构 * Anhui Province Key Laboratory of Digital Security (School of Cyber Science and Technology, University of Science and Technology of China)(安徽省数字安全重点实验室(网络安全学院,中国科学技术大学))

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出了一种面向图像到视频生成的主动时间鉴伪方法,通过追踪像素在视频中的流动和变换,解决了传统空间鉴伪在时间维度上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04520 2026-05-21 cs.CV 79%

THEval. Evaluation Framework for Talking Head Video Generation

THEval:谈话头视频生成的评估框架

Nabyl Quignon, Baptiste Chopin, Yaohui Wang, Antitza Dantcheva

机构 * Inria Centre at Université Côte d’Azur(Inria 雅克-路易·科蒂尔大学中心) Shanghai AI Laboratory(上海人工智能实验室) da/sec - Biometrics and Security Research Group, Hochschule Darmstadt(da/sec 生物识别与安全研究组,达姆斯塔特大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出了一种新的评估框架,用于评估生成谈话头视频的质量、自然性和同步性,通过8个指标来衡量,并通过大量实验验证了现有方法在生成表情和无瑕疵细节方面的不足。

Comments CVPR 2026 Findings, Project Page: https://newbyl.github.io/theval_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21042 2026-05-21 cs.CV 79%

Dynamic Video Generation: Shaping Video Generation Across Time and Space

动态视频生成:跨时间和空间的视频生成塑造

Shikang Zheng, Jingkai Huang, Jiacheng Liu, Guantao Chen, Lixuan, Yuqi Lin, Peiliang Cai, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出DVG框架,通过在时间和空间上联合分配计算,自动选择内容感知的加速策略,实现近无损加速,展示了在视频生成中的高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20476 2026-05-21 cs.CV 79%

Goodbye Drift: Anchored Tree Sampling for Long-Horizon Video-to-Video Generation

告别漂移:用于长时视频到视频生成的锚定树采样

Matthew Bendel, Stephen W. Bailey, Mithilesh Vaidya, Sumukh Badam, Xingzhe He

机构 * Descript, Inc.(Descript公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出了一种名为锚定树采样的方法,通过减少关键路径步骤来解决长时视频生成中的漂移问题,并在静态相机模式下实现了稳定且高质量的视频生成。

Comments 30 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19995 2026-05-20 cs.CV 79%

CogOmniControl: Reasoning-Driven Controllable Video Generation via Creative Intent Cognition

CogOmniControl: 通过创意意图认知实现推理驱动的可控视频生成

Hongji Yang, Songlian Li, Yucheng Zhou, Xiaotong Zhao, Alan Zhao, Chengzhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS实验室) Online-Video BU, Tencent(腾讯在线视频事业部)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出CogOmniControl框架,通过将可控视频生成分解为创意意图认知和生成两个阶段,利用专门训练的CogVLM生成更专业清晰的输出,并通过强化学习对齐不同条件的控制,最终在两个基准测试中超越现有开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19728 2026-05-20 cs.CV 79%

Aero-World: Action-Conditioned Aerial Video Generation from Inertial Controls

Aero-World: 从惯性控制生成动作条件的空中视频

Abdul Mohaimen Al Radi, Kunyang Li, Yuzhang Shang, Mubarak Shah, Yu Tian

机构 * Institute of Artificial Intelligence, University of Central Florida(中央佛罗里达大学人工智能研究所)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Aero-World,一种将预训练图像到视频扩散模型转换为可控空中视频生成器的方法,通过注入加速度和角速度序列,利用冻结的物理探测器提供惯性一致性监督,从而提高生成视频对低级动作信号的符合度和时间稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18396 2026-05-20 cs.CV 79%

NEWTON: Agentic Planning for Physically Grounded Video Generation

NEWTON:面向物理基础视频生成的代理规划

Yuxiang Feng, Juncheng Wang, Chao Xu, Yijie Qian, Huihan Wang, Wenlong Hou, Yang Liu, Baigui Sun, Yong Liu, Shujun Wang

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(IROOTECH技术公司) Sany Group(三一集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出NEWTON,通过将视频生成从系统输出降级为代理工具箱中的一个动作,利用学习的规划器协调物理感知工具,提高视频生成的物理合理性,从而在VideoPhy-2数据集上显著提升联合准确性。

Comments project page: https://Newton026.github.io/newton

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08503 2026-05-20 cs.CV 79%

Phantom: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamics

Phantom:通过联合建模视觉和潜在物理动态实现物理 infused 的视频生成

Ying Shen, Jerry Xiong, Tianjiao Yu, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Phantom模型,通过联合建模视觉内容和潜在物理动态,使视频生成过程具备物理一致性,从而生成既视觉真实又物理合理的视频。

Comments 15 pages, 6 figures, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22292 2026-05-20 cs.CV cs.AI 79%

Jailbreaking on Text-to-Video Models via Scene Splitting Strategy

通过场景分割策略对文本到视频模型进行劫持

Wonjun Lee, Haon Park, Doehyeon Lee, Bumsub Ham, Suhyun Kim

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术院) AIM Intelligence(AIM智能) Seoul National University(首尔国立大学) Kyung Hee University(庆熙大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出了一种新的黑盒劫持方法SceneSplit,通过将有害叙述分割成多个良性场景,利用场景组合作为约束来引导最终输出,从而提高生成有害视频的可能性,验证了当前文本到视频模型的安全机制存在漏洞。

Comments ICLR 2026. Project page at https://velpegor.github.io/SceneSplit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01099 2026-05-19 cs.CV cs.AI cs.LG cs.RO 79%

Geometry-aware 4D Video Generation for Robot Manipulation

面向机器人操作的几何感知4D视频生成

Zeyi Liu, Shuang Li, Eric Cousineau, Siyuan Feng, Benjamin Burchfiel, Shuran Song

机构 * Stanford University(斯坦福大学) Toyota Research Institute(丰田研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出了一种几何感知的4D视频生成模型,通过跨视角点图对齐进行训练,以确保生成视频在多视角下的3D一致性,从而在单个RGB-D图像输入下生成时空一致的未来视频序列,并在不依赖相机姿态的情况下实现稳定的视觉和空间对齐预测。

Comments ICLR 2026; Project website: https://robot4dgen.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16795 2026-05-19 cs.CV cs.AI cs.GR 79%

3DPhysVideo: Consistency-Guided Flow SDE for Video Generation via 3D Scene Reconstruction and Physical Simulation

3DPhysVideo: 通过3D场景重建和物理模拟的一致性引导流SDE用于视频生成

Hwidong Kim, Yunho Kim, Tae-Kyun Kim

机构 * KAIST(韩国科学技术院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出了一种无需训练的管道,通过3D场景重建和物理模拟生成逼真视频,利用一致性引导流SDE分解预测速度以确保条件输入的一致性,从而在多物体和流体交互场景中实现从单张图像到物理合理视频的过渡。

Comments Project page: https://hwidong-kim.github.io/projects/3DPhysVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16420 2026-05-19 cs.CV cs.LG 79%

Video Reconstruction using Diffusion-based Image-to-Video Generation with Trajectory Guidance

基于扩散模型的图像到视频生成与轨迹引导的视频重建

Stelio Bompai, Ioannis Kontopoulos, Giannis Spiliopoulos, Dimitris Zissis, Konstantinos Tserpes

机构 * Department of Electrical and Computer Engineering, National Technical University of Athens, Greece(电气与计算机工程系,希腊国家技术大学雅典分校) Department of Product and Systems Design Engineering, University of the Aegean, Syros, Greece(产品与系统设计工程系,爱琴海大学锡罗斯分校)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出利用预训练的图像到视频扩散模型,通过GPS轨迹引导生成无人机视频的缺失或丢失帧,无需领域特定微调,展示了在低纹理和小目标条件下视频重建的有效性。

Comments Accepted at the 1st Workshop on Multi-Sensor Trajectory Knowledge Discovery and Extraction (MuseKDE 2026), co-located with the 27th IEEE International Conference on Mobile Data Management (IEEE MDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00678 2026-05-18 cs.CV 79%

Pixel-to-4D: Camera-Controlled Image-to-Video Generation with Dynamic 3D Gaussians

像素到4D:通过动态3D高斯进行相机控制的图像到视频生成

Melonie de Almeida, Daniela Ivanova, Tong Shi, John H. Williamson, Paul Henderson

机构 * University of Glasgow(格拉斯哥大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一种基于动态3D高斯的图像到视频生成框架,通过单次前向传递构建3D场景表示并采样合理物体运动,实现高效且可控的视频生成,实验表明其在多个数据集上均达到SOTA视频质量和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15199 2026-05-15 cs.CV cs.AI 79%

EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation

EntityBench:迈向实体一致的长程多次视频生成

Ruozhen He, Meng Wei, Ziyan Yang, Vicente Ordonez

机构 * ByteDance(字节跳动) ByteDance Seed(字节跳动种子) Rice University(罗切斯特大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 EntityBench通过140集(2491个镜头)的真实叙事媒体,构建了包含实体调度的评估基准,结合三支柱评估体系和fidelity gate,评估实体一致性。EntityMem作为基线方法,通过存储验证的实体视觉参考提升生成质量。

Comments Project page: https://catherine-r-he.github.io/EntityBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15182 2026-05-15 cs.CV 79%

Warp-as-History: Generalizable Camera-Controlled Video Generation from One Training Video

Warp-as-History:从单个训练视频生成可泛化的相机控制视频

Yifan Wang, Tong He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Warp-as-History方法,通过将相机诱导的变形转化为相机变形的伪历史,实现无需训练的零样本相机轨迹生成,提升视频生成的相机顺应性和视觉质量。

Comments Project page: https://yyfz.github.io/warp-as-history/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15116 2026-05-15 cs.CV 79%

DriveCtrl: Conditioned Sim-to-Real Driving Video Generation

DriveCtrl: 基于条件的仿真到现实驾驶视频生成

Haonan Zhao, Yiting Wang, Jingkun Chen, Valentina Donzella, Thomas Bashford-Rogers, Kurt Debattista

机构 * University of Warwick(沃里克大学) Northwestern Polytechnical University(西北工业大学) Queen Mary University of London(伦敦大学玛丽女王学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出DriveCtrl框架,通过深度条件生成逼真的驾驶视频,保留场景结构和运动模式,提升生成视频的现实感和时序一致性,同时引入可扩展的数据生成管道和Driving Video Realism Score评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏