Xp-GAN: Unsupervised Multi-object Controllable Video Generation
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV
Comments 8 pages, 9 figures
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV
Comments 8 pages, 9 figures
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV
Comments Accepted by InterSpeech2021
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV
Comments arXiv admin note: substantial text overlap with arXiv:2012.07842, arXiv:2012.07304
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV
Comments 14 pages, 15 figures
S^2VG:基于去噪帧矩阵的3D立体与空间视频生成
机构 * Department of Electrical and Electronic Engineering at The University of Hong Kong(香港大学电子与电气工程系) ; Google(谷歌)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 提出一种无需姿态和训练的方法,利用现成单目视频生成模型,通过深度图扭曲和帧矩阵修复框架,生成时空一致的3D立体与空间视频。
Comments immersive video generation, 4D scene, spatial video, stereo video
专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV
Comments Technical report. Project page: \url{https://modelscope.cn/models/damo/text-to-video-synthesis/summary}
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV;video understanding(comments)
Comments To appear at 2019 ICCV Workshop on Large Scale Holistic Video Understanding
直接式、并行式还是顺序式?无训练多主体图像到视频生成的对比研究
机构 * University of Memphis(孟菲斯大学) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Iowa(爱荷华大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文对比研究直接、并行、顺序三种无训练多主体图像到视频生成范式,通过实证评估明确各范式的优劣势,为可控多主体视频生成系统设计提供实用见解。
Comments ACM Multimedia Workshop 2026
FIRM-Video:可靠文本到视频奖励建模的评分前检查机制
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent Youtu Lab(腾讯优图实验室) ; Tongji University(同济大学)
专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV
AI总结 本文提出基于“评分前检查”的FIRM-Video框架,构建相关数据集与基准,其衍生模型在文本到视频奖励建模相关任务上取得最优表现。
对齐人类感知:用于视频生成的校准分布奖励学习
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文针对视频生成中奖励信号不可靠、偏好维度权衡丢失、KL散度难捕捉偏好全局结构的问题,提出统一偏好感知学习框架,通过精英过滤、分布建模与Wasserstein对齐改进,提升了奖励可靠性与视频感知一致性。
Comments Accepted by ECCV 2026
VGI-BENCH:探究视频生成模型的视觉智能
机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tsinghua University(清华大学) ; University of Waterloo(滑铁卢大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(矢量研究所) ; Microsoft Research(微软研究院) ; Etude AI
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本研究推出VGI-bench基准,含27项任务810个实例,评估视频生成模型视觉推理能力,发现最强模型Seedance~2.0仅达51.0%,将推动下一代视频生成模型发展。
从运动学至路由视觉控制:用于动作条件化外科视频生成
机构 * SJTU(上海交通大学) ; NUS(国立新加坡大学) ; THU(清华大学) ; EIT(欧洲研究所) ; WHU(武汉大学) ; Harvard(哈佛大学) ; NVIDIA(NVIDIA公司) ; CUHK(香港大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出一种运动学至视觉提升范式,通过五种图像对齐的控制模态生成动作条件化外科视频,采用分层路由框架提升控制精度与效率,构建新基准并验证方法有效性。
生成现实:基于交互式视频生成的人本世界模拟
机构 * Stanford University(斯坦福大学) ; NYU Shanghai(纽约大学上海分校) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV
AI总结 本文提出了一种基于交互式视频生成的人本世界模拟系统,通过结合头部和手部姿态控制,提升虚拟环境的交互性和用户控制感。
Comments Project page here: this https URL (https://codeysun.github.io/generated-reality)
BulletTime: 分离时间与相机姿态的视频生成控制
专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV
AI总结 BulletTime通过分离时间与相机姿态,实现了视频生成的精细控制与高质量生成。
Comments CVPR 2026, Project Page: this https URL (https://19reborn.github.io/Bullet4D/)
Grounded-Exo2Ego:用于鲁棒外部视角到自我视角视频生成的结构化语义 grounding
机构 * NVIDIA(英伟达)
专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV
AI总结 本文提出Grounded-Exo2Ego框架,通过双分支视频扩散模型、相机重定位算法和自动合成数据引擎,在EgoExo4D数据集上大幅提升了外部视角到自我视角视频生成的性能。
Comments website url: this https URL (https://research.nvidia.com/labs/amri/projects/grounded-exo2ego/)
OmniCamera:一个统一的多任务视频生成框架,支持任意相机控制
机构 * Sun Yat-sen University(中山大学) ; Hunyuan, Tencent(腾讯混元) ; CityU(香港城市大学) ; PolyU(香港理工大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 OmniCamera通过显式解耦场景内容与相机运动,实现灵活的视频生成,提出混合数据集和双阶段课程协同训练策略,提升多任务学习性能。
CamWorldQA:相机控制型世界视频生成的感知质量评估
机构 * Shanghai Jiao Tong University(上海交通大学) ; Eindhoven University of Technology(埃因霍温理工大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本研究推出首个相机控制型世界视频生成质量评估基准CamWorldQA,并提出含三分支的无参考评估网络CWQA,实验显示其性能优于现有方法。
划分支撑集,重建残差:用于视频生成和世界模型的无训练稀疏注意力
机构 * Texas A&M University(德克萨斯农工大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出SparsePR算法,结合响应耦合划分与探针拟合残差重建,在四个视频生成和世界模型上实现注意力重建误差降低,22.0%-26.0%执行对密度下保持生成质量,获1.48-2.61倍端到端加速。
Comments 22 pages, 5 figures. Project page: https://pardistaghavi.github.io/SparsePR-website/
GeCo:通过运动和结构评估视频生成的几何一致性
机构 * Harvard University(哈佛大学) ; Google DeepMind(谷歌DeepMind) ; MIT(麻省理工学院)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 GeCo通过融合残差运动和深度先验,检测静态场景中的几何变形和遮挡不一致问题,并用于评估视频生成模型的性能与缺陷。
IP-Bench:图像到视频生成场景中的图像保护方法基准
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Wuhan University(武汉大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 针对图像到视频生成场景中图像保护方法缺乏统一评估框架的问题,IP-Bench提出首个系统性基准,评估6种保护方法和5种先进模型的鲁棒性及跨模型转移能力。
Comments 15 pages, 7 figures, 9 tables
ORV:基于占用的4D机器人视频生成
机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; IIIS, Tsinghua University(清华大学人工智能研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Eastern Institute of Technology, Ningbo(宁波工程技术院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; ByteDance(字节跳动) ; Kling, Kuaishou Technology(Kling,快手科技) ; GigaAI ; AIR, Tsinghua University(清华大学人工智能研究院)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 ORV提出一种基于占用的4D机器人视频生成框架,通过结合动作先验与占用视觉先验,提升视频生成质量与可控性,实现多视角一致合成和仿真到现实的迁移。
Comments CVPR 2026. Project page: https://orangesodahub.github.io/ORV/ Code: https://github.com/OrangeSodahub/ORV
基于流匹配模型的快速视频生成的幅度-方向解耦方法
机构 * Nanjing University of Science and Technology(南京理工大学) ; Huawei(华为)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 针对流匹配视频生成模型计算开销高的问题,提出MDD方法,通过解耦幅度与方向复用轻量模型,在Wan2.1上实现最高2.95倍加速,性能优于现有方法且保真度高。
SemComp-Bench:视频生成中的语义任务完成基准
机构 * University of Science and Technology of China(中国科学技术大学) ; Sun Yat-sen University(中山大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 该研究提出面向结果的视频生成任务语义任务完成,构建SemComp-Data数据集与SemComp-Bench基准,发现代表性视频生成模型在兼顾结果实现与参考图像语义基础上仍具挑战。
PersonaShot:多镜头视频生成中以人为中心的叙事连续性基准
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent Youtu Lab(腾讯优图实验室) ; Zhejiang University(浙江大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 该研究针对多镜头视频生成中角色叙事连续性评估的不足,推出PersonaShot基准,设计三类特定评估器,发现先进模型感知质量与跨镜头连续性存在差距,评估器与人类专家判断一致性强。
SingDance:基于角色感知音频条件的组合式零样本歌舞视频生成
机构 * Kuaishou Technology(快手科技)
专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV
AI总结 SingDance是统一视频扩散框架,将语音表达设为语义角色,通过硬紧凑路由等技术实现组合式零样本歌舞视频生成,参数少且性能具竞争力。
Comments 9 pages, 5 figures
均衡强迫:无需噪声条件的自适应视频生成
机构 * UC San Diego(加州大学圣地亚哥分校) ; MIT(麻省理工学院) ; Harvard University(哈佛大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 该研究提出无需噪声条件的均衡强迫(EqF)框架,解耦去噪场学习与采样,实现自适应闭环推理,提升自回归视频生成的质量与一致性,性能优于传统噪声条件方法。
Comments Project page: https://equilibriumforcing.github.io/
EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存
机构 * Peking University(北京大学) ; Taiyuan University of Technology(太原理工大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。
Comments EchoCache is honored to be accepted by ACM MM 2026
频域渐进扩散用于高效图像和视频生成
机构 * Stanford University(斯坦福大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出了一种频域渐进扩散框架,通过在预训练扩散模型的去噪轨迹中逐步提高分辨率,实现高效的图像和视频生成,同时改进了效率和质量。
Comments Project website at https://howardxiao.ca/speed