DialogueNeRF: Towards Realistic Avatar Face-to-Face Conversation Video Generation
专题命中 视频生成 :video generation(title);分类 cs.CV、eess.IV
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频生成 :video generation(title);分类 cs.CV、eess.IV
专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM
Comments ACM MM 2023
专题命中 视频生成 :video generation(title);分类 cs.CV、eess.IV
专题命中 视频生成 :video generation(title);分类 cs.CV、eess.IV
Comments 8 pages, 4 figures, NeurIPS 2019 workshop
Journal ref NeurIPS 2019 Workshop
RigidBench:评估视频生成模型中的刚体物理效果
机构 * University of Cambridge(剑桥大学)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 该研究提出基于模拟器的RigidBench基准,评估视频生成模型的刚体物理效果,分析8个模型的表现,用5000个训练视频微调Wan 2.2 TI2V-5B并揭示其表征物体位置的机制。
Comments 30 pages, including appendices. Code: https://github.com/swarnim-j/RigidBench. Dataset: https://doi.org/10.5281/zenodo.21649156
Alpha作为效率信号:可见性路由的RGBA图像到视频生成
机构 * ByteDance(字节跳动)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 针对游戏RGBA视频生成的数据集与效率问题,提出可见性路由的RGBA视频生成模型,实现了更低FVD与1.2倍推理加速,质量下降可忽略。
Vorch-IR:长视频统一多模态身份替换生成模型
机构 * Vorch Team(Vorch团队) ; Fudan University(复旦大学)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 Vorch-IR是基于LTX2的统一多模态视频身份替换框架,支持单人、双人身份及可选背景替换,通过自动数据构建流水线与时间重叠推理策略,实现长视频生成,在身份保留、动作保真等方面表现出色。
Comments Project page: https://vorch-project.github.io/Vorch-IR-project/
Flash-VAED: 用于高效视频生成的即插即用VAE解码器
机构 * Hong Kong University of Science and Technology(香港科技大学)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 Flash-VAED通过通道剪枝和分阶段运算优化,实现了高效视频生成的高质量与高速度平衡。
Comments Accepted by ICML 2026
AptAvatar:用于生产就绪头像的快速且生动的长格式音频驱动视频生成
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 研究生产就绪的音频驱动头像生成,提出AptAvatar框架,通过端点锚定分布蒸馏和自生成历史重放方法,实现快速且生动的长格式视频生成,仅用2次归一化流评估,加速60倍且保持视觉保真度和长跨度身份。
Comments 9 pages, 5 figures
Vera:身份忠实的人类主体到视频生成
机构 * Kuaishou Technology(快手科技) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Tsinghua University(清华大学)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 针对主体到视频生成中人类身份一致性不足问题,提出Vera框架,通过构建百万对身份对齐数据集,引入身份聚焦掩码监督和参考感知分层注意力两种设计,提升了身份一致性、主体绑定及运动自然性等。
MultiRef-Compass:迈向多参考到音频-视频生成的综合评估
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 研究针对多参考到音频-视频生成设置,引入MultiRef-Compass基准。通过可扩展管道构建350个样本,定义含四个维度14个子指标的评估协议,集成自动指标与MLLM评判框架,实验表明该基准对MR2AV研究有重要意义。
Comments 32 pages
几何互易性:解锁立体视频生成的自监督能力
机构 * Visual AI Lab, The University of Hong Kong, Hong Kong, China(香港大学视觉人工智能实验室)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 针对单目转立体任务中立体修复依赖稀缺标注数据的问题,提出几何互易性定理,构建自监督框架,从海量单目视频学习,性能远超现有无监督、监督SOTA方法。
Comments Accepted to ICML 2026. Project page: https://visual-ai.github.io/grt/
动态生成视频中3D空间几何一致性的测量
机构 * Tongji University(同济大学) ; Tsinghua University(清华大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 本文提出SGC指标,用于评估动态生成视频中的3D空间几何一致性,通过分析多个相机姿态的分歧度来量化几何不一致问题,实验证实其能有效识别现有方法遗漏的关键故障。
Comments Accepted at ECCV 2026. Code is available at https://github.com/tj12323/SGC
StreamGVE: 无需训练的视频编辑通过少步流式视频生成
机构 * The University of British Columbia(不列颠哥伦比亚大学) ; ETH Zürich(苏黎世联邦理工学院) ; McMaster University(麦马斯特大学) ; Vector Institute(向量研究所) ; Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 本文提出StreamGVE,一种基于噪声到数据视角的视频编辑方法,通过引入双分支快速采样和自注意力桥接以及交叉注意力接地/增强,实现了高效的视频编辑,能够在少步设置中优于现有方法。
Comments ECCV 2026. Project Page: https://dsl-lab.github.io/StreamEdit/
AR-CoPO: 利用对比策略优化对齐自回归视频生成
机构 * CUHK MMLab(香港中文大学多媒体实验室) ; Vivix Group Limited(Vivix集团有限公司) ; HKUST(香港科技大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; CPII under InnoHK(InnoHK下的CPII)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 提出AR-CoPO框架,通过分叉机制构建邻域候选、分块级对齐和半在线训练策略,解决流式自回归视频生成中RLHF对齐难题,提升跨域泛化与人类偏好对齐。
Comments ECCV 2026
RefAlign:参考到视频生成的表示对齐
机构 * PCA Lab, VCIP, College of Computer Science, Nankai University(南开大学计算机学院VCIP实验室PCA Lab) ; Baidu Inc.(百度公司) ; PCA Lab, School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院PCA Lab) ; College of Artificial Intelligence, Jilin University(吉林大学人工智能学院)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 RefAlign通过显式对齐DiT参考分支特征与视觉基础模型的语义空间,提升参考生成的准确性与可控性,实验表明其在R2V任务中优于现有方法。
Comments Accepted to ECCV 2026;Code: https://github.com/gudaochangsheng/RefAlign Project: https://gudaochangsheng.github.io/RefAlign-Page/
通过高级模态条件与交互驯服文本到发声视频生成
机构 * Renmin University of China(中国人民大学) ; Apple(苹果公司)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 提出分层视觉基础字幕框架(HVGC)生成解耦的视频和音频字幕,并基于此引入双塔扩散变换器BridgeDiT,通过双交叉注意力机制实现对称双向信息交互,在三个基准数据集上达到最先进结果。
Comments The 19th European Conference on Computer Vision -- ECCV 2026
Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界模型
机构 * Qwen Team(Qwen团队)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 提出Qwen-RobotWorld,一种以自然语言为统一动作接口的语言条件视频世界模型,通过双流MMDiT、大规模具身世界知识语料和渐进式课程训练,在机器人操作、自动驾驶等任务中实现物理一致的未来视觉轨迹预测,在多个基准上取得最优结果。
Auteur: 以语言驱动的电影化取景实现以人为中心的视频生成
机构 * Koç University(科克大学) ; University College London(伦敦大学学院) ; Adobe(Adobe公司) ; Hacettepe University(哈切特佩大学)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 提出Auteur方法,通过将相机运动参数化为以人为中心的取景(包括镜头尺寸、角度和构图),并利用领域特定语言(DSL)和微调的多模态大语言模型,实现语言驱动的电影化取景,在人类中心视频生成中优于现有方法。
Comments Project Page: https://cyberiada.github.io/Auteur/
Avatar V:缩放视频参考的化身视频生成
机构 * HeyGen Research(HeyGen 研究院)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 提出Avatar V框架,通过视频参考条件化身份建模,利用稀疏参考注意力机制实现长视频线性复杂度条件化,结合运动表示流和身份感知超分辨率精炼器,生成无限时长1080p视频,在身份保持、唇形同步和质量上超越现有方法。
Comments 31 pages, 15 figures. All contributors are listed in alphabetical order by first name
V2V-Bench:视频到视频生成评估的综合基准
机构 * Centific Global Solutions Inc.(Centific全球解决方案公司)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 针对视频到视频生成评估中现有指标无法同时衡量编辑指令遵循和帧级对应的问题,提出包含11个维度、5个类别的V2V-Bench基准,评估三个模型并验证其与人类判断高度相关。
Comments Accepted at ICML 2026 workshop
CityRAG: 通过空间感知的视频生成进入城市
机构 * Google(谷歌) ; Cornell University(康奈尔大学) ; Stanford University(斯坦福大学)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 CityRAG通过利用地理注册数据的大型语料库,生成空间一致且可导航的真实环境视频,其核心方法是结合学习的先验知识和时空不一致训练数据,以实现复杂的运动和外观变化。
Comments Project page: cityrag.github.io
自回归视频生成中的策略对抗流蒸馏
机构 * LIGHTSPEED ; University College London(伦敦大学学院)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 提出策略对抗流蒸馏(AFD)框架,通过策略内对抗性反馈和正向过程流匹配,实现从异构黑盒教师模型向自回归学生模型的高效蒸馏。
TIE:面向事件视频生成的时间区间编码
机构 * University of Science and Technology of China(中国科学技术大学) ; Matrix Team(Matrix团队) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; University of Waterloo(滑铁卢大学) ; The Pennsylvania State University(宾夕法尼亚州立大学) ; Zhongguancun Academy(中关村学院) ; The University of Hong Kong(香港大学)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 提出时间区间编码(TIE),将旋转位置嵌入推广为区间感知形式,解决扩散变换器(DiT)在重叠事件视频生成中时间区间无法表示的问题,显著提升时间可控性。
椭圆傅里叶描述符域中的细胞假体视频生成
机构 * Department of Electronics Information and Bioengineering(电子信息与生物工程系)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 本研究提出了一种在椭圆傅里叶描述符(EFD)域中生成细胞假体视频的新框架,通过将细胞假体演变表示为多变量时间序列的EFD系数,引入了强先验知识,从而高效生成在时间上一致的视频,验证了在EFD空间建模时间演变能够生成生物合理性的假体视频,为合成标注数据生成提供了方法,减少了标注努力。
Comments 6 pages, Accepted at the International Conference on Image Processing (ICIP) 2026
场景-动作提示融合用于连贯的文本到视频叙事
机构 * University of Maryland at College Park(马里兰大学学院市分校) ; Dolby Laboratories(杜比实验室)
专题命中 视频生成 :text-to-video(title);分类 cs.CV
AI总结 本文提出了一种整合场景和动作提示的叙事框架,通过动态启发的提示混合策略,解决文本到视频生成中时间一致性、语义一致性和场景-动作连续性的问题,通过三个关键组件实现了更连贯的视频叙事。
Comments Accepted to the 2026 IEEE International Conference on Image Processing (ICIP 2026). 13 pages, 4 figures
SwiftI2V: 通过条件分段生成实现高效的高分辨率图像到视频生成
机构 * HKUST(香港科技大学) ; CUHK(香港大学) ; Joy Future Academy(京东探索研究院) ; HKU(香港大学) ; HUAWEI Research(华为研究)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 本文提出SwiftI2V框架,通过分段生成和双向上下文交互,在2K分辨率下实现高效图像到视频生成,相比端到端模型减少GPU时间202倍。
Comments 27 pages, 17 figures
RealCam: 通过交互式相机控制实现实时新视角视频生成
机构 * Zhejiang University(浙江大学) ; Xmax.AI Ltd.(Xmax.AI有限公司) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 RealCam提出一种自回归框架,实现交互式实时相机控制的视频到视频生成,通过交叉帧上下文学习和循环闭合数据增强提升生成质量与效率。
Immune2V: 图像免疫对抗双流图像到视频生成
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 针对图像到视频生成中对抗性攻击的鲁棒性问题,提出Immune2V框架,通过时间平衡的潜在差异和预计算的崩溃诱导轨迹提升防御效果。
PoseGen: 一种基于上下文LoRA微调的长人类视频生成框架
机构 * Xiaoice, China(小冰公司,中国) ; The University of Sydney, Australia(悉尼大学,澳大利亚)
专题命中 视频生成 :video generation(title);分类 cs.CV
AI总结 PoseGen通过上下文LoRA微调实现对人物姿态的精细控制,生成长时长视频,解决了身份漂移和视频长度限制问题。
Comments Accepted to CVPR 2026 Findings