arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2160 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2160 篇

2605.00244 2026-05-04 cs.RO cs.CV 57%

Lucid-XR: An Extended-Reality Data Engine for Robotic Manipulation

Lucid-XR:一种用于机器人操控的扩展现实数据引擎

Yajvan Ravan, Adam Rashid, Alan Yu, Kai McClennen, Gio Huh, Kevin Yang, Zhutian Yang, Qinxi Yu, Xiaolong Wang, Phillip Isola, Ge Yang

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) FortyFive Labs(FortyFive实验室) Caltech(加州理工学院) Harvard University(哈佛大学) UC San Diego(南加州大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Lucid-XR通过XR头显直接运行的物理模拟环境生成多模态数据,实现零样本迁移至复杂环境,支持软材料、松散颗粒和刚体接触的精细操控任务。

Comments Project website: https://lucidxr.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00080 2026-05-04 cs.RO cs.CV 57%

World Model for Robot Learning: A Comprehensive Survey

机器人学习的世界模型:全面综述

Bohan Hou, Gen Li, Jindou Jia, Tuo An, Xinying Guo, Sicong Leng, Haoran Geng, Yanjie Ze, Tatsuya Harada, Philip Torr, Oier Mees, Marc Pollefeys, Zhuang Liu, Jiajun Wu, Pieter Abbeel, Jitendra Malik, Yilun Du, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) The University of Tokyo(东京大学) University of Oxford(牛津大学) Microsoft(微软公司) ETH Zurich(苏黎世联邦理工学院) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 综述从机器人学习角度系统回顾世界模型的快速发展,探讨其与机器人策略的耦合、作为强化学习模拟器的作用以及机器人视频世界模型的发展,总结关键范式与挑战。

Comments 43 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27621 2026-05-01 cs.RO cs.CV 57%

Robot Learning from Human Videos: A Survey

从人类视频学习机器人:综述

Junyi Ma, Erhang Zhang, Haoran Yang, Ditao Li, Chenyang Xu, Guangming Wang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Cambridge(剑桥大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文综述了通过人类视频学习机器人技能的方法,探讨了政策学习基础、人类视频接口、技能转移层次分类及数据基础,分析了挑战与未来研究方向。

Comments Paper list: https://github.com/IRMVLab/awesome-robot-learning-from-human-videos

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26571 2026-05-01 cs.CV cs.AI 57%

GVCC: Zero-Shot Video Compression via Codebook-Driven Stochastic Rectified Flow

GVCC:基于代码本驱动的随机修正流零样本视频压缩

Ziyue Zeng, Xun Su, Haoyuan Liu, Bingyu Lu, Yui Tatsumi, Hiroshi Watanabe

机构 * Graduate School of Fundamental Science and Engineering, Waseda University(早稻田大学基础科学与工程研究生院)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 GVCC通过预训练视频生成模型直接作为解码器,在极低比特率下实现高质量视频重建,通过编码生成轨迹的随机创新信息,提升压缩效率。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25819 2026-04-29 cs.CV cs.SD 57%

Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation

相互推动:双模式自我进化用于快速自回归音频视频生成

Yupeng Zhou, Lianghua Huang, Zhifan Wu, Jiabao Wang, Yupeng Shi, Biao Jiang, Daquan Zhou, Yu Liu, Ming-Ming Cheng, Qibin Hou

机构 * VCIP, School of Computer Science, Nankai University(南开大学计算机科学学院VCIP实验室) Tongyi Lab(通义实验室) Peking University(北京大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Mutual Forcing框架,通过双阶段训练策略解决音频视频联合建模与快速自回归生成问题,通过共享参数实现自蒸馏,提升训练推理一致性,相比传统方法更高效且质量更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03075 2026-04-28 cs.CV cs.AI cs.LG 57%

What Drives Compositional Generalization? The Importance of Continuous Training Objectives in Visual Generative Models

是什么驱动了组合泛化?在视觉生成模型中连续训练目标的重要性

Karim Farid, Rajat Sahay, Yumna Ali Alnaggar, Simon Schrodi, Volker Fischer, Cordelia Schmid, Thomas Brox

机构 * University of Freiburg Bosch Center for Artificial Intelligence Inria, \'E cole Normale Sup \'e rieure, CNRS, PSL Research University

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 研究探讨了视觉生成模型中连续训练目标对组合泛化能力的影响,发现训练目标分布的离散或连续性及条件信息对泛化性能有关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23579 2026-04-28 cs.MM 57%

CineAGI: Character-Consistent Movie Creation through LLM-Orchestrated Multi-Modal Generation and Cross-Scene Integration

CineAGI:通过LLM协同多模态生成与跨场景整合实现角色一致的电影创作

Tianyidan Xie, Zhentao Huang, Mingjie Wang, Xin Huang, Jun Zhou, Minglun Gong, Zili Yi

专题命中 视频生成 :video generation(abstract);分类 cs.MM

AI总结 CineAGI通过多代理叙事合成模块、角色中心流水线和分层音视频同步机制,提升电影创作的一致性和质量,实现40%的整体一致性提升。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23574 2026-04-28 cs.CV 57%

PhysLayer: Language-Guided Layered Animation with Depth-Aware Physics

PhysLayer:基于语言的分层动画与深度感知物理

Tianyidan Xie, Zhentao Huang, Mingjie Wang, Xin Huang, Jun Zhou, Minglun Gong, Zili Yi

机构 * Nanjing University(南京大学) University of Guelph(圭尔夫大学) Zhejiang Sci-Tech University(浙江科技大学) Dalian Maritime University(大连海事大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 PhysLayer通过深度感知物理模拟和语言引导,实现静态图像的分层动画生成,提升了物理真实性和可控性,实验结果显示在多个指标上均有显著提升。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19234 2026-04-28 cs.CV 57%

Learning to Credit the Right Steps: Objective-aware Process Optimization for Visual Generation

学习正确的步骤:面向视觉生成的客观感知过程优化

Rui Li, Ke Hao, Yuanzhi Liang, Haibin Huang, Chi Zhang, Yun Gu, XueLong Li

机构 * University of Science and Technology of China(科学技术大学) Shanghai Jiao Tong University(交通大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出OTCA框架,通过细粒度奖励分配提升视觉生成质量,解决传统GRPO在奖励分配上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22554 2026-04-27 cs.CV 57%

Video Analysis and Generation via a Semantic Progress Function

通过语义进度函数进行视频分析与生成

Gal Metzer, Sagi Polaczek, Ali Mahdavi-Amiri, Raja Giryes, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学) Simon Fraser University(西蒙弗雷泽大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出语义进度函数,用于分析和修正视频生成模型中非线性变化的问题,通过线性化语义变化提升视频过渡的平滑性和一致性。

Comments SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07940 2026-04-24 cs.CV 57%

Beyond the Frame: Generating 360 Panoramic Videos from Perspective Videos

超越帧限:从视角视频生成360度全景视频

Rundong Luo, Matthew Wallingford, Ali Farhadi, Noah Snavely, Wei-Chiu Ma

机构 * Cornell University(康奈尔大学) University of Washington(华盛顿大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出从视角视频生成完整全景视频的方法,通过设计几何与运动感知操作提升生成质量,实现空间与时间一致性,应用于视频稳定、视角控制和交互式视觉问答。

Comments Project page: https://red-fairy.github.io/argus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20357 2026-04-23 cs.CV cs.CL 57%

SignDATA: Data Pipeline for Sign Language Translation

SignDATA:手语翻译的数据管道

Kuanwei Chen, Tingyi Lin

机构 * Computer Science and Information Engineering National Central University(计算机科学与信息工程国家级中央大学) Electrical Engineering National Changhua University Of Education(电气工程国家彰化教育大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出SignDATA,一种标准化手语数据集的预处理工具包,支持端到端的姿势和视频处理流程,通过可配置的接口实现统一输出,提升手语研究的可重复性和比较性。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20157 2026-04-23 cs.CV 57%

HumanScore: Benchmarking Human Motions in Generated Videos

HumanScore:在生成视频中评估人类动作的基准测试

Yusu Fang, Tiange Xiang, Tian Tan, Narayan Schuetz, Scott Delp, Li Fei-Fei, Ehsan Adeli

机构 * Stanford University(斯坦福大学) Peking University(北京大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出HumanScore框架,通过六个可解释指标评估AI生成视频中人类动作的质量,揭示感知合理性与生物力学真实性的差距,并产生可靠的模型排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18564 2026-04-22 cs.CV 57%

MultiWorld: Scalable Multi-Agent Multi-View Video World Models

多世界:可扩展的多智能体多视角视频世界模型

Haoyu Wu, Jiwen Yu, Yingtian Zou, Xihui Liu

机构 * The University of Hong Kong(香港大学) Sreal AI

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 多世界框架通过多智能体控制模块和全局状态编码器,实现多智能体多视角视频世界建模,提升视频保真度和多视角一致性。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17021 2026-04-21 cs.CV 57%

LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing

LIVE: 利用图像篡改先验知识进行基于指令的视频编辑

Weicheng Wang, Zhicheng Zhang, Zhongqi Zhang, Juncheng Zhou, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan, Jufeng Yang

机构 * Nankai University(南开大学) Pengcheng Laboratory(鹏城实验室) Kuaishou Technology(快手科技) Nankai International Advanced Research Institute (SHENZHEN·FUTIAN)(南开国际先进研究院(深圳·福田))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出LIVE框架,结合大规模高质量图像编辑数据和视频数据提升编辑能力,通过帧级噪声策略和两阶段训练策略,构建包含60多项挑战性任务的评估基准,实验表明方法达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16391 2026-04-21 cs.RO cs.CV 57%

Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining

通过分离前向和逆向动力学预训练实现解耦的机器人学习

Wenyao Zhang, Bozhou Zhang, Zekun Qi, Wenjun Zeng, Xin Jin, Li Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究所) Shanghai Innovation Institute(上海创新研究院) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出DeFI框架,通过分离前向和逆向动力学预训练,利用不同数据源解决视觉-动作耦合问题,实现端到端微调,实验表明在CALVIN ABC-D和SimplerEnv上取得最佳性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20360 2026-04-21 cs.CV 57%

EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning

EditVerse:通过上下文学习统一图像和视频编辑与生成

Xuan Ju, Tianyu Wang, Yuqian Zhou, He Zhang, Qing Liu, Nanxuan Zhao, Zhifei Zhang, Yijun Li, Yuanhao Cai, Shaoteng Liu, Daniil Pakhomov, Zhe Lin, Soo Ye Kim, Qiang Xu

机构 * Adobe Research(Adobe研究院) CUHK(中国香港大学) Johns Hopkins University(约翰霍普金斯大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出EditVerse框架,通过统一token序列实现图像和视频生成编辑,利用自注意力机制实现跨模态知识迁移,实验表明其在视频编辑任务中达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17909 2026-04-20 cs.CV 57%

A Single Image and Multimodality Is All You Need for Novel View Synthesis

单张图像与多模态信息足矣实现新视角合成

Amirhosein Javadi, Chi-Shiang Gau, Konstantinos D. Polyzos, Tara Javidi

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出利用稀疏多模态测距数据提升单图像新视角合成的几何一致性和视觉质量,通过多模态深度重建框架替代传统单目深度估计,增强扩散模型的生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15299 2026-04-17 cs.CV 57%

AnimationBench: Are Video Models Good at Character-Centric Animation?

AnimationBench: 视频模型在以角色为中心的动画生成中表现如何?

Leyi Wu, Pengjun Fang, Kai Sun, Yazhou Xing, Yinwei Wu, Songsong Wang, Ziqi Huang, Dan Zhou, Yingqing He, Ying-Cong Chen, Qifeng Chen

机构 * New AI Labs

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出AnimationBench,首个系统评估动画图像到视频生成的基准,结合动画十二基本原则和IP保护,评估语义一致性、运动合理性等质量维度,支持标准化和开放集评估,揭示现实主义基准忽视的动画特定质量差异。

Comments Project Page: https://animationbench.github.io Code: https://github.com/VideoVerses/AnimationBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15134 2026-04-17 cs.CV 57%

How to Correctly Make Mistakes: A Framework for Constructing and Benchmarking Mistake Aware Egocentric Procedural Videos

如何正确犯错:一个用于构建和基准测试错误感知第一人称视频的框架

Olga Loginova, Frank Keller

机构 * University of Trento(特伦托大学) University of Edinburgh(爱丁堡大学) Italy(意大利) United Kingdom(大不列颠岛)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出PIE-V框架,通过引入可控的人类合理偏差来构建和评估错误感知的第一人称视频,结合心理学启发的错误计划、纠正计划、LLM作家和评委,提升视频的合理性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13425 2026-04-16 cs.CV 57%

VibeFlow: Versatile Video Chroma-Lux Editing through Self-Supervised Learning

VibeFlow:通过自监督学习实现多功能视频色光编辑

Yifan Li, Pei Cheng, Bin Fu, Shuai Yang, Jiaying Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出VibeFlow框架,通过自监督学习实现视频色光编辑,解决光照和颜色修改的同时保持结构和时间保真的问题,无需昂贵训练资源,支持零样本应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13036 2026-04-15 cs.CV 57%

Lyra 2.0: Explorable Generative 3D Worlds

Lyra 2.0:可探索的生成3D世界

Tianchang Shen, Sherwin Bahmani, Kai He, Sangeetha Grama Srinivasan, Tianshi Cao, Jiawei Ren, Ruilong Li, Zian Wang, Nicholas Sharp, Zan Gojcic, Sanja Fidler, Jiahui Huang, Huan Ling, Jun Gao, Xuanchi Ren

机构 * NVIDIA

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Lyra 2.0通过维持每帧3D几何和自增强历史训练,解决空间遗忘和时间漂移问题,实现大规模可探索的3D世界生成。

Comments Project Page: https://research.nvidia.com/labs/sil/projects/lyra2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11792 2026-04-14 cs.CV 57%

LottieGPT: Tokenizing Vector Animation for Autoregressive Generation

LottieGPT:为自回归生成设计向量动画的标记化

Junhao Chen, Kejun Gao, Yuehan Cui, Mingze Sun, Mingjin Chen, Shaohui Wang, Xiaoxiao Long, Fei Ma, Qi Tian, Ruqi Huang, Hao Zhao

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) AIR, Tsinghua University(清华大学人工智能研究院) BAAI(百度人工智能研究院) The Hong Kong Polytechnic University(香港理工大学) Nanjing University(南京大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出首个向量动画标记化与自回归生成框架,基于Lottie标准设计标记器并构建大规模数据集,通过微调Qwen-VL生成可编辑的向量动画。

Comments Accepted by CVPR 2026. Project Page: https://lottiegpt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20654 2026-04-14 cs.CV cs.AI 57%

AccidentSim: Generating Vehicle Collision Videos with Physically Realistic Collision Trajectories from Real-World Accident Reports

AccidentSim: 从真实世界事故报告生成具有物理真实碰撞轨迹的车辆碰撞视频

Xiangwen Zhang, Qian Zhang, Longfei Han, Qiang Qu, Xiaoming Chen, Weidong Cai

机构 * School of Computer and Artificial Intelligence, Beijing Technology and Business University(北京工商大学计算机与人工智能学院) The University of Sydney(悉尼大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 AccidentSim通过提取事故报告中的物理信息生成真实碰撞视频,结合物理模拟和NeRF技术提升视觉与物理真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04175 2026-04-13 cs.CV 57%

Beyond Flicker: Detecting Kinematic Inconsistencies for Generalizable Deepfake Video Detection

超越闪烁:检测可泛化深度伪造视频检测中的运动不一致

Alejandro Cobo, Roberto Valle, José Miguel Buenaposada, Luis Baumela

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出合成视频生成方法,通过引入微妙的运动不一致来训练模型,从而提升深度伪造视频检测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06655 2026-04-09 cs.CV 57%

Controllable Generative Video Compression

可控生成视频压缩

Ding Ding, Daowen Li, Ying Chen, Yixin Gao, Ruixiao Dong, Kai Li, Li Li

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出可控生成视频压缩方法,通过多视觉条件引导生成细节,兼顾信号保真度与感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06339 2026-04-09 cs.CV 57%

Evolution of Video Generative Foundations

视频生成基础的演变

Teng Hu, Jiangning Zhang, Hongrui Huang, Ran Yi, Zihan Su, Jieyu Weng, Zhucun Xue, Lizhuang Ma, Ming-Hsuan Yang, Dacheng Tao

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文综述了视频生成技术的发展,从早期GAN到扩散模型,再到AR和多模态技术,探讨了核心原理、关键进展及未来趋势,旨在为视频生成及其应用提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04142 2026-04-07 cs.CV 57%

OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models

OP-GRPO:用于流匹配模型的高效非策略GRPO

Liyu Zhang, Kehan Li, Tingrui Han, Tao Zhao, Yuxuan Sheng, Shibo He, Chao Li

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Central Research Institute, Huawei(华为中央研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 OP-GRPO通过高效非策略训练方法提升流匹配模型生成质量,通过高质轨迹选择与重要采样修正,实现训练效率提升34.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04029 2026-04-07 cs.CV 57%

ATSS: Detecting AI-Generated Videos via Anomalous Temporal Self-Similarity

ATSS:通过异常时间自相似性检测AI生成视频

Hang Wang, Chao Shen, Lei Zhang, Zhi-Qi Cheng

机构 * Xi’an Jiaotong University(西安交通大学) The Hong Kong Polytechnic University(香港理工大学) University of Washington(华盛顿大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出ATSS方法,通过三重相似性表示和跨注意融合机制,检测AI生成视频的异常时间自相似性,优于现有方法,在多个基准上表现更优。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03305 2026-04-07 cs.CV 57%

HVG-3D: Bridging Real and Simulation Domains for 3D-Conditional Hand-Object Interaction Video Synthesis

HVG-3D: 联接真实与仿真领域用于3D条件手-物体交互视频合成

Mingjin Chen, Junhao Chen, Zhaoxin Fan, Yujian Lee, Zichen Dang, Lili Wang, Yawen Cui, Lap-Pui Chau, Yi Wang

机构 * Dept. of EEE, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院未来区块链与隐私计算北京高精尖创新中心) Tsinghua University(清华大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院) State Key Laboratory of Virtual Reality Technology and Systems, School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院虚拟现实技术与系统国家重点实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 HVG-3D提出一种统一框架,通过显式3D表示条件生成3D-aware手-物体交互视频,结合3D ControlNet与扩散架构,实现高保真度与时空可控性。

Comments Project page: https://hvg3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏