arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1306 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1306 篇

2604.23858 2026-04-28 cs.CV 57%

Latent Inter-Frame Pruning: A Training-Free Method Bridging Traditional Video Compression and Modern Diffusion Transformers for Efficient Generation

潜在帧剪枝:一种无训练方法,连接传统视频压缩与现代扩散变换器以实现高效生成

Dennis Menn, Chih-Hsien Chou

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Futurewei Technologies, Inc.(未来科技公司)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出一种无训练的潜在帧剪枝方法,通过剪枝重复的潜在块来减少计算负担并提高生成速度,同时引入注意力恢复机制以解决训练与推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24086 2026-04-21 cs.CV 57%

RainFusion2.0: Temporal-Spatial Awareness and Hardware-Efficient Block-wise Sparse Attention

RainFusion2.0: 基于时序-空间感知与硬件高效性的块状稀疏注意力

Aiyue Chen, Yaofu Liu, Junjian Huang, Guang Lian, Yiwu Yao, Wangli Lan, Jing Lin, Zhixin Ma, Tingting Zhou

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出RainFusion2.0,通过块状均值代表token预测稀疏掩码、时空感知token排列及首帧sink机制,实现视频和图像生成模型的高效稀疏注意力,实验表明在保持视频质量的同时,达到80%的稀疏度和1.5~1.8倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11331 2026-04-14 cs.CV cs.CG 57%

Any 3D Scene is Worth 1K Tokens: 3D-Grounded Representation for Scene Generation at Scale

任何3D场景都值得1000个标记:面向大规模场景生成的3D grounded表示

Dongxu Wei, Qi Xu, Zhiqi Li, Hangning Zhou, Cong Qiu, Hailong Qin, Mu Yang, Zhaopeng Cui, Peidong Liu

机构 * Westlake University(西湖大学) Afari Intelligent Drive(阿法里智能驾驶) Zhejiang University(浙江大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出在隐式3D潜在空间中直接生成3D场景,解决传统2D方法在3D空间扩展中的不足,通过3DRAE和3DDiT实现高效且一致的3D生成。

Comments Under Review. Project Page: https://wswdx.github.io/3DRAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10632 2026-04-13 cs.CV 57%

CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos

CoMoVi:3D人类动作与真实视频的联合生成

Chengfeng Zhao, Jiazhi Shu, Yubo Zhao, Tianyu Huang, Jiahao Lu, Zekai Gu, Chengwei Ren, Zhiyang Dou, Qing Shuai, Yuan Liu

机构 * HKUST(香港科技大学) SCUT(华南理工大学) HKU(香港大学) MIT(麻省理工学院) ZJU(浙江大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出CoMoVi框架,通过单个扩散去噪循环同步生成3D人类动作和视频,采用双分支扩散模型实现动作与视频生成的互惠特征交互和3D-2D交叉注意力。

Comments Project Page: https://igl-hkust.github.io/CoMoVi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08500 2026-04-10 cs.CV 57%

Novel View Synthesis as Video Completion

新颖视角合成作为视频补全

Qi Wu, Khiem Vuong, Minsik Jeon, Srinivasa Narasimhan, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出将稀疏新颖视角合成视为低帧率视频补全任务,通过改进架构实现视角不变性,证明视频模型能以最少监督生成竞争性稀疏视角合成结果。

Comments Project page: https://frame-crafter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17445 2026-04-10 cs.CV 57%

LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents

LangDriveCTRL: 通过多模态代理实现自然语言可控的驾驶场景编辑

Yun He, Francesco Pittaluga, Ziyu Jiang, Matthias Zwicker, Manmohan Chandraker, Zaid Tasneem

机构 * University of Maryland, College Park(马里兰大学帕克分校) NEC Labs America(NEC美国实验室) UC San Diego(加州大学圣迭戈分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 LangDriveCTRL通过多模态代理实现驾驶视频的自然语言可控编辑,生成多样化的交通场景,提升真实感和交通场景的真实性。

Comments Project Page: https://yunhe24.github.io/langdrivectrl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04934 2026-04-07 cs.CV 57%

Vanast: Virtual Try-On with Human Image Animation via Synthetic Triplet Supervision

Vanast:通过合成三元监督实现的人像虚拟试穿

Hyunsoo Cha, Wonjung Woo, Byungjun Kim, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 Vanast通过统一框架直接从单张人体图像、服装图像和姿态引导视频生成服装转移的人形动画视频,解决传统两阶段流程导致的身份漂移、服装扭曲和前后不一致问题。

Comments Accepted to CVPR 2026, Project Page: https://hyunsoocha.github.io/vanast/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00408 2026-04-07 cs.CV cs.AI 57%

Low-Bitrate Video Compression through Semantic-Conditioned Diffusion

基于语义的低比特率视频压缩

Lingdong Wang, Guan-Ming Su, Divya Kothandaraman, Tsung-Wei Huang, Mohammad Hajiesmaili, Ramesh K. Sitaraman

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Dolby Laboratories(杜比实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出DiSCo框架,通过语义条件扩散模型在低比特率下实现高质量视频压缩,采用文本描述、空间时间退化视频和可选草图等模态,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02828 2026-04-06 cs.CV cs.AI 57%

NavCrafter: Exploring 3D Scenes from a Single Image

NavCrafter:从单张图像探索3D场景

Hongbo Duan, Peiyu Zhuang, Yi Liu, Zhengyang Zhang, Yuxin Zhang, Pengting Luo, Fangming Liu, Xueqian Wang

机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院人工智能与机器人中心) Peng Cheng Laboratory(鹏城实验室) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络空间安全学院) Central Media Technology Institute, Huawei Incorporated Company(华为技术有限公司中央媒体技术研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 NavCrafter通过合成新颖视角视频序列,实现从单张图像生成灵活的3D场景,采用视频扩散模型和几何感知扩展策略,提升可控多视角合成与3D重建精度。

Comments 8 pages accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02296 2026-04-03 cs.CV cs.AI 57%

VOID: Video Object and Interaction Deletion

VOID:视频对象和交互删除

Saman Motamed, William Harvey, Benjamin Klein, Luc Van Gool, Zhuoning Yuan, Ta-Ying Cheng

机构 * Netflix

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 VOID通过物理合理填充解决复杂场景下的视频对象删除问题,结合视觉语言模型和视频扩散模型,提升场景动态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01129 2026-04-02 cs.CV 57%

ReinDriveGen: Reinforcement Post-Training for Out-of-Distribution Driving Scene Generation

ReinDriveGen:强化学习后训练用于分布外驾驶场景生成

Hao Zhang, Lue Fan, Weikang Bian, Zehuan Wu, Lewei Lu, Zhaoxiang Zhang, Hongsheng Li

机构 * MMLab, CUHK(MMLab,香港中文大学) CASIA(中国科学院自动化研究所) SenseTime Research(商汤科技研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 ReinDriveGen通过动态点云场景生成与强化学习后训练,实现对驾驶场景的可控生成,提升安全关键场景的模拟质量。

Comments Project page: https://drive-sim.github.io/ReinDriveGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01053 2026-04-02 cs.CV 57%

PHASOR: Anatomy- and Phase-Consistent Volumetric Diffusion for CT Virtual Contrast Enhancement

PHASOR:基于解剖和相位一致的体积扩散用于CT虚拟对比增强

Zilong Li, Dongyang Li, Chenglong Ma, Zhan Feng, Dakai Jin, Junping Zhang, Hao Luo, Fan Wang, Hongming Shan

机构 * Shanghai Key Lab of Intelligent Information Processing, School of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院上海市智能信息处理重点实验室) Institute of Science and Technology for Brain-inspired Intelligence and MOE Frontiers Center for Brain Science, Fudan University(复旦大学类脑智能科学与技术研究院及教育部脑科学前沿中心) Shanghai Center for Brain Science and Brain-inspired Technology(上海脑科学与类脑研究中心) Department of Radiology, First Affiliated Hospital of College of Medical Science, Zhejiang University(浙江大学医学院附属第一医院放射科) Alibaba DAMO Academy(阿里巴巴达摩院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出PHASOR框架,通过体积扩散模型提升CT虚拟对比增强质量,引入解剖路由混合专家和强度-相位意识表示对齐模块,解决解剖异质性和空间偏移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00853 2026-04-02 cs.CV 57%

MotionGrounder: Grounded Multi-Object Motion Transfer via Diffusion Transformer

MotionGrounder: 通过扩散变换器实现多物体运动迁移

Samuel Teodoro, Yun Chen, Agus Gunawan, Soo Ye Kim, Jihyong Oh, Munchurl Kim

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology(韩国科学技术院电气工程学院) Adobe Research(Adobe研究院) CMLab, Chung-Ang University(中央大学CMLab)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出MotionGrounder,一种基于扩散变换器的多物体运动迁移框架,通过流式运动信号和对象-描述对齐损失实现稳定运动先验和空间对齐,实验显示其在定量、定性和人类评估中均优于现有方法。

Comments Please visit our project page at https://kaist-viclab.github.io/motiongrounder-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00792 2026-04-02 cs.CV 57%

HICT: High-precision 3D CBCT reconstruction from a single X-ray

HICT: 从单张X射线实现高精度3D CBCT重建

Wen Ma, Jiaxiang Liu, Zikai Xiao, Ziyang Wang, Feng Yang, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Angelalign Technology Inc.(时代天使科技有限公司)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出HICT框架,通过视频扩散模型生成多视角投影并结合动态注意力网络与X射线采样策略,实现高精度CBCT重建,实验表明其在临床应用中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30043 2026-04-01 cs.CV 57%

Video Models Reason Early: Exploiting Plan Commitment for Maze Solving

视频模型早起推理:利用计划承诺解决迷宫

Kaleb Newman, Tyler Zhu, Olga Russakovsky

机构 * Princeton University(普林斯顿大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 研究通过2D迷宫解决探讨视频模型生成过程中的规划动态,发现模型在早期步骤中承诺高层运动计划,并揭示路径长度而非障碍密度是迷宫难度的主要预测因素,提出ChEaP方法提升复杂迷宫解决性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29036 2026-04-01 cs.CV 57%

Generating Humanless Environment Walkthroughs from Egocentric Walking Tour Videos

从第一人称行走游览视频生成无人类环境 walkthroughs

Yujin Ham, Junho Kim, Vivek Boominathan, Guha Balakrishnan

机构 * Rice University(莱斯大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出一种生成算法,通过去除行走视频中的人和阴影效果,提升环境建模应用,使用半合成数据集训练Casper模型,实现高质量的无人类视频生成,进而构建三维/四维城市模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11423 2026-04-01 cs.CV 57%

JoyStreamer-Flash: Real-time and Infinite Audio-Driven Avatar Generation with Autoregressive Diffusion

JoyStreamer-Flash: 基于自回归扩散的实时和无限音频驱动化身生成

Chaochao Li, Ruikui Wang, Liangbo Zhou, Jinheng Feng, Huaishao Luo, Huan Zhang, Youzheng Wu, Xiaodong He

机构 * JD Technology(京东科技)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出JoyStreamer-Flash,一种能实现实时推断和无限长度视频生成的音频驱动自回归模型,通过渐进式步进 bootstrap、运动条件注入和无界RoPE via Cache-Resetting提升生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27209 2026-03-31 cs.CV cs.CL cs.GR cs.LG 57%

LightMover: Generative Light Movement with Color and Intensity Controls

LightMover:具有颜色和强度控制的生成式光移动

Gengze Zhou, Tianyu Wang, Soo Ye Kim, Zhixin Shu, Xin Yu, Yannick Hold-Geoffroy, Sumit Chaturvedi, Qi Wu, Zhe Lin, Scott Cohen

机构 * AIML, Adelaide University(阿德莱德大学机器学习研究所) Adobe Research(Adobe研究院) University of Hong Kong(香港大学) Yale University(耶鲁大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 LightMover通过视频扩散先验生成单图像中可控的光照变化,统一处理空间和外观控制,提升操控与光照理解,并引入自适应令牌修剪机制,减少控制序列长度41%同时保持编辑保真度。

Comments CVPR 2026. 10 pages, 5 figures, 6 tables in main paper; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22065 2026-03-31 cs.CV cs.AI cs.HC 57%

StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars

StreamAvatar:用于实时交互人类分身的流式扩散模型

Zhiyao Sun, Ziqiao Peng, Yifeng Ma, Yi Chen, Zhengguang Zhou, Zixiang Zhou, Guozhen Zhang, Youliang Zhang, Yuan Zhou, Qinglin Lu, Yong-Jin Liu

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) Tencent Hunyuan(腾讯混元) Nanjing University(南京大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出一种两阶段自回归适应与加速框架,通过自回归蒸馏和对抗性细化,使高保真人类视频扩散模型适用于实时交互流式生成,实现自然对话与倾听行为。

Comments Accepted by CVPR 2026. Project page: https://streamavatar.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22854 2026-03-27 cs.CV cs.GR cs.LG 57%

ByteLoom: Weaving Geometry-Consistent Human-Object Interactions through Progressive Curriculum Learning

ByteLoom: 通过渐进课程学习编织几何一致的人-物体交互

Bangya Liu, Xinyu Gong, Zelin Zhao, Ziyang Song, Yulei Lu, Suhui Wu, Jun Zhang, Suman Banerjee, Hao Zhang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ByteDance(字节跳动) Georgia Institute of Technology(佐治亚理工学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出ByteLoom框架,通过简化的人类条件和3D物体输入生成几何一致的人-物体交互视频,解决多视角信息注入和手部网格标注依赖的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24260 2026-03-26 cs.CV cs.AI 57%

Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep

通过异构缓存加速基于扩散的视频编辑:超越采样去噪时间步的全计算

Tianyi Liu, Ye Lu, Linfeng Zhang, Chen Cai, Jianjun Gao, Yi Wang, Kim-Hui Yap, Lap-Pui Chau

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出HetCache框架,通过利用扩散基于掩码视频到视频生成中的异构性,减少冗余注意力运算,提升视频编辑效率与质量。

Comments 10 pages, 6 figures, accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22533 2026-03-26 cs.CV 57%

Fast3Dcache: Training-free 3D Geometry Synthesis Acceleration

Fast3Dcache: 无训练3D几何合成加速

Mengyu Yang, Yanming Yang, Chenyi Xu, Chenxi Song, Yufan Zuo, Tong Zhao, Ruibo Li, Chi Zhang

机构 * AGI Lab, Westlake University(西溪大学AGI实验室) University of Electronic Science and Technology of China(电子科学与技术大学) Nanyang Technological University(南洋理工大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出Fast3Dcache,一种无训练的几何感知缓存框架,通过动态缓存调度和时空稳定性准则,显著加速3D扩散模型推理,同时保持几何精度。

Comments Accepted by CVPR 2026; Project page: https://fast3dcache-agi.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04090 2026-03-24 cs.CV 57%

Gen3R: 3D Scene Generation Meets Feed-Forward Reconstruction

Gen3R:3D场景生成与前馈重建的结合

Jiaxin Huang, Yuanbo Yang, Bangbang Yang, Lin Ma, Yuewen Ma, Yiyi Liao

机构 * Zhejiang University(浙江大学) ByteDance Project(字节跳动项目)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 Gen3R通过结合基础重建模型的强先验与视频扩散模型,实现3D场景生成,生成RGB视频及3D几何数据,实验显示其在单图和多图条件下达到SOTA结果。

Comments Project page: https://xdimlab.github.io/Gen3R/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15130 2026-03-24 cs.GR cs.AI cs.CV 57%

Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control

通过零样本相机控制驯服视频模型以实现3D和4D生成

Chenxi Song, Yanming Yang, Tong Zhao, Ruibo Li, Chi Zhang

机构 * AGI Lab, Westlake University(西溪大学AGI实验室) Nanyang Technological University(南洋理工大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出WorldForge框架,通过推理时的三重组件实现零样本3D/4D生成,解决视频扩散模型在空间任务中的控制不足问题,提升视觉真实性与轨迹一致性。

Comments Accepted to CVPR 2026. Project Webpage: https://worldforge-agi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16736 2026-03-19 cs.CV 57%

World Reconstruction From Inconsistent Views

从不一致视角重建世界

Lukas Höllein, Matthias Nießner

机构 * Technical University of Munich, Germany(慕尼黑技术大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出一种非刚性对齐方法,通过全局一致坐标框架生成清晰点云,提升视频扩散模型在3D世界重建中的性能。

Comments project website: https://lukashoel.github.io/video_to_world video: https://www.youtube.com/watch?v=qXnUwhVmBzA code: https://github.com/lukasHoel/video_to_world

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16871 2026-03-18 cs.CV 57%

WorldCam: Interactive Autoregressive 3D Gaming Worlds with Camera Pose as a Unifying Geometric Representation

WorldCam: 交互式自回归3D游戏世界与相机姿态作为统一的几何表示

Jisu Nam, Yicong Hong, Chun-Hao Paul Huang, Feng Liu, JoungBin Lee, Jiyoung Kim, Siyoon Jin, Yunsung Lee, Jaeyoon Jung, Suhwan Choi, Seungryong Kim, Yang Zhou

机构 * Adobe Research(Adobe研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出WorldCam,通过将相机姿态作为统一的几何表示,解决交互式游戏世界中动作控制与长时序3D一致性问题,结合物理连续动作空间和全局相机姿态索引提升导航与视觉质量。

Comments Project page is available at https://cvlab-kaist.github.io/WorldCam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16566 2026-03-18 cs.CV cs.GR 57%

VideoMatGen: PBR Materials through Joint Generative Modeling

VideoMatGen:基于联合生成模型的PBR材质

Jon Hasselgren, Zheng Zeng, Milos Hasan, Jacob Munkberg

机构 * NVIDIA

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出基于视频扩散变压器架构的方法,通过输入几何和文本描述联合生成物理合理的PBR材质,包含基础颜色、粗糙度、金属度和高度图等属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15415 2026-03-17 cs.CV 57%

AnyCrowd: Instance-Isolated Identity-Pose Binding for Arbitrary Multi-Character Animation

AnyCrowd:实例隔离的身份-姿态绑定用于任意多角色动画

Zhenyu Xie, Ji Xia, Michael Kampffmeyer, Panwen Hu, Zehua Ma, Yujian Zheng, Jing Wang, Zheng Chong, Xujie Zhang, Xianhang Cheng, Xiaodan Liang, Hao Li

机构 * Mohamed bin Zayed University of Artificial Intelligence, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) University of Tromsø (UiT) – The Arctic University of Norway, Norway(特罗姆瑟大学(UiT)——挪威北极大学,挪威) Shenzhen campus of Sun Yet-sen University, China(孙中山大学深圳校区,中国)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出AnyCrowd框架,通过实例隔离潜在表示和三阶段解耦注意力机制,解决多角色动画中身份与姿态绑定不一致的问题,提升生成视频的可控性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15279 2026-03-17 cs.LG cs.CV 57%

Faster Inference of Flow-Based Generative Models via Improved Data-Noise Coupling

通过改进的数据-噪声耦合实现流基生成模型的更快推理

Aram Davtyan, Leello Tadesse Dadi, Volkan Cevher, Paolo Favaro

机构 * University of Bern(伯尔尼大学) EPFL(苏黎世联邦理工学院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出LOOM-CFM方法,通过优化 minibatch OT 跨 minibatch 的 assignments,提升流基生成模型在样本速度与质量间的平衡,支持高分辨率潜在空间合成和蒸馏初始化。

Comments Patched from ICLR2025. Code: https://github.com/araachie/loom-cfm

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20673 2026-03-16 cs.CV 57%

GA-Drive: Geometry-Appearance Decoupled Modeling for Free-viewpoint Driving Scene Generation

GA-Drive:用于自由视角驾驶场景生成的几何-外观解耦建模

Hao Zhang, Lue Fan, Qitai Wang, Wenbo Li, Zehuan Wu, Lewei Lu, Zhaoxiang Zhang, Hongsheng Li

机构 * MMLab, CUHK(CUHK的MMLab) CASIA Shanghai Jiaotong University(上海交通大学) SenseTime Research(商汤科技研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 GA-Drive通过几何-外观解耦和扩散生成技术,生成可编辑的高保真驾驶场景,提升自动驾驶训练和评估的效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏