arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6808 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1308 篇

2512.13247 2026-07-21 cs.CV 版本更新 79%

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

STARCaster:用于身份和视图感知的会说话肖像的时空自回归视频扩散

Foivos Paraperas Papantoniou, Stathis Galanakis, Rolandos Alexandros Potamias, Bernhard Kainz, Stefanos Zafeiriou

机构 * Imperial College London, UK(伦敦帝国理工学院) FAU Erlangen–Nürnberg, Germany(埃朗根-纽伦堡大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 研究提出STARCaster模型,通过重新思考参考和几何范式,采用组合方法及解耦学习,解决语音驱动肖像动画和动态视点控制问题,能有效泛化,超越先前方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12358 2026-07-17 cs.CV 版本更新 79%

ACID: Adaptive Caching for vIDeo generation

ACID:用于视频生成的自适应缓存

Om Agrawal, Saurabh Agarwal, Aditya Akella

机构 * UT Austin(德克萨斯大学奥斯汀分校)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 研究视频扩散模型推理慢问题,提出ACID自适应缓存方法,通过监测漂移信号变化动态切换阈值,无需重新训练,可插入现有缓存方法,实验证明其能显著提升推理速度且质量退化可忽略。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08016 2026-07-16 cs.CV cs.GR 版本更新 79%

LightCrafter: PBR-Conditioned Video Diffusion Refinement for Controllable and Consistent Relighting

LightCrafter:用于可控且一致的重光照的PBR条件视频扩散细化

Zixin Guo, Yehonathan Litman, Yifeng He, John Miller, Chuhan Chen, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) Bosch Research(博世研究)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 研究视频重光照问题,提出LightCrafter混合管道,将其重表述为代理视频转换,利用PBR渲染并结合光度先验,在真实世界重光照基准上优于现有技术,还贡献合成基准及相关资源。

Comments Project page: https://www.zixinguo.me/lightcrafter

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13031 2026-07-15 cs.LG cs.CV 新提交 79%

The Seriality Gap in Video Diffusion Models

视频扩散模型中的序列性差距

Jorge Diaz Chao, Konpat Preechakul, Yuxi Liu, Yutong Bai

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 研究视频扩散模型在多球动力学实验中的表现,发现其存在序列性差距,即任务所需串行计算与模型去噪循环不匹配,增加有效串行计算的方法可提升性能,还证明去噪步骤在串行推理和模拟任务上有结构障碍。

Comments Jorge Diaz Chao and Konpat Preechakul contributed equally. 24 pages, 12 figures, and 5 tables. Project page: https://seriality-gap.jdiazchao.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09122 2026-07-15 cs.CV 版本更新 79%

LVMark: Robust Watermark for Latent Video Diffusion Models

LVMark:用于潜在视频扩散模型的鲁棒水印

Youngdong Jang, MinHyuk Jang, JaeHyeok Lee, Feng Yang, Gyeongrok Oh, Jongheon Jeong, Sangpil Kim

机构 * Department of Artificial Intelligence, Korea University, Seoul 02841, Republic of Korea(人工智能系,韩国大学,首尔02841,大韩民国) Google DeepMind, Mountain View, CA 94043, USA(谷歌DeepMind,山景城,加利福尼亚州94043,美国)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散模型现有水印方法的局限,提出LVMark方法,通过学习相邻帧一致性设计新颖水印解码器,结合小波域低频分量与视频颜色特征确保解码准确,训练潜在解码器保持视觉保真,平衡视觉质量与比特精度,实现高容量鲁棒水印嵌入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08770 2026-07-10 cs.CV 新提交 79%

LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models

LongE2V:基于视频扩散模型的长时程基于事件的视频重建、预测和帧插值

Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang, Chin-Yang Lin, Kun-Ru Wu, Yu-Chee Tseng, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 研究从稀疏事件流恢复高质量视频的难题,提出LongE2V方法,利用预训练视频扩散先验,通过微调基础模型实现联合处理视频重建、预测和帧插值,在多任务上优于现有方法,有高数据效率、时间连贯性和零样本泛化能力。

Comments SIGGRAPH 2026. Project page: https://cdfan0627.github.io/LongE2V-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30308 2026-07-10 cs.CV 版本更新 79%

The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction

视频扩散模型在手部运动重建中的惊人有效性

Yuxi Wang, Chengkai Jin, Yufei Liu, Wenqi Ouyang, Tianyi Wei, Zhiwei Zeng, Siyuan Huang, Zhiqi Shen, Xingang Pan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出ViDiHand,利用预训练视频扩散模型重建4D双手姿态,无需检测器或优化,在多个基准上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11117 2026-07-10 cs.CV 版本更新 79%

HairWeaver: Few-Shot Photorealistic Hair Motion Synthesis with Sim-to-Real Guided Video Diffusion

HairWeaver:基于仿真到现实引导视频扩散的少样本逼真头发运动合成

Di Chang, Ji Hou, Aljaz Bozic, Assaf Neuberger, Felix Juefei-Xu, Olivier Maury, Gene Wei-Chin Lin, Tuur Stuyck, Doug Roble, Mohammad Soleymani, Stephane Grabli

机构 * Meta University of Southern California(Meta 美国南加州大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 HairWeaver旨在解决现有方法在头发运动控制上的不足,通过运动上下文LoRA和风格对齐LoRA两个模块,结合CG模拟器生成的数据集训练视频扩散主干,实现对头发运动的精细控制,生成高度逼真且具动态细节的头发动画,达到新的技术水平。

Comments Accepted by ECCV 2026. Website: https://boese0601.github.io/hairweaver/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06856 2026-07-09 cs.CV cs.LG 新提交 79%

Gen4U: Unifying Video Generation and Understanding via Diffusion

Gen4U:通过扩散统一视频生成与理解

Michael King, Aravindh Mahendran, Matthew Koichi Grimes, Fedor Kitashov, Adham Elarabawy, Pedro Velez, Maks Ovsjanikov, Viorica Pătrăucean

机构 * Google DeepMind(谷歌DeepMind)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 研究通过互 kNN 对齐指标揭示视频扩散模型潜在空间特性,引入 Gen4U 框架,该框架能单次前向传递重新利用生成表示,实验表明冻结的大规模视频扩散模型可作视频编码器,Gen4U 统一视频生成与理解范式且保留生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06631 2026-07-09 cs.CV cs.AI cs.LG 新提交 79%

Dynamic-in-Few-Step: Unifying Dynamic Computation and Few-Step Distillation for Efficient Video Generation

动态少步长:统一动态计算与少步长蒸馏以实现高效视频生成

Yu Cheng, Siyue Yao, Zhongang Qi, Shanyan Guan, Wei Li, Fajie Yuan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) BlueImage, vivo(蓝城图像,维沃) Xian Jiaotong-Liverpool University(西交利物浦大学)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 针对视频扩散模型计算成本高问题,提出将动态结构稀疏化融入蒸馏过程的加速框架,联合优化去噪步骤与模型稀疏性,引入相关策略和机制确保训练稳定,开发推理引擎,有效提升效率且保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03960 2026-07-07 cs.CV 新提交 79%

Reward Lightning: Fast Video Generation via Homologous Preference Distillation

奖励闪电:通过同源偏好蒸馏实现快速视频生成

Jiaxiang Cheng, Bing Ma, Xuhua Ren, Kai Yu, Peng Zhang, Tianxiang Zheng, Qinglin Lu

机构 * Tencent Hunyuan(腾讯混元)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 研究视频扩散模型中同时进行偏好对齐和蒸馏加速的挑战,提出统一框架Reward Lightning,利用同源原理在共享表示中对齐和加速模型,介绍潜在奖励模型和同源偏好蒸馏,实验证明其有效性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17195 2026-07-07 cs.CV 版本更新 79%

DreamShot: Personalized Storyboard Synthesis with Video Diffusion Prior

DreamShot: 基于视频扩散先验的个性化分镜合成

Junjia Huang, Binbin Yang, Pengxiang Yan, Jiyang Liu, Bin Xia, Zhao Wang, Yitong Wang, Liang Lin, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) ByteDance Intelligent Creation(字节跳动智能创作) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 DreamShot通过视频扩散先验实现可控的多镜头合成,支持文本到镜头和参考到镜头生成,提升叙事连贯性和角色一致性。

Comments Accepted by CVPR2026 as a Highlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11797 2026-07-07 cs.RO cs.CV 版本更新 79%

AnchorDream: Repurposing Video Diffusion for Embodiment-Aware Robot Data Synthesis

AnchorDream:将视频扩散用于具身感知机器人数据合成

Junjie Ye, Rong Xue, Basile Van Hoorick, Pavel Tokmakov, Muhammad Zubair Irshad, Yue Wang, Vitor Guizilini

机构 * Toyota Research Institute(丰田研究院) USC Physical Superintelligence (PSI) Lab(USC物理超智能(PSI)实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 针对机器人示范数据收集瓶颈,AnchorDream利用预训练视频扩散模型,通过机器人运动渲染来合成数据,无需环境建模,从少量示范生成多样高质量数据集,提升下游策略学习。

Comments Project page: https://jay-ye.github.io/AnchorDream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02461 2026-07-03 cs.CV cs.AI cs.LG 新提交 79%

OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers

OrbitQuant: 图像和视频扩散Transformer的数据无关量化

Donghyun Lee, Jitesh Chavan, Duy Nguyen, Sam Huang, Liming Jiang, Priyadarshini Panda, Timo Mertens, Saurabh Shukla

机构 * Cantina Labs(Cantina实验室) University of Southern California(南加州大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 提出数据无关量化方法OrbitQuant,通过归一化旋转基和Lloyd-Max码本,无需校准数据即可对扩散Transformer的权重和激活进行低比特量化,在多个模型和模态上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01869 2026-07-03 cs.CV 新提交 79%

QWERTY: Training-Free Motion Control via Query-Warped Video Diffusion Transformers

QWERTY: 通过查询扭曲的视频扩散变换器实现无需训练的运动控制

Kyobin Choo, Youngmin Kim, Hyunkyung Han, Geunrip Park, Chanyoung Kim, Sunyoung Jung, Seong Jae Hwang

机构 * Department of Computer Science, Yonsei University(延世大学计算机科学系) Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出QWERTY框架,通过扭曲查询的语义子空间,在预训练图像到视频扩散变换器中实现无需训练的运动控制,性能接近微调方法。

Comments 37 pages, 18 figures, accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01761 2026-07-03 cs.CV 版本更新 79%

Control-DINO: Feature Space Conditioning for Controllable Image-to-Video Diffusion

Control-DINO:用于可控图像到视频扩散的特征空间条件

Edoardo A. Dominici, Thomas Deixelberger, Konstantinos Vardis, Markus Steinberger

机构 * Huawei Technologies, Switzerland(华为技术(瑞士)) Huawei Technologies, Austria(华为技术(奥地利)) Graz University of Technology, Austria(格拉茨技术大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Control-DINO,通过解耦外观与其他特征,实现对视频扩散模型的可控生成,提升生成渲染的可控性。

Comments ECCV 2026 - Project Page https://dedoardo.github.io/projects/control-dino/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15129 2026-07-02 cs.CV 版本更新 79%

Next-Frame Decoding for Ultra-Low-Bitrate Image Compression with Video Diffusion Priors

利用视频扩散先验的超低比特率图像压缩的下一帧解码

Yunuo Chen, Chuqin Zhou, Jiangchuan Li, Xiaoyue Ling, Bing He, Jincheng Dai, Li Song, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出一种超低比特率图像压缩新范式,通过定义紧凑锚帧作为中间状态,利用预训练视频扩散模型将解码转化为下一帧预测,在保持语义的同时丢弃高频细节,相比DiffC在CLIC2020上节省超50%比特率并实现5倍解码加速。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11641 2026-07-02 cs.CV cs.LG 版本更新 79%

Mixture of Distributions Matters: Dynamic Sparse Attention for Efficient Video Diffusion Transformers

分布混合至关重要:面向高效视频扩散Transformer的动态稀疏注意力

Yuxi Liu, Yipeng Hu, Zekun Zhang, Kunze Jiang, Kun Yuan

机构 * Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 提出MOD-DiT框架,通过两阶段动态稀疏注意力(利用早期去噪先验和分布混合线性近似预测掩码,结合在线块掩码策略)在无需采样的情况下实现高效视频生成,显著加速并保持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15702 2026-07-02 cs.CV 版本更新 79%

End-to-End Training for Autoregressive Video Diffusion via Self-Resampling

通过自重采样实现自回归视频扩散的端到端训练

Yuwei Guo, Ceyuan Yang, Hao He, Yang Zhao, Meng Wei, Zhenheng Yang, Weilin Huang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance Seed(字节跳动Seed) ByteDance(字节跳动)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出自回归视频扩散模型的端到端训练框架Resampling Forcing,通过自重采样模拟推理错误,结合稀疏因果掩码和动态历史路由,实现长视频生成的时间一致性。

Comments Project Page: https://guoyww.github.io/projects/resampling-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14965 2026-07-01 cs.CV 版本更新 79%

GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis

GeoNVS: 基于几何的视频扩散模型用于新视角合成

Minjun Kang, Inkyu Shin, Taeyeop Lee, Myungchul Kim, In So Kweon, Kuk-Jin Yoon

机构 * KAIST, South Korea(韩国科学技术院) Luma AI, USA(Luma AI(美国))

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出GeoNVS,通过高斯溅射特征适配器将扩散特征提升为3D高斯表示,增强几何保真度和相机可控性,在新视角合成任务上超越现有方法。

Comments The code will be available at https://sites.google.com/view/minjun-kang/geonvs-eccv26 (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20606 2026-06-30 cs.CV 79%

Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking

探查并利用视频扩散变换器特征以实现稳健的点跟踪

Soowon Son, Honggyu An, Jisu Nam, Hyunah Ko, Chaehyun Kim, Dahyun Chung, Siyoon Jin, Jung Yi, Junhwa Hur, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) Google DeepMind(谷歌DeepMind)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文探讨了视频扩散变换器在点跟踪中的优势,提出DiTracker框架,通过整合视频DiT特征提升跟踪鲁棒性,实验证明其在挑战性场景下表现优异。

Comments Project Page: https://cvlab-kaist.github.io/DiTracker/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17426 2026-06-29 cs.CV 版本更新 79%

SHIFT: Motion Alignment in Video Diffusion Models with Adversarial Hybrid Fine-Tuning

SHIFT: 视频扩散模型中的运动对齐与对抗混合微调

Xi Ye, Wenjia Yang, Yangyang Xu, Xiaoyang Liu, Duo Su, Mengfei Xia, Jun Zhu

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团) University of Chinese Academy of Science(中国科学院大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散模型微调后运动保真度下降的问题,提出基于像素通量动力学的像素运动奖励和SHIFT框架(平滑混合微调),通过对抗优势改进收敛并缓解奖励黑客,有效解决动态度坍塌。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26087 2026-06-25 cs.CV 新提交 79%

MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation

MVTrack4Gen: 多视角点跟踪作为4D视频生成的几何监督

JoungBin Lee, Jaewoo Jung, Jongmin Lee, Tongmin Kim, Hyunsung Kim, Takuya Narihira, Kazumi Fukuda, Jahyeok Koo, Jisang Han, Yuki Mitsufuji, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能学院) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团公司)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 提出MVTrack4Gen框架,利用多视角点跟踪作为几何与运动监督信号,增强仅相机条件的新视角视频扩散模型的运动一致性和几何一致性。

Comments Project Page : https://cvlab-kaist.github.io/MVTrack4Gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23743 2026-06-25 cs.CV cs.AI cs.LG 新提交 79%

Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation

Sol视频推理引擎:面向高效视频生成的智能原生全栈加速框架

Yitong Li, Junsong Chen, Haopeng Li, Haozhe Liu, Jincheng Yu, Ligeng Zhu, Ping Luo, Song Han, Enze Xie

机构 * NVIDIA Research, Efficient AI Team & Singapore Lab(英伟达研究院高效AI团队及新加坡实验室) NVIDIA SANA Team(英伟达SANA团队) Codex GPT-Image2

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 提出Sol视频推理引擎,通过智能体驱动的缓存、稀疏注意力、令牌剪枝、量化和内核融合五种技术组合,针对具体模型、硬件和配置自动优化,实现视频扩散模型2倍以上加速且保持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23019 2026-06-23 cs.CV cs.AI 新提交 79%

ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers

ScalingAttention: 发现视频扩散变换器的内在稀疏注意力拓扑

Ruiliang Zhou, Xuecheng Wu, Kang He, Guangyun Han, Bin Liu, Qinqin Chen, Wende Xu, Qingjie Zhao, Chengru Song

机构 * KlingAI Research(KlingAI研究院) Beijing Institute of Technology(北京理工大学) NVIDIA(英伟达) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 提出ScalingAttention框架,通过权重编码的稀疏拓扑(WEST)和保真度感知灵敏度调优(FAST)实现训练无关的注意力稀疏化,在Wan2.1上获得最高1.90倍加速并保持高质量。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15980 2026-06-17 cs.CV 版本更新 79%

Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization

Flash-GRPO:通过单步策略优化实现视频扩散的高效对齐

Xiaoxuan He, Siming Fu, Zeyue Xue, Weijie Wang, Ruizhe He, Yuming Li, Dacheng Yin, Shuai Dong, Haoyang Huang, Hongfa Wang, Nan Duan, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Joy Future Academy(京东探索研究院) Independent Researcher(独立研究员) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出Flash-GRPO单步训练框架,通过等时分组和时间梯度校正解决计算瓶颈,在低计算预算下实现优于全轨迹训练的对齐质量和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03485 2026-06-17 cs.CV cs.AI cs.RO 版本更新 79%

Phys4D: Fine-Grained Physics-Consistent 4D Modeling from Video Diffusion

Phys4D: 从视频扩散模型实现细粒度物理一致的4D建模

Haoran Lu, Shang Wu, Songling Liu, Jianshu Zhang, Maojiang Su, Guo Ye, Chenwei Xu, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Dolby Laboratories(杜比实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出Phys4D流水线,通过三阶段训练(伪监督预训练、物理监督微调、强化学习校正)从视频扩散模型学习物理一致的4D世界表示,显著提升细粒度时空与物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01801 2026-06-15 cs.CV cs.AI 版本更新 79%

Fast Autoregressive Video Diffusion and World Models with Temporal Cache Compression and Sparse Attention

快速自回归视频扩散与世界模型:基于时间缓存压缩与稀疏注意力

Dvir Samuel, Issar Tzachor, Matan Levy, Michael Green, Gal Chechik, Rami Ben-Ari

机构 * Hebrew University of Jerusalem(特拉维夫大学) Google Research(谷歌研究)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出FAST-AR框架,通过TempCache压缩KV缓存、AnnCA加速交叉注意力、AnnSA稀疏化自注意力,实现自回归视频扩散模型5-10倍加速,同时保持视觉质量并稳定GPU内存使用。

Comments Accepted to ICML 2026. Project Page: https://dvirsamuel.github.io/fast-auto-regressive-video/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07800 2026-06-10 cs.CV 版本更新 79%

SARA: Semantically Adaptive Relational Alignment for Video Diffusion Models

SARA: 语义自适应关系对齐用于视频扩散模型

Jiesong Lian, Zixiang Zhou, Ruizhe Zhong, Yuan Zhou, Qinglin Lu, Rui Wang, Long Hu, Yixue Hao, Baoru Huang

机构 * Tencent Hunyuan(腾讯文英)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出SARA方法,通过文本条件显著性引导令牌对监督,提升视频扩散模型的文本对齐和运动质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16518 2026-06-10 cs.CV cs.AR 版本更新 79%

FG-Attn: Leveraging Fine-Grained Sparse Attention in Video Diffusion Models

FG-Attn:在视频扩散模型中利用细粒度稀疏注意力

Sankeerth Durvasula, Kavya Sreedhar, Zain Moustafa, Suraj Kothawade, Tianlei Pang, Ashish Gondimalla, Suvinay Subramanian, Narges Shahidi, Nandita Vijaykumar

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 针对视频扩散模型中注意力层计算开销大的问题,提出FG-Attn,一种低开销的细粒度稀疏注意力机制,在MxN块粒度上跳过分数计算,实现最高2.45倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏