Echocardiography video synthesis from end diastolic semantic map via diffusion model
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、eess.IV
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、eess.IV
专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV、cs.MM
Vid2WAM:将视频扩散先验蒸馏为世界动作模型
专题命中 视频扩散模型 :video diffusion(title)
AI总结 Vid2WAM是将视频扩散先验蒸馏为WAM的离线框架,通过双监督通道与源感知残差动作适配,提升了机器人策略的新任务泛化性与数据效率,且推理高效。
Comments Project website: https://qch-fa.github.io/vid2wam-website/
机构 * The University of British Columbia(不列颠哥伦比亚大学) ; University of Toronto(多伦多大学) ; Vancouver General Hospital, Vancouver, BC, Canada(温哥华总医院)
专题命中 视频扩散模型 :video diffusion(title)
Comments Data Curation and Augmentation in Medical Imaging CVPR 2024
Mask2Real-WM:作为可控灵巧世界模型的模拟到现实桥梁的分割掩码
机构 * Soft Robotic Lab, Department of Mechanical and Process Engineering ETH Zurich, Switzerland(苏黎世联邦理工学院机械与过程工程系软机器人实验室)
专题命中 视频扩散模型 :video diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 提出Mask2Real-WM,一种用于灵巧操纵的两阶段动作条件世界模型,将像素预测解耦为动力学和渲染模型,利用分割空间较小的模拟到现实差距,通过合成数据预训练和真实演示微调实现各自由度动作可控。
Comments 23 pages, 24 figures, 4 tables. Preprint. Project page: https://srl-ethz.github.io/Mask2Real-WM/
AdaCorrection: 用于准确扩散变换器的自适应偏移缓存校正
机构 * Columbia University(哥伦比亚大学)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 本文提出AdaCorrection框架,通过自适应偏移缓存校正提升扩散变换器的生成质量与缓存复用效率,减少计算开销并保持高保真度。
MiniWorld:从零开始普及视频世界模型的训练
机构 * Peking University(北京大学)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 MiniWorld是从零开始训练流式视频世界模型的可复现框架,采用特定模型与训练策略,可在单台8-GPU服务器数天内完成训练,旨在降低训练门槛以推动相关研究。
Comments 19 pages
生成式可重光照虚拟化身
机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)
专题命中 视频扩散模型 :video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 提出生成式可重光照虚拟化身(GRA),结合物理光照与概率细化,实现全身人物的自由视角渲染和环境图重光照,在感知质量上优于现有方法。
Comments Project Page: https://vcai.mpi-inf.mpg.de/projects/GRA/
Genie Sim PanoWorld:基于全景场景建模与仿真的无限室内3D世界生成流水线
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 Genie Sim PanoWorld是两阶段前馈流水线,从单张360°全景生成可自由导航的高保真3D高斯场景,优于几何条件基线,且能零样本泛化至未见室内场景
穿越绘画:来自互联网先验的自我中心世界模型
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Toyota Research Institute(丰田研究机构)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 EgoWM通过利用互联网先验和轻量级条件层,将预训练视频扩散模型转换为自我中心世界模型,实现可控的未来预测,提升结构一致性评分并降低推理延迟。
OmniCache:用于扩散模型的多维分层特征缓存
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 针对高分辨率图像和视频扩散模型推理成本高的问题,提出OmniCache框架,利用中间扩散特征冗余,通过多种缓存实现多维特征重用,减少推理延迟,在多模型上取得良好效果,且无需重新训练。
循环自回归扩散:全局记忆与局部注意力相结合
机构 * Peking University(北京大学) ; Princeton University(普林斯顿大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV
AI总结 研究针对超长视频生成中现有模型的不足,提出循环自回归扩散(RAD)框架,结合循环块与局部注意力,解决训练推理差距等问题,在相关数据集实验中展现出长视频生成的优越性。
Comments Published at ECCV 2026. Project page: https://yeyutaihan.github.io/recurrent-autoregressive-diffusion/
具有世界状态寄存器的流式多智能体自回归扩散模型
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; Adobe Research(Adobe研究院)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 研究多智能体交互世界模型共享状态维护难题,提出WorldWeaver模型,利用跨智能体世界状态寄存器及混合变压器设计,经双智能体我的世界视频生成实验验证,该模型能提升逻辑一致性与生成质量。
Comments Project page: https://vail-ucla.github.io/worldweaver/
RealVDeblur:用于通用真实世界视频去模糊的一步扩散法
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; CUHK MMLab(香港中文大学多媒体实验室) ; CPII under InnoHK(创新香港研究院下的CPII) ; Tsinghua University(清华大学)
专题命中 视频扩散模型 :video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 针对真实世界视频去模糊难题,提出RealVDeblur框架。构建模糊合成管道提供数据,利用视频扩散先验恢复,采用逐帧编码并简化采样为一步生成器,还有时间窗口掩码稳定推理,在多方面表现出色且提升3D重建鲁棒性。
Comments Project page with code: https://rbjin.github.io/RealVDeblur/
生成模型了解空间:解锁隐式3D先验用于场景理解
机构 * Huazhong University of Science and Technology(华中科技大学) ; Baidu Inc.(百度公司)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 本文提出通过大规模视频生成模型的隐式空间先验提升场景理解,引入VEGA-3D框架,利用预训练视频扩散模型作为潜在世界模拟器,通过时空特征提取与语义融合增强大语言模型的几何信息,实验验证其在3D场景理解、空间推理和具身操控中的优越性。
Comments Accepted by ECCV 2026
用于多步视觉推理的分层去噪
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室) ; The Hong Kong University of Science and Technology(香港科技大学) ; Beihang University(北京航空航天大学) ; Fuzhou University(福州大学) ; Muka Robotics(木卡机器人)
专题命中 视频扩散模型 :video generation(abstract);video reasoning(abstract);分类 cs.CV
AI总结 研究针对视频模型多步推理不足的问题,提出HDR框架,通过树形层次结构和稀疏分层注意力模式进行多步推理,在新基准测试中提升了成功率和进度,推理更快,数据效率更高,在机器人实验中展现潜力。
FADRA:用于视频人脸识别的频率感知扩散与残差自适应
机构 * United Arab Emirates University (UAEU)(阿联酋大学) ; Ocean University of China (OUC)(中国海洋大学) ; Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)
专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 研究针对视频人脸识别在复杂退化下难以平衡空间保真度和时间连贯性的问题,提出FADRA框架,利用预训练模型的时间一致性,通过LoRA适配器、重复残差自适应头及频率感知损失等实现,实验证明其在恢复面部结构和保持时间一致性上优于现有方法。
FlashBlock:用于高效长上下文块扩散的注意力缓存
机构 * Monash University(墨尔本大学) ; Zhejiang University(浙江大学)
专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV
AI总结 研究长内容生成中块扩散在长上下文设置下的注意力计算开销问题,提出FlashBlock机制,利用块外注意力输出稳定性复用注意力,减少计算与缓存访问,提升效率且不影响质量。
TinyHistory: 通过两阶段上下文学习实现轻量级视频历史嵌入
机构 * Stanford University(斯坦福大学) ; MIT(麻省理工学院) ; Carnegie Mellon University(卡内基梅隆大学) ; HKUST(香港科技大学)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 本文提出TinyHistory,通过两阶段上下文学习实现轻量级视频历史嵌入,在有限计算和内存下实现与更重模型相当的一致性。
Comments Additional Results: https://lllyasviel.github.io/TinyHistory_gitpage/
VideoSketcher:利用视频模型先验的序列草图生成
机构 * MIT(麻省理工学院)
专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 提出VideoSketcher方法,结合LLM的语义规划与视频扩散模型的时序渲染,通过两阶段微调从少量样本学习笔画顺序与风格,生成高质量序列草图。
DTG-Restore: 无需训练的视频超分辨率扩散精炼
机构 * Virginia Tech(弗吉尼亚理工大学) ; Adobe(Adobe公司)
专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 提出解耦时间引导(DTG)方法,通过时间解耦条件与无条件分支,无需训练即可增强扭曲低分辨率视频,提升结构保真度和时间稳定性。
射线即像素:学习视频与相机轨迹的联合分布
机构 * Meta AI
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 提出一种视频扩散模型(Rays as Pixels),通过将相机表示为密集射线像素(raxels)并与视频帧共享潜在空间,联合去噪实现相机轨迹预测和相机控制视频生成。
Comments Accepted to ICML 2026. 9-page main paper plus supplementary material. Project page: https://wbjang.github.io/raysaspixels/
minWM: 用于实时交互式视频世界模型的全栈开源框架
机构 * ShengShu(盛书) ; THU(清华大学) ; RUC(中国人民大学) ; HKUST(香港科技大学) ; UT-Austin(德克萨斯大学奥斯汀分校)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 提出minWM全栈开源框架,通过因果强制/因果强制++流水线将双向视频扩散模型转化为可控制、低延迟的自回归世界模型,支持相机控制与多种骨干架构。
EPiC: 基于精确锚点视频引导的高效视频摄像机控制学习
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 提出EPiC框架,通过基于首帧可见性掩码构建精确对齐的锚点视频,并引入轻量模块Anchor-ControlNet,以极低参数实现高效、精确的3D摄像机控制,在RealEstate10K和MiraData上达到最先进性能。
Comments Accepted to ICML 2026. Project website: https://zunwang1.github.io/Epic
Sketch2Motion: 文本驱动的二维草图到三维动画的扩散引导骨架优化
机构 * Graphics Research Group, IIIT Delhi(IIIT德里图形研究组)
专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 提出Sketch2Motion框架,结合扩散模型和骨架优化,将二维草图转化为三维动画,无需配对运动数据,支持多种角色类型。
LESA: 可学习的阶段感知预测器用于扩散模型加速
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 针对扩散模型计算开销大、现有缓存策略难以适应去噪过程阶段动态变化的问题,提出基于两阶段训练的可学习阶段感知预测器框架,利用KAN网络学习时序特征映射并采用多阶段多专家架构,在保持高质量生成的同时实现显著加速。
Comments Accepted to CVPR 2026
利用局部转移一致性加速扩散采样
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 提出一种无需训练的加速方法LTC-Accel,通过利用相邻步骤间转移算子的统计关系来估计当前转移算子,从而加速文本到图像和视频的扩散采样,兼容多种网络结构和现有加速技术。
BodyReLux: 时序一致的全身人体视频重照明
机构 * Eyeline Labs(Eyeline实验室)
专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 本文提出BodyReLux,一种基于视频扩散的框架,用于在时序一致的方式下重照明全身人体表演。该方法利用混合数据集训练,结合传统静态单光源捕捉和新型动态表演捕捉技术,通过引入新的光照条件表示方法和数据增强管道,实现了高质量、鲁棒且时序一致的视频重照明。
Comments Siggraph 2026 Journal Track. Project page: https://eyeline-labs.github.io/bodyrelux/
RoPeSLR: 3D RoPE驱动的稀疏低秩注意力用于高效的扩散变换器
机构 * Peking University(北京大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV
AI总结 本研究提出RoPeSLR,一种基于3D RoPE的稀疏低秩注意力框架,旨在解决扩散变换器中长序列生成的高复杂度问题,通过结合高频率语义尖峰集和极低秩背景连续体,实现子二次稀疏性和子线性秩增长,从而在超长视频推理中表现出色。
FIS-DiT:通过无训练帧交错稀疏性打破视频推断的少步障碍
机构 * Platform and Content Group, Tencent(腾讯平台与内容组)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 本文提出FIS-DiT,通过将优化重点从时间轨迹转向潜在帧维度,解决少步推断中特征复用和预测建模受限的问题,实现2.11-2.41倍的加速效果。