Covariance-aware sampling for Diffusion Models
考虑协方差的扩散模型采样
机构 * GDM - Amsterdam(阿姆斯特丹GDM)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出一种考虑协方差的采样器,改进了扩散模型在少步 regime 中的像素空间采样质量。通过显式建模反向过程的协方差,结合 Tweedie 公式和结构化傅里叶空间分解,实现高效采样。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
考虑协方差的扩散模型采样
机构 * GDM - Amsterdam(阿姆斯特丹GDM)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出一种考虑协方差的采样器,改进了扩散模型在少步 regime 中的像素空间采样质量。通过显式建模反向过程的协方差,结合 Tweedie 公式和结构化傅里叶空间分解,实现高效采样。
双上升扩散用于逆问题
机构 * Stanford University(斯坦福大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出双上升优化框架解决逆问题,提升图像质量与鲁棒性,改进扩散模型先验的MAP求解方法。
Comments Project page: https://soniaminseokim.github.io/ddiff/
OmniLiDAR:一个多领域3D激光雷达生成的统一扩散框架
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; School of Computing, Department of Computer Science, National University of Singapore(新加坡国立大学计算机学院) ; College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) ; Technical University of Munich(慕尼黑技术大学) ; Nanjing University of Science and Technology(南京理工大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; University of Sydney(悉尼大学) ; The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学(深圳))
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 OmniLiDAR提出一种统一的文本条件扩散框架,生成跨八个领域的3D激光雷达扫描,通过跨域训练策略和特征建模提升多域生成能力,实验显示在数据增强和鲁棒性评估中表现优异。
Comments Preprint; 12 pages, 7 figures, 10 tables
实时-VLA FLASH:基于扩散模型的视觉-语言-动作模型的推测推理框架
机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Nanjing University(南京大学) ; Dexmal
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出实时-VLA FLASH框架,通过轻量级草案模型和主模型的Action Expert并行验证,实现低延迟高频率重规划,实验显示在LIBERO上任务性能保持良好,推理延迟降低至19.1ms。
通过束流图扩散模型生成和基于LSTM的优化学习优化放射治疗计划
机构 * Politecnico di Milano(米兰理工学院) ; Digital Technology and Innovation, Siemens Healthineers(西门子医疗数字化技术与创新)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出一种扩散驱动的学习优化方法,用于端到端的VMAT计划,通过生成可行的束流图并利用LSTM优化模块提高计划效率和机器可交付性。
Comments Early Accept at MICCAI 2026
测试时稀疏性用于极端快速动作扩散
机构 * Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出测试时稀疏性方法,通过动态预测可剪枝的残差计算来加速动作扩散,解决开放环境中的动态策略问题,实验表明在减少92% FLOPs的同时提升5倍生成速度,保持无损性能。
DiffST: 用于现实世界时空视频超分辨率的时空感知扩散模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Duke University(杜克大学) ; Huawei Consumer Business Group(华为消费者业务集团)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 DiffST提出一种高效时空感知视频扩散框架,通过跨帧上下文聚合和视频表示引导提升时空信息利用,实现高效实时世界时空视频超分辨率。
Comments Code is available at: https://github.com/zhengchen1999/DiffST
EgoForce:通过扩散强迫实现鲁棒的在线自体视角运动重建
机构 * Seoul National University(首尔国立大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出EgoForce框架,通过扩散强迫方法实现从噪声自体视角输入中鲁棒的长时间全身体运动重建,优于现有在线和离线方法。
Comments Project page: https://inwoohwang.me/EgoForce
PRISM:基于先验校正和不确定性感知结构建模的扩散文本图像超分辨率
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 PRISM通过Flow-Matching Prior Rectification和Structure-guided Uncertainty-aware Residual Encoder解决文本超分辨率中的先验校正和局部结构细化问题,实现高精度文本生成。
Comments Code is available at https://github.com/faithxuz/PRISM
GTA: 通过几何然后外观视频扩散推进图像到3D世界生成
机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出GTA方法,通过几何先于外观的两阶段框架提升3D场景生成的结构精度和视觉质量,同时引入随机潜在shuffle策略和测试时缩放方案,实验表明其在保真度、视觉质量和几何准确性上优于现有方法。
基于NNMF的扩散特征去噪在鲁棒手写数字多类分类中的应用
机构 * Doctoral School of Computer Science, University of Szeged(塞格德大学计算机科学博士学院) ; University Research and Innovation Center (EKIK), Óbuda University(奥布达大学研究与创新中心(EKIK))
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出结合扩散驱动特征去噪与混合特征表示的鲁棒多类分类框架,通过NNMF提取紧致可解释特征并结合CNN深度特征,提升噪声和对抗攻击下的分类鲁棒性。
当扩散模型失效约束:通过强化学习和MCTS的序列自回归生成
机构 * Salesforce AI Research(Salesforce人工智能研究) ; University of Sydney(悉尼大学) ; National University of Singapore(新加坡国立大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文研究了扩散模型在约束生成任务中的失效模式,通过拼图生成和简化矩形组合任务,发现扩散模型难以满足约束,提出基于自回归序列生成的约束意识生成方法。
TrackCraft3R:将视频扩散变换器重新用于密集3D跟踪
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; Google DeepMind(谷歌DeepMind)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出TrackCraft3R,通过重新利用预训练的视频扩散变换器,实现了基于单目视频的密集3D跟踪,采用双潜表示和时间RoPE对齐设计,提升了跟踪性能和效率。
Comments Project page and code are available at https://cvlab-kaist.github.io/TrackCraft3r/
OmniNFT: 多模态联合音频视频生成的模态感知强化学习
机构 * University of Science and Technology of China(中国科学技术大学) ; Peking University(北京大学) ; JD Explore Academy(京东探索研究院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出OmniNFT,通过模态感知强化学习框架解决多模态联合生成中的模态一致性、梯度不平衡和信用分配问题,提升音频视频感知质量与同步性能。
Comments Project page: https://zghhui.github.io/OmniNFT/
GaitProtector: 通过无训练扩散潜在优化实现基于伪装的步态去标识
机构 * City University of New York(纽约城市大学) ; Wuhan University(武汉大学) ; University of Aberdeen(阿伯丁大学) ; Nanyang Technological University(南洋理工大学) ; ELLIS Institute Finland(芬兰ELLIS研究所) ; University of Oulu(奥卢大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出GaitProtector框架,通过无训练扩散潜在优化实现基于伪装的步态去标识,通过伪装和伪装两个紧密耦合组件,在保持主导身体形状和运动动态的同时减少识别准确率。
Comments Accepted to the 20th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)
GeoQuery: 用于稀疏视角重建的几何-查询扩散
机构 * University of Electronic Science ; Tianjin University Tianjin China ; Tianjin University
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出GeoQuery,通过几何引导的扩散框架,在稀疏视角重建中有效减少渲染伪影。
Comments Accept to SIGGRAPH 2026 Conference Track
UniFixer:一种通用参考引导的扩散基视图合成修复器
机构 * ETH Zürich(苏黎世联邦理工学院) ; DisneyResearch|Studios(迪士尼研究实验室)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出UniFixer,通过粗到细策略修复扩散基视图合成中的多种退化问题,包括空间、时间及模型相关的退化,通过参考预对齐、全局结构锚定和局部细节注入模块实现高质量视图合成。
少样本合成数据生成与扩散模型用于下游视觉任务
机构 * National University of Science and Technology MISIS(俄罗斯莫斯科国立研究型技术大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出一种轻量级合成数据增强方法,通过微调LoRA适配器和预训练扩散模型生成合成样本,提升罕见类别的召回率和F1分数,适用于不同视觉领域。
Comments 5 pages, 3 figures, 1 table. Accepted at SynData4CV Workshop @ CVPR 2026
基于置信度引导的扩散增强法提升孟加拉语复合字符识别
机构 * Department of Computer Science and Engineering(计算机科学与工程系)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出一种置信度引导的扩散增强框架,通过结合分类引导和改进的U-Net结构,提升低分辨率孟加拉语复合字符识别性能,实验表明在AIBangla数据集上多个模型的分类准确率显著提高。
UnfoldLDM: 基于迭代潜在扩散先验的退化感知展开网络用于盲图像恢复
机构 * Duke University(杜克大学) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; Xiamen University(厦门大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出UnfoldLDM,结合深度展开网络与潜在扩散模型,解决盲图像恢复中的退化依赖和过平滑偏差问题,通过多粒度退化感知模块和退化抗性LDM提取先验,提升恢复质量与视觉效果。
Comments 6 figures, 11 tables
DiffSegLung: 基于扩散的放射组学蒸馏用于无监督肺部病理分割
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出DiffSegLung,通过引入扩散放射组学蒸馏方法,利用手工制作的放射组学描述符作为物理基础的教师,引导3D扩散U-Net的瓶颈层,提升无监督肺部病理分割性能。
单次曝光HDR恢复通过视频扩散先验
机构 * University of California San Diego(加州大学圣地亚哥分校) ; Creare LLC(Creare公司)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出通过视频扩散模型生成曝光序列并融合生成HDR图像,提升单次曝光HDR重建的保真度和可解释性,优于现有方法。
ZeroIDIR:基于扰动一致扩散模型的零参考照明退化图像恢复
机构 * School of Aeronautics and Astronautics, Sichuan University(四川大学航空航天学院) ; University of Electronic Science and Technology of China(电子科技大学) ; College of Electronics and Information Engineering, Sichuan University(四川大学电子信息工程学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出ZeroIDIR框架,通过自适应伽马校正模块和扰动一致性扩散模型,实现零参考照明退化图像恢复,提升恢复精度与稳定性。
Comments Accepted by CVPR 2026
VidSplat:基于几何引导视频扩散先验的高斯点云重建
机构 * School of Software, Tsinghua University(清华大学软件学院) ; Department of Computer Science, Wayne State University(韦恩州立大学计算机科学系)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 VidSplat通过几何引导的视频扩散先验,解决稀疏视图下3D场景重建问题,提出免训练生成框架,迭代合成新视角以恢复完整3D场景。
Comments Accepted by SIGGRAPH Conference 2026. Project Page: https://tangjm24.github.io/VidSplat
基于扩散模型的零样本人体姿态估计
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出InPose方法,通过预训练扩散模型和旋转测量条件,解决人体姿态估计中用户体型差异导致的泛化问题。
Comments Published as a Conference Paper at The Fourteenth International Conference on Learning Representations
异方差扩散用于多智能体轨迹建模
机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息学院,CSIC-UPC)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出U2Diffine模型,通过异方差不确定性估计提升多智能体轨迹补全与预测性能,结合Taylor近似和RankNN实现高效推理与误差概率评估,优于现有方法。
Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Extended version of arXiv:2503.18589 (CVPR 2025)
通过扩散框架实现逼真且高效的bokeh渲染
机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) ; vivo BlueImage Lab, vivo Mobile Communication Co., Ltd.(vivo BlueImage实验室,vivo移动通信有限公司) ; Shenzhen University of Advanced Technology(深圳大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出MagicBokeh框架,通过替代训练策略和聚焦感知的掩码注意力机制,联合优化bokeh渲染与超分辨率,提升可控性和视觉保真度,并引入降质感知深度模块以提高低质量输入的深度估计准确性。
Comments Accepted by CVPR 2026
动态点云的扩散掩码预训练
机构 * Xi’an Jiaotong University(西安交通大学) ; School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) ; University of Western Australia(西澳大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出DiMP框架,通过引入扩散建模解决动态点云预训练中位置泄露和运动监督问题,提升下游任务性能。
COP-GEN:用于Copernicus地球观测数据的潜在扩散变换器
机构 * School of Engineering University of Edinburgh(工程学院爱丁堡大学) ; European Space Agency (ESA)(欧洲航天局) ; Asterisk Labs(Asterisk实验室)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 COP-GEN通过建模异质地球观测模态的联合分布,实现了多模态潜在扩散变换器,支持灵活的任意到任意条件生成,包括无需重新训练的零样本模态翻译。
随机性的确定性:提示残差种子塑形用于扩散生成
机构 * USTC(中国科学技术大学) ; Li Auto Inc.(利亚自动化公司) ; Xi’an High-tech Research Institute(西安高新技术研究院) ; Wechat Vision(微信视觉) ; Cambridge University(剑桥大学) ; HUST(华中科技大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文研究了扩散生成中种子敏感性,提出无需训练的提示残差种子塑形方法,通过单个高噪声冷启动提示残差提升生成对齐和质量。