Multivariate Diffusion Transformer with Decoupled Attention for High-Fidelity Mask-Text Collaborative Facial Generation
多变量扩散变换器与解耦注意力用于高保真遮罩-文本协同面部生成
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 MDiTFace通过解耦注意力机制和多变量变换块提升遮罩-文本协同面部生成的保真度与一致性。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
多变量扩散变换器与解耦注意力用于高保真遮罩-文本协同面部生成
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 MDiTFace通过解耦注意力机制和多变量变换块提升遮罩-文本协同面部生成的保真度与一致性。
专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV
Journal ref https://aclanthology.org/2025.emnlp-industry.17/
用于忠实超分辨率的不确定性引导潜在扩散模型
机构 * National Taiwan University(国立台湾大学) ; NTU AI-CoRE(台大AI核心研究中心)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 针对单图像超分辨率的感知-失真权衡问题,提出新型UGDiff不确定性引导潜在扩散模型,通过结合重建不确定性与扩散采样器后验方差引导采样,实现更优的感知-失真平衡,性能优于现有同类方法。
Comments ICIP 2026
基于扩散模型的无监督解剖特征学习:用去噪扩散概率模型增强医学图像分割
机构 * Manipal Institute of Technology Bengaluru, Manipal Academy of Higher Education(马尼帕尔理工学院班加罗尔分校,马尼帕尔高等教育学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 该研究提出用无监督DDPM预训练提取解剖特征,将编码器权重迁移至U-Net实现医学图像分割,在BTCV数据集上显著提升多器官分割性能,低数据场景下仍保持稳健表现。
Comments 15 pages, 5 figures. Submitted for peer review
扩散加权MRI急性缺血性脑卒中的深度学习分割:跨三个数据集的实用评估
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本研究训练nnU-Net模型,对比不同输入配置与架构,发现仅用DWI训练的基线nnU-Net可快速准确分割急性缺血性脑卒中病灶,性能优于DeepISLES,或可支持临床工作。
Comments 19 pages, 8 figure and 4 tables
用于屋顶图合成与重建的扩散Transformer
机构 * The Remote Sensing Technology Institute(遥感技术研究所) ; German Aerospace Center (DLR)(德国航空航天中心)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 提出RoofDiT框架,以扩散Transformer和边预测模块为核心,结合几何感知注意力与多条件信号,在屋顶图合成与重建任务中取得优于基线的性能。
Comments Pre-review manuscript. Accepted at the ICPR 2026 Workshop on Pattern Recognition in Remote Sensing (PRRS)
基于基础模型条件扩散的降水降尺度方法
机构 * IBM Research(IBM研究院) ; Fathom ; STFC Hartree Centre(STFC哈特雷中心)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 该研究针对降水降尺度问题,探究三种扩散模型条件策略,发现交叉注意力条件优于通道拼接,且Prithvi WxC基础模型在数据有限场景下性能良好。
针对扩散Transformer的Muon优化器的缩放研究
机构 * University of Southern California(南加州大学) ; Meta
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 该研究针对大型扩散Transformer的Muon优化器,提出周期性行级Muon,在保留其生成质量优势的同时,大幅降低训练的计算、通信开销与时间。
IRIS:用于扩散图像防伪造水印的视觉-语义绑定
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 IRIS是一种无需训练的扩散图像防伪造水印方案,通过视觉-语义绑定抵御固定图案移植与事后再生剥离,在三个提示数据集上检测可靠且保真度优异。
Comments Substantial revisions
奖励分数匹配:统一流模型和扩散模型的基于奖励的微调
机构 * Graduate School of AI, KAIST, Korea(人工智能研究生院,韩国科学技术院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 提出奖励分数匹配(RSM)框架,统一了多种基于奖励的微调方法,通过分数匹配与值引导目标对齐,简化了设计空间并提高了效率。
Comments 50 pages, 15 figures. Best Paper Award at SPIGM workshop, ICML 2026
Memory-V2V: 通过记忆增强的视频到视频扩散模型实现一致的多轮编辑
机构 * Adobe Research(Adobe研究实验室) ; KAIST AI(韩国科学技术院人工智能研究所) ; Adobe Internship(Adobe实习) ; Project Lead(项目负责人)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 Memory-V2V通过引入外部记忆模块,解决多轮视频编辑中的跨轮一致性问题,提升编辑连贯性并保持视觉质量,优于现有基线模型。
Comments 38 pages, 22 figures, ECCV 2026, Project page: https://dohunlee1.github.io/MemoryV2V
扩散模型中的在线策略自蒸馏
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出DiffusionOPSD在线策略自蒸馏框架,将图像级奖励指导转为中间监督,在SD 3.5-M等模型上获最佳保留得分,训练GPU小时显著减少,为高效可诊断的扩散模型对齐提供新路径。
Comments Technical Report; Project Page at https://diffusionopsd.github.io GitHub Repo at https://github.com/worldbench/DiffusionOPSD
ZODIAC:基于八叉树的零样本解剖结构补全扩散模型
机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Konrad Zuse School of Excellence in Reliable AI (relAI)(康拉德·楚泽可靠AI卓越学院(relAI))
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本研究针对术中超声脊柱补全的不适定问题,提出零样本框架ZODIAC,通过混合补全机制结合扩散先验与部分几何,在HD95指标上较全监督方法提升22%泛化能力。
DRRG:用于放射报告生成的离散扩散框架
机构 * School of Electrical and Computer Engineering, The University of Sydney(悉尼大学电气与计算机工程学院) ; Department of Radiology, The First Affiliated Hospital of Soochow University(苏州大学附属第一医院放射科) ; School of Computer Science, The University of Adelaide(阿德莱德大学计算机学院) ; School of Computing and Information Technology, University of Wollongong(卧龙岗大学计算与信息技术学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本研究提出基于离散扩散大语言模型的DRRG框架,将放射报告生成转化为迭代掩码词去噪,在MIMIC-CXR、CheXpert Plus数据集上的多项指标优于对比方法,为放射报告生成提供了有效替代方案。
扩散模型与基于流的模型中的表示学习:应用视角
机构 * Fudan University(复旦大学) ; School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(西北工业大学光学与电子信息人工智能学院(iOPEN)) ; The University of Hong Kong(香港大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本综述聚焦应用场景,提出三层渐进框架,梳理扩散与基于流的模型中表示学习的双向关系,分类下游任务方法,明确研究挑战并指明未来方向,为相关应用研究提供参考。
Comments Accepted by Vicinagearth
AffineTok:面向扩散模型友好型视觉分词器的语义仿射一致性
机构 * Fudan University(复旦大学) ; Alibaba Group(阿里巴巴集团)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出AffineTok,通过语义仿射一致性(SAC)引导视觉分词器训练,引入M_SAC作为代理指标,在ImageNet 256上实现了gFID的显著降低,达到无引导1.21、有引导1.10的SOTA性能。
Comments Project page: https://michaelyu781.github.io/AffineTok-site/
通过速度匹配扩展扩散模型的强化学习
机构 * Georgia Institute of Technology(佐治亚理工学院) ; NVIDIA(英伟达公司)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 该研究提出基于奖励的速度匹配(RVM)方法,用于扩散模型的奖励微调,其训练成本显著降低,性能优于或相当基于轨迹的策略梯度方法,还通过动态跟踪奖励改善了视频生成的运动效果。
Comments 30 pages, 13 figures
基于扩散模型的可控盲去模糊
机构 * DxO Labs ; LTCI, Télécom Paris, IP Paris(LTCI,巴黎电信学院,巴黎理工大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 提出基于扩散模型的SuperSharpen盲去模糊方法,通过模糊度量可控调整复原强度,经实验验证其在合成与真实模糊上的感知质量及可控性优于对比策略
Comments 6 pages, 5 figures, 1 table. Accepted to IEEE ICIP 2026
Block3D:基于分块扩散的高效文本到3D生成
机构 * ZipLab, Zhejiang University(浙江大学ZipLab) ; University of California, Berkeley(加州大学伯克利分校) ; Wuhan University(武汉大学) ; Monash University(莫纳什大学) ; University of Adelaide(阿德莱德大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 针对文本到3D生成成本高的问题,提出Block3D分块扩散框架,通过分块生成、联合去噪及置信度引导的块内修正,在保持几何保真度的同时实现5.15倍的速度提升。
Comments Project page: https://alexandertsui.github.io/block3d/
扩散模型遗忘中的共现关联保留概念
机构 * Dongguk University-Seoul(东国大学-首尔) ; Chung-Ang University(Chung-Ang 大学) ; Korea Institute for Advanced Study(韩国高级研究院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 针对扩散模型遗忘中误删良性共现概念的问题,提出CARE评分量化保留程度,并设计ReCARE框架通过自动构建CARE集实现稳健遗忘,平衡概念擦除、整体效用与共现概念保留。
Comments Accepted as a poster at ICLR 2026. Code available at https://github.com/damilab/CARE
具有鲁棒性的扩散求解器用于逆问题
机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) ; Yau Mathematical Sciences Center, Tsinghua University(清华大学尤太数学科学中心)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出一种鲁棒扩散求解器,通过噪声估计和Huber损失构建迭代加权最小二乘目标,以解决逆问题中的异常值问题,并在多个图像数据集上验证了其有效性。
Comments Accepted by CVPR 2026
基于模式坐标扩散映射的时空服装重建
机构 * CVLab, École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL)计算机视觉实验室) ; Mohamed bin Zayed University of Artificial Intelligence(马尔代夫人工智能大学) ; Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) ; Pinscreen and Mohamed bin Zayed University of Artificial Intelligence(Pinscreen和马尔代夫人工智能大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出了一种基于模式坐标扩散映射的时空服装重建方法,结合隐式缝合模式与生成扩散模型,实现高保真3D服装重建,适用于虚拟试穿和动画等领域。
Comments arXiv admin note: text overlap with arXiv:2504.08353
基于Voronoi辅助优化的无向点云无符号距离场扩散方法
机构 * S-Lab Nanyang Technological University Singapore(南洋理工大学新加坡S-Lab) ; College of Mathematics Nanjing University of Aeronautics and Astronautics China(南京航空航天大学数学学院) ; College of Computing and Data Science Nanyang Technological University Singapore(南洋理工大学计算与数据科学学院) ; Institute of Software Chinese Academy of Sciences China(中国科学院软件研究所) ; School of Computer Science Shandong University China(山东大学计算机科学学院) ; Department of Computer Science City University of Hong Kong China(香港城市大学计算机科学系) ; SenseTime Research China(SenseTime研究院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出轻量级无网络方法VAD,通过Voronoi准则对齐无向点云法向量并扩散积分,可高效稳定计算UDF,稳健处理各类三维几何结构。
用于放疗中危及器官分割质量保证的图像条件扩散模型
机构 * UCL Hawkes Institute(UCL霍克斯研究所) ; University College London(伦敦大学学院) ; National Physical Laboratory(英国国家物理实验室) ; University College London Hospital(伦敦大学学院医院) ; National Radiotherapy Trials Quality Assurance Group(国家放射治疗试验质量保证组) ; Mount Vernon Hospital(芒特弗农医院) ; University of Manchester(曼彻斯特大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 该研究针对放疗中危及器官分割审阅耗时主观的问题,对比VAE框架与图像条件分割扩散模型,发现后者能更一致地定位细微边界错误,为分割质量保证提供了有前景的框架。
Comments Submitted to the MICCAI 2026 UNSURE Workshop
基于自由形式指令的时尚互补图像生成的接地
机构 * Politecnico di Bari(巴里理工大学) ; Sapienza University of Rome(罗马大学) ; University of Klagenfurt(克拉根福大学)
专题命中 扩散模型 :image generation(title,abstract);分类 cs.CV
AI总结 针对现有时尚互补图像生成基准的缺陷,该研究提出基于自由形式指令的新设置,用StyleFlow模型实现该任务,其生成的服装符合指令且风格连贯,同时降低了架构复杂度和推理成本。
用于人体动作生成的时空解耦自回归扩散模型
机构 * AI Institute, Shanghai Jiao Tong University(上海交通大学AI学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出名为DeMoDiff的时空解耦框架,通过针对每个身体关节编码的时空VAE与融入时空掩码和注意力的自回归扩散生成器,在HumanML3D和KIT-ML数据集上取得最优重构性能与动作生成效果,且具备强时空编辑能力。
Comments Accepted by ICME 2026
面向计算机断层扫描重建的即插即用基础先验:基于多模态扩散模型
机构 * Oak Ridge National Laboratory(橡树岭国家实验室)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 该研究探究用跨多成像域训练的单一多模态扩散模型作为CT重建的通用先验,在三类不同CT数据集上验证其性能优于解析重建,为异构CT重建提供可复用基础先验。
AnaDiffusion:用于可控3D脑部MRI生成的解剖学组成式潜在扩散模型
机构 * Stanford University(斯坦福大学) ; Texas A&M University(德克萨斯农工大学) ; University of Minnesota(明尼苏达大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Johns Hopkins University(约翰霍普金斯大学) ; UTHealth Houston(休斯顿健康科学中心) ; Stony Brook University(纽约州立大学石溪分校)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 AnaDiffusion是一种解剖学组成式潜在扩散框架,通过分解3D脑部MRI生成为解剖区域并组装细化,在ADNI测试集上实现低FID与高Cohen's d值,支持无需密集分割图的可控部分编辑。
结合高效非对角协方差建模的改进去噪扩散概率模型
机构 * University of Cambridge(剑桥大学) ; MediaTek Research(联发科研究院) ; University of Warwick(华威大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出K-DCT协方差模型改进DDPM,降低计算复杂度,在少采样步数下于多数据集上实现优于现有SOTA的采样性能。
Comments 29 pages, 11 figures
Journal ref TMLR 06/2026
GaussVid:结合3D感知视频扩散先验的稀疏视图高斯溅射
机构 * The University of Hong Kong(香港大学) ; School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) ; Futurewei Technologies Inc(华为主流技术公司)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本研究提出结合3D感知视频扩散先验的GaussVid框架,构建3DGS视频数据集并引入相机条件几何先验,提升稀疏视图3DGS重建的像素、结构保真度与多视图一致性。