High-Fidelity Medical Shape Generation via Skeletal Latent Diffusion
通过骨骼潜在扩散实现高保真的医学形状生成
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出了一种骨骼潜在扩散框架,通过结合结构先验实现高效高保真医学形状生成,并构建了大规模MedSDF数据集以提升生成质量与效率。
Comments 11 pages, 5 figures, journal
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
通过骨骼潜在扩散实现高保真的医学形状生成
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出了一种骨骼潜在扩散框架,通过结合结构先验实现高效高保真医学形状生成,并构建了大规模MedSDF数据集以提升生成质量与效率。
Comments 11 pages, 5 figures, journal
流形最优引导:扩散引导的黎曼控制视角统一观
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出流形最优引导(MOG)和Auto-MOG,通过黎曼控制视角解决扩散引导中的几何不匹配问题,提升生成质量并减少计算开销。
几何自编码器用于扩散模型
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出几何自编码器GAE,通过优化低维语义监督目标和潜在规范化,提升扩散模型在生成质量、压缩与稳健重建之间的平衡,实现更高效的高分辨率视觉生成。
Comments Code and models are publicly available at https://github.com/sii-research/GAE
GeoDiff4D: 基于几何的扩散模型用于4D头像重建
机构 * Tsinghua University(清华大学) ; Li Auto(利亚自动)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 GeoDiff4D通过几何感知扩散模型,结合表面法线和表情编码器,实现了高保真的4D头像重建,提升了视觉质量和跨身份泛化能力。
Comments 17 pages
对比扩散引导用于空间逆问题
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of South Carolina(南卡罗来纳大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出CoGuide模型,通过对比学习在平滑嵌入空间中近似似然分数,以解决空间逆问题中的非可微前向算子挑战,实现更稳定的去噪和更稳健的重建。
InvAD: 基于逆向的无重建异常检测方法与扩散模型
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 InvAD提出了一种基于逆向的无重建异常检测方法,通过DDIM逆向推断潜在变量并利用先验分布测量偏差,实现高效且准确的异常检测。
Comments Accepted to CVPR2026. Project page: https://invad-project.com
用反事实对抗幻觉:基于扩散引导的扰动用于LVLM幻觉抑制
机构 * York University(约克大学) ; Macquarie University(麦考瑞大学) ; Northern Illinois University(北伊利诺伊大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 CIPHER通过反事实图像扰动减少LVLM中的视觉幻觉,提升模型忠实性。
Comments CVPR 2026
基于方差意识的扩散模型训练自适应加权
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出一种基于方差意识的自适应加权策略,用于改进扩散模型的训练稳定性与生成性能。
Comments 15 pages, 8 figures, 1 table
PRoADS: 基于音频扩散模型的可证明安全且稳健的音频隐写框架:利用潜在优化和后向欧拉反演
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM
AI总结 PRoADS通过正交矩阵投影和潜在优化技术,在音频扩散模型中实现可证明安全且稳健的隐写,达到0.15%的低比特错误率。
Comments This paper has been accepted for presentation at the 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)
ConfCtrl: 通过置信度感知插值实现视频扩散中的精确相机控制
机构 * University of Freiburg(弗赖堡大学) ; Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) ; Technical University of Munich(慕尼黑技术大学) ; Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑))
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 ConfCtrl通过置信度感知插值实现视频扩散中的精确相机控制,解决大视角变化下新视角生成问题,提升几何一致性与视觉合理性。
Comments 13 pages
何时锁定注意力:视频扩散中的无训练KV控制
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 KV-Lock通过动态调度KV融合比和CFG尺度,提升视频扩散模型中前景质量与背景一致性的平衡,实现无训练的高效视频编辑。
Comments 18 pages, 9 figures, 3 tables
复兴 ConvNeXt 以实现高效的卷积扩散模型
机构 * KAIST(韩国科学技术院) ; ETH Zürich(苏黎世联邦理工学院) ; ISTI-CNR(意大利国家研究理事会信息与自动化研究所) ; University of Pisa(比萨大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出全卷积扩散模型 FCDM-XL,通过使用 ConvNeXt 结构实现高效扩散模型,以更少的 FLOPs 和训练步骤达到与 DiT-XL 相当的性能。
Comments CVPR 2026. Official implementation: https://github.com/star-kwon/FCDM
谁制造了这个?通过扩散特征进行伪造检测和来源归因
机构 * Department of Information Engineering and Mathematics, University of Siena(信息工程与数学系,锡耶纳大学) ; AIGO, Italian Institute of Technology(AIGO,意大利理工学院)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 FRIDA通过分析扩散特征,利用k-最近邻方法和紧凑神经分类器实现伪造图像检测与来源归因,达到跨生成器检测的最优性能。
EasyText: 用于多语言文本渲染的可控扩散变换器
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 EasyText提出了一种基于DiT的可控扩散变换器,用于多语言文本渲染,通过字符位置编码和插值技术实现精确生成,并利用大规模数据集提升性能。
半监督生物医学图像分割:通过扩散模型和教师-学生协同训练
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出了一种基于扩散模型的半监督生物医学图像分割框架,通过教师-学生协同训练和多轮伪标签生成策略,在有限标注数据下提升分割性能。
谱结构扩散用于单图像雨去除
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 SpectralDiff通过引入结构化的频谱扰动,提升单图像雨去除的效率和性能。
Comments 15 pages, 4 figures
基于扩散的复制检测模式认证:一种多模态框架与打印机签名条件化
机构 * Université Lumière Lyon 2, CNRS, INSA Lyon, Universite Claude Bernard Lyon 1, LIRIS UMR5205(里摩日大学里昂2分校、法国国家科学研究中心、里昂国立应用科学学院、里昂大学克莱尔-贝尔纳分校、LIRIS UMR5205)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出基于扩散的多模态认证框架,利用打印机签名条件化技术,实现对复制检测模式的高效认证,优于传统方法和深度学习方法。
Comments Accepted at WACV 2026
基于扩散的数据增强用于图像识别:系统分析与评估
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出UniDiffDA框架,系统分析DiffDA方法的三个核心组件,通过全面评估揭示不同策略的优劣,提供可复现的代码和配置以促进研究。
Journal ref Int J Comput Vis 134, 126 (2026)
可解释的运动注意力图:在视频扩散变换器中进行时空定位概念
机构 * Yonsei University(延世大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出一种可解释的运动注意力图方法,通过时空定位运动概念,提升视频扩散变换器的可解释性与定位能力。
Comments CVPR 2026
M4Diffuser:多视角扩散策略与具有操纵性意识的控制的多自由度扩散策略用于鲁棒移动操纵
机构 * TAMS (Technical Aspects of Multimodal Systems), Department of Informatics, University of Hamburg(汉堡大学信息学院技术多模态系统部门) ; Technical University of Munich(慕尼黑技术大学) ; Agile Robots SE(敏捷机器人有限公司)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 M4Diffuser通过多视角扩散策略与操纵性意识控制器实现鲁棒移动操纵,提升任务成功率与环境适应性。
Comments Project page: https://sites.google.com/view/m4diffuser, 10 pages, 9 figures
VesselFusion:基于扩散模型的3D CT图像血管中心线提取
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 VesselFusion通过扩散模型实现3D CT图像中血管中心线的提取,采用粗到细表示和投票聚合方法,提升提取精度和结果自然度。
VSDiffusion:通过可见性约束扩散镇定模糊的阴影生成
机构 * East China University of Science and Technology(东华大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 VSDiffusion通过可见性约束扩散框架,结合多尺度结构指导和软先验图,有效生成逼真阴影,提升复杂场景下的几何一致性。
Comments 12 pages,8 figures
结构与进展感知扩散用于医学图像分割
机构 * School of Artificial Intelligence(人工智能学院) ; School of Computer Science and Technology(计算机科学与技术学院) ; State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室) ; Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能重点实验室) ; Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省多模态认知计算重点实验室)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出SPAD方法,结合语义集中扩散和边界集中扩散,通过进展感知调度器实现医学图像分割的粗到细的扩散过程。
SoundWeaver: 语义预热启动用于文本到音频扩散服务
机构 * University of Illinois Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校) ; Assured Intelligence, USA(Assured Intelligence)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 SoundWeaver通过语义预热启动技术,提升文本到音频扩散服务的效率,减少延迟并保持音频质量。
Comments Submitted to INTERSPEECH 2026
DECADE:一种用于增强Rb-82动态心脏PET图像去噪的时序一致无监督扩散模型
机构 * Yale University(耶鲁大学) ; Yale School of Medicine(耶鲁医学院) ; Siemens Medical Solutions USA, Inc.(西门子医疗解决方案美国公司) ; Inselspital, Bern University Hospital(伯尔尼大学医院Inselspital) ; University of Bern(伯尔尼大学) ; Department of Biomedical Engineering(生物医学工程系) ; Department of Radiology and Biomedical Imaging(放射科和生物医学成像系) ; Department of Medicine (Cardiology)(医学系(心脏病学))
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 DECADE是一种用于增强Rb-82动态心脏PET图像去噪的无监督扩散模型,通过引入时间一致性提升去噪效果,实现高质量动态和参数图像重建。
学习上下文自适应的运动先验以实现遮蔽运动扩散模型的高效运动学注意力聚合
机构 * Department of Computer Science, Hong Kong Baptist University(计算机科学系,香港 Baptist 大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 MMDM通过高效运动学注意力聚合机制,学习上下文自适应的运动先验,实现遮蔽运动数据的高效重建与生成。
Comments Accepted by IEEE Transactions on Multimedia. Supplementary material is included
解耦文本先验用于基于扩散的图像超分辨率
机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing 210023, China(新型软件技术国家重点实验室,南京大学,南京)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 DTPSR通过解耦文本先验提升基于扩散的图像超分辨率性能,引入空间层次和频率语义两个维度,实现高感知质量和强泛化能力。
Comments Accepted by CVPR 2026
N-Tree Diffusion用于长周期野火风险预测
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 N-Tree Diffusion通过共享早期去噪阶段和后期分支,提高了长周期野火风险预测的效率和准确性。
Comments 15 pages, 6 figures
实时可控的自回归视频扩散
机构 * Nanyang Technological University(南洋理工大学) ; Xmax.AI Ltd(Xmax.AI有限公司) ; Zhejiang University(浙江大学) ; Singapore Management University(新加坡国立大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 AR-Drag是一种基于强化学习的实时图像到视频生成模型,通过自回归机制和轨迹奖励模型实现高效运动控制,提升视频生成质量和效率。
Vid2World: 构建视频扩散模型以交互式世界模型
机构 * Tsinghua University(清华大学) ; Chongqing University(重庆大学)
专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV
AI总结 Vid2World通过因果化视频扩散模型,提升其在交互式世界建模中的可控性和生成能力,适用于机器人操作、游戏模拟和开放世界导航等多种领域。
Comments Project page: http://knightnemo.github.io/vid2world/