arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86872 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2607.06335 2026-07-08 cs.CV 新提交 79%

Bridging Diffusion Pruning and Step Distillation with Teacher-Aligned Repair

通过教师对齐修复弥合扩散剪枝与步长蒸馏

Jincheng Ying, Li Wenlin, Minghui Xu, Yinhao Xiao

机构 * School of Big Data and Artificial Intelligence(大数据与人工智能学院) Guangdong University of Finance and Economics(广东财经大学) School of Computer Science(计算机科学学院) Shandong University(山东大学) GDUFE-UCM Joint Institute(广东财经大学-UCM联合学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究扩散模型推理成本高的问题,提出用教师对齐修复阶段连接剪枝与步长蒸馏,解决剪枝后重新训练难题,在ImageNet-512上实验,不同剪枝比例下模型参数减少、评估次数降低,FID有相应变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05711 2026-07-08 cs.LG cs.CV 新提交 79%

FourTune: Towards Fully 4-Bit Efficient Post-Training for Diffusion Models

FourTune:迈向扩散模型的全4位高效训练后优化

Bowen Xue, Zihan Min, Xingyang Li, Zhekai Zhang, Haocheng Xi, Lvmin Zhang, Maneesh Agrawala, Jun-Yan Zhu, Song Han, Yujun Lin, Muyang Li

机构 * Nunchux AI MIT(麻省理工学院) CMU(卡内基梅隆大学) UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对大型扩散模型训练后优化的挑战,提出FourTune框架,基于端到端W4A4G4范式,引入三分支混合管道、硬件高效量化等,在多任务中质量与全精度微调相当,在特定数据集上降低内存开销、提高训练吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05702 2026-07-08 cs.CV 新提交 79%

Robust Face Super-Resolution and Recognition Through Multi-Feature Aggregation in Diffusion Models

基于扩散模型中的多特征聚合实现鲁棒的面部超分辨率和识别

Marcelo dos Santos, Rayson Laroca, João Carlos Raposo Neves, David Menotti

机构 * Federal University of Paraná(巴拉那联邦大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对监控图像质量低影响人脸识别的问题,提出基于扩散模型的FASR++算法,通过整合多图像特征生成超分辨率输出,减少身份失真,经实验验证,该算法在多指标上取得最优结果,提升了人脸识别性能。

Journal ref Journal of the Brazilian Computer Society, vol. 32, no. 1, pp. 1457-1470, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05637 2026-07-08 cs.CV 新提交 79%

Recovering Cloud Microstructures with Cascaded Diffusion Inversion

通过级联扩散反演恢复云微观结构

Hanan Gani, Guy Pulik, Daniel Rosenfeld, Duncan Watson-Parris, Salman Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学) University of California, San Diego(加利福尼亚大学圣地亚哥分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对卫星云图像分辨率不足及现有方法不适用于此类图像的问题,提出基于扩散的两阶段超分辨率框架,能将云微观结构分辨率提高4倍,在精度和视觉质量上优于现有方法,为云微物理分析及利用AI促进气候和可持续性提供路径。

Comments Published at ML4RS Workshop ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02998 2026-07-08 cs.CV cs.AI cs.LG 新提交 79%

CONFLUX: A Latent Diffusion Model for 3D Chest-CT Synthesis with RL Post-Training

CONFLUX:一种用于3D胸部CT合成的潜在扩散模型及强化学习后训练

Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert

机构 * Department of Biomedical Data Science, Stanford University School of Medicine(斯坦福大学医学院生物医学数据科学系) Department of Mathematical Modelling, Statistics & Bioinformatics, Ghent University(根特大学数学建模、统计与生物信息学系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出CONFLUX潜在扩散模型用于胸部CT合成,由3D变分自编码器和整流流变压器构成,基于放射学元数据生成,通过强化学习后训练增强对临床属性控制,在三平面弗雷歇距离上领先并发布模型与数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16147 2026-07-08 cs.CV 版本更新 79%

Registers Matter for Pixel-Space Diffusion Transformers

注册信息对像素空间扩散变换器的重要性

Nikita Starodubcev, Ilia Sudakov, Ilya Drobyshevskiy, Artem Babenko, Dmitry Baranchuk

机构 * Yandex Research(Yandex研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究发现扩散变换器与视觉变换器在处理像素空间时存在差异,注册令牌显著提升了生成质量,通过分析中间表示发现其在高噪声水平下产生更清晰的特征图,进而提出了一种高效的双流架构以提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10439 2026-07-08 cs.CV 版本更新 79%

Filtering Memorization from Parameter-Space in Diffusion Models

从参数空间过滤记忆化在扩散模型中

Yu Zhe, Yang Jiayan, Wei Junhao, Yu-Lin Tsai, Wang Chen

机构 * RIKEN AIP(理化学研究所Advanced Institute for Peripheral Research) Science of Tokyo(东京科学大学) University of California, Berkeley(加州大学伯克利分校) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出BAF框架,通过分解LoRA更新并测量其与预训练骨干的主子空间对齐度,实现训练后记忆抑制,减少生成内容中的版权或敏感内容复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15932 2026-07-08 cs.CV 版本更新 79%

NAMD: Virtual Follow-up Computed Tomography Synthesis via Nodule-Aligned Multimodal Diffusion Models for Early Lung Cancer Diagnosis

基于LLM驱动多模态扩散的结节对齐潜在空间学习:用于肺结节进展预测

James Song, Yifan Wang, Chuan Zhou, Liyue Shen

机构 * Department of EECS, University of Michigan(电子工程与计算机科学系,密歇根大学) University of Michigan Medical School(密歇根大学医学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出NAMD框架,通过生成1年随访CT图像预测肺结节进展,利用结节对齐潜在空间和LLM驱动控制机制,在NLST数据集上实现优于基线和现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04024 2026-07-08 cs.CV cs.AI 版本更新 79%

Volumetric Directional Diffusion: Anchoring Uncertainty Quantification in Anatomical Consensus for Ambiguous Medical Image Segmentation

体积方向扩散:在模糊医学图像分割的解剖学共识中锚定不确定性量化

Chao Wu, Mahesh Bhosale, Kangxian Xie, Pouya Karimian, David Doermann, Mingchen Gao

机构 * Department of Computer Science and Engineering University at Buffalo, SUNY Buffalo, NY, USA(计算机科学与工程系,布法罗大学,纽约州,布法罗,美国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对模糊医学图像分割中不同专家边界描绘有差异的问题,提出体积方向扩散(VDD)框架,以粗略共识预测为锚点,学习方向扩散过程生成边界变化,实验表明该方法能在保持精度和结构一致性时改善不确定性分布对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00001 2026-07-08 cs.CV cs.AI cs.CY 版本更新 79%

Replication in Visual Diffusion Models: A Survey and Outlook

视觉扩散模型中的复制:一项综述与展望

Wenhao Wang, Yifan Sun, Zongxin Yang, Zhengdong Hu, Zhentao Tan, Yi Yang

机构 * Australian Artificial Intelligence Institute, University of Technology Sydney(澳大利亚人工智能研究所,悉尼技术大学) Baidu Inc.(百度公司) College of Computer Science and Technology, Zhejiang University(计算机科学与技术学院,浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文综述视觉扩散模型中的复制现象,将现有研究分类为揭示、理解和缓解该现象的方法,还回顾其现实影响,讨论了检测和基准测试复制的挑战及未来方向,助力研究人员和从业者理解AI技术与社会公益交叉点。

Comments Accepted by TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03299 2026-07-07 eess.IV cs.CV cs.LG 新提交 79%

Piecewise Dynamic Diffusion Regularization for Reconstruction of Cardiac Cine MRI

用于心脏电影MRI重建的分段动态扩散正则化方法

Florian Fürnrohr, Reinhard Heckel

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对实时心脏电影MRI严重欠采样与运动导致的重建难题,提出PDDR方法,分段融合时空扩散先验,实现高效高质量重建,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05319 2026-07-07 cs.CV cs.AI 新提交 79%

Steering Optimisation Trajectories in Diffusion Representation Learning

引导扩散表示学习中的优化轨迹

Rajat Rasal, Avinash Kori, Tian Xia, Ben Glocker

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究探究扩散自编码器图像质量相近但潜在结构差异大的成因,提出SteeringDRL方法,通过门控残差U-Net和噪声水平课程引导优化,提升表示质量并降低种子敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04352 2026-07-07 cs.CV 新提交 79%

Last-Meter Precision Navigation for UAVs: A Diffusion-Refined Aerial Visual Servoing Approach

无人机的最后一米精确导航:一种扩散细化的空中视觉伺服方法

Yaxuan Li, Jiarui Zeng, Shaofei Huang, Zhedong Zheng

机构 * FST and ICI, University of Macau(澳门大学科技学院及资讯与通信技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究无人机最后一米精确导航,提出DreamNav框架,先粗估计旋转,再用预训练世界模型模拟未来视觉观测选轨迹,贡献PairUAV基准测试,实验表明DreamNav性能优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04276 2026-07-07 cs.CV 新提交 79%

EMPURPLE: A Free Lunch for Diffusion Distillation based on the Information Bottleneck

EMPURPLE:基于信息瓶颈的扩散蒸馏免费午餐

Zilai Li, Lujia Bai

机构 * University of Nottingham(诺丁汉大学) Ruhr University Bochum(波鸿鲁尔大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究扩散模型推理成本高问题。通过PAC-style泛化界分析原因,提出无需训练的EMPURPLE减少中间潜在分布不匹配,提升FID,该方法与模型无关,在多个模型上效果显著。

Comments 20 pages,2 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03803 2026-07-07 cs.CV cs.AI 新提交 79%

CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation

CineMobile:用于电影级相机运动生成的设备端图像到视频扩散

Xuyao Huang, Zelai Deng, Xu Wang, Xizhong Xiao, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Nankai University(南开大学) Transsion(传音)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对移动设备图像到视频创作需求,提出CineMobile。采用蒸馏引导剪枝、扩散蒸馏与强化学习优化及混合后训练量化策略,在保持视觉质量的同时大幅加速生成,证明其在移动图像到视频创作中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03770 2026-07-07 cs.CV cs.AI cs.LG 新提交 79%

Self-Improving Diffusion Classifiers with Minority Preference Optimization

通过少数偏好优化实现自我改进的扩散分类器

Hyunsoo Kim, Jungmyung Wi, Soobin Um, Donghyun Kim, Suhyun Kim

机构 * Korea University(韩国大学) Kook Min University(国民大学) Kyung Hee University(庆熙大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究发现扩散分类器感知偏向多数区域,提出MiPO方法,利用少数偏好奖励微调预训练扩散模型,无需额外图像数据等,经实验验证可缓解偏差并提升零样本扩散分类性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03696 2026-07-07 cs.CV 新提交 79%

IPDiff: Diffusion-driven ORSI Salient Object Detection with Information Reconstruction and Multi-Prior Guidance

IPDiff:基于信息重构和多先验引导的扩散驱动光学遥感图像显著目标检测

Gongyang Li, Zhen Bai, Runmin Cong, Dan Zeng, Weisi Lin, Xiao-Ping Zhang

机构 * School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) Department of Medical Equipment, the First Affiliated Hospital of Zhengzhou University(郑州大学第一附属医院医学装备部) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院) School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院) Shenzhen Key Laboratory of Ubiquitous Data Enabling, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院深圳泛在数据赋能重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出IPDiff,一种基于独特动态优化策略的扩散驱动光学遥感图像显著目标检测方法,通过提取多先验信息,在去噪网络中迭代去噪生成显著图,并经混合损失函数监督训练,性能优于46种先进方法。

Comments 22 pages, 8 figures, accepted by IJCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03568 2026-07-07 cs.CV cs.AI 新提交 79%

EPRA U-Net: An Efficient Pyramid Residual Attention Framework for Accurate Infarct Segmentation in Diffusion-Weighted MRI

EPRA U-Net:一种用于扩散加权磁共振成像中准确梗死分割的高效金字塔残差注意力框架

Hasan Ulutas, Muhammet Emin Sahin, Mustafa Fatih Erkoc, Esra Yuce, Turker Tuncer, Sengul Dogan, Serkan Kiranyaz

机构 * Yozgat Bozok University(亚兹加特博兹克大学) Izmir Bakircay University(伊兹米尔巴克伊大学) Queen Mary’s Digital Environment Research Institute (DERI)(皇后玛丽数字环境研究 institute (DERI)) Firat University(费拉特大学) Qatar University(卡塔尔大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究提出EPRA U-Net用于DWI图像梗死分割,用基于EfficientNet的编码器提取特征,集成多种模块并采用双注意力机制,用Tversky损失函数,实验表明其性能优于其他模型。

Comments 25 pages, 13 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03509 2026-07-07 cs.CV 新提交 79%

Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model

Flex-Forcing:迈向统一的自回归和双向视频扩散模型

Xinyin Ma, Julius Berner, Chao Liu, Arash Vahdat, Weili Nie, Xinchao Wang

机构 * NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对现有视频生成方法推理范式僵化的问题,提出Flex-Forcing框架。核心是灵活分块机制,可依设备预算灵活分块,跨块双向推理与块内自回归生成,实验表明该框架提升了视频质量、稳定性并加快推理速度。

Comments Project page: https://research.nvidia.com/labs/genair/flex-forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03422 2026-07-07 cs.CV 新提交 79%

Handwriting Trajectory Recovery with Diffusion Models

使用扩散模型进行手写轨迹恢复

Hiroki Nagamatsu, Shoji Toyota, Seiichi Uchida

机构 * Kyushu University(九州大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出首个基于扩散模型的框架用于从离线手写图像恢复在线笔轨迹,将其作为图像条件生成任务,用去噪扩散模型采样轨迹,实验验证该方法能准确恢复复杂多笔画字符,提升指标并具笔画顺序倾向及泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03103 2026-07-07 cs.CV cs.AI 新提交 79%

SNR-Adaptive Unified Diffusion for Multi-Task Medical Image Segmentation

用于多任务医学图像分割的信噪比自适应统一扩散

Jiahao Liu, Hang Wei, Shuai Wu

机构 * School of Telecommunications Engineering, Xidian University(西安电子科技大学通信工程学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究解决临床心脏成像模型冗余及知识共享问题,提出统一扩散分割框架UniT-Diff,通过特定机制化解冲突,在多基准测试中超越独立训练的特定任务基线。

Comments Accepted to IEEE SMC 2026. 6 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03012 2026-07-07 cs.CV cs.AI cs.LG 新提交 79%

HyperVAttention: Efficient Sparse Attention with Spatio-Temporal Clustering for Video Diffusion

HyperVAttention:用于视频扩散的具有时空聚类的高效稀疏注意力

Dongyeun Lee, Amir Zandieh, Vahab Mirrokni, Junmo Kim, Insu Han

机构 * KAIST(韩国科学技术院) Google Research(谷歌研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散中自注意力机制的二次复杂度问题,提出HyperVAttention框架,通过3D局部窗口聚类等方法解决聚类开销大及CTA利用率低的瓶颈,提升视频扩散中无训练稀疏注意力的质量和速度。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02968 2026-07-07 cs.CV 新提交 79%

Awakening Diffusion Transformers: Eliciting Stronger Generation and Understanding via Massive Activation Modulation

唤醒扩散变换器:通过大规模激活调制激发更强的生成和理解能力

Chaofan Gan, Zicheng Zhao, Yuanpeng Tu, Xi Chen, Ziran Qin, Tieyuan Chen, Supavadee Aramvith, Mehrtash Harandi, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Monash University(莫纳什大学) The University of Hong Kong(香港大学) Zhongguancun Academy(中关村科学城创新中心) Chulalongkorn University(朱拉隆功大学) City University of Hong Kong(香港城市大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究扩散变换器中大规模激活(MAs)的结构和功能,发现其空间分布及与AdaLN残差缩放因子的关系。基于此提出EMA框架,通过MA驱动的细节引导和MA调制的表征提取,提升生成和理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02643 2026-07-07 cs.CV 新提交 79%

BiSLW: Bi-Spectral Latent Watermarking for Generative Diffusion Models

BiSLW:用于生成扩散模型的双谱潜在水印

Aryan Pandit

机构 * PDPM Indian Institute of Information Technology, Jabalpur(印度信息技术学院(贾巴尔普尔))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对扩散生成模型易被非法使用且缺乏可靠溯源方法的问题,提出BiSLW框架,利用潜在空间频率结构在互补谱带嵌入身份信号,平衡感知保真度与鲁棒性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02038 2026-07-07 cs.CV 新提交 79%

Hierarchical Anti-Aesthetics: Protecting Facial Privacy against Customized Diffusion Models

分层反美学:保护面部隐私免受定制扩散模型侵害

Songping Wang, Yueming Lyu, Shiqi Liu, Chen Zhao, Ziyuan Chen, Ning Li, Jing Dong, Caifeng Shan

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) China Mobile Information Technology Co., Ltd.(中国移动信息科技有限公司) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Center for Research on Intelligent Perception and Computing (CRIPAC), Institute of Automation Chinese Academy of Sciences (CASIA)(多模态人工智能系统国家重点实验室(MAIS)、智能感知与计算研究中心(CRIPAC)、中国科学院自动化研究所(CASIA))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出分层反美学框架,通过全局和局部反美学奖励机制降低定制扩散模型的生成质量,从而保护面部隐私。

Comments arXiv admin note: text overlap with arXiv:2504.12129

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01983 2026-07-07 cs.CV cs.LG 新提交 79%

Open-Weather Robust 3D Detection via Dual-Critic Diffusion Alignment

基于双判别器扩散对齐的开放天气鲁棒3D检测

Shuyao Li, Chuanxing Geng, Heyang Sun, Qiang Zhou, Jingjing Gu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) MIIT Key Laboratory of Pattern Analysis and Machine Intelligence(工业和信息化部模式分析与机器智能重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出双判别器引导扩散对齐(DCDA)框架,通过4D雷达条件扩散过程恢复退化LiDAR特征,无需显式天气建模,在未见天气类型和强度下实现鲁棒3D检测。

Comments 18 pages, 6 figures, 8 tables. ECCV 2026 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20294 2026-07-07 cs.CV 版本更新 79%

Ctrl-Z Sampling: Scaling Diffusion Sampling with Controlled Random Zigzag Explorations

Ctrl-Z Sampling:通过受控随机zigzag探索扩展扩散采样

Shunqi Mao, Wei Guo, Chaoyi Zhang, Jieting Long, Ke Xie, Weidong Cai

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Ctrl-Z采样方法,通过检测质量景观中的高原并进行受控探索,提升扩散模型生成质量,在不同NFE预算下均表现优异。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16357 2026-07-07 cs.CV 版本更新 79%

GMODiff: One-Step Gain Map Refinement with Diffusion Priors for HDR Reconstruction

GMODiff:基于扩散先验的单步增益图优化用于高动态范围重建

Tao Hu, Weiyu Zhou, Yanjie Tu, Peng Wu, Wei Dong, Qingsen Yan, Yanning Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GMODiff,通过单步扩散框架优化增益图,提升多曝光HDR重建的动态范围和效率,实验表明其性能优于现有方法且速度提升100倍。

Comments This paper is accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04795 2026-07-07 cs.CV cs.AI 版本更新 79%

LAW & ORDER: Adaptive Spatial Weighting for Medical Diffusion and Segmentation

法律与秩序:医学扩散与分割的自适应空间加权

Anugunj Naman, Ayushman Singh, Gaibo Zhang, Yaguang Zhang

机构 * Elmore Family School of Electrical and Computer Engineering(埃尔莫尔电气与计算机工程学院) Purdue University(普渡大学) Sesame AI Department of Computer Science(计算机科学系) Department of Agricultural and Biological Engineering (ABE)(农业与生物工程系) Department of Agricultural Sciences Education and Communication (ASEC)(农业科学教育与交流系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究医学图像分析中自适应空间加权,通过两个适配器实现。LAW为掩码条件扩散学习像素损失权重,ORDER通过选择性双向跳跃注意力改进分割,在多个数据集上取得良好效果,证明该方法对医学扩散和分割的有效性。

Comments Accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10099 2026-07-07 cs.LG cs.CV 版本更新 79%

Learning on the Manifold: Unlocking Standard Diffusion Transformers with Representation Encoders

流形上的学习:通过表示编码器解锁标准扩散变压器

Amandeep Kumar, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究利用表示编码器进行生成建模时标准扩散变压器收敛失败的问题,指出根本原因是几何干扰,提出黎曼流匹配与雅可比正则化方法,使标准扩散变压器无需宽度缩放就能收敛。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏