arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86623 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70082 篇

2606.00689 2026-06-02 cs.CV 83%

Wavelet-Fusion Diffusion Model for Multimodal Brain MRI Synthesis with Modality and Metadata Conditioning

小波融合扩散模型用于多模态脑MRI合成,具有模态和元数据条件

Muhammad Nabi Yasinzai, Remika Mito, Mangor Pedersen

机构 * Department of Psychology & Neuroscience, Auckland University of Technology(心理学与神经科学系,奥克兰技术大学) Department of Psychiatry, University of Melbourne(精神病学系,墨尔本大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种小波融合扩散模型(WFDM),结合小波融合变分自编码器(WF-VAE)和条件3D U-Net扩散模型,通过显式模态和元数据条件实现多模态脑MRI合成,解决了数据集模态覆盖不均和异质性问题,在分布对齐上优于现有方法。

Comments 51 pages, 7 figures, including supplementary material. Submitted to Imaging Neuroscience

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00377 2026-06-02 cs.CV 83%

Score-Control for Hallucination Reduction in Diffusion Models

扩散模型中减少幻觉的分数控制

Mahesh Bhosale, Naresh Kumar Devulapally, Abdul Wasi, Chau Pham, Vishnu Suresh Lokhande, David Doermann

机构 * University at Buffalo(布法罗大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 针对扩散模型中的幻觉问题,提出基于方差引导的分数调制策略,通过控制分数雅可比矩阵减少幻觉,在保持高保真度和多样性的同时将幻觉降低约25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30987 2026-06-01 cs.CV 83%

Benchmarking Single-Step Inpainting Methods for Multi-Object 3D Gaussian Splatting Scenes

多对象3D高斯泼溅场景的单步修复方法基准测试

Finn Dröge, Cecilia Curreli, Abhishek Saroha, Daniel Cremers

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 扩散模型 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 针对3D高斯泼溅场景中的对象移除与修复任务,比较了2D修复器在3D一致性上的表现,发现基于重建的修复器优于生成扩散模型,且从头初始化场景比微调现有场景效果更好,同时引入了一个带真实数据的新多对象场景。

Comments Accepted as an extended abstract to the CVEU Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30332 2026-05-29 cs.CV 83%

Colored Noise Diffusion Sampling

有色噪声扩散采样

Hadar Davidson, Noam Issachar, Sagie Benaim

机构 * The Hebrew University of Jerusalem(希伯来大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对扩散模型生成过程中均匀白噪声注入的低效问题,提出一种无训练的有色噪声采样方法(CNS),通过动态频率依赖的噪声调度利用谱偏置,显著提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26064 2026-05-29 cs.CV cs.LG 83%

Paris 2.0: A Decentralized Diffusion Model for Video Generation

Paris 2.0: 一种去中心化的视频生成扩散模型

Ali Rouzbayani, Bidhan Roy, Marcos Villagra, Zhiying Jiang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出Paris 2.0,首个通过去中心化计算预训练的视频生成模型,基于Paris 1.0的扩散模型框架,在低分辨率文本到视频任务中相比集中式模型将FVD从561.04降至279.01,提升约2倍,并提高了CLIP文本-视频相似度和美学评分。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27607 2026-05-29 cs.CV cs.RO 83%

Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model

双流扩散用于世界模型增强的视觉-语言-动作模型

John Won, Kyungmin Lee, Huiwon Jang, Dongyoung Kim, Jinwoo Shin

机构 * Kim Jaechul Graduate School of AI, Korea Advanced Institute of Technology, Seoul, Republic of Korea(金 Jaechul 人工智能研究生院,韩国科学技术院,首尔,大韩民国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出DUST框架,通过双流扩散Transformer和异步采样方法,解决世界模型增强的视觉-语言-动作模型中的模态差距问题,在模拟和真实任务中取得显著性能提升。

Comments Accepted at ICML 2026. Project page at https://periphanes.github.io/dust (20 pages, 10 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20497 2026-05-28 cs.CV cs.AI 83%

LESA: Learnable Stage-Aware Predictors for Diffusion Model Acceleration

LESA: 可学习的阶段感知预测器用于扩散模型加速

Peiliang Cai, Jiacheng Liu, Haowen Xu, Xinyu Wang, Chang Zou, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对扩散模型计算开销大、现有缓存策略难以适应去噪过程阶段动态变化的问题,提出基于两阶段训练的可学习阶段感知预测器框架,利用KAN网络学习时序特征映射并采用多阶段多专家架构,在保持高质量生成的同时实现显著加速。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27235 2026-05-27 cs.CV 83%

MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale

MRT:用于大规模分层图像生成与编辑的掩码区域变换器

Zhicong Tang, Zhao Zhang, Jingye Chen, Mohan Zhou, Yifan Pu, Yuchi Liu, Yalong Bai, Ethan Smith, Yuhui Yuan

机构 * Canva Research(Canva研究院)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出MRT,一个200亿参数的掩码区域扩散模型,通过统一文本到层、图像到层和层到层任务,并引入溢出感知画布层,实现高效的多层透明图像生成与编辑。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05204 2026-05-27 cs.CV 83%

D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models

D-OPSD:用于连续调优步蒸馏扩散模型的在线自蒸馏方法

Dengyang Jiang, Xin Jin, Dongyang Liu, Zanyi Wang, Mingzhe Zheng, Ruoyi Du, Xiangpeng Yang, Qilong Wu, Zhen Li, Peng Gao, Harry Yang, Steven Hoi

机构 * The Hong Kong University of Science and Technology(香港科技大学) Z-Image Team, Alibaba Group(阿里集团Z-Image团队) University of California, San Diego(加州大学圣地亚哥分校) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出D-OPSD,一种在线自蒸馏训练范式,使步蒸馏扩散模型在监督微调中保持少步推理能力,通过让模型同时作为教师和学生,利用不同上下文条件(学生仅文本特征,教师多模态特征)最小化预测分布,学习新概念和风格而不牺牲原有少步能力。

Comments Project Page: https://vvvvvjdy.github.io/d-opsd/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03352 2026-05-27 cs.CV cs.AI cs.LG 83%

Inference-Time Search Using Side Information for Diffusion-Based Image Reconstruction

基于侧信息的推理时搜索用于扩散模型图像重建

Mahdi Farahbakhsh, Vishnu Teja Kunde, Dileep Kalathil, Krishna Narayanan, Jean-Francois Chamberland

机构 * Department of Electrical and Computer Engineering, Texas A&M University(电气与计算机工程系,德克萨斯A&M大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 提出一种即插即用、无需训练的推理时搜索框架,将侧信息融入现有扩散模型逆问题求解器,显著提升重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16870 2026-05-27 cs.CV cs.LG 83%

Align & Invert: Solving Inverse Problems with Diffusion and Flow-based Models via Representation Alignment

对齐与反转:通过表示对齐解决扩散和流模型中的逆问题

Loukas Sfountouris, Giannis Daras, Paris Giampouras

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 提出将扩散或流模型的内部表示与预训练自监督编码器(DINOv2)对齐(REPA),在推理时引导逆问题重建,显著提升重建质量和感知真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21167 2026-05-27 cs.LG cs.CV 83%

A Unified Framework for Diffusion Model Unlearning with f-Divergence

基于f-散度的扩散模型遗忘统一框架

Nicola Novello, Federico Fontana, Luigi Cinque, Deniz Gunduz, Andrea M. Tonello

机构 * University of Klagenfurt, Austria(克雷根福特大学) Sapienza University of Rome, Italy(罗马萨皮恩扎大学) Imperial College London, UK(伦敦帝国学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出一个基于f-散度的统一框架,将扩散模型概念遗忘中的MSE损失推广到任意f-散度,并通过理论分析和实验验证不同散度对遗忘效果的影响。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26032 2026-05-26 cs.CV cond-mat.stat-mech cs.AI cs.LG 83%

Everything at Every Scale: Scale-Invariant Diffusion with Continuous Super-Resolution

一切尺度:具有连续超分辨率的尺度不变扩散

Zixin Jessie Chen, Zhuo Chen, Archer Wang, Jeff Gore, William T. Freeman, Congyue Deng, Marin Soljačić

机构 * Department of Physics, Massachusetts Institute of Technology(麻省理工学院物理系) Department of EECS, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系) NSF AI Institute for Artificial Intelligence and Fundamental Interactions(国家科学基金会人工智能与基础相互作用研究所) Institute for Data, Systems and Society, Massachusetts Institute of Technology(麻省理工学院数据、系统与社会研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出SKILD模型,通过尺度不变扩散统一图像生成与连续超分辨率,仅改变起始时间步即可实现不同任务。

Comments 29 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25765 2026-05-26 cs.CV cs.AI cs.LG 83%

Concept Unlearning via Cross-Attention Activation Projection for Diffusion Models

通过交叉注意力激活投影实现扩散模型的概念遗忘

Saemi Moon, Suhyeon Jun, Seoyeon Lee, Dongwoo Kim

机构 * CSE, POSTECH(POSTECH计算机科学系) GSAI, POSTECH(POSTECH通用人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出PURE方法,利用交叉注意力激活空间构建遗忘和保留基,通过线性投影编辑权重,在保持保留概念的同时有效消除目标概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25022 2026-05-26 cs.CV cs.AI 83%

D3S2: Diffusion-Guided Dataset Distillation for Semantic Segmentation

D3S2: 扩散引导的语义分割数据集蒸馏

Wenjie Zheng, Haoji Hu, Jiali Lu, Xingze Zou, Jing Wang

机构 * Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对语义分割数据集蒸馏中的长尾类别不平衡、像素级对齐和高计算成本问题,提出两阶段框架D3S2,通过类别平衡掩码选择和扩散引导图像合成生成紧凑训练集,在极低压缩率下显著提升分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23902 2026-05-25 cs.CV 83%

PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion

PiD: 基于像素扩散的快速高分辨率潜解码

Yifan Lu, Qi Wu, Jay Zhangjie Wu, Zian Wang, Huan Ling, Sanja Fidler, Xuanchi Ren

机构 * NVIDIA

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出像素扩散解码器PiD,将潜解码重构为条件像素扩散,统一解码与上采样,实现低延迟高分辨率图像生成。

Comments Project Page: https://research.nvidia.com/labs/sil/projects/pid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22011 2026-05-22 cs.CV 83%

Rethinking Token Reduction for Diffusion Models via Output-Similarity-Awareness

重新思考扩散模型的token减少:通过输出相似性意识

Hangyeol Lee, Hyojeong Lee, Joo-Young Kim

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出DiTo,一种基于输出中心的token减少方法,通过利用相邻时间步的输出相似性来建立token对应关系,从而减少计算复杂度并提高生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01273 2026-05-21 cs.CV 83%

Q-DiT4SR: Exploration of Detail-Preserving Diffusion Transformer Quantization for Real-World Image Super-Resolution

Q-DiT4SR: 探索细节保留的扩散变换器量化以实现实景图像超分辨率

Xun Zhang, Kaicheng Yang, Hongliang Lu, Haotong Qin, Yong Guo, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei(华为)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Q-DiT4SR,一种专门针对基于扩散变换器的实现实景图像超分辨率的后训练量化框架,通过引入层次化SVD和变异性感知时空混合精度方法,在保持细节的同时实现高效的模型压缩和加速。

Comments Accepted to ICML 2026. Our code and models will be available at https://github.com/xunzhang1128/Q-DiT4SR

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23313 2026-05-21 cs.CV 83%

The Cow of Rembrandt - Analyzing Artistic Prompt Interpretation in Text-to-Image Models

伦勃朗的牛 - 分析文本到图像模型中艺术提示的解释

Alfio Ferrara, Sergio Picascia, Elisabetta Rocchetti

机构 * Department of Computer Science, Università degli Studi di Milano, Via Celoria, 18, 20133 Milan, Italy(米兰大学计算机科学系)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文研究了文本到图像扩散模型在生成艺术作品时如何解释内容和风格的概念,通过交叉注意力热图分析生成图像中像素与特定提示词的关联,揭示了不同艺术提示和风格下内容与风格分离的程度,为理解大规模生成模型内部如何表示复杂艺术概念提供了新见解。

Comments to be published in: Applications of AI in the Analysis of Cultural and Artistic Heritage, organized within the 35th IEEE International Workshop on Machine Learning for Signal Processing (MLSP) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20267 2026-05-21 cs.CV cs.AI 83%

Generation of Heterogeneous PET Images from Uniform Organ Activity Maps Using a Pretrained Domain-Adapted Diffusion Model

基于预训练域适应扩散模型生成异质性PET图像

Suya Li, Kaushik Dutta, Debojyoti Pal, Jingqin Luo, Kooresh I. Shoghi

机构 * Mallinckrodt Institute of Radiology, Washington University School of Medicine, St. Louis, USA(华盛顿大学医学院马林克罗德特放射医学研究所,圣路易斯,美国) Imaging Science Program, McKelvey School of Engineering, Washington University in St Louis, St. Louis, USA(华盛顿大学圣路易斯分校麦克雷高中工程学院成像科学计划,圣路易斯,美国) Department of Surgery, Washington University School of Medicine, St. Louis, USA(华盛顿大学医学院外科部,圣路易斯,美国) Department of Biomedical Engineering, Washington University in St Louis, St. Louis, USA(华盛顿大学圣路易斯分校生物医学工程部,圣路易斯,美国)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种预训练域适应扩散模型,用于从均匀器官活动图生成临床相关的异质性PET图像,通过两阶段训练策略提高合成图像的定量精度和肿瘤分割性能。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11688 2026-05-20 cs.LG cs.CV 83%

Hierarchical Schedule Optimization for Fast and Robust Diffusion Model Sampling

分层调度优化用于快速且稳健的扩散模型采样

Aihua Zhu, Rui Su, Qinglin Zhao, Li Feng, Meng Shen, Shibo He

机构 * School of Computer Science and Engineering, Macau University of Science and Technology(澳门科学技术大学计算机科学与工程学院) Beijing Institute of Technology(北京理工大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种分层调度优化方法,通过改进的双层优化框架,在极低的函数评估次数下实现高效的扩散模型采样,显著提升了样本质量和计算效率。

Comments Preprint, accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17759 2026-05-19 cs.CV 83%

FrequencyBooster: Full-Frequency Modeling for High-Fidelity Pixel Diffusion

FrequencyBooster: 高保真像素扩散的全频建模

Lichen Ma, Zipeng Guo, Yu He, Xiaolong Fu, Luohang Liu, Jingling Fu, Junshi Huang, Yan Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出FrequencyBooster,一种能够提升像素扩散模型全频建模能力的框架,通过高容量解码器提取高频细节和低频语义,从而在保持全局结构的同时实现更精确的像素生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06162 2026-05-19 cs.LG cs.CV 83%

Forget Many, Forget Right: Scalable and Precise Concept Unlearning in Diffusion Models

忘却众多,忘却正确:扩散模型中可扩展且精确的概念反学习

Kaiyuan Deng, Gen Li, Yang Xiao, Bo Hui, Xiaolong Ma

机构 * The University of Arizona(亚利桑那大学) Clemson University(克莱姆森大学) The University of Tulsa(塔尔萨大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种名为ScaPre的统一框架,用于在大规模扩散模型中实现精确的概念反学习,通过解决冲突更新、不精确机制和依赖额外数据的问题,提高了反学习的效率和精度。

Comments Accepted at ICLR 2026

Journal ref International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17294 2026-05-19 cs.CV 83%

HierEdit: Region-Aware Hierarchical Diffusion for Efficient High-Resolution Editing

HierEdit: 基于区域的分层扩散用于高效的高分辨率编辑

Yuyao Zhang, Alexander Huang-Menders, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出HierEdit,一种区域感知的分层扩散框架,用于高效可扩展的高分辨率图像编辑。通过低分辨率代理生成参考并定位修改区域,结合分层局部窗口扩散模型和推理加速机制,实现无需高分辨率训练数据的快速高保真编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16873 2026-05-19 cs.CV 83%

HAD: Hallucination-Aware Diffusion Priors for 3D Reconstruction

HAD:面向3D重建的幻觉感知扩散先验

Xi Liu, Weiwei Sun, Zhou Ren, Chris Broaddus, Siyu Huang, Laurent Guigues

机构 * Amazon AWS(亚马逊AWS) Clemson University(克莱姆森大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HAD,一种面向3D重建的幻觉感知扩散先验,通过利用预训练在大规模3D数据上的馈送式新视角合成(NVS)网络的多视角推理能力,估计增强图像的像素级幻觉分数图,从而在逐步3D重建过程中选择性地屏蔽不可靠像素,减少幻觉伪影,提升3D重建质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16861 2026-05-19 cs.CV cs.AI 83%

Prefix-Adaptive Block Diffusion for Efficient Document Recognition

前缀自适应块扩散用于高效的文档识别

Mingxu Chai, Ziyu Shen, Chenyu Liu, Kaidi Zhang, Jiazheng Zhang, Dingwei Zhu, Zhiheng Xi, Ruoyu Chen, Jun Long, Jihua Kang, Tao Gui, Qi Zhang

机构 * Computation and Artificial Intelligence Innovative College, Fudan University, Shanghai, China(复旦大学计算与人工智能创新学院,上海,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国) ByteDance, Shanghai, China(字节跳动,上海,中国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出前缀自适应块扩散模型(PA-BDM),通过改进块内去噪和缓存机制,提升文档识别的效率和准确性。

Comments 17pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17352 2026-05-19 cs.CV 83%

Alignment and Safety of Diffusion Models via Reinforcement Learning and Reward Modeling: A Survey

通过强化学习和奖励建模对扩散模型的对齐与安全性:综述

Preeti Lamba, Kiran Ravish, Ankita Kushwaha, Pawan Kumar

机构 * International Institute of Information Technology(国际信息科技学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文综述了通过强化学习、奖励建模等方法对文本到图像扩散模型进行对齐和安全性的最新进展,探讨了反馈来源、奖励信号形式、优化机制等五个维度,并提出了多目标对齐、反馈高效偏好学习等开放性挑战。

Comments 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15267 2026-05-18 cs.CV cs.AI cs.LG 83%

Autoguided Online Data Curation for Diffusion Model Training

自引导在线数据精炼用于扩散模型训练

Valeria Pais, Luis Oala, Daniele Faccio, Marco Aversa

机构 * University of Glasgow(格拉斯哥大学) Dotphoton

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文研究自引导和在线数据选择方法对扩散模型训练效率的影响,通过合成数据任务验证了自引导在样本质量和多样性上的优势。

Comments Accepted non-archival paper at ICCV 2025 Workshop on Curated Data for Efficient Learning (CDEL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15193 2026-05-15 cs.CV 83%

Aligning Latent Geometry for Spherical Flow Matching in Image Generation

在图像生成中利用球面流匹配对潜在几何进行对齐

Tuna Han Salih Meral, Kaan Oktay, Hidir Yesiltepe, Adil Kaan Akan, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学) fal(法尔)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出通过分解潜在标记为径向和角向成分,利用球面线性插值改进流匹配,使生成图像在不同分词器下提升FID评分,无需辅助编码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15055 2026-05-15 cs.LG cs.CV 83%

DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models

DiffusionOPD:扩散模型中在线策略蒸馏的统一视角

Quanhao Li, Junqiu Yu, Kaixun Jiang, Yujie Wei, Zhen Xing, Pandeng Li, Ruihang Chu, Shiwei Zhang, Yu Liu, Zuxuan Wu

机构 * Fudan University(复旦大学) Wan Team, Alibaba Group(阿里集团万团队)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出DiffusionOPD,通过在线策略蒸馏统一多任务训练,解决多任务优化中的交叉干扰和不平衡问题,理论推导出连续状态马尔可夫过程的KL目标,实验显示其在训练效率和性能上优于多奖励RL和级联RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏