arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86623 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70082 篇

2510.21783 2026-04-20 cs.CV cs.AI cs.CR 85%

Noise Aggregation Analysis Driven by Small-Noise Injection: Efficient Membership Inference for Diffusion Models

由小噪声注入驱动的噪声聚合分析:扩散模型的高效成员推断

Guo Li, Weihong Chen, Yongfu Fan

机构 * South China University of Technology(华南理工大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出基于噪声聚合分析的成员推断方法,通过单步低强度噪声注入策略增强成员与非成员样本差异,降低模型查询需求并提升推断效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10675 2026-04-14 cs.CV 85%

HiddenObjects: Scalable Diffusion-Distilled Spatial Priors for Object Placement

HiddenObjects: 用于物体放置的可扩展扩散-蒸馏空间先验

Marco Schouten, Ioannis Siglidis, Serge Belongie, Dim P. Papadopoulos

机构 * Technical University of Denmark(丹麦技术大学) University of Copenhagen(哥本哈根大学) Pioneer Centre for AI(人工智能先锋中心)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出通过扩散模型蒸馏学习显式的类别条件空间先验,用于自然场景中的物体放置。通过自动化框架构建大规模数据集,实验表明其优于人类标注和现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06338 2026-04-07 cs.AI cs.CV cs.LG 85%

Circuit Mechanisms for Spatial Relation Generation in Diffusion Transformers

扩散变换器中空间关系生成的电路机制

Binxu Wang, Jingxuan Fan, Xu Pan

机构 * Kempner Institute, Harvard University(哈佛大学肯普纳研究所) Harvard University(哈佛大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究通过机械可解释性方法探讨扩散变换器如何生成正确空间关系,发现不同文本编码器影响电路机制,随机嵌入通过双阶段电路生成,预训练编码器则通过信息融合生成,两种方法在领域内表现相似但抗扰性不同。

Comments 45 pages, 30 figures, accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26834 2026-03-31 eess.IV cs.AI cs.CV 85%

Hybrid Diffusion Model for Breast Ultrasound Image Augmentation

混合扩散模型用于乳腺超声图像增强

Farhan Fuad Abir, Sanjeda Sara Jennifer, Niloofar Yousefi, Laura J. Brattain

机构 * University of Central Florida(中佛罗里达大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出混合扩散框架,结合文本生成与图像精修提升超声图像真实性,通过LoRA和文本倒置优化,降低FID值,提升分类性能。

Comments Accepted at IEEE International Symposium on Biomedical Imaging (ISBI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18425 2026-03-30 cs.CV cs.AI cs.LG 85%

U-Sketch: An Efficient Approach for Sketch to Image Diffusion Models

U-Sketch:一种高效的从草图到图像扩散模型方法

Ilias Mitsouras, Eleftherios Tsonis, Paraskevi Tzouveli, Athanasios Voulodimos

机构 * Artificial Intelligence and Learning Systems Laboratory(人工智能与学习系统实验室) School of Electrical and Computer Engineering(电气与计算机工程学院) National Technical University of Athens(雅典国立技术大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 U-Sketch通过引入U-Net类型的潜在边缘预测器和草图简化网络,提升草图到图像合成的效率与真实度,减少去噪步骤并提升生成质量。

Journal ref IEEE Access 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23903 2026-03-26 cs.CV cs.AI 85%

Latent Bias Alignment for High-Fidelity Diffusion Inversion in Real-World Image Reconstruction and Manipulation

潜在偏置对齐用于高保真扩散倒置在现实世界图像重建与操控中的应用

Weiming Chen, Qifan Liu, Siyi Liu, Yushun Tang, Yijia Wang, Zhihan Zhu, Zhihai He

机构 * Department of Electrical and Electronic Engineering, Southern University of Science and Technology(南方科技大学电子与电气工程系) Undergraduate School of Artificial Intelligence, Shenzhen Polytechnic University(深圳理工大学人工智能本科生学院) Huawei Technologies Co., Ltd.(华为技术有限公司) Pengcheng Lab(鹏城实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出Latent Bias Optimization和Image Latent Boosting方法,解决扩散模型与现实场景衔接中的重建质量与鲁棒性问题,提升图像编辑和稀有概念生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22275 2026-03-24 cs.CV 85%

Repurposing Geometric Foundation Models for Multi-view Diffusion

将几何基础模型重新利用于多视图扩散

Wooseok Jang, Seonghu Jeon, Jisang Han, Jinhyeok Choi, Minkyung Kwon, Seungryong Kim, Saining Xie, Sainan Liu

机构 * KAIST AI(韩国科学技术院人工智能实验室) New York University(纽约大学) Intel Labs(英特尔实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Geometric Latent Diffusion框架,利用几何一致的特征空间作为多视图扩散的潜在空间,提升多视角生成的几何一致性和图像质量。

Comments project website: https://cvlab-kaist.github.io/GLD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19158 2026-03-20 cs.CV 85%

Adaptive Auxiliary Prompt Blending for Target-Faithful Diffusion Generation

自适应辅助提示融合用于目标忠实的扩散生成

Kwanyoung Lee, SeungJu Cha, Yebin Ahn, Hyunwoo Oh, Sungho Koh, Dong-Jin Kim

机构 * Hanyang University(翰阳大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出自适应辅助提示融合框架,通过辅助锚点提示在低密度区域稳定扩散过程,提升目标提示的忠实性与生成质量。

Comments Accepted in CVPR 2026 (main track). 10 pages, 6 figures; supplementary material included (14 pages, 11 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19917 2026-03-17 cs.CV 85%

Scale Where It Matters: Training-Free Localized Scaling for Diffusion Models

在关键区域进行扩展:无需训练的扩散模型局部化扩展

Qin Ren, Yufei Wang, Lanqing Guo, Wen Zhang, Zhiwen Fan, Chenyu You

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出LoTTS,一种无需训练的局部化测试时扩展方法,通过局部重采样缺陷区域提升图像质量并减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14062 2026-03-17 cs.CV cs.LG 85%

TMPDiff: Temporal Mixed-Precision for Diffusion Models

TMPDiff:扩散模型的时序混合精度

Basile Lewandowski, Simon Kurz, Aditya Shankar, Robert Birke, Jian-Jia Chen, Lydia Y. Chen

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 TMPDiff通过为不同去噪时间步分配不同精度,优化扩散模型的推理效率,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06300 2026-03-09 cs.CV cs.LG 85%

3D CBCT Artefact Removal Using Perpendicular Score-Based Diffusion Models

使用垂直分数扩散模型进行3D锥束CT伪影去除

Susanne Schaub, Florentin Bieder, Matheus L. Oliveira, Yulan Wang, Dorothea Dagassan-Berndt, Michael M. Bornstein, Philippe C. Cattin

机构 * Department of Biomedical Engineering, University of Basel, Allschwil, Switzerland Piracicaba Dental School, University of Campinas, Piracicaba, Brazil State Key Laboratory of Oral \& Maxillofacial Reconstruction Regeneration, Key Laboratory of Oral Biomedicine Ministry of Education, Hubei Key Laboratory of Stomatology, School \& Hospital of Stomatology, Wuhan University, Wuhan, China Dental Imaging, University Center for Dental Medicine, University of Basel, Basel, Switzerland Department of Oral Health \& Medicine, University Center for Dental Medicine, University of Basel, Basel, Switzerland

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出基于垂直分数扩散模型的3D牙科植入物修复方法,通过结合两个2D模型在投影域中操作,有效减少CBCT图像伪影,提升临床成像质量。

Comments Accepted at DGM4MICCAI 2025

Journal ref Lecture Notes in Computer Science, vol. 16128, Springer, 2025, pp. 244-253

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03973 2026-03-05 cs.LG cs.CV 85%

Dual-Solver: A Generalized ODE Solver for Diffusion Models with Dual Prediction

Dual-Solver: 一种用于扩散模型的通用微分方程求解器,具有双预测功能

Soochul Park, Yeon Ju Lee

机构 * SteAI MODULABS Korea University(韩国大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 Dual-Solver通过可学习参数泛化多步采样器,提高扩散模型在低NFE下的生成质量。

Comments Published as a conference paper at ICLR 2026. 36 pages, 18 figures

Journal ref Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08184 2026-03-05 cs.CV 85%

Scaling Laws For Diffusion Transformers

扩散变换器的扩展定律

Zhengyang Liang, Hao He, Ceyuan Yang, Bo Dai

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文研究了扩散变换器的扩展定律,通过实验验证了模型大小、数据需求与计算预算之间的幂律关系,并展示了预训练损失与生成性能的一致性,为模型性能和数据质量评估提供了可预测的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06547 2026-03-03 cs.CV cs.LG 85%

Concept-TRAK: Understanding how diffusion models learn concepts through concept-level attribution

Concept-TRAK: 通过概念层面的归因理解扩散模型如何学习概念

Yonghyun Park, Chieh-Hsin Lai, Satoshi Hayakawa, Yuhta Takida, Naoki Murata, Wei-Hsiang Liao, Woosung Choi, Kin Wai Cheuk, Junghyun Koo, Yuki Mitsufuji

机构 * University of Pennsylvania(宾夕法尼亚大学) SONY AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 Concept-TRAK通过概念层面归因方法,提升扩散模型对特定概念的解释能力,适用于图像生成中的版权与透明性问题。

Comments This paper has been accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01068 2026-03-03 cs.CV cs.LG 85%

LLaDA-o: An Effective and Length-Adaptive Omni Diffusion Model

LLaDA-o:一种高效且长度自适应的多模态扩散模型

Zebin You, Xiaolu Zhang, Jun Zhou, Chongxuan Li, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China.(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models(北京大型模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索工程研究中心)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 LLaDA-o通过混合扩散框架和数据驱动的长度适应策略,实现了高效且灵活的多模态扩散建模,展示了在文本到图像生成任务中的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25162 2026-02-24 cs.CV 85%

AlignTok: Aligning Visual Foundation Encoders to Tokenizers for Diffusion Models

AlignTok: 将预训练视觉编码器对齐到分词器以用于扩散模型

Bowei Chen, Sai Bi, Hao Tan, He Zhang, Tianyuan Zhang, Zhengqi Li, Yuanjun Xiong, Jianming Zhang, Kai Zhang

机构 * University of Washington(华盛顿大学) Adobe Research(Adobe研究)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 AlignTok通过将预训练视觉编码器对齐为分词器,提升扩散模型的生成质量和收敛速度,适用于图像生成任务。

Comments ICLR 2026, Project Page: https://aligntok.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11875 2026-02-13 cs.CV cs.RO 85%

DiffPlace: Street View Generation via Place-Controllable Diffusion Model Enhancing Place Recognition

DiffPlace: 通过可控制位置的扩散模型增强位置识别生成街道视图

Ji Li, Zhiwei Li, Shihao Li, Zhenjiang Yu, Boyang Wang, Haiou Liu

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 DiffPlace通过引入位置ID控制器,实现了位置可控的多视角图像生成,提升了视觉位置识别任务中的生成质量和训练支持。

Comments accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09268 2026-02-11 cs.CV 85%

Rethinking Global Text Conditioning in Diffusion Transformers

重新思考扩散变换器中的全局文本条件化

Nikita Starodubcev, Daniil Pakhomov, Zongze Wu, Ilya Drobyshevskiy, Yuchen Liu, Zhonghao Wang, Yuqian Zhou, Zhe Lin, Dmitry Baranchuk

机构 * Yandex Research(Yandex研究院) Adobe Research(Adobe研究院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 本文重新思考扩散变换器中的全局文本条件化,发现传统调制机制贡献有限,但通过不同视角使用池化嵌入可带来显著性能提升。

Comments Accepted at ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08486 2026-02-11 cs.CV 85%

Temporal Concept Dynamics in Diffusion Models via Prompt-Conditioned Interventions

通过提示条件干预研究扩散模型中的时间概念动态

Ada Gorgun, Fawaz Sammani, Nikos Deligiannis, Bernt Schiele, Jonas Fischer

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) ETRO Department, Vrije Universiteit Brussel and imec(ETRO部门,布鲁塞尔自由大学和imec)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 通过提示条件干预研究扩散模型中概念随时间动态的变化,揭示不同阶段对特定概念的适应性,提升文本驱动图像编辑的效果。

Comments Accepted at the International Conference on Learning Representations 2026 (ICLR 2026). Code is available at: https://adagorgun.github.io/PCI-Project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08249 2026-02-10 eess.IV cs.CV 85%

A Unified Framework for Multimodal Image Reconstruction and Synthesis using Denoising Diffusion Models

基于去噪扩散模型的多模态图像重建与合成统一框架

Weijie Gan, Xucheng Wang, Tongyao Wang, Wenshang Wang, Chunwei Ying, Yuyang Hu, Yasheng Chen, Hongyu An, Ulugbek S. Kamilov

机构 * Department of Computer Science and Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校计算机科学与工程系) Mallinckrodt Institute of Radiology, Washington University in St. Louis(华盛顿大学圣路易斯分校马林克罗德特放射医学研究所) Department of Electrical and Systems Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校电气与系统工程系) Department of Neurology, Washington University in St. Louis(华盛顿大学圣路易斯分校神经病学系) Department of Biomedical Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校生物医学工程系) Division of Biology and Biomedical Sciences, Washington University in St. Louis(华盛顿大学圣路易斯分校生物学与生物医学科学 division) Department of Electrical and Computer Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校电气与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

AI总结 Any2all通过统一框架实现多模态图像重建与合成,利用去噪扩散模型提升性能与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06825 2026-02-09 cs.LG cs.AI cs.CV 85%

AEGPO: Adaptive Entropy-Guided Policy Optimization for Diffusion Models

AEGPO:适应性熵引导策略优化用于扩散模型

Yuming Li, Qingyu Li, Chengyu Bai, Xiangyang Luo, Zeyue Xue, Wenyu Qin, Meng Wang, Yikai Wang, Shanghang Zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The University of Hong Kong(香港大学) Beijing Normal University(北京师范大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 AEGPO通过双信号双层自适应优化提升扩散模型策略优化效率,实现更高效的收敛和更好的对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26096 2026-02-04 cs.CV cs.IT cs.LG math.IT math.OC stat.ML 85%

EVODiff: Entropy-aware Variance Optimized Diffusion Inference

EVODiff: 基于熵的方差优化扩散推理

Shigui Li, Wei Chen, Delu Zeng

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 EVODiff通过优化条件熵减少不确定性,提升扩散模型的推理效率和生成质量。

Comments NeurIPS 2025, 41 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12203 2026-02-04 cs.CV 85%

LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence

LazyDrag: 通过显式对应关系在多模态扩散变换器上实现稳定的拖拽编辑

Zixin Yin, Xili Dai, Duomin Wang, Xianfang Zeng, Lionel M. Ni, Gang Yu, Heung-Yeung Shum

机构 * The Hong Kong University of Science and Technology(香港科技大学) StepFun The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

AI总结 LazyDrag通过显式对应关系实现多模态扩散变换器的稳定拖拽编辑,消除了隐式点匹配依赖,提升生成能力与精确控制。

Comments https://zxyin.github.io/LazyDrag

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16660 2026-01-26 eess.IV cs.CV cs.LG 85%

Fast, faithful and photorealistic diffusion-based image super-resolution with enhanced Flow Map models

快速、忠实且逼真基于扩散的图像超分辨率与增强的流图模型

Maxence Noble, Gonzalo Iñaki Quintana, Benjamin Aubin, Clément Chadebec

机构 * Jasper Research(Jasper研究机构) CMAP, CNRS, Ecole polytechnique(CMAP、CNRS、巴黎高等师范学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出FlowMapSR,一种基于扩散的图像超分辨率框架,通过增强流图模型和对抗微调提升效率和逼真度,实现高 fidelity 和快速推理。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16060 2026-01-23 cs.CV 85%

ProGiDiff: Prompt-Guided Diffusion-Based Medical Image Segmentation

ProGiDiff: 基于提示引导的扩散模型医学图像分割

Yuan Lin, Murong Xu, Marc Hölle, Chinmay Prabhakar, Andreas Maier, Vasileios Belagiannis, Bjoern Menze, Suprosanna Shit

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) University of Zurich(苏黎世大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 ProGiDiff通过提示引导的扩散模型实现医学图像分割,结合自定义编码器和多类条件化机制,提升分割性能和跨模态适应能力。

Comments 5 pages, 4 figures. It has been accepted by IEEE ISBI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15473 2026-01-23 cs.CV cs.LG eess.IV 85%

Emergence and Evolution of Interpretable Concepts in Diffusion Models

扩散模型中可解释概念的涌现与演化

Berk Tinaz, Zalan Fabian, Mahdi Soltanolkotabi

机构 * Dept. of Electrical and Computer Engineering University of Southern California(电气与计算机工程系 美国南加州大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究利用SAEs框架揭示扩散模型中可解释概念的涌现与演化,发现早期阶段可控制图像组成,中间阶段确定组成,后期仅能改变细节。

Comments 32 pages, 32 figures, published at the 39th Conference on Neural Information Processing Systems (NeurIPS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12283 2026-01-21 cs.CV 85%

SDiT: Semantic Region-Adaptive for Diffusion Transformers

SDiT:语义区域自适应的扩散变换器

Bowen Lin, Fanjiang Ye, Yihua Liu, Zhenghui Guo, Boyuan Zhang, Weijian Zheng, Yufan Xu, Tiancheng Xing, Yuke Wang, Chengming Zhang

机构 * University of Houston(德克萨斯大学奥斯汀分校) Rice University(里奇大学) Indiana University Bloomington(印第安纳大学布卢明顿分校) Argonne National Laboratory(阿贡国家实验室) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 SDiT通过语义区域自适应技术,在不重新训练模型的情况下,实现去噪加速,同时保持高质量的图像生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06803 2026-01-15 cs.CV 85%

DyDiT++: Diffusion Transformers with Timestep and Spatial Dynamics for Efficient Visual Generation

DyDiT++: 带时间步和空间动态的扩散变换器用于高效的视觉生成

Wangbo Zhao, Yizeng Han, Jiasheng Tang, Kai Wang, Hao Luo, Yibing Song, Gao Huang, Fan Wang, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎扑实验室) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 DyDiT++通过动态调整时间步和空间计算,提升视觉生成效率,减少计算成本并拓展应用范围。

Comments This paper was accepted to the IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) on January 9, 2026. arXiv admin note: substantial text overlap with arXiv:2410.03456

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12318 2026-01-07 cs.CV cs.AI cs.LG 85%

Compositional Discrete Latent Code for High Fidelity, Productive Diffusion Models

组合式离散潜在代码用于高保真、高效的扩散模型

Samuel Lavoie, Michael Noukhovitch, Aaron Courville

机构 * Mila, Université de Montréal(蒙特利尔大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出离散潜在代码(DLC)以提升扩散模型的生成保真度,通过组合性实现分布外样本生成,并展示其在图像生成和文本到图像生成中的应用。

Comments Published at NeurIPS, 22 pages, 7 tables, 12 figures, code and models available

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15465 2026-01-05 cs.CV 85%

FP4DiT: Towards Effective Floating Point Quantization for Diffusion Transformers

FP4DiT: 向有效浮点量化扩散变换器迈进

Ruichen Chen, Keith G. Mills, Di Niu

机构 * Department of Electrical and Computer Engineering, Faculty of Engineering University of Alberta(电气与计算机工程系,工程学院,阿尔伯塔大学) Division of Computer Science and Engineering, College of Engineering Louisiana State University(计算机科学与工程系,工程学院,路易斯安那州立大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 FP4DiT通过浮点量化技术实现更高效的扩散变换器量化,提升图像生成性能。

Comments The code is available at https://github.com/cccrrrccc/FP4DiT

详情

展开后加载摘要…

URL PDF HTML 收藏