arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2308.07605 2023-08-16 cs.CV cs.AI cs.MM 86%

SGDiff: A Style Guided Diffusion Model for Fashion Synthesis

Zhengwentai Sun, Yanghong Zhou, Honghong He, P. Y. Mok

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV、cs.MM

Comments Accepted by ACM MM'23

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.03099 2022-12-07 cs.CV cs.CL cs.MM 86%

Semantic-Conditional Diffusion Networks for Image Captioning

Jianjie Luo, Yehao Li, Yingwei Pan, Ting Yao, Jianlin Feng, Hongyang Chao, Tao Mei

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM

Comments Source code is available at \url{https://github.com/YehLi/xmodaler/tree/master/configs/image_caption/scdnet}

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11319 2022-11-22 cs.CV cs.AI cs.GR cs.LG 86%

VectorFusion: Text-to-SVG by Abstracting Pixel-Based Diffusion Models

Ajay Jain, Amber Xie, Pieter Abbeel

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV、cs.GR

Comments Project webpage: https://ajayj.com/vectorfusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15185 2025-03-18 cs.CV 86%

Tiled Diffusion

Or Madar, Ohad Fried

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments Please visit our website for more information and the code: https://madaror.github.io/tiled-diffusion.github.io/

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20971 2025-01-14 cs.LG cs.CV 86%

Amortizing intractable inference in diffusion models for vision, language, and control

Siddarth Venkatraman, Moksh Jain, Luca Scimeca, Minsu Kim, Marcin Sendera, Mohsin Hasan, Luke Rowe, Sarthak Mittal, Pablo Lemos, Emmanuel Bengio, Alexandre Adam, Jarrid Rector-Brooks, Yoshua Bengio, Glen Berseth, Nikolay Malkin

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments NeurIPS 2024; code: https://github.com/GFNOrg/diffusion-finetuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20474 2024-11-04 cs.CV 86%

GrounDiT: Grounding Diffusion Transformers via Noisy Patch Transplantation

Phillip Y. Lee, Taehoon Yoon, Minhyuk Sung

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2024. Project Page: https://groundit-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01954 2024-06-17 cs.CV 86%

Plug-and-Play Diffusion Distillation

Yi-Ting Hsiao, Siavash Khodadadeh, Kevin Duarte, Wei-An Lin, Hui Qu, Mingi Kwon, Ratheesh Kalarot

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2024 project page: https://5410tiffany.github.io/plug-and-play-diffusion-distillation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05135 2024-03-11 cs.CV 86%

ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment

Xiwei Hu, Rui Wang, Yixiao Fang, Bin Fu, Pei Cheng, Gang Yu

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Project Page: https://ella-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16203 2023-09-14 cs.LG cs.AI cs.CV cs.NE cs.RO 86%

Your Diffusion Model is Secretly a Zero-Shot Classifier

Alexander C. Li, Mihir Prabhudesai, Shivam Duggal, Ellis Brown, Deepak Pathak

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments In ICCV 2023. Website at https://diffusion-classifier.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14891 2023-07-04 cs.CV cs.LG eess.IV 86%

Fuzzy-Conditioned Diffusion and Diffusion Projection Attention Applied to Facial Image Correction

Majed El Helou

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

Comments Code available on https://github.com/majedelhelou/FC-Diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.04304 2023-06-09 cs.CV cs.LG 86%

Q-Diffusion: Quantizing Diffusion Models

Xiuyu Li, Yijiang Liu, Long Lian, Huanrui Yang, Zhen Dong, Daniel Kang, Shanghang Zhang, Kurt Keutzer

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments The code is available at https://github.com/Xiuyu-Li/q-diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16491 2026-08-18 physics.med-ph 版本更新 86%

Continuous 3-D Latent Diffusion for Medical Image Generation and Reconstruction

用于医学生成与重建的连续3D潜扩散

Youness Mellak, Antoine De Paepe, Dimitris Visvikis, Alexandre Bousse

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

AI总结 研究针对高分辨率三维医学扩散模型成本问题,提出连续3D潜扩散模型框架,核心是含特定解码器的紧凑自动编码器,经实验评估,该框架在计算效率、内存使用和重建效果间达平衡,能支持多种医学影像任务。

Comments 14 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21913 2026-07-24 physics.med-ph cs.AI 版本更新 86%

Equivariant Conditional Diffusion Model for Head and Neck CT Image Synthesis from CBCT

用于从CBCT合成头颈CT图像的等变条件扩散模型

Alzahra Altalib, Chunhui Li, Alessandro Perelli

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title)

AI总结 针对CBCT图像有伪影、CT图像难捕捉治疗中解剖变化的问题,提出EqDiff-CT模型,基于扩散概率模型和群等变条件U-Net主干,从CBCT合成高质量CT图像,经实验验证在多方面有显著提升,为CBCT改进提供框架。

Comments 43 pages, 9 figures, 6 tables, accepted in Medical Physics

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20424 2026-05-26 cs.CR 86%

Attacks on Approximate Caches in Text-to-Image Diffusion Models

文本到图像扩散模型中的近似缓存攻击

Desen Sun, Shuncheng Jie, Sihang Liu

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title)

AI总结 本文针对文本到图像扩散模型中的近似缓存优化,提出了远程隐蔽信道、提示词窃取和投毒三种攻击方法,揭示了其严重的安全漏洞。

Comments Accepted by Usenix Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00126 2026-05-04 cs.LG eess.SP stat.ML 86%

SPLICE: Latent Diffusion over JEPA Embeddings for Conformal Time-Series Inpainting

SPLICE:基于JEPA嵌入的潜在扩散模型用于置信时间序列修复

Arnaud Zinflou

机构 * Hydro-Québec Research Institute Canada(加拿大水电研究院)

专题命中 扩散模型 :inpainting(title,abstract);diffusion(title)

AI总结 SPLICE结合潜在生成修复与分布无关的在线自适应预测区间,通过JEPA编码器、条件潜在桥接和解码器实现时间序列修复,利用ACI保证预测覆盖,优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07786 2026-03-16 gr-qc astro-ph.HE astro-ph.IM 86%

Accelerating Black Hole Image Generation via Latent Space Diffusion Models

通过潜在空间扩散模型加速黑洞图像生成

Ao Liu, Xudong Zhang, Lin Ding, Cuihong Wen, Wentao Liu, Jieci Wang

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

AI总结 本文提出一种基于潜在空间的扩散模型,通过物理条件生成高保真黑洞图像,显著提升生成效率和图像质量,减少计算成本四倍以上。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01639 2026-03-06 cs.RO 86%

Vision-based Tactile Image Generation via Contact Condition-guided Diffusion Model

基于视觉的触觉图像生成 via 接触条件引导的扩散模型

Xi Lin, Weiliang Xu, Yixian Mao, Jing Wang, Meixuan Lv, Lu Liu, Xihui Luo, Xinming Li

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

AI总结 本文提出了一种接触条件引导的扩散模型,通过将物体RGB图像和接触力数据映射到高保真的触觉图像,有效降低了均方误差和标记位移误差,提升了触觉视觉传感器在复杂负载下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00992 2026-03-03 cs.LG 86%

Compensation-free Machine Unlearning in Text-to-Image Diffusion Models by Eliminating the Mutual Information

通过消除互信息实现无补偿的文本到图像扩散模型机器反学习

Xinwen Cheng, Jingyuan Zhang, Zhehao Huang, Yingwen Wu, Xiaolin Huang

机构 * Institute of Image Processing and Pattern Recognition(图像处理与模式识别研究所) School of Automation and Intelligent Sensing(自动化与智能感知学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title)

AI总结 本文提出无补偿的概念擦除方法MiM-MU,通过最小化互信息精准消除不需要的知识,从而在保持其他生成质量的同时无需事后补偿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03405 2026-02-06 quant-ph cs.LG 86%

Enhancing Quantum Diffusion Models for Complex Image Generation

增强量子扩散模型用于复杂图像生成

Jeongbin Jo, Santanam Wishal, Shah Md Khalil Ullah, Shan Zeng, Dikshant Dulal

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

AI总结 本文提出混合量子-经典U-Net架构,结合自适应非局部可观测量,以提升复杂图像生成的性能和可扩展性。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01294 2026-01-29 cs.SD cs.AI eess.AS 86%

Diffusion Timbre Transfer Via Mutual Information Guided Inpainting

通过互信息引导的修复生成进行扩散音色转移

Ching Ho Lee, Javier Nistal, Stefan Lattner, Marco Pasini, George Fazekas

机构 * Queen Mary University of London(伦敦玛丽女王大学) Sony Computer Science Laboratories(索尼计算机科学实验室)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title)

AI总结 本文提出通过互信息引导的修复生成方法,在无需额外训练的情况下实现音乐音频的音色转移,通过潜在空间噪声注入和早期步骤钳制机制,有效控制音色变化与结构保持的平衡。

Comments 5 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10655 2025-12-12 cs.AI 86%

CAPTAIN: Semantic Feature Injection for Memorization Mitigation in Text-to-Image Diffusion Models

CAPTAIN: 语义特征注入用于文本到图像扩散模型中的记忆抑制

Tong Zhang, Carlos Hinojosa, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title)

AI总结 CAPTAIN通过在去噪过程中直接修改潜在特征,有效减少文本到图像扩散模型的记忆问题,同时保持提示的保真度和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14163 2025-09-18 quant-ph cs.LG 86%

Quantum Reinforcement Learning-Guided Diffusion Model for Image Synthesis via Hybrid Quantum-Classical Generative Model Architectures

Chi-Sheng Chen, En-Jui Kuo

机构 * Independent Researcher Cambridge, USA(独立研究者 美国剑桥) Department of Electrophysics National Yang Ming Chiao Tung University Hsinchu, Taiwan(电子物理系 国立阳明交通大学 台北县)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09385 2025-08-14 cs.LG cs.AI 86%

Understanding Dementia Speech Alignment with Diffusion-Based Image Generation

Mansi, Anastasios Lepipas, Dominika Woszczyk, Yiying Guan, Soteris Demetriou

机构 * Imperial College London(帝国理工学院伦敦校区)

专题命中 扩散模型 :image generation(title);diffusion(title);text-to-image(abstract)

Comments Paper accepted at Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04208 2025-08-07 cs.CR 86%

DP-DocLDM: Differentially Private Document Image Generation using Latent Diffusion Models

Saifullah Saifullah, Stefan Agne, Andreas Dengel, Sheraz Ahmed

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

Comments Accepted in ICDAR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06482 2025-07-21 cs.LG 86%

FedDifRC: Unlocking the Potential of Text-to-Image Diffusion Models in Heterogeneous Federated Learning

Huan Wang, Haoran Li, Huaming Chen, Jun Yan, Jiahua Shi, Jun Shen

机构 * School of Computing and Information Technology, University of Wollongong, Wollongong, Australia(新南威尔士大学计算机与信息科技学院) School of Electrical and Computer Engineering, The University of Sydney, Sydney, Australia(悉尼大学电子与计算机工程学院) QLD Alliance for Agriculture and Food Innovation, The University of Queensland, Brisbane, Australia(昆士兰大学昆士兰农业与食品创新联盟)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title)

Comments 11 Pages, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10255 2025-01-30 cond-mat.stat-mech math.PR 86%

Convergence properties of Markov models for image generation with applications to spin-flip dynamics and to diffusion processes

Cecile Monthus

专题命中 扩散模型 :image generation(title,abstract);diffusion(title)

Comments v2= revised version with new sections on illustrative examples (28 pages)

Journal ref J. Stat. Mech. (2025) 013213

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12236 2024-08-23 cs.AI 86%

MedDiT: A Knowledge-Controlled Diffusion Transformer Framework for Dynamic Medical Image Generation in Virtual Simulated Patient

Yanzeng Li, Cheng Zeng, Jinchao Zhang, Jie Zhou, Lei Zou

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02649 2023-11-08 physics.med-ph 86%

CBCT-Based Synthetic CT Image Generation Using Conditional Denoising Diffusion Probabilistic Model

Junbo Peng, Richard L. J. Qiu, Jacob F Wynne, Chih-Wei Chang, Shaoyan Pan, Tonghe Wang, Justin Roper, Tian Liu, Pretesh R. Patel, David S. Yu, Xiaofeng Yang

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23102 2026-08-25 cs.CV cs.IR 新提交 85%

Training-Free Pseudo-Fusion for Composed Image Retrieval with Diffusion Models and Multimodal Large Language Models

无需训练的伪融合:基于扩散模型和多模态大语言模型的组合图像检索

Fan Xu, Luis A. Leiva

机构 * University of Luxembourg(卢森堡大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出无需训练的PeFuse伪融合框架,结合扩散模型与多模态大语言模型,将组合图像检索转化为单模态检索任务,在零样本场景下实现了媲美当前最优方法的性能。

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20334 2026-08-24 cs.CV 版本更新 85%

Exploring the Performance Frontier of Compact Unified Image Generation Models

Swift-Image:探索紧凑统一图像生成模型的性能前沿

Taihang Hu, Zhao Wang, Zuan Gao, Tao Liu, Hao Yan, Zhengze Xu, Yuhang Yu, Yongchao Du, Xingjian Wang, Jun Zheng, Qinye Zhou, Yaqi Cai, Zhengrui Chen, Chao Lin, Yefeng Shen, Yuan Wang, Zhengtao Wu, Ge Wu, Xiaoli Xu, Denghui Yang, Huayu Zhang, Mingzhou Zhang, Mengting Chen

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 本研究提出紧凑统一图像生成模型Swift-Image,采用6B单流DiT等技术,实现领先综合性能,压缩后3B模型无明显损失,还总结了相关实用经验。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏