arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86623 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70082 篇

2407.17911 2024-07-26 cs.MM cs.AI cs.CV 86%

ReCorD: Reasoning and Correcting Diffusion for HOI Generation

Jian-Yu Jiang-Lin, Kang-Yang Huang, Ling Lo, Yi-Ning Huang, Terence Lin, Jhih-Ciang Wu, Hong-Han Shuai, Wen-Huang Cheng

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM

Comments Accepted by ACM MM 2024. Project website: https://alberthkyhky.github.io/ReCorD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10316 2024-05-17 cs.CV cs.GR 86%

Analogist: Out-of-the-box Visual In-Context Learning with Image Diffusion Model

Zheng Gu, Shiyuan Yang, Jing Liao, Jing Huo, Yang Gao

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);inpainting(abstract);分类 cs.CV、cs.GR

Comments Project page: https://analogist2d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.12422 2024-05-07 cs.CV cs.GR cs.LG 86%

DreamTime: An Improved Optimization Strategy for Diffusion-Guided 3D Generation

Yukun Huang, Jianan Wang, Yukai Shi, Boshi Tang, Xianbiao Qi, Lei Zhang

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV、cs.GR

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16225 2023-12-08 cs.GR cs.CV 86%

ProSpect: Prompt Spectrum for Attribute-Aware Personalization of Diffusion Models

Yuxin Zhang, Weiming Dong, Fan Tang, Nisha Huang, Haibin Huang, Chongyang Ma, Tong-Yee Lee, Oliver Deussen, Changsheng Xu

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01409 2023-12-05 cs.CV cs.AI cs.GR 86%

Generative Rendering: Controllable 4D-Guided Video Generation with 2D Diffusion Models

Shengqu Cai, Duygu Ceylan, Matheus Gadelha, Chun-Hao Paul Huang, Tuanfeng Yang Wang, Gordon Wetzstein

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.GR

Comments Project page: https://primecai.github.io/generative_rendering/

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.00398 2023-09-08 cs.CV cs.MM 86%

VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation

Xin Li, Wenqing Chu, Ye Wu, Weihang Yuan, Fanglong Liu, Qi Zhang, Fu Li, Haocheng Feng, Errui Ding, Jingdong Wang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM

Comments 8pages, 8figures, project page: https://videogen.github.io/VideoGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07605 2023-08-16 cs.CV cs.AI cs.MM 86%

SGDiff: A Style Guided Diffusion Model for Fashion Synthesis

Zhengwentai Sun, Yanghong Zhou, Honghong He, P. Y. Mok

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV、cs.MM

Comments Accepted by ACM MM'23

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.03099 2022-12-07 cs.CV cs.CL cs.MM 86%

Semantic-Conditional Diffusion Networks for Image Captioning

Jianjie Luo, Yehao Li, Yingwei Pan, Ting Yao, Jianlin Feng, Hongyang Chao, Tao Mei

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM

Comments Source code is available at \url{https://github.com/YehLi/xmodaler/tree/master/configs/image_caption/scdnet}

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11319 2022-11-22 cs.CV cs.AI cs.GR cs.LG 86%

VectorFusion: Text-to-SVG by Abstracting Pixel-Based Diffusion Models

Ajay Jain, Amber Xie, Pieter Abbeel

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV、cs.GR

Comments Project webpage: https://ajayj.com/vectorfusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15185 2025-03-18 cs.CV 86%

Tiled Diffusion

Or Madar, Ohad Fried

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments Please visit our website for more information and the code: https://madaror.github.io/tiled-diffusion.github.io/

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20971 2025-01-14 cs.LG cs.CV 86%

Amortizing intractable inference in diffusion models for vision, language, and control

Siddarth Venkatraman, Moksh Jain, Luca Scimeca, Minsu Kim, Marcin Sendera, Mohsin Hasan, Luke Rowe, Sarthak Mittal, Pablo Lemos, Emmanuel Bengio, Alexandre Adam, Jarrid Rector-Brooks, Yoshua Bengio, Glen Berseth, Nikolay Malkin

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments NeurIPS 2024; code: https://github.com/GFNOrg/diffusion-finetuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20474 2024-11-04 cs.CV 86%

GrounDiT: Grounding Diffusion Transformers via Noisy Patch Transplantation

Phillip Y. Lee, Taehoon Yoon, Minhyuk Sung

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2024. Project Page: https://groundit-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01954 2024-06-17 cs.CV 86%

Plug-and-Play Diffusion Distillation

Yi-Ting Hsiao, Siavash Khodadadeh, Kevin Duarte, Wei-An Lin, Hui Qu, Mingi Kwon, Ratheesh Kalarot

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2024 project page: https://5410tiffany.github.io/plug-and-play-diffusion-distillation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05135 2024-03-11 cs.CV 86%

ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment

Xiwei Hu, Rui Wang, Yixiao Fang, Bin Fu, Pei Cheng, Gang Yu

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Project Page: https://ella-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16203 2023-09-14 cs.LG cs.AI cs.CV cs.NE cs.RO 86%

Your Diffusion Model is Secretly a Zero-Shot Classifier

Alexander C. Li, Mihir Prabhudesai, Shivam Duggal, Ellis Brown, Deepak Pathak

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments In ICCV 2023. Website at https://diffusion-classifier.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14891 2023-07-04 cs.CV cs.LG eess.IV 86%

Fuzzy-Conditioned Diffusion and Diffusion Projection Attention Applied to Facial Image Correction

Majed El Helou

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

Comments Code available on https://github.com/majedelhelou/FC-Diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.04304 2023-06-09 cs.CV cs.LG 86%

Q-Diffusion: Quantizing Diffusion Models

Xiuyu Li, Yijiang Liu, Long Lian, Huanrui Yang, Zhen Dong, Daniel Kang, Shanghang Zhang, Kurt Keutzer

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments The code is available at https://github.com/Xiuyu-Li/q-diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16491 2026-08-18 physics.med-ph 版本更新 86%

Continuous 3-D Latent Diffusion for Medical Image Generation and Reconstruction

用于医学生成与重建的连续3D潜扩散

Youness Mellak, Antoine De Paepe, Dimitris Visvikis, Alexandre Bousse

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

AI总结 研究针对高分辨率三维医学扩散模型成本问题,提出连续3D潜扩散模型框架,核心是含特定解码器的紧凑自动编码器,经实验评估,该框架在计算效率、内存使用和重建效果间达平衡,能支持多种医学影像任务。

Comments 14 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21913 2026-07-24 physics.med-ph cs.AI 版本更新 86%

Equivariant Conditional Diffusion Model for Head and Neck CT Image Synthesis from CBCT

用于从CBCT合成头颈CT图像的等变条件扩散模型

Alzahra Altalib, Chunhui Li, Alessandro Perelli

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title)

AI总结 针对CBCT图像有伪影、CT图像难捕捉治疗中解剖变化的问题,提出EqDiff-CT模型,基于扩散概率模型和群等变条件U-Net主干,从CBCT合成高质量CT图像,经实验验证在多方面有显著提升,为CBCT改进提供框架。

Comments 43 pages, 9 figures, 6 tables, accepted in Medical Physics

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20424 2026-05-26 cs.CR 86%

Attacks on Approximate Caches in Text-to-Image Diffusion Models

文本到图像扩散模型中的近似缓存攻击

Desen Sun, Shuncheng Jie, Sihang Liu

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title)

AI总结 本文针对文本到图像扩散模型中的近似缓存优化,提出了远程隐蔽信道、提示词窃取和投毒三种攻击方法,揭示了其严重的安全漏洞。

Comments Accepted by Usenix Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00126 2026-05-04 cs.LG eess.SP stat.ML 86%

SPLICE: Latent Diffusion over JEPA Embeddings for Conformal Time-Series Inpainting

SPLICE:基于JEPA嵌入的潜在扩散模型用于置信时间序列修复

Arnaud Zinflou

机构 * Hydro-Québec Research Institute Canada(加拿大水电研究院)

专题命中 扩散模型 :inpainting(title,abstract);diffusion(title)

AI总结 SPLICE结合潜在生成修复与分布无关的在线自适应预测区间,通过JEPA编码器、条件潜在桥接和解码器实现时间序列修复,利用ACI保证预测覆盖,优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07786 2026-03-16 gr-qc astro-ph.HE astro-ph.IM 86%

Accelerating Black Hole Image Generation via Latent Space Diffusion Models

通过潜在空间扩散模型加速黑洞图像生成

Ao Liu, Xudong Zhang, Lin Ding, Cuihong Wen, Wentao Liu, Jieci Wang

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

AI总结 本文提出一种基于潜在空间的扩散模型,通过物理条件生成高保真黑洞图像,显著提升生成效率和图像质量,减少计算成本四倍以上。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01639 2026-03-06 cs.RO 86%

Vision-based Tactile Image Generation via Contact Condition-guided Diffusion Model

基于视觉的触觉图像生成 via 接触条件引导的扩散模型

Xi Lin, Weiliang Xu, Yixian Mao, Jing Wang, Meixuan Lv, Lu Liu, Xihui Luo, Xinming Li

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

AI总结 本文提出了一种接触条件引导的扩散模型,通过将物体RGB图像和接触力数据映射到高保真的触觉图像,有效降低了均方误差和标记位移误差,提升了触觉视觉传感器在复杂负载下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00992 2026-03-03 cs.LG 86%

Compensation-free Machine Unlearning in Text-to-Image Diffusion Models by Eliminating the Mutual Information

通过消除互信息实现无补偿的文本到图像扩散模型机器反学习

Xinwen Cheng, Jingyuan Zhang, Zhehao Huang, Yingwen Wu, Xiaolin Huang

机构 * Institute of Image Processing and Pattern Recognition(图像处理与模式识别研究所) School of Automation and Intelligent Sensing(自动化与智能感知学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title)

AI总结 本文提出无补偿的概念擦除方法MiM-MU,通过最小化互信息精准消除不需要的知识,从而在保持其他生成质量的同时无需事后补偿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03405 2026-02-06 quant-ph cs.LG 86%

Enhancing Quantum Diffusion Models for Complex Image Generation

增强量子扩散模型用于复杂图像生成

Jeongbin Jo, Santanam Wishal, Shah Md Khalil Ullah, Shan Zeng, Dikshant Dulal

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

AI总结 本文提出混合量子-经典U-Net架构,结合自适应非局部可观测量,以提升复杂图像生成的性能和可扩展性。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01294 2026-01-29 cs.SD cs.AI eess.AS 86%

Diffusion Timbre Transfer Via Mutual Information Guided Inpainting

通过互信息引导的修复生成进行扩散音色转移

Ching Ho Lee, Javier Nistal, Stefan Lattner, Marco Pasini, George Fazekas

机构 * Queen Mary University of London(伦敦玛丽女王大学) Sony Computer Science Laboratories(索尼计算机科学实验室)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title)

AI总结 本文提出通过互信息引导的修复生成方法,在无需额外训练的情况下实现音乐音频的音色转移,通过潜在空间噪声注入和早期步骤钳制机制,有效控制音色变化与结构保持的平衡。

Comments 5 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10655 2025-12-12 cs.AI 86%

CAPTAIN: Semantic Feature Injection for Memorization Mitigation in Text-to-Image Diffusion Models

CAPTAIN: 语义特征注入用于文本到图像扩散模型中的记忆抑制

Tong Zhang, Carlos Hinojosa, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title)

AI总结 CAPTAIN通过在去噪过程中直接修改潜在特征,有效减少文本到图像扩散模型的记忆问题,同时保持提示的保真度和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14163 2025-09-18 quant-ph cs.LG 86%

Quantum Reinforcement Learning-Guided Diffusion Model for Image Synthesis via Hybrid Quantum-Classical Generative Model Architectures

Chi-Sheng Chen, En-Jui Kuo

机构 * Independent Researcher Cambridge, USA(独立研究者 美国剑桥) Department of Electrophysics National Yang Ming Chiao Tung University Hsinchu, Taiwan(电子物理系 国立阳明交通大学 台北县)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09385 2025-08-14 cs.LG cs.AI 86%

Understanding Dementia Speech Alignment with Diffusion-Based Image Generation

Mansi, Anastasios Lepipas, Dominika Woszczyk, Yiying Guan, Soteris Demetriou

机构 * Imperial College London(帝国理工学院伦敦校区)

专题命中 扩散模型 :image generation(title);diffusion(title);text-to-image(abstract)

Comments Paper accepted at Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04208 2025-08-07 cs.CR 86%

DP-DocLDM: Differentially Private Document Image Generation using Latent Diffusion Models

Saifullah Saifullah, Stefan Agne, Andreas Dengel, Sheraz Ahmed

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

Comments Accepted in ICDAR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏