arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86585 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70051 篇

2506.10605 2025-09-08 cs.CV 89%

High-resolution efficient image generation from WiFi CSI using a pretrained latent diffusion model

Eshan Ramesh, Takayuki Nishio

机构 * School of Engineering, Institute of Science Tokyo(东京科学研究所工程学院)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06151 2025-08-11 cs.LG cs.CV 89%

Improving Diagnostic Accuracy for Oral Cancer with inpainting Synthesis Lesions Generated Using Diffusion Models

Yong Oh Lee, JeeEun Kim, Jung Woo Lee

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13708 2025-07-24 cs.CV 89%

PoemTale Diffusion: Minimising Information Loss in Poem to Image Generation with Multi-Stage Prompt Refinement

Sofia Jamil, Bollampalli Areen Reddy, Raghvendra Kumar, Sriparna Saha, Koustava Goswami, K. J. Joseph

机构 * Department of Computer Science \& Engineering, Indian Institute of Technology Patna, India Adobe Research

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16154 2025-07-23 cs.CV cs.AI 89%

LSSGen: Leveraging Latent Space Scaling in Flow and Diffusion for Efficient Text to Image Generation

Jyun-Ze Tang, Chih-Fan Hsu, Jeng-Lin Li, Ming-Ching Chang, Wei-Chao Chen

机构 * Inventec Corporation(英威达公司) University at Albany, State University of New York(纽约州立大学阿尔巴尼分校)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments ICCV AIGENS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09102 2025-07-15 cs.CV 89%

Harnessing Text-to-Image Diffusion Models for Point Cloud Self-Supervised Learning

Yiyang Chen, Shanshan Zhao, Lunhao Duan, Changxing Ding, Dacheng Tao

机构 * South China University of Technology(华南理工大学) Alibaba International Digital Commerce Group(阿里巴巴国际数字商务集团) Pazhou Lab(琶洲实验室) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02713 2025-07-08 cs.CV 89%

UniMC: Taming Diffusion Transformer for Unified Keypoint-Guided Multi-Class Image Generation

Qin Guo, Ailing Zeng, Dongxu Yue, Ceyuan Yang, Yang Cao, Hanzhong Guo, Fei Shen, Wei Liu, Xihui Liu, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Tencent(腾讯) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02714 2025-07-04 cs.CV cs.AI 89%

FairHuman: Boosting Hand and Face Quality in Human Image Generation with Minimum Potential Delay Fairness in Diffusion Models

Yuxuan Wang, Tianwei Cao, Huayu Zhang, Zhongjiang He, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18999 2025-06-25 cs.CV 89%

Diffusion Transformer-to-Mamba Distillation for High-Resolution Image Generation

Yuan Yao, Yicong Hong, Difan Liu, Long Mai, Feng Liu, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) Adobe Research(Adobe研究)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14284 2025-05-07 cs.CV 89%

Paragraph-to-Image Generation with Information-Enriched Diffusion Model

Weijia Wu, Zhuang Li, Yefei He, Mike Zheng Shou, Chunhua Shen, Lele Cheng, Yan Li, Tingting Gao, Di Zhang

机构 * Kuaishou Technology(快手科技) Zhejiang University(浙江大学) Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments The project website is at: https://weijiawu.github.io/ParaDiffusionPage/. Code: https://github.com/weijiawu/ParaDiffusion

Journal ref IJCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05594 2025-04-09 cs.CV 89%

Tuning-Free Image Editing with Fidelity and Editability via Unified Latent Diffusion Model

Qi Mao, Lan Chen, Yuchao Gu, Mike Zheng Shou, Ming-Hsuan Yang

专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);text-to-image(abstract);分类 cs.CV

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18830 2025-04-08 cs.CV 89%

Multi-Scale Diffusion: Enhancing Spatial Layout in High-Resolution Panoramic Image Generation

Xiaoyu Zhang, Teng Zhou, Xinlong Zhang, Jia Wei, Yongchuan Tang

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00289 2025-04-03 cs.CV cs.AI cs.LG 89%

Dual Diffusion for Unified Image Generation and Understanding

Zijie Li, Henry Li, Yichun Shi, Amir Barati Farimani, Yuval Kluger, Linjie Yang, Peng Wang

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13985 2025-03-28 cs.CV cs.AI cs.LG 89%

DefectFill: Realistic Defect Generation with Inpainting Diffusion Model for Visual Inspection

Jaewoo Song, Daemin Park, Kanghyun Baek, Sangyub Lee, Jooyoung Choi, Eunji Kim, Sungroh Yoon

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);image generation(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16969 2025-03-26 cs.CV 89%

ZoomLDM: Latent Diffusion Model for multi-scale image generation

Srikar Yellapragada, Alexandros Graikos, Kostas Triaridis, Prateek Prasanna, Rajarsi R. Gupta, Joel Saltz, Dimitris Samaras

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12271 2025-03-18 cs.CV 89%

Reflect-DiT: Inference-Time Scaling for Text-to-Image Diffusion Transformers via In-Context Reflection

Shufan Li, Konstantinos Kallidromitis, Akash Gokul, Arsh Koneru, Yusuke Kato, Kazuki Kozuka, Aditya Grover

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10618 2025-03-18 cs.CV 89%

DiT-Air: Revisiting the Efficiency of Diffusion Model Architecture Design in Text to Image Generation

Chen Chen, Rui Qian, Wenze Hu, Tsu-Jui Fu, Jialing Tong, Xinze Wang, Lezhi Li, Bowen Zhang, Alex Schwing, Wei Liu, Yinfei Yang

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05149 2025-03-10 cs.CV cs.AI 89%

Development and Enhancement of Text-to-Image Diffusion Models

Rajdeep Roshan Sahu

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01243 2025-03-06 cs.CV cs.AI 89%

Schedule On the Fly: Diffusion Time Prediction for Faster and Better Image Generation

Zilyu Ye, Zhiyang Chen, Tiancheng Li, Zemin Huang, Weijian Luo, Guo-Jun Qi

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15368 2025-01-24 cs.CV 89%

Flow-Guided Diffusion for Video Inpainting

Bohai Gu, Yongsheng Yu, Heng Fan, Libo Zhang

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);image generation(abstract);分类 cs.CV

Comments This paper has been withdrawn as a new iteration of the work has been developed, which includes significant improvements and refinements based on this submission. The withdrawal is made to ensure academic integrity and compliance with publication standards. If you are interested, please refer to the updated work at arXiv:2412.00857

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05839 2025-01-13 cs.CV 89%

Poetry in Pixels: Prompt Tuning for Poem Image Generation via Diffusion Models

Sofia Jamil, Bollampalli Areen Reddy, Raghvendra Kumar, Sriparna Saha, K J Joseph, Koustava Goswami

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18791 2024-12-30 cs.CV 89%

Protective Perturbations against Unauthorized Data Usage in Diffusion-based Image Generation

Sen Peng, Jijia Yang, Mingyue Wang, Jianfei He, Xiaohua Jia

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03349 2024-12-12 cs.CV cs.LG 89%

Image Inpainting via Tractable Steering of Diffusion Models

Anji Liu, Mathias Niepert, Guy Van den Broeck

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10686 2024-11-19 cs.CV cs.LG 89%

MaskMedPaint: Masked Medical Image Inpainting with Diffusion Models for Mitigation of Spurious Correlations

Qixuan Jin, Walter Gerych, Marzyeh Ghassemi

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Findings paper presented at Machine Learning for Health (ML4H) symposium 2024, December 15-16, 2024, Vancouver, Canada, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11001 2024-11-19 cs.CV 89%

MegaFusion: Extend Diffusion Models towards Higher-resolution Image Generation without Further Tuning

Haoning Wu, Shaocheng Shen, Qiang Hu, Xiaoyun Zhang, Ya Zhang, Yanfeng Wang

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted by WACV 2025. Project Page: https://haoningwu3639.github.io/MegaFusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07126 2024-11-12 cs.CV cs.LG 89%

Edify Image: High-Quality Image Generation with Pixel Space Laplacian Diffusion Models

NVIDIA, :, Yuval Atzmon, Maciej Bala, Yogesh Balaji, Tiffany Cai, Yin Cui, Jiaojiao Fan, Yunhao Ge, Siddharth Gururani, Jacob Huffman, Ronald Isaac, Pooya Jannaty, Tero Karras, Grace Lam, J. P. Lewis, Aaron Licata, Yen-Chen Lin, Ming-Yu Liu, Qianli Ma, Arun Mallya, Ashlee Martino-Tarr, Doug Mendez, Seungjun Nah, Chris Pruett, Fitsum Reda, Jiaming Song, Ting-Chun Wang, Fangyin Wei, Xiaohui Zeng, Yu Zeng, Qinsheng Zhang

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03286 2024-11-08 cs.CV 89%

DiT4Edit: Diffusion Transformer for Image Editing

Kunyu Feng, Yue Ma, Bingyuan Wang, Chenyang Qi, Haozhe Chen, Qifeng Chen, Zeyu Wang

专题命中 扩散模型 :diffusion(title,abstract);image editing(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03739 2024-11-08 cs.CV cs.AI cs.LG cs.RO 89%

Aligning Text-to-Image Diffusion Models with Reward Backpropagation

Mihir Prabhudesai, Anirudh Goyal, Deepak Pathak, Katerina Fragkiadaki

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments This paper is subsumed by a later paper of ours: arXiv:2407.08737

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03595 2024-11-07 cs.MM 89%

Investigating Conceptual Blending of a Diffusion Model for Improving Nonword-to-Image Generation

Chihaya Matsuhira, Marc A. Kastner, Takahiro Komamizu, Takatsugu Hirayama, Ichiro Ide

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.MM

Comments Paper accepted at ACM MM 2024 (doi: 10.1145/3664647.3681202) with supplementary materials concatenated

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16840 2024-10-23 cs.CV 89%

MPDS: A Movie Posters Dataset for Image Generation with Diffusion Model

Meng Xu, Tong Zhang, Fuyun Wang, Yi Lei, Xin Liu, Zhen Cui

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12908 2024-10-15 cs.CV cs.AI cs.LG 89%

RealCompo: Balancing Realism and Compositionality Improves Text-to-Image Diffusion Models

Xinchen Zhang, Ling Yang, Yaqi Cai, Zhaochen Yu, Kai-Ni Wang, Jiake Xie, Ye Tian, Minkai Xu, Yong Tang, Yujiu Yang, Bin Cui

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments NeurIPS 2024. Project: https://github.com/YangLing0818/RealCompo

详情

展开后加载摘要…

URL PDF HTML 收藏