arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86714 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2506.07986 2025-07-24 cs.CV 83%

Rethinking Cross-Modal Interaction in Multimodal Diffusion Transformers

Zhengyao Lv, Tianlin Pan, Chenyang Si, Zhaoxi Chen, Wangmeng Zuo, Ziwei Liu, Kwan-Yee K. Wong

机构 * The University of Hong Kong(香港大学) Nanjing University(南京大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted by ICCV 2025; Project Page: https://vchitect.github.io/TACA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16579 2025-07-23 eess.IV cs.AI cs.CV 83%

Pyramid Hierarchical Masked Diffusion Model for Imaging Synthesis

Xiaojiao Xiao, Qinmin Vivian Hu, Guanghui Wang

机构 * Department of Computer Science(计算机科学系) Toronto Metropolitan University(多伦多 Metropolitan 大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01738 2025-07-23 cs.CV cs.AI 83%

VitaGlyph: Vitalizing Artistic Typography with Flexible Dual-branch Diffusion Models

Kailai Feng, Yabo Zhang, Haodong Yu, Zhilong Ji, Jinfeng Bai, Hongzhi Zhang, Wangmeng Zuo

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments https://github.com/Carlofkl/VitaGlyph

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15361 2025-07-22 eess.IV cs.AI cs.CV 83%

Latent Space Synergy: Text-Guided Data Augmentation for Direct Diffusion Biomedical Segmentation

Muhammad Aqeel, Maham Nazir, Zanxi Ruan, Francesco Setti

机构 * Dept. of Engineering for Innovation Medicine, University of Verona(创新医学工程系,威尼斯大学) Department of Computer Science, Beihang University(计算机科学系,北航大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

Comments Accepted to CVGMMI Workshop at ICIAP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15216 2025-07-22 cs.CV 83%

Improving Joint Embedding Predictive Architecture with Diffusion Noise

Yuping Qiu, Rui Zhu, Ying-cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14797 2025-07-22 cs.CV 83%

Distilling Parallel Gradients for Fast ODE Solvers of Diffusion Models

Beier Zhu, Ruoyu Wang, Tong Zhao, Hanwang Zhang, Chi Zhang

机构 * Nanyang Technological University(南洋理工大学) Westlake University(西湖大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

Comments To appear in ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14575 2025-07-22 cs.CV cs.AI 83%

Benchmarking GANs, Diffusion Models, and Flow Matching for T1w-to-T2w MRI Translation

Andrea Moschetto, Lemuel Puglisi, Alec Sargood, Pierluigi Dell'Acqua, Francesco Guarnera, Sebastiano Battiato, Daniele Ravì

机构 * Università degli Studi di Catania(卡塔尼亚大学) Università degli Studi di Messina(梅斯纳大学) University College London(伦敦大学学院)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12170 2025-07-21 cs.RO cs.CV 83%

DiffAD: A Unified Diffusion Modeling Approach for Autonomous Driving

Tao Wang, Cong Zhang, Xingguang Qu, Kun Li, Weiwei Liu, Chang Huang

机构 * Carizon Beihang University(北航大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments 8 pages, 6 figures; Code released

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06848 2025-07-21 cs.LG cs.CL cs.CV 83%

A General Framework for Inference-time Scaling and Steering of Diffusion Models

Raghav Singhal, Zachary Horvitz, Ryan Teehan, Mengye Ren, Zhou Yu, Kathleen McKeown, Rajesh Ranganath

机构 * Department of Computer Science, New York University(纽约大学计算机科学系) Columbia University(哥伦比亚大学) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12933 2025-07-18 cs.CV cs.AI cs.LG 83%

DMQ: Dissecting Outliers of Diffusion Models for Post-Training Quantization

Dongyeun Lee, Jiwan Hur, Hyounguk Shon, Jae Young Lee, Junmo Kim

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03558 2025-07-18 cs.CV 83%

MIDI: Multi-Instance Diffusion for Single Image to 3D Scene Generation

Zehuan Huang, Yuan-Chen Guo, Xingqiao An, Yunhan Yang, Yangguang Li, Zi-Xin Zou, Ding Liang, Xihui Liu, Yan-Pei Cao, Lu Sheng

机构 * Beihang University(北京航空航天大学) VAST Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Project page: https://huanngzh.github.io/MIDI-Page/

Journal ref Proceedings of the Computer Vision and Pattern Recognition Conference (CVPR), 2025, pp. 23646 - 23657

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09502 2025-07-18 cs.LG cs.CV 83%

Golden Noise for Diffusion Models: A Learning Framework

Zikai Zhou, Shitong Shao, Lichen Bai, Shufei Zhang, Zhiqiang Xu, Bo Han, Zeke Xie

机构 * HKUST-GZ(香港科技大学-广州) Shanghai AI Lab(上海人工智能实验室) MBZUAI(穆罕默德·本·拉希德人工智能学院) HKBU(香港都会大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10745 2025-07-17 cs.CV 83%

Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition

Jeonghyeok Do, Munchurl Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments ICCV 2025 (camera-ready version). Please visit our project page at https://kaist-viclab.github.io/TDSM_site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04692 2025-07-15 cs.CV 83%

Structure-Guided Diffusion Models for High-Fidelity Portrait Shadow Removal

Wanchang Yu, Qing Zhang, Rongjia Zheng, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部人工智能与先进计算重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

Comments Accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07878 2025-07-14 cs.CV 83%

Single-Step Latent Diffusion for Underwater Image Restoration

Jiayi Wu, Tianfu Wang, Md Abu Bakr Siddique, Md Jahidul Islam, Cornelia Fermuller, Yiannis Aloimonos, Christopher A. Metzler

机构 * University of Maryland(马里兰大学) University of Florida(佛罗里达大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07104 2025-07-14 cs.CV 83%

Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models

Tiezheng Zhang, Yitong Li, Yu-cheng Chou, Jieneng Chen, Alan Yuille, Chen Wei, Junfei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Tsinghua University(清华大学) Rice University(Rice 大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Project Page: https://lambert-x.github.io/Vision-Language-Vision/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07591 2025-07-11 cs.CV 83%

Stable-Hair v2: Real-World Hair Transfer via Multiple-View Diffusion Model

Kuiyuan Sun, Yuxuan Zhang, Jichao Zhang, Jiaming Liu, Wei Wang, Niculae Sebe, Yao Zhao

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) School of Computer Science, Ocean University of China(中国海洋大学计算机学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Artificial Intelligence department, Tiamat AI(Tiamat AI人工智能部门) Department of Information Engineering and Computer Science (DISI), University of Trento(特伦托大学信息工程与计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09932 2025-07-11 cs.CV cs.AI 83%

HadaNorm: Diffusion Transformer Quantization through Mean-Centered Transformations

Marco Federici, Riccardo Del Chiaro, Boris van Breugel, Paul Whatmough, Markus Nagel

机构 * Qualcomm(高通)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments 8 Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07106 2025-07-10 cs.CV cs.LG 83%

Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor

Vatsal Agarwal, Matthew Gwilliam, Gefen Kohavi, Eshan Verma, Daniel Ulbricht, Abhinav Shrivastava

机构 * University of Maryland(马里兰大学) Apple(苹果公司)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Website: see https://vatsalag99.github.io/mustafar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17660 2025-07-09 cs.CV 83%

OMR-Diffusion:Optimizing Multi-Round Enhanced Training in Diffusion Models for Improved Intent Understanding

Kun Li, Jianhui Wang, Miao Zhang, Xueqian Wang

机构 * Xiamen University(厦门大学) University of Electronic Science and Technology of China(电子科技大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Xidian University(西安电子科技大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09277 2025-07-09 cs.CV cs.AI 83%

UniCombine: Unified Multi-Conditional Combination with Diffusion Transformer

Haoxuan Wang, Jinlong Peng, Qingdong He, Hao Yang, Ying Jin, Jiafu Wu, Xiaobin Hu, Yanjie Pan, Zhenye Gan, Mingmin Chi, Bo Peng, Yabiao Wang

机构 * Fudan University(复旦大学) Tencent Youtu Lab(腾讯优图实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Ocean University(上海海洋大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15098 2025-07-08 cs.CV cs.AI cs.LG 83%

OminiControl: Minimal and Universal Control for Diffusion Transformer

Zhenxiong Tan, Songhua Liu, Xingyi Yang, Qiaochu Xue, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03953 2025-07-08 cs.CV cs.AI 83%

Evaluating Adversarial Protections for Diffusion Personalization: A Comprehensive Study

Kai Ye, Tianyi Chen, Zhen Wang

机构 * School of Cyberspace, Hangzhou Dianzi University, Hangzhou, China(信息空间学院,杭州电子大学,杭州,中国) Microsoft, Redmond, USA(微软,美国西雅图)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Accepted to the 2nd Workshop on Reliable and Responsible Foundation Models (R2-FM 2025) at ICML. 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23580 2025-07-08 cs.CV 83%

DiT4SR: Taming Diffusion Transformer for Real-World Image Super-Resolution

Zheng-Peng Duan, Jiawei Zhang, Xin Jin, Ziheng Zhang, Zheng Xiong, Dongqing Zou, Jimmy S. Ren, Chun-Le Guo, Chongyi Li

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) SenseTime Research(商汤科技研究院) Hong Kong Metropolitan University(香港 Metropolitan 大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17377 2025-07-08 cs.CV cs.AI cs.LG 83%

Self-Rectifying Diffusion Sampling with Perturbed-Attention Guidance

Donghoon Ahn, Hyoungwon Cho, Jaewon Min, Wooseok Jang, Jungwoo Kim, SeonHwa Kim, Hyun Hee Park, Kyong Hwan Jin, Seungryong Kim

机构 * Korea University(韩国大学) Samsung Electronics(三星电子)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

Comments Project page is available at https://ku-cvlab.github.io/Perturbed-Attention-Guidance. This version reflects the ECCV 2024 camera-ready submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05520 2025-07-08 cs.CV cs.AI cs.CL 83%

From Pampas to Pixels: Fine-Tuning Diffusion Models for Gaúcho Heritage

Marcellus Amadeus, William Alberto Cruz Castañeda, André Felipe Zanella, Felipe Rodrigues Perche Mahlow

机构 * Alana AI Research(阿尔纳人工智能研究)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00772 2025-07-02 cs.CV 83%

Unsupervised contrastive analysis for anomaly detection in brain MRIs via conditional diffusion models

Cristiano Patrício, Carlo Alberto Barbano, Attilio Fiandrotti, Riccardo Renzulli, Marco Grangetto, Luis F. Teixeira, João C. Neves

机构 * University of Turin(都灵大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Under consideration at Pattern Recognition Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23731 2025-07-01 cs.LG cs.CV 83%

Radioactive Watermarks in Diffusion and Autoregressive Image Generative Models

Michel Meintz, Jan Dubiński, Franziska Boenisch, Adam Dziedzic

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心) Warsaw University of Technology(华沙技术大学) NASK-National Research Institute(国家研究机构)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23466 2025-07-01 eess.IV cs.CV physics.med-ph 83%

FD-DiT: Frequency Domain-Directed Diffusion Transformer for Low-Dose CT Reconstruction

Qiqing Liu, Guoquan Wei, Zekun Zhou, Yiyang Wen, Liu Shi, Qiegen Liu

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments 11pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23460 2025-07-01 cs.CV 83%

Contrastive Learning with Diffusion Features for Weakly Supervised Medical Image Segmentation

Dewen Zeng, Xinrong Hu, Yu-Jen Chen, Yawen Wu, Xiaowei Xu, Yiyu Shi

机构 * University of Notre Dame(诺丁汉大学) National Tsing Hua University(国立清华大学) Guangdong Provincial People’s Hospital(广东省人民医院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏