arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2505.20723 2025-05-28 cs.CV cs.LG 83%

LeDiFlow: Learned Distribution-guided Flow Matching to Accelerate Image Generation

Pascal Zwick, Nils Friederich, Maximilian Beichter, Lennart Hilbert, Ralf Mikut, Oliver Bringmann

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07538 2025-05-28 cs.CV 83%

Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning

Bohan Wang, Zhongqi Yue, Fengda Zhang, Shuo Chen, Li'an Bi, Junzhe Zhang, Xue Song, Kennard Yanting Chan, Jiachun Pan, Weijia Wu, Mingze Zhou, Wang Lin, Kaihang Pan, Saining Zhang, Liyu Jia, Wentao Hu, Wei Zhao, Hanwang Zhang

机构 * Selftok Team(Selftok团队) Media Technology Institute(媒体技术研究所) Huawei(华为)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06814 2025-05-27 cs.LG cs.AI cs.GR 83%

Diffusion Instruction Tuning

Chen Jin, Ryutaro Tanno, Amrutha Saseendran, Tom Diethe, Philip Teare

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.GR

Comments Project page at https://astrazeneca.github.io/vlm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18358 2025-05-27 cs.CV 83%

CONCORD: Concept-Informed Diffusion for Dataset Distillation

Jianyang Gu, Haonan Wang, Ruoxi Jia, Saeed Vahidian, Vyacheslav Kungurtsev, Wei Jiang, Yiran Chen

机构 * The Ohio State University(俄亥俄州立大学) National University of Singapore(新加坡国立大学) Virginia Tech(弗吉尼亚理工大学) Duke University(杜克大学) Czech Technical University(捷克技术大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17311 2025-05-26 cs.CV cs.LG 83%

Harnessing EHRs for Diffusion-based Anomaly Detection on Chest X-rays

Harim Kim, Yuhan Wang, Minkyu Ahn, Heeyoul Choi, Yuyin Zhou, Charmgil Hong

机构 * Handong Global University(Handong Global大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments MICCAI 2025 early accept

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11015 2025-05-26 cs.CV 83%

AnimeDL-2M: Million-Scale AI-Generated Anime Image Detection and Localization in Diffusion Era

Chenyang Zhu, Xing Zhang, Yuyang Sun, Ching-Chun Chang, Isao Echizen

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments 8+2 pages; update figure 3,4,5 as adding real images into detection task tests

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16792 2025-05-23 cs.CV cs.AI 83%

REPA Works Until It Doesn't: Early-Stopped, Holistic Alignment Supercharges Diffusion Training

Ziqiao Wang, Wangbo Zhao, Yuhao Zhou, Zekai Li, Zhiyuan Liang, Mingjia Shi, Xuanlei Zhao, Pengfei Zhou, Kaipeng Zhang, Zhangyang Wang, Kai Wang, Yang You

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14673 2025-05-21 cs.CV cs.AI cs.CR 83%

Training-Free Watermarking for Autoregressive Image Generation

Yu Tong, Zihao Pan, Shuai Yang, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港 Baptist 大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学) Peking University(北京大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11340 2025-05-21 eess.IV cs.CV 83%

StainDiffuser: MultiTask Dual Diffusion Model for Virtual Staining

Tushar Kataria, Beatrice Knudsen, Shireen Y. Elhabian

机构 * Scientific Computing and Imaging Institute & Kahlert School of Computing(科学计算与成像研究所及卡勒特计算学院) Department of Pathology(病理学系) University of Utah(犹他大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13152 2025-05-20 eess.IV cs.CV 83%

Higher fidelity perceptual image and video compression with a latent conditioned residual denoising diffusion model

Jonas Brenig, Radu Timofte

机构 * Computer Vision Lab, CAIDAS \& IFI, University of W\"urzburg, Germany

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Accepted at AIM Workshop 2024 at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15309 2025-05-20 cs.CV cs.CL cs.LG 83%

Controlled Training Data Generation with Diffusion Models

Teresa Yeo, Andrei Atanov, Harold Benoit, Aleksandr Alekseev, Ruchira Ray, Pooya Esmaeil Akhoondi, Amir Zamir

机构 * Swiss Federal Institute of Technology Lausanne(瑞士联邦理工学院洛桑分校)

专题命中 扩散模型 :diffusion(title);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Project page at https://adversarial-prompts.epfl.ch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11257 2025-05-19 cs.CV cs.LG 83%

DRAGON: A Large-Scale Dataset of Realistic Images Generated by Diffusion Models

Giulia Bertazzini, Daniele Baracchi, Dasara Shullani, Isao Echizen, Alessandro Piva

机构 * Department of Information Engineering University of Florence(信息工程系佛罗伦萨大学) National Institute of Informatics(日本信息机构)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11245 2025-05-19 cs.CV 83%

Diffusion-NPO: Negative Preference Optimization for Better Preference Aligned Generation of Diffusion Models

Fu-Yun Wang, Yunhao Shui, Jingtan Piao, Keqiang Sun, Hongsheng Li

机构 * MMLab, CUHK, Hong Kong(CUHK的MMLab, 香港) Shanghai Jiang Tong University, Shanghai(上海江 Tong大学, 上海) CPII under InnoHK, Hong Kong(InnoHK下的CPII, 香港)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11070 2025-05-19 cs.CV cs.AI 83%

Towards Self-Improvement of Diffusion Models via Group Preference Optimization

Renjie Chen, Wenfeng Lin, Yichen Zhang, Jiangchuan Wei, Boyuan Liu, Chao Feng, Jiao Ran, Mingyu Guo

机构 * ByteDance Douyin Content Group(字节跳动抖音内容团队)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09358 2025-05-15 cs.CV cs.LG 83%

Marigold: Affordable Adaptation of Diffusion-Based Image Generators for Image Analysis

Bingxin Ke, Kevin Qu, Tianfu Wang, Nando Metzger, Shengyu Huang, Bo Li, Anton Obukhov, Konrad Schindler

机构 * Photogrammetry and Remote Sensing Laboratory, ETH Zürich(摄影测量与遥感实验室,苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Journal extension of our CVPR 2024 paper, featuring new tasks, improved efficiency, high-resolution capabilities, and enhanced accessibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08247 2025-05-14 eess.IV cs.CV 83%

Skeleton-Guided Diffusion Model for Accurate Foot X-ray Synthesis in Hallux Valgus Diagnosis

Midi Wan, Pengfei Li, Yizhuo Liang, Di Wu, Yushan Pan, Guangzhen Zhu, Hao Wang

机构 * Xidian University(西安电子科技大学) Beijing Tongren Hospital(北京同仁医院) Capital Medical University(首都医科大学) Norwegian University of Science and Technology(挪威科学技术大学) Xi’an Jiaotong–Liverpool University(西安交大利物浦大学) Chongqing Jiaotong University(重庆交通大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08190 2025-05-14 cs.CV cs.LG 83%

Unsupervised Raindrop Removal from a Single Image using Conditional Diffusion Models

Lhuqita Fazry, Valentino Vito

机构 * Faculty of Computer Science, Universitas Indonesia(计算机科学学院,印度尼西亚大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07906 2025-05-14 cond-mat.mtrl-sci cs.CV cs.LG 83%

Image-Guided Microstructure Optimization using Diffusion Models: Validated with Li-Mn-rich Cathode Precursors

Geunho Choi, Changhwan Lee, Jieun Kim, Insoo Ye, Keeyoung Jung, Inchul Park

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments 37 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05829 2025-05-12 cs.CV cs.LG eess.IV 83%

Accelerating Diffusion Transformer via Increment-Calibrated Caching with Channel-Aware Singular Value Decomposition

Zhiyuan Chen, Keyi Li, Yifan Jia, Le Ye, Yufei Ma

机构 * Peking University(北京大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02255 2025-05-12 cs.CV cs.AI 83%

Enhancing AI Face Realism: Cost-Efficient Quality Improvement in Distilled Diffusion Models with a Fully Synthetic Dataset

Jakub Wasala, Bartlomiej Wrzalski, Kornelia Noculak, Yuliia Tarasenko, Oliwer Krupa, Jan Kocon, Grzegorz Chodak

机构 * Department of Artificial Intelligence, Wroclaw University of Science and Technology(人工智能系,波兹南技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments 25th International Conference on Computational Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04729 2025-05-08 cs.SD cs.AI cs.LG cs.MM eess.AS 83%

JEN-1: Text-Guided Universal Music Generation with Omnidirectional Diffusion Models

Peike Li, Boyu Chen, Yao Yao, Yikai Wang, Allen Wang, Alex Wang

机构 * Futureverse AI Research(未来视AI研究)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.MM

Comments Github Demo Page: https://gogoduck912.github.io/Jen1-Demo-Page/

Journal ref https://ieeecai.org/2024/wp-content/pdfs/540900a773/540900a773.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03562 2025-05-07 cs.CV cs.AI 83%

Real-Time Person Image Synthesis Using a Flow Matching Model

Jiwoo Jeong, Kirok Kim, Wooju Kim, Nam-Joon Kim

机构 * Department of Industrial Engineering, Yonsei University(延世大学工业工程系) Next-Generation Semiconductor, Seoul National University(首尔国立大学下一代半导体研究所)

专题命中 扩散模型 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03203 2025-05-07 cs.CV 83%

PiCo: Enhancing Text-Image Alignment with Improved Noise Selection and Precise Mask Control in Diffusion Models

Chang Xie, Chenyi Zhuang, Pan Gao

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02753 2025-05-06 cs.CV 83%

Advancing Generalizable Tumor Segmentation with Anomaly-Aware Open-Vocabulary Attention Maps and Frozen Foundation Diffusion Models

Yankai Jiang, Peng Zhang, Donglin Yang, Yuan Tian, Hai Lin, Xiaosong Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

Comments This paper is accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03184 2025-05-02 cs.CV 83%

Ouroboros3D: Image-to-3D Generation via 3D-aware Recursive Diffusion

Hao Wen, Zehuan Huang, Yaohui Wang, Xinyuan Chen, Lu Sheng

机构 * School of Software, Beihang University(北航软件学院) Shanghai AI Laboratory(上海人工智能实验室) VAST(中国科学院软件研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments See our project page at https://costwen.github.io/Ouroboros3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21292 2025-05-01 cs.CV 83%

Can We Achieve Efficient Diffusion without Self-Attention? Distilling Self-Attention into Convolutions

ZiYi Dong, Chengxing Zhou, Weijian Deng, Pengxu Wei, Xiangyang Ji, Liang Lin

机构 * Australian National University(澳大利亚国立大学) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21231 2025-05-01 cs.CV cs.AI cs.LG 83%

T2ID-CAS: Diffusion Model and Class Aware Sampling to Mitigate Class Imbalance in Neck Ultrasound Anatomical Landmark Detection

Manikanta Varaganti, Amulya Vankayalapati, Nour Awad, Gregory R. Dion, Laura J. Brattain

机构 * Department of Computer Science, University of Central Florida(计算机科学系,中央佛罗里达大学) Department of Otolaryngology Head Neck Surgery, University of Cincinnati College of Medicine(耳鼻喉科与头颈外科系,辛辛那提大学医学院) Department of Internal Medicine, University of Central Florida College of Medicine(内科系,中央佛罗里达大学医学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments submitted to IEEE EMBC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20685 2025-04-30 cs.CV cs.HC 83%

Efficient Listener: Dyadic Facial Motion Synthesis via Action Diffusion

Zesheng Wang, Alexandre Bruckert, Patrick Le Callet, Guangtao Zhai

机构 * Nantes Université(南特大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20241 2025-04-30 cs.CV 83%

Physics-Informed Diffusion Models for SAR Ship Wake Generation from Text Prompts

Kamirul Kamirul, Odysseas Pappas, Alin Achim

机构 * Visual Information Laboratory, University of Bristol(视觉信息实验室,布里斯托尔大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments 4 pages; Submitted Machine Intelligence for GeoAnalytics and Remote Sensing (MIGARS) - 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12743 2025-04-30 cs.CV 83%

Controllable Face Synthesis with Semantic Latent Diffusion Models

Alex Ergasti, Claudio Ferrari, Tomaso Fontanini, Massimo Bertozzi, Andrea Prati

机构 * University of Parma(帕尔马大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏