arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86585 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70051 篇

2403.18370 2024-10-04 cs.CV cs.LG 87%

Ship in Sight: Diffusion Models for Ship-Image Super Resolution

Luigi Sigillo, Riccardo Fosco Gramaccioni, Alessandro Nicolosi, Danilo Comminiello

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);inpainting(abstract)

Comments Accepted at 2024 International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00350 2024-08-02 cs.CV cs.AI 87%

A Simple Background Augmentation Method for Object Detection with Diffusion Model

Yuhang Li, Xin Dong, Chen Chen, Weiming Zhuang, Lingjuan Lyu

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);inpainting(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13188 2024-07-22 cs.CV 87%

Safe-SD: Safe and Traceable Stable Diffusion with Text Prompt Trigger for Invisible Generative Watermarking

Zhiyuan Ma, Guoli Jia, Biqing Qi, Bowen Zhou

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14291 2024-06-18 cs.CV 87%

Open-Vocabulary Attention Maps with Token Optimization for Semantic Segmentation in Diffusion Models

Pablo Marcos-Manchón, Roberto Alcover-Couso, Juan C. SanMiguel, Jose M. Martínez

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10835 2024-04-08 cs.CV 87%

Your Student is Better Than Expected: Adaptive Teacher-Student Collaboration for Text-Conditional Diffusion Models

Nikita Starodubcev, Artem Fedorov, Artem Babenko, Dmitry Baranchuk

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract);image synthesis(abstract)

Comments CVPR2024 camera ready v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08247 2024-03-19 cs.CV 87%

Diffusion in Diffusion: Cyclic One-Way Diffusion for Text-Vision-Conditioned Generation

Ruoyu Wang, Yongqi Yang, Zhihao Qian, Ye Zhu, Yu Wu

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);inpainting(abstract);personalized generation(abstract)

Comments Accepted by ICLR2024, 21 pages with 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00739 2024-01-02 cs.CV cs.AI 87%

DiffMorph: Text-less Image Morphing with Diffusion Models

Shounak Chatterjee

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04884 2023-12-27 cs.CV 87%

UDiffText: A Unified Framework for High-quality Text Synthesis in Arbitrary Images via Character-aware Diffusion Models

Yiming Zhao, Zhouhui Lian

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17908 2023-12-21 cs.CV 87%

Trade-offs in Fine-tuned Diffusion Models Between Accuracy and Interpretability

Mischa Dombrowski, Hadrien Reynaud, Johanna P. Müller, Matthew Baugh, Bernhard Kainz

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05390 2023-12-12 cs.CV 87%

NoiseCLR: A Contrastive Learning Approach for Unsupervised Discovery of Interpretable Directions in Diffusion Models

Yusuf Dalva, Pinar Yanardag

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

Comments Project page: https://noiseclr.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00079 2023-12-04 cs.CV cs.AI cs.CL cs.LG 87%

HiFi Tuner: High-Fidelity Subject-Driven Fine-Tuning for Diffusion Models

Zhonghao Wang, Wei Wei, Yang Zhao, Zhisheng Xiao, Mark Hasegawa-Johnson, Humphrey Shi, Tingbo Hou

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16090 2023-11-28 cs.CV 87%

Self-correcting LLM-controlled Diffusion Models

Tsung-Han Wu, Long Lian, Joseph E. Gonzalez, Boyi Li, Trevor Darrell

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10829 2023-11-28 cs.CV 87%

Exact Diffusion Inversion via Bi-directional Integration Approximation

Guoqiang Zhang, J. P. Lewis, W. Bastiaan Kleijn

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

Comments arXiv admin note: text overlap with arXiv:2304.11328. Our code is available at https://github.com/guoqiang-zhang-x/BDIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.11305 2023-07-04 cs.CV 87%

SVDiff: Compact Parameter Space for Diffusion Fine-Tuning

Ligong Han, Yinxiao Li, Han Zhang, Peyman Milanfar, Dimitris Metaxas, Feng Yang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

Comments Added additional analysis and style-mixing results

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16576 2023-05-18 cs.CV 87%

WordStylist: Styled Verbatim Handwritten Text Generation with Latent Diffusion Models

Konstantina Nikolaidou, George Retsinas, Vincent Christlein, Mathias Seuret, Giorgos Sfikas, Elisa Barney Smith, Hamam Mokayed, Marcus Liwicki

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.03142 2023-04-14 cs.CV cs.AI cs.LG 87%

On Distillation of Guided Diffusion Models

Chenlin Meng, Robin Rombach, Ruiqi Gao, Diederik P. Kingma, Stefano Ermon, Jonathan Ho, Tim Salimans

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image editing(abstract);inpainting(abstract)

Comments CVPR 2023, Award candidate

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.13757 2023-03-17 cs.CV 87%

Diffusion-SDF: Conditional Generative Modeling of Signed Distance Functions

Gene Chou, Yuval Bahat, Felix Heide

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);inpainting(abstract);image synthesis(abstract)

Comments revised experiments and added link to code and supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00837 2026-06-02 cs.RO cs.LG 87%

Coarse-to-Fine Compositional Diffusion for Long-Horizon Planning

粗到细的组合扩散用于长时域规划

Byoungwoo Park, Utkarsh A. Mishra, Jaemoo Choi, Juho Lee, Yongxin Chen

机构 * KAIST(韩国科学技术院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,summary_cn);image generation(abstract)

AI总结 提出Coarse-to-Fine Compositional Diffusion (CoFi)方法,通过先形成全局骨架再细化局部细节,在长时域机器人规划、全景图像生成和长视频生成中提升全局一致性和局部质量,同时减少2-8倍去噪评估次数。

Comments Project page: https://cofi-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14304 2025-03-19 cs.GR cs.CV eess.IV 87%

Bracket Diffusion: HDR Image Generation by Consistent LDR Denoising

Mojtaba Bemana, Thomas Leimkühler, Karol Myszkowski, Hans-Peter Seidel, Tobias Ritschel

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);分类 cs.CV、cs.GR

Comments 11 pages, 14 figures, Accepted to Eurographics 2025, see https://bracketdiffusion.mpi-inf.mpg.de

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10886 2024-12-06 cs.CV cs.AI cs.GR cs.RO 87%

MetricGold: Leveraging Text-To-Image Latent Diffusion Models for Metric Depth Estimation

Ansh Shah, K Madhava Krishna

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05352 2024-07-09 cs.CV cs.MM 87%

Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model

Danni Yang, Ruohan Dong, Jiayi Ji, Yiwei Ma, Haowei Wang, Xiaoshuai Sun, Rongrong Ji

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);分类 cs.CV、cs.MM

Comments Accepted by ECCV2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04654 2023-12-11 cs.CV cs.AI cs.GR 87%

NeuSD: Surface Completion with Multi-View Text-to-Image Diffusion

Savva Ignatyev, Daniil Selikhanovych, Oleg Voynov, Yiqun Wang, Peter Wonka, Stamatios Lefkimmiatis, Evgeny Burnaev

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01875 2023-09-06 cs.CV cs.LG cs.MM cs.PF eess.IV 87%

Gradient Domain Diffusion Models for Image Synthesis

Yuanhao Gong

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.06908 2023-02-28 cs.CV cs.AI cs.LG cs.MM 87%

DiffFaceSketch: High-Fidelity Face Image Synthesis with Sketch-Guided Latent Diffusion Model

Yichen Peng, Chunqi Zhao, Haoran Xie, Tsukasa Fukusato, Kazunori Miyata

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV、cs.MM

Comments 10 pages, 12 figures, and 2 tables, project page: https://puckikk1202.github.io/difffacesketch2023/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16887 2026-08-18 cs.CV 新提交 87%

An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models

像素空间文本到图像扩散模型训练的实证研究

Dengyang Jiang, Ruoyi Du, Zhennan Chen, Dongyang Liu, Zanyi Wang, Mingzhe Zheng, Xiangpeng Yang, Huanqia Cai, Aiming Hao, Yuming Jiang, Peng Gao, Harry Yang, Steven Hoi

机构 * Alibaba Token Hub(阿里巴巴令牌中心) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);分类 cs.CV

AI总结 本文通过实证研究提出潜空间到像素空间的训练策略,确定关键设计选择,使像素空间文本到图像扩散模型性能媲美或超越潜空间模型,且推理加速3.18至4.75倍,为相关研究提供实用指南。

Comments Z-Image-Pixel & Empirical Insight of Training Pixel-Space Diffusion Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11605 2026-03-27 cs.CV cs.AI cs.LG 87%

Scalable High-Resolution Pixel-Space Image Synthesis with Hourglass Diffusion Transformers

可扩展的高分辨率像素空间图像合成与Hourglass扩散变换器

Katherine Crowson, Stefan Andreas Baumann, Alex Birch, Tanishq Mathew Abraham, Daniel Z. Kaplan, Enrico Shippole

机构 * Birchlabs, England, United Kingdom(英国英格兰Birchlabs实验室) Independent Researcher, Florida, United States(美国佛罗里达独立研究员)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 本文提出Hourglass Diffusion Transformer,通过线性扩展像素数量实现高分辨率图像生成,无需传统高分辨率训练技术, 在ImageNet和FFHQ数据集上取得新突破。

Comments 20 pages, 13 figures, project page and code available at https://crowsonkb.github.io/hourglass-diffusion-transformers/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16923 2026-08-19 cs.SI cs.LG 新提交 87%

Network Denoising Revisited: A Ricci-Flow-Inspired Graph Diffusion Method

重访网络去噪:一种受里奇流启发的图扩散方法

Ye Fang, Chuan-Xian Ren

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 该研究针对现有网络去噪方法忽略图非欧几里得几何的问题,提出受里奇流启发的曲率引导图扩散方法Ricci-Diffusion,经实验验证其可提升结构恢复与下游性能。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18019 2026-08-19 math.NA cs.NA math.DS 新提交 87%

Ordered Diffusion Kernels

有序扩散核(Ordered Diffusion Kernels, ODKs)

Jack H. Soulsby, Andreas C. S. Jørgensen, Atiyo Ghosh, Vahid Shahrezaei

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 本文提出新型有序扩散核(ODKs),可近似任意伊藤SDE的无穷小生成元,通过松弛势估计为序推断实现平流与扩散解耦,经合成数据验证能准确恢复多种动力系统属性。

Comments 46 pages, 7 figures, 46 page appendix, related to work presented at ECMTB26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15727 2026-08-18 cs.LG cs.AI stat.ML 新提交 87%

FirstDiff: One-Step Diffusion-Based Anomaly Detection for Multivariate Time Series via Initial Noise Prediction

FirstDiff:基于初始噪声预测的单步扩散模型多变量时间序列异常检测

Ali Boudaghi, Alireza Nemati, Hadi Zare

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 FirstDiff是一种基于初始噪声预测的单步扩散异常检测框架,采用Diffusion Transformer作为骨干,仅需一次去噪网络评估即可在五个基准数据集上实现最优多变量时间序列异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13079 2026-08-17 cs.LG 版本更新 87%

Learning Discrete Decisions for MIPs with Constraint-Aware Diffusion

基于约束感知扩散的混合整数规划离散决策学习

Vincenzo Di Vito, Mehdi Taghizadeh, Deepjyoti Deka, Kaarthik Sundar, Ferdinando Fioretto

机构 * University of Virginia(弗吉尼亚大学) MIT(麻省理工学院) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 该研究提出Constrained Graph Diffusion(CGD)框架,结合图扩散模型与可行性投影算子求解混合整数规划,在两类任务上较基线方法提升可行性与质量,且最高加速425倍。

详情

展开后加载摘要…

URL PDF HTML 收藏