arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70082 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70082 篇

2305.15266 2025-01-13 eess.AS cs.SD 88%

Diffusion-Based Audio Inpainting

Eloi Moliner, Vesa Välimäki

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

Comments Submitted for publication to the Journal of Audio Engineering Society on January 30th, 2023

Journal ref Journal of the Audio Engineering Society 72, no. 3 (2024): 100-113

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00712 2024-10-04 q-bio.NC cs.LG 88%

NECOMIMI: Neural-Cognitive Multimodal EEG-informed Image Generation with Diffusion Models

Chi-Sheng Chen

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03509 2024-09-04 cs.CL cs.AI cs.HC cs.LG 88%

Diffusion Explainer: Visual Explanation for Text-to-image Stable Diffusion

Seongmin Lee, Benjamin Hoover, Hendrik Strobelt, Zijie J. Wang, ShengYun Peng, Austin Wright, Kevin Li, Haekyu Park, Haoyang Yang, Duen Horng Chau

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);image generation(abstract)

Comments 5 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06747 2024-08-13 eess.IV cs.NA math.NA 88%

Efficient Parallel Data Optimization for Homogeneous Diffusion Inpainting of 4K Images

Niklas Kämper, Vassillen Chizhov, Joachim Weickert

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00544 2024-08-02 cs.AI 88%

Illustrating Classic Brazilian Books using a Text-To-Image Diffusion Model

Felipe Mahlow, André Felipe Zanella, William Alberto Cruz Castañeda, Regilene Aparecida Sarzi-Ribeiro

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract)

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01499 2024-07-02 cs.SD cs.LG eess.AS 88%

Pictures Of MIDI: Controlled Music Generation via Graphical Prompts for Image-Based Diffusion Inpainting

Scott H. Hawley

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

Comments 6 pages text + 2 pages references, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06744 2024-01-15 eess.IV cs.NA math.NA 88%

Efficient Parallel Algorithms for Inpainting-Based Representations of 4K Images -- Part I: Homogeneous Diffusion Inpainting

Niklas Kämper, Vassillen Chizhov, Joachim Weickert

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08761 2023-12-27 eess.IV 88%

Regularised Diffusion-Shock Inpainting

Kristina Schaefer, Joachim Weickert

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09450 2023-05-15 eess.IV 88%

Diffusion-Shock Inpainting

Kristina Schaefer, Joachim Weickert

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

Journal ref In L. Calatroni, M. Donatelli, S. Morigi, M. Prato, M. Santacesaria (Eds.): Scale Space and Variational Methods in Computer Vision. Lecture Notes in Computer Science, Vol. 14009. Springer, Cham, 588-600, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13285 2023-03-24 physics.med-ph physics.comp-ph 88%

Fourier Diffusion Models: A Method to Control MTF and NPS in Score-Based Stochastic Image Generation

Matthew Tivnan, Jacopo Teneggi, Tzu-Cheng Lee, Ruoqiao Zhang, Kirsten Boedeker, Liang Cai, Grace J. Gang, Jeremias Sulam, J. Webster Stayman

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.14371 2023-03-24 eess.IV 88%

Deep Spatial and Tonal Data Optimisation for Homogeneous Diffusion Inpainting

Pascal Peter, Karl Schrader, Tobias Alt, Joachim Weickert

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.01217 2023-02-03 stat.ML cs.AI cs.LG math.ST stat.TH 88%

A Theoretical Justification for Image Inpainting using Denoising Diffusion Probabilistic Models

Litu Rout, Advait Parulekar, Constantine Caramanis, Sanjay Shakkottai

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

Comments 30 pages, 5 figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.09642 2023-01-25 q-bio.QM cs.AI cs.LG 88%

DiffSDS: A language diffusion model for protein backbone inpainting under geometric conditions and constraints

Zhangyang Gao, Cheng Tan, Stan Z. Li

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.03946 2022-02-15 eess.IV 88%

Domain Decomposition Algorithms for Real-time Homogeneous Diffusion Inpainting in 4K

Niklas Kämper, Joachim Weickert

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.12263 2020-04-30 eess.IV 88%

Compressing Flow Fields with Edge-aware Homogeneous Diffusion Inpainting

Ferdinand Jost, Pascal Peter, Joachim Weickert

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18040 2026-08-19 cs.LG cs.CV 新提交 87%

Optimize Your Sampling: Tuned Diffusion Sampling with Bayesian Optimization

优化你的采样:基于贝叶斯优化的调优扩散采样

Travis Zhang, Christian Belardi, Justin Lovelace, Jin Peng Zhou, Saebyeol Shin, Carla P. Gomes, Kilian Q. Weinberger

机构 * Cornell University(康奈尔大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);inpainting(abstract)

AI总结 本研究提出OYS方法,将扩散模型采样的时间步长选择作为黑盒优化问题,用贝叶斯优化直接优化目标指标,可提升多类图像生成任务性能,大幅降低推理成本且无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23452 2026-08-12 cs.CV cs.CL 版本更新 87%

FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing

FoR-SALE:基于参考坐标系引导的LLM驱动扩散编辑中的空间调整

Tanawan Premsri, Parisa Kordjamshidi

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 FoR-SALE是SLD的扩展,通过参考坐标系引导的潜在空间操作调整图像朝向与深度,在三个空间理解基准上仅单轮校正就将SOTA T2I模型性能提升最高7.0个百分点,解决了非相机视角空间表达的生成偏差问题。

Comments Published in COLM 2026. 10 main pages, 4 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22428 2026-07-27 cs.HC cs.AI cs.LG cs.MM 新提交 87%

Unboxing Diffusion Models for the Arts: Interactive Model Bending and Practice-Based Explainability

剖析艺术领域的扩散模型:交互式模型调整与基于实践的可解释性

Ahmed M. Abuzuraiq, Philippe Pasquier

机构 * School of Interactive Arts and Technology, Surrey, Canada(交互艺术与技术学院,英国苏城)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.MM

AI总结 研究探讨创意实践中可解释人工智能,提出以实验和干预为中心的方法,通过集成模型调整和交互界面到工作流程,经对Stable Diffusion 1.5分析,助艺术家理解模型组件对生成图像的影响,让大型模型成为创意材料。

Comments Under review for "Explainable AI for the Arts" (N. Bryan-Kinns, Ed.), Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14580 2026-07-17 cs.CV cs.LG 新提交 87%

Advanced Image Generation: Negative Prompt Optimization and Latent Classifier Guidance

先进图像生成:负提示优化与潜在分类器引导

Vaddi Charan Sai Nandan Reddy, Harini B, Chandana M S

专题命中 扩散模型 :diffusion(summary_cn,abstract);image generation(title);分类 cs.CV

AI总结 该研究提出新系统,通过微调序列到序列语言模型集成负提示优化与潜在空间分类器引导,自动生成优化负提示,用混合分类器评估引导扩散步骤,减少伪影并提高语义保真度,提升Stable Diffusion图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14008 2026-07-17 cs.CV 版本更新 87%

Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models

稀疏-LaViDa:稀疏多模态离散扩散语言模型

Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

机构 * Adobe(Adobe公司) UCLA(加州大学洛杉矶分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 针对掩码离散扩散模型推理速度慢的问题,提出Sparse-LaViDa框架,通过动态截断冗余掩码令牌加速采样,引入专用寄存器令牌和注意力掩码保证质量与一致性,基于LaViDa - O构建,在多任务中实现加速且保持质量。

Comments 18 pages (12 pages for the main paper and 6 pages for the appendix), 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06590 2026-07-09 cs.CV cs.LG 新提交 87%

AI for Cultural Heritage Textiles: Fine-Tuned Latent Diffusion for Novel Ulos Motif Synthesis

用于文化遗产纺织品的人工智能:针对新型乌洛花纹合成的微调潜在扩散模型

Humasak Tommy Argo Simanjuntak, Jesika Purba, Sitogab Girsang, Widya Manurung, Samuel Situmeang, Arlinta Barus, Daniel Oranova Siahaan

机构 * Information Systems Study Program, Faculty of Informatics and Electrical Engineering, Institut Teknologi Del(信息系统研究项目,信息与电气工程学院,技术学院)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 该研究针对传统乌洛编织局限,提出在高分辨率乌洛图案数据集上微调Protogen v3.4和Stable Diffusion v1.4两个潜在扩散模型来生成新颖设计,通过多种方式评估模型性能,发现特定引导尺度能平衡保真度与多样性,支持非物质文化遗产创新更新。

Comments 21 pages, 8 figures, 3 tables. The manuscript is currently under review at the 2026 4th International Conference on Data, Information and Computing Science (https://www.cdics.org/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20416 2026-07-08 cs.LG cs.CV 新提交 87%

On the Redundancy of Timestep Embeddings in Diffusion Models

扩散模型中时间步嵌入的冗余性研究

José A. Chávez

机构 * Independent Researcher, Lima, Peru(独立研究者,秘鲁利马)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文通过理论和实验证明,在U-Net和Diffusion Transformer架构中,扩散模型无需显式时间步嵌入也能达到全局最优,甚至在某些指标上超越有条件模型。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02211 2026-07-07 cs.CV 版本更新 87%

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers

TexTailor:用于多模态扩散变压器的推理时文本引导剪裁

Binglei Li, Mengping Yang, Zhiyu Tan, Junping Zhang, Hao Li

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 研究基于变压器的扩散模型中不同模块与文本条件的交互。通过系统管道分析各模块功能,提出推理时逐块文本引导剪裁方法,提升文本图像对齐,有多种下游应用,实验表明优于基线。

Comments To appear in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16325 2026-07-02 cs.CV 版本更新 87%

UltraImageGen: Efficient Ultra-High-Resolution Image Generation with Hierarchical Local Attention

UltraImageGen: 高效超高清图像生成与层级局部注意力

Yuyao Zhang, Yu-Wing Tai

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 提出UltraImageGen框架,通过层级局部注意力和低分辨率全局引导,将预训练扩散模型扩展到8K以上分辨率,实现近线性复杂度、10倍加速和更低内存占用。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11615 2026-06-18 cs.CV cs.CR cs.LG 新提交 87%

Adv-TGD: Adversarial Text-Guided Diffusion for Face Recognition Impersonation Attacks

Adv-TGD:面向人脸识别冒充攻击的对抗性文本引导扩散

Omid Ahmadieh, Nima Karimian

机构 * University of South Florida, Bellini College of Artificial Intelligence, Cybersecurity and Computing(南佛罗里达大学贝利尼人工智能、网络安全与计算学院)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 提出Adv-TGD框架,利用Stable Diffusion和LoRA微调生成逼真对抗人脸,在保持视觉质量的同时实现高成功率身份冒充攻击,平均ASR达85.90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22050 2026-06-01 cs.CV 87%

Broken Memories: Detecting and Mitigating Memorization in Diffusion Models with Degraded Generations

破碎的记忆:通过退化生成检测和缓解扩散模型中的记忆化

Yuanmin Huang, Mi Zhang, Chen Chen, Feifei Li, Geng Hong, Xiaoyu You, Min Yang

机构 * Fudan University(复旦大学) East China University of Science and Technology(东华大学)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文首次发现扩散模型中的记忆化会导致内部数值不稳定性并表现为视觉“破碎”伪影,基于此提出了一种基于潜变量更新范数的经验稳定区域来量化稳定行为,并设计了一个即时的逐步骤检测与自适应缓解框架,在不改变提示或引导的情况下抑制记忆化,在Stable Diffusion 1.4上实现了AUC>0.999的检测性能和0.0%的记忆化率。

Comments KDD 2026, extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30230 2026-05-29 cs.CV 87%

IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation

IP-Adapter 就够了:迈向免微调扩散模型的人脸说话视频生成

Hao Wu, Xiangyang Luo, Hao Wang, Jiawei Zhang, Yi Zhang, Jinwei Wang

机构 * Information Engineering University(信息工程大学) Huai’an University(淮安大学) Chongqing University of Post and Telecommunications(重庆邮电大学) Nankai University(南开大学)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 提出一种免微调范式,利用预训练的 Stable Diffusion 和 IP-Adapter,结合三个无参数组件解决身份漂移、同步误差和时间不稳定问题,在唇同步精度和视觉保真度上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24792 2026-05-26 cs.CV cs.AI 87%

Parameter-Efficient VLMs for Gastrointestinal Endoscopy: Medical Image Generation and Clinical Visual Question Answering

用于胃肠内窥镜的参数高效视觉语言模型:医学图像生成与临床视觉问答

Ojonugwa Oluwafemi Ejiga Peter, Frederick Akor Ejiga, Fahmi Khalifa, Md Mahmudur Rahman

机构 * Computer Science Department, Morgan State University(莫尔甘州大学计算机科学系) International Organization for Migration (IOM)(国际移民组织) Electrical & Computer Engineering Department, Morgan State University(莫尔甘州大学电气与计算机工程系)

专题命中 扩散模型 :diffusion(summary_cn,abstract);image generation(title);分类 cs.CV

AI总结 提出双流水线参数高效微调模型,结合Florence-2和LoRA Stable Diffusion,分别解决临床视觉问答和隐私保护合成数据生成问题,在Kvasir-VQA数据集上取得高ROUGE和BLEU分数,并显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22717 2026-05-22 cs.SD cs.AI cs.LG cs.MM 87%

Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators

实时音乐扩散模型:交互式音乐生成扩散模型的高效微调与后训练

Zachary Novack, Stephen Brade, Haven Kim, Hugo Flores García, Nithya Shikarpur, Chinmay Talegaonkar, Suwan Kim, Valerie K. Chen, Julian McAuley, Taylor Berg-Kirkpatrick, Cheng-Zhi Anna Huang

机构 * UC San Diego(加州大学圣迭戈分校) MIT(麻省理工学院) Adobe(Adobe公司)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.MM

AI总结 本文研究了音频扩散模型能否通过块级KV缓存高效地转化为交互式模型,从而在消费级硬件上实现。提出的Live Music Diffusion Models (LMDMs)通过块级KV缓存恢复并超越了离散Live Music Models (LMMs)的推理复杂度,并通过ARC-Forcing范式实现稳定的后训练对齐,从而在无需显式RL或奖励模型的情况下减少误差累积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11494 2026-05-13 cs.CV 87%

STRIDE: Training-Free Diversity Guidance via PCA-Directed Feature Perturbation in Single-Step Diffusion Models

STRIDE:通过PCA引导的特征扰动在单步扩散模型中实现训练自由的多样性指导

Ankit Yadav, Arpit Garg, Ta Duc Huy, Lingqiao Liu

机构 * Australian Institute for Machine Learning, Adelaide University, Australia(澳大利亚机器学习研究所,阿德莱德大学,澳大利亚)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract,abstract_cn);分类 cs.CV

AI总结 针对单步扩散模型多样性不足问题,STRIDE通过PCA引导的特征扰动在单次前向传递中提升多样性,保持文本对齐性,优于现有训练自由基线。

Comments 11 Pages 3 figures 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏