arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86623 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70082 篇

2605.08777 2026-05-12 stat.ML cs.LG math.PR 85%

Measuring and Decomposing Mode Separation via the Canonical Diffusion

通过规范扩散测量和分解模式分离

Shaul Tolkovsky, Ori Meidler, Or Zuk

机构 * Department of Statistics and Data Science(统计与数据科学系)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出通过规范扩散的自相关矩阵提取SSA和DA,用于测量模式分离,适用于高维数据和生成模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06553 2026-05-08 cs.LG 85%

Diverse Sampling in Diffusion Models with Marginal Preserving Particle Guidance

扩散模型中的多样性采样与边际保持粒子引导

Gal Vinograd, Idan Achituve, Ethan Fetaya

机构 * Faculty of Engineering Bar-Ilan University(巴伊兰大学工程学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 EDDY通过利用福克-普朗克方程的对称性,利用漂移扰动改变粒子轨迹同时保持边际分布,提升样本多样性并保持质量,适用于扩散和流匹配模型。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09861 2026-04-14 cs.AI cs.NE 85%

Evolutionary Token-Level Prompt Optimization for Diffusion Models

扩散模型的进化令牌级提示优化

Domício Pereira Neto, João Correia, Penousal Machado

机构 * University of Coimbra(科英布拉大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出基于遗传算法的扩散模型令牌级提示优化方法,通过进化CLIP模型的token向量提升生成质量,实验显示比基线方法提升23.93%。

Comments 17 pages, 3 figures, 2 tables, 6 appendix figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18960 2026-03-20 cs.HC 85%

Sketch2Topo: Using Hand-Drawn Inputs for Diffusion-Based Topology Optimization

Sketch2Topo: 利用手绘输入进行基于扩散的拓扑优化

Shuyue Feng, Cedric Caremel, Yoshihiro Kawahara

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image editing(abstract)

AI总结 Sketch2Topo通过结合图像到图像生成和图像编辑能力,提升扩散模型在拓扑优化中的定制化与用户交互体验,平衡功能与美学。

Comments 5 pages, 4 figures, accepted at CHI 2026 as a poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22524 2026-03-17 cs.LG 85%

Inference-Time Scaling of Discrete Diffusion Models via Importance Weighting and Optimal Proposal Design

通过重要加权和最优提案设计实现离散扩散模型的推理时间扩展

Zijing Ou, Chinmay Pani, Yingzhen Li

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出基于SMC框架的重要加权和最优提案设计方法,提升离散扩散模型在推理时的可控制性和样本质量,适用于多个领域任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00502 2026-03-09 cs.LG 85%

Diffusion Alignment as Variational Expectation-Maximization

扩散对齐作为变分期望最大化

Jaewoo Lee, Minsu Kim, Sanghyeok Choi, Inhyuck Song, Sujin Yun, Hyeongyu Kang, Woocheol Shin, Taeyoung Yun, Kiyoung Om, Jinkyoo Park

机构 * KAIST(韩国科学技术院) MongooseAI Mila - Quebec AI Institute(魁北克人工智能研究所) University of Edinburgh(爱丁堡大学) Mila, Université de Montréal(魁北克大学Mila) Omelet

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 DAV通过变分期望最大化框架,在文本生成和DNA设计中实现奖励优化与多样性保持。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02692 2026-03-04 cs.LG cs.AI 85%

Fine-Tuning Diffusion Models via Intermediate Distribution Shaping

通过中间分布塑形微调扩散模型

Gautham Govind Anil, Shaan Ul Haque, Nithish Kannen, Dheeraj Nagaraj, Sanjay Shakkottai, Karthikeyan Shanmugam

机构 * Google DeepMind(谷歌DeepMind) Georgia Institute of Technology(佐治亚理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 通过中间分布塑形提升扩散模型微调效果,改进文本到图像生成质量

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25170 2026-02-12 cs.LG cs.AI stat.ML 85%

GLASS Flows: Transition Sampling for Alignment of Flow and Diffusion Models

GLASS Flows: 用于对齐流模型与扩散模型的过渡采样

Peter Holderrieth, Uriel Singer, Tommi Jaakkola, Ricky T. Q. Chen, Yaron Lipman, Brian Karrer

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) FAIR, Meta(FAIR与Meta)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 GLASS Flows通过在流匹配模型内部模拟来提升流和扩散模型的推理效率,结合ODE的效率和SDE的随机性,实现文本生成性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02927 2026-02-04 stat.ML cs.LG 85%

Training-Free Self-Correction for Multimodal Masked Diffusion Models

无需训练的多模态掩码扩散模型自校正

Yidong Ouyang, Panwen Hu, Zhengyan Wan, Zhe Wang, Liyan Xie, Dmitriy Bespalov, Ying Nian Wu, Guang Cheng, Hongyuan Zha, Qiang Sun

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学) East China Normal University(华东师范大学) University of Virginia(弗吉尼亚大学) University of Minnesota(明尼苏达大学) Drexel university(德雷塞尔大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Toronto(多伦多大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出无需训练的多模态掩码扩散模型自校正方法,通过减少采样步骤提升生成质量,适用于文本到图像和多模态理解任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02051 2026-02-03 cs.AI 85%

SIDiffAgent: Self-Improving Diffusion Agent

SIDiffAgent:自改进扩散代理

Shivank Garg, Ayush Singh, Gaurav Kumar Nayak

机构 * Indian Institute of Technology, Roorkee(印度理工学院罗尔基分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 SIDiffAgent通过自改进的扩散代理框架,利用Qwen系列模型提升文本到图像生成的可靠性与可控性,实现更高质量的图像输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22127 2026-01-30 cs.CV cs.GR cs.LG cs.MM 85%

EditYourself: Audio-Driven Generation and Manipulation of Talking Head Videos with Diffusion Transformers

EditYourself: 基于音频驱动的谈话头视频生成与操控的扩散变换器

John Flynn, Wolfgang Paier, Dimitar Dinev, Sam Nhut Nguyen, Hayk Poghosyan, Manuel Toribio, Sandipan Banerjee, Guy Gafni

机构 * Pipio AI Amazon(亚马逊)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 EditYourself通过音频驱动的视频到视频编辑框架,实现基于脚本的谈话头视频修改,包括内容的添加、删除和重新定时,同时保持唇同步和时间一致性。

Comments Project page: https://edit-yourself.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16292 2025-12-23 cs.CY cs.AI 85%

Visual Stereotypes of Autism Spectrum in Janus-Pro-7B, DALL-E, Stable Diffusion, SDXL, FLUX, and Midjourney

自闭症光谱的视觉刻板印象:Janus-Pro-7B、DALL-E、Stable Diffusion、SDXL、FLUX和Midjourney的视觉表现

Maciej Wodziński, Marcin Rządeczka, Anastazja Szuła, Kacper Dudzic, Marcin Moskalewicz

机构 * Maria Curie-Skłodowska University(玛丽·居里大学) IDEAS Research Institute(IDEAS研究机构) Adam Mickiewicz University(亚当·密茨凯维奇大学) AMU Center for Artificial Intelligence(AMU人工智能中心) Poznań University of Medical Sciences(波兹南医科大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本研究评估了六个AI图像生成模型在自闭症相关图像中的刻板印象表现,发现尽管技术有所改进,但模型在再现潜在有害刻板印象方面无显著变化。

Comments Preprint of a publication accepted to Identity-Aware AI 2025 (ECAI 2025)

Journal ref CEUR Workshop proceeding, 2025, Vol-4136 urn:nbn:de:0074-4136-x; https://ceur-ws.org/Vol-4136/iaai15.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15663 2025-12-08 cs.SE cs.AI 85%

SustainDiffusion: Optimising the Social and Environmental Sustainability of Stable Diffusion Models

SustainDiffusion: 优化稳定扩散模型的社会和环境可持续性

Giordano d'Aloisio, Tosin Fadahunsi, Jay Choy, Rebecca Moussa, Federica Sarro

机构 * University of L'Aquila(拉奎拉大学) University College London(伦敦大学学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 SustainDiffusion通过优化超参数和提示结构,减少稳定扩散模型的性别、种族偏见和能耗,提升其社会和环境可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00459 2025-11-21 cond-mat.mtrl-sci cs.AI 85%

Parameter-aware high-fidelity microstructure generation using stable diffusion

基于稳定扩散的参数感知高保真微结构生成

Hoang Cuong Phan, Minh Tien Tran, Chihun Lee, Hoheok Kim, Sehyeok Oh, Dong-Kyu Kim, Ho Won Lee

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出基于稳定扩散3.5大模型的参数感知微结构生成方法,通过数值感知嵌入和微调技术实现高保真微结构生成,验证了其在材料设计中的有效性。

Comments 46 pages, 27 figures, 6 tables, 3rd Word Congress on Artificial Intelligence in Materials & Manufacturing 2025

Journal ref Adv. Eng. Inform. (2025), 104080

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10933 2025-11-17 cs.CR 85%

On the Information-Theoretic Fragility of Robust Watermarking under Diffusion Editing

Yunyi Ni, Ziyu Yang, Ze Niu, Emily Davis, Finn Carter

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12220 2025-10-15 cs.LG 85%

Hierarchical Koopman Diffusion: Fast Generation with Interpretable Diffusion Trajectory

Hanru Bai, Weiyang Ding, Difan Zou

机构 * Fudan University(复旦大学) The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11964 2025-10-15 eess.IV 85%

Normalization-equivariant Diffusion Models: Learning Posterior Samplers From Noisy And Partial Measurements

Brett Levac, Jon Tamir, Marcelo Pereyra, Julian Tachella

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);inpainting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03886 2025-10-07 cs.AI 85%

Rare Text Semantics Were Always There in Your Diffusion Transformer

Seil Kang, Woojung Han, Dayun Ju, Seong Jae Hwang

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract)

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02838 2025-10-06 cs.DC 85%

TridentServe: A Stage-level Serving System for Diffusion Pipelines

Yifei Xia, Fangcheng Fu, Hao Yuan, Hanke Zhang, Xupeng Miao, Yijun Liu, Suhan Ling, Jie Jiang, Bin Cui

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);generative vision(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00815 2025-10-02 cs.LG stat.ML 85%

Learn to Guide Your Diffusion Model

Alexandre Galashov, Ashwini Pokle, Arnaud Doucet, Arthur Gretton, Mauricio Delbracio, Valentin De Bortoli

机构 * Google DeepMind(谷歌DeepMind) Gatsby Unit, University College London(Gatsby单位,伦敦大学学院) Google(谷歌)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03164 2025-09-09 cs.LG 85%

Test-Time Scaling of Diffusion Models via Noise Trajectory Search

Vignav Ramesh, Morteza Mardani

机构 * Harvard University(哈佛大学) NVIDIA(NVIDIA公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08364 2025-08-18 cs.LG 85%

A Survey on Pre-Trained Diffusion Model Distillations

Xuhui Fan, Zhangkai Wu, Hongyu Wu

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08754 2025-08-13 cs.GR cs.CV cs.MM 85%

Exploring Palette based Color Guidance in Diffusion Models

Qianru Qiu, Jiafeng Mao, Xueting Wang

机构 * CyberAgent Inc.(CyberAgent公司)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR、cs.MM

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03646 2025-07-08 cs.CR 85%

When There Is No Decoder: Removing Watermarks from Stable Diffusion Models in a No-box Setting

Xiaodong Wu, Tianyi Tang, Xiangman Li, Jianbing Ni, Yong Yu

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

Comments arXiv admin note: text overlap with arXiv:2408.02035

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01309 2025-07-03 cs.AR 85%

SD-Acc: Accelerating Stable Diffusion through Phase-aware Sampling and Hardware Co-Optimizations

Zhican Wang, Guanghui He, Hongxiang Fan

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20701 2025-06-27 cs.LG cs.AI stat.ML 85%

Diffusion Tree Sampling: Scalable inference-time alignment of diffusion models

Vineet Jain, Kusha Sareen, Mohammad Pedramfar, Siamak Ravanbakhsh

机构 * School of Computer Science, McGill University(计算机科学系,麦吉尔大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11039 2025-06-26 cs.LG cs.AI 85%

Angle Domain Guidance: Latent Diffusion Requires Rotation Rather Than Extrapolation

Cheng Jin, Zhenyu Xiao, Chutao Liu, Yuantao Gu

机构 * Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系) Zhili College, Tsinghua University, Beijing, China(清华大学紫金学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)

Comments Accepted at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02819 2025-06-10 cs.LG 85%

Feynman-Kac Correctors in Diffusion: Annealing, Guidance, and Product of Experts

Marta Skreta, Tara Akhound-Sadegh, Viktor Ohanesian, Roberto Bondesan, Alán Aspuru-Guzik, Arnaud Doucet, Rob Brekelmans, Alexander Tong, Kirill Neklyudov

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克AI研究所) Imperial College London(伦敦帝国学院) Google DeepMind(谷歌DeepMind) Duke University(杜克大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

Comments Accepted as a Spotlight Presentation at the International Conference of Machine Learning 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01271 2025-06-06 cs.CL cs.AI 85%

MuLan: Adapting Multilingual Diffusion Models for Hundreds of Languages with Negligible Cost

Sen Xing, Muyan Zhong, Zeqiang Lai, Liangchen Li, Jiawen Liu, Yaohui Wang, Jifeng Dai, Wenhai Wang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02928 2025-05-27 cs.CR cs.AI 85%

Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models

Jiachen Ma, Yijiang Li, Zhiqing Xiao, Anda Cao, Jie Zhang, Chao Ye, Junbo Zhao

机构 * Zhejiang University(浙江大学) UC San Diego(加州大学圣地亚哥分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

Journal ref NAACL2025

详情

展开后加载摘要…

URL PDF HTML 收藏