arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2510.02692 2026-03-04 cs.LG cs.AI 85%

Fine-Tuning Diffusion Models via Intermediate Distribution Shaping

通过中间分布塑形微调扩散模型

Gautham Govind Anil, Shaan Ul Haque, Nithish Kannen, Dheeraj Nagaraj, Sanjay Shakkottai, Karthikeyan Shanmugam

机构 * Google DeepMind(谷歌DeepMind) Georgia Institute of Technology(佐治亚理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 通过中间分布塑形提升扩散模型微调效果,改进文本到图像生成质量

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25170 2026-02-12 cs.LG cs.AI stat.ML 85%

GLASS Flows: Transition Sampling for Alignment of Flow and Diffusion Models

GLASS Flows: 用于对齐流模型与扩散模型的过渡采样

Peter Holderrieth, Uriel Singer, Tommi Jaakkola, Ricky T. Q. Chen, Yaron Lipman, Brian Karrer

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) FAIR, Meta(FAIR与Meta)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 GLASS Flows通过在流匹配模型内部模拟来提升流和扩散模型的推理效率,结合ODE的效率和SDE的随机性,实现文本生成性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02927 2026-02-04 stat.ML cs.LG 85%

Training-Free Self-Correction for Multimodal Masked Diffusion Models

无需训练的多模态掩码扩散模型自校正

Yidong Ouyang, Panwen Hu, Zhengyan Wan, Zhe Wang, Liyan Xie, Dmitriy Bespalov, Ying Nian Wu, Guang Cheng, Hongyuan Zha, Qiang Sun

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学) East China Normal University(华东师范大学) University of Virginia(弗吉尼亚大学) University of Minnesota(明尼苏达大学) Drexel university(德雷塞尔大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Toronto(多伦多大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出无需训练的多模态掩码扩散模型自校正方法,通过减少采样步骤提升生成质量,适用于文本到图像和多模态理解任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02051 2026-02-03 cs.AI 85%

SIDiffAgent: Self-Improving Diffusion Agent

SIDiffAgent:自改进扩散代理

Shivank Garg, Ayush Singh, Gaurav Kumar Nayak

机构 * Indian Institute of Technology, Roorkee(印度理工学院罗尔基分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 SIDiffAgent通过自改进的扩散代理框架,利用Qwen系列模型提升文本到图像生成的可靠性与可控性,实现更高质量的图像输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22127 2026-01-30 cs.CV cs.GR cs.LG cs.MM 85%

EditYourself: Audio-Driven Generation and Manipulation of Talking Head Videos with Diffusion Transformers

EditYourself: 基于音频驱动的谈话头视频生成与操控的扩散变换器

John Flynn, Wolfgang Paier, Dimitar Dinev, Sam Nhut Nguyen, Hayk Poghosyan, Manuel Toribio, Sandipan Banerjee, Guy Gafni

机构 * Pipio AI Amazon(亚马逊)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 EditYourself通过音频驱动的视频到视频编辑框架,实现基于脚本的谈话头视频修改,包括内容的添加、删除和重新定时,同时保持唇同步和时间一致性。

Comments Project page: https://edit-yourself.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16292 2025-12-23 cs.CY cs.AI 85%

Visual Stereotypes of Autism Spectrum in Janus-Pro-7B, DALL-E, Stable Diffusion, SDXL, FLUX, and Midjourney

自闭症光谱的视觉刻板印象:Janus-Pro-7B、DALL-E、Stable Diffusion、SDXL、FLUX和Midjourney的视觉表现

Maciej Wodziński, Marcin Rządeczka, Anastazja Szuła, Kacper Dudzic, Marcin Moskalewicz

机构 * Maria Curie-Skłodowska University(玛丽·居里大学) IDEAS Research Institute(IDEAS研究机构) Adam Mickiewicz University(亚当·密茨凯维奇大学) AMU Center for Artificial Intelligence(AMU人工智能中心) Poznań University of Medical Sciences(波兹南医科大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本研究评估了六个AI图像生成模型在自闭症相关图像中的刻板印象表现,发现尽管技术有所改进,但模型在再现潜在有害刻板印象方面无显著变化。

Comments Preprint of a publication accepted to Identity-Aware AI 2025 (ECAI 2025)

Journal ref CEUR Workshop proceeding, 2025, Vol-4136 urn:nbn:de:0074-4136-x; https://ceur-ws.org/Vol-4136/iaai15.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15663 2025-12-08 cs.SE cs.AI 85%

SustainDiffusion: Optimising the Social and Environmental Sustainability of Stable Diffusion Models

SustainDiffusion: 优化稳定扩散模型的社会和环境可持续性

Giordano d'Aloisio, Tosin Fadahunsi, Jay Choy, Rebecca Moussa, Federica Sarro

机构 * University of L'Aquila(拉奎拉大学) University College London(伦敦大学学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 SustainDiffusion通过优化超参数和提示结构,减少稳定扩散模型的性别、种族偏见和能耗,提升其社会和环境可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00459 2025-11-21 cond-mat.mtrl-sci cs.AI 85%

Parameter-aware high-fidelity microstructure generation using stable diffusion

基于稳定扩散的参数感知高保真微结构生成

Hoang Cuong Phan, Minh Tien Tran, Chihun Lee, Hoheok Kim, Sehyeok Oh, Dong-Kyu Kim, Ho Won Lee

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 本文提出基于稳定扩散3.5大模型的参数感知微结构生成方法,通过数值感知嵌入和微调技术实现高保真微结构生成,验证了其在材料设计中的有效性。

Comments 46 pages, 27 figures, 6 tables, 3rd Word Congress on Artificial Intelligence in Materials & Manufacturing 2025

Journal ref Adv. Eng. Inform. (2025), 104080

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10933 2025-11-17 cs.CR 85%

On the Information-Theoretic Fragility of Robust Watermarking under Diffusion Editing

Yunyi Ni, Ziyu Yang, Ze Niu, Emily Davis, Finn Carter

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12220 2025-10-15 cs.LG 85%

Hierarchical Koopman Diffusion: Fast Generation with Interpretable Diffusion Trajectory

Hanru Bai, Weiyang Ding, Difan Zou

机构 * Fudan University(复旦大学) The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11964 2025-10-15 eess.IV 85%

Normalization-equivariant Diffusion Models: Learning Posterior Samplers From Noisy And Partial Measurements

Brett Levac, Jon Tamir, Marcelo Pereyra, Julian Tachella

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);inpainting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03886 2025-10-07 cs.AI 85%

Rare Text Semantics Were Always There in Your Diffusion Transformer

Seil Kang, Woojung Han, Dayun Ju, Seong Jae Hwang

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image editing(abstract)

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02838 2025-10-06 cs.DC 85%

TridentServe: A Stage-level Serving System for Diffusion Pipelines

Yifei Xia, Fangcheng Fu, Hao Yuan, Hanke Zhang, Xupeng Miao, Yijun Liu, Suhan Ling, Jie Jiang, Bin Cui

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);generative vision(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00815 2025-10-02 cs.LG stat.ML 85%

Learn to Guide Your Diffusion Model

Alexandre Galashov, Ashwini Pokle, Arnaud Doucet, Arthur Gretton, Mauricio Delbracio, Valentin De Bortoli

机构 * Google DeepMind(谷歌DeepMind) Gatsby Unit, University College London(Gatsby单位,伦敦大学学院) Google(谷歌)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03164 2025-09-09 cs.LG 85%

Test-Time Scaling of Diffusion Models via Noise Trajectory Search

Vignav Ramesh, Morteza Mardani

机构 * Harvard University(哈佛大学) NVIDIA(NVIDIA公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08364 2025-08-18 cs.LG 85%

A Survey on Pre-Trained Diffusion Model Distillations

Xuhui Fan, Zhangkai Wu, Hongyu Wu

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08754 2025-08-13 cs.GR cs.CV cs.MM 85%

Exploring Palette based Color Guidance in Diffusion Models

Qianru Qiu, Jiafeng Mao, Xueting Wang

机构 * CyberAgent Inc.(CyberAgent公司)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR、cs.MM

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03646 2025-07-08 cs.CR 85%

When There Is No Decoder: Removing Watermarks from Stable Diffusion Models in a No-box Setting

Xiaodong Wu, Tianyi Tang, Xiangman Li, Jianbing Ni, Yong Yu

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

Comments arXiv admin note: text overlap with arXiv:2408.02035

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01309 2025-07-03 cs.AR 85%

SD-Acc: Accelerating Stable Diffusion through Phase-aware Sampling and Hardware Co-Optimizations

Zhican Wang, Guanghui He, Hongxiang Fan

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20701 2025-06-27 cs.LG cs.AI stat.ML 85%

Diffusion Tree Sampling: Scalable inference-time alignment of diffusion models

Vineet Jain, Kusha Sareen, Mohammad Pedramfar, Siamak Ravanbakhsh

机构 * School of Computer Science, McGill University(计算机科学系,麦吉尔大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11039 2025-06-26 cs.LG cs.AI 85%

Angle Domain Guidance: Latent Diffusion Requires Rotation Rather Than Extrapolation

Cheng Jin, Zhenyu Xiao, Chutao Liu, Yuantao Gu

机构 * Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系) Zhili College, Tsinghua University, Beijing, China(清华大学紫金学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)

Comments Accepted at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02819 2025-06-10 cs.LG 85%

Feynman-Kac Correctors in Diffusion: Annealing, Guidance, and Product of Experts

Marta Skreta, Tara Akhound-Sadegh, Viktor Ohanesian, Roberto Bondesan, Alán Aspuru-Guzik, Arnaud Doucet, Rob Brekelmans, Alexander Tong, Kirill Neklyudov

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克AI研究所) Imperial College London(伦敦帝国学院) Google DeepMind(谷歌DeepMind) Duke University(杜克大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

Comments Accepted as a Spotlight Presentation at the International Conference of Machine Learning 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01271 2025-06-06 cs.CL cs.AI 85%

MuLan: Adapting Multilingual Diffusion Models for Hundreds of Languages with Negligible Cost

Sen Xing, Muyan Zhong, Zeqiang Lai, Liangchen Li, Jiawen Liu, Yaohui Wang, Jifeng Dai, Wenhai Wang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02928 2025-05-27 cs.CR cs.AI 85%

Jailbreaking Prompt Attack: A Controllable Adversarial Attack against Diffusion Models

Jiachen Ma, Yijiang Li, Zhiqing Xiao, Anda Cao, Jie Zhang, Chao Ye, Junbo Zhao

机构 * Zhejiang University(浙江大学) UC San Diego(加州大学圣地亚哥分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

Journal ref NAACL2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01370 2025-03-24 cs.GR cs.CV cs.MM 85%

Kiss3DGen: Repurposing Image Diffusion Models for 3D Asset Generation

Jiantao Lin, Xin Yang, Meixi Chen, Yingjie Xu, Dongyu Yan, Leyi Wu, Xinli Xu, Lie XU, Shunsi Zhang, Ying-Cong Chen

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV、cs.GR、cs.MM

Comments The first three authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14007 2025-02-24 cs.GR cs.AI cs.CV cs.MM eess.IV 85%

d-Sketch: Improving Visual Fidelity of Sketch-to-Image Translation with Pretrained Latent Diffusion Models without Retraining

Prasun Roy, Saumik Bhattacharya, Subhankar Ghosh, Umapada Pal, Michael Blumenstein

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV、cs.GR、cs.MM

Comments Accepted in The International Conference on Pattern Recognition (ICPR) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12432 2024-12-10 cs.RO 85%

Imagine2Servo: Intelligent Visual Servoing with Diffusion-Driven Goal Generation for Robotic Tasks

Pranjali Pathre, Gunjan Gupta, M. Nomaan Qureshi, Mandyam Brunda, Samarth Brahmbhatt, K. Madhava Krishna

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image editing(abstract)

Comments Published at 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02031 2024-12-09 cs.DC cs.AI cs.LG 85%

SwiftDiffusion: Efficient Diffusion Model Serving with Add-on Modules

Suyi Li, Lingyun Yang, Xiaoxiao Jiang, Hanfeng Lu, Dakai An, Zhipeng Di, Weiyi Lu, Jiawei Chen, Kan Liu, Yinghao Yu, Tao Lan, Guodong Yang, Lin Qu, Liping Zhang, Wei Wang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15798 2024-12-03 cs.LG 85%

BK-SDM: A Lightweight, Fast, and Cheap Version of Stable Diffusion

Bo-Kyeong Kim, Hyoung-Kyu Song, Thibault Castells, Shinkook Choi

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);personalized generation(abstract)

Comments ECCV 2024 Camera-Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08306 2024-08-16 eess.IV 85%

Accelerated Image-Aware Generative Diffusion Modeling

Tanmay Asthana, Yufang Bao, Hamid Krim

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏