arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2512.03247 2025-12-04 cs.CV 85%

PixPerfect: Seamless Latent Diffusion Local Editing with Discriminative Pixel-Space Refinement

PixPerfect: 基于判别像素空间的无缝潜在扩散局部编辑

Haitian Zheng, Yuan Yao, Yongsheng Yu, Yuqian Zhou, Jiebo Luo, Zhe Lin

机构 * Adobe Research(Adobe研究院) University of Rochester(罗切斯特大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);inpainting(abstract);分类 cs.CV

AI总结 PixPerfect通过判别像素空间和伪影模拟流程,实现跨不同LDM架构和任务的无缝高保真局部编辑。

Comments Published in the Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11253 2025-12-02 cs.CV 85%

CountSteer: Steering Attention for Object Counting in Diffusion Models

CountSteer:在扩散模型中通过引导注意力实现物体计数

Hyemin Boo, Hyoryung Kim, Myungjin Lee, Seunghyeon Lee, Jiyoung Lee, Jang-Hwan Choi, Hyunsoo Cho

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 CountSteer通过引导扩散模型的注意力机制,提升指定物体数量的生成精度,实现更可控的图像生成。

Comments Accepted to AAAI 2026 Workshop on Shaping Responsible Synthetic Data in the Era of Foundation Models (RSD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13987 2025-12-01 cs.CV cs.AI 85%

Entropy Rectifying Guidance for Diffusion and Flow Models

熵校正引导用于扩散和流模型

Tariq Berrada Ifriqi, Adriana Romero-Soriano, Michal Drozdzal, Jakob Verbeek, Karteek Alahari

机构 * FAIR at Meta(Meta 的 FAIR 部门) Univ. Grenoble Alpes(格勒诺布尔阿尔卑斯大学) Inria(法国国家信息与自动化技术研究院) CNRS(法国国家科学研究中心) Grenoble INP(格勒诺布尔研究所) LJK, France(法国劳埃德-约瑟夫-克劳德实验室) McGill University(麦吉尔大学) Mila, Quebec AI institute(魁北克人工智能研究所) Canada CIFAR AI chair(加拿大 CIFAR 人工智能主席)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 ERG是一种基于注意力机制变化的简单有效引导方法,能同时提升图像质量、多样性及提示一致性,适用于扩散和流模型的多种生成任务。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00234 2025-12-01 cs.LG cs.CV cs.NA math.NA physics.comp-ph stat.ML 85%

Fast Solvers for Discrete Diffusion Models: Theory and Applications of High-Order Algorithms

离散扩散模型的快速求解器:高阶算法的理论与应用

Yinuo Ren, Haoxuan Chen, Yuchen Zhu, Wei Guo, Yongxin Chen, Grant M. Rotskoff, Molei Tao, Lexing Ying

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出高阶算法用于离散扩散模型,提升推断效率和样本质量,适用于文本、图像等生成任务。

Comments Accepted at NeurIPS 2025 as a Poster (https://openreview.net/forum?id=OuklL6Q3sO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18262 2025-11-25 cs.CV 85%

MammothModa2: A Unified AR-Diffusion Framework for Multimodal Understanding and Generation

MammothModa2: 一种用于多模态理解和生成的统一AR-扩散框架

Tao Shen, Xin Wan, Taicai Chen, Rui Zhang, Junwen Pan, Dawei Lu, Fanding Lei, Zhilin Lu, Yunfei Yang, Chen Cheng, Qi She, Chang Liu, Zhenbang Sun

机构 * ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 MammothModa2通过统一的AR-扩散框架实现多模态理解和生成,结合自回归语义规划与扩散生成,取得文本到图像和指令编辑的优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16986 2025-11-25 cs.CV 85%

VCE: Safe Autoregressive Image Generation via Visual Contrast Exploitation

VCE:通过视觉对比利用实现安全的自回归图像生成

Feng Han, Chao Gong, Zhipeng Wei, Jingjing Chen, Yu-Gang Jiang

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 VCE通过视觉对比利用方法,有效保护自回归图像生成模型,实现对不安全内容的精确擦除并保持安全内容的完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.20105 2025-11-19 cs.CV 85%

FreeSeg-Diff: Training-Free Open-Vocabulary Segmentation with Diffusion Models

Barbara Toniella Corradini, Mustafa Shukor, Paul Couairon, Guillaume Couairon, Franco Scarselli, Matthieu Cord

机构 * DIISM University of Siena(DIISM锡耶纳大学) CNRS, ISIR Sorbonne University(CNRS,ISIR索邦大学) Inria, ARCHES Sorbonne University(Inria,ARCHES索邦大学) Valeo.ai Sorbonne University(Valeo.ai索邦大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Journal ref Proceedings of the 2025 International Joint Conference on Neural Networks (IJCNN 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08075 2025-11-12 cs.CV cs.AI 85%

CLIP is All You Need for Human-like Semantic Representations in Stable Diffusion

Cameron Braunstein, Mariya Toneva, Eddy Ilg

机构 * Saarland University, Saarbrücken Germany(萨尔兰州大学) MPI for Software Systems, Saarbrücken Germany(软件系统研究所) University of Technology Nuremberg, Nuremberg Germany(纽伦堡技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 28 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07362 2025-11-11 cs.CV cs.AI cs.LG 85%

Inference-Time Scaling of Diffusion Models for Infrared Data Generation

Kai A. Horstmann, Maxim Clouser, Kia Khezeli

机构 * Cornell University(康奈尔大学) YRIKKA, Inc.(YRIKKA公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Peer-reviewed workshop paper

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Learning to Sense

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10037 2025-11-11 cs.CV 85%

Role Bias in Diffusion Models: Diagnosing and Mitigating through Intermediate Decomposition

Sina Malakouti, Adriana Kovashka

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15270 2025-11-03 cs.LG cs.AI cs.CV 85%

Scaling Diffusion Transformers Efficiently via $μ$P

Chenyu Zheng, Xinyu Zhang, Rongzhen Wang, Wei Huang, Zhi Tian, Weilin Huang, Jun Zhu, Chongxuan Li

机构 * Gaoling School of AI, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models(北京大型模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索与推荐工程研究中心) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025, 38 pages, 10 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10173 2025-10-31 cs.CV cs.AI cs.LG 85%

SPARKE: Scalable Prompt-Aware Diversity and Novelty Guidance in Diffusion Models via RKE Score

Mohammad Jalali, Haoyu Lei, Amin Gohari, Farzan Farnia

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) Department of Information Engineering, The Chinese University of Hong Kong(信息工程系,香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15863 2025-10-31 cs.CV 85%

EmoAttack: Emotion-to-Image Diffusion Models for Emotional Backdoor Generation

Tianyu Wei, Shanmin Pang, Qi Guo, Yizhuo Ma, Xiaofeng Cao, Qing Guo

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) Tongji University(同济大学) College of Computer Science, Nankai University(南开大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24717 2025-10-29 cs.CV 85%

Uniform Discrete Diffusion with Metric Path for Video Generation

Haoge Deng, Ting Pan, Fan Zhang, Yang Liu, Zhuoyan Luo, Yufeng Cui, Wenxuan Wang, Chunhua Shen, Shiguang Shan, Zhaoxiang Zhang, Xinlong Wang

机构 * National Laboratory of Pattern Recognition, CASIA(中国科学院自动化所模式识别国家实验室) Key Laboratory of Intelligent Information Processing, ICT, CAS(中国科学院信息科技重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16751 2025-10-28 cs.CV 85%

Visual Autoregressive Models Beat Diffusion Models on Inference Time Scaling

Erik Riise, Mehmet Onurcan Kaya, Dim P. Papadopoulos

机构 * Technical University of Denmark(丹麦技术大学) Pioneer Center for AI(先锋人工智能中心)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16887 2025-10-21 cs.CV 85%

Class-N-Diff: Classification-Induced Diffusion Model Can Make Fair Skin Cancer Diagnosis

Nusrat Munia, Abdullah Imran

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments EMBC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07008 2025-10-21 cs.CV cs.AI 85%

Eye-for-an-eye: Appearance Transfer with Semantic Correspondence in Diffusion Models

Sooyeon Go, Kyungmook Choi, Minjung Shin, Youngjung Uh

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

Comments project page : https://sooyeon-go.github.io/eye_for_an_eye/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12789 2025-10-15 cs.CV cs.AI cs.LG 85%

UniFusion: Vision-Language Model as Unified Encoder in Image Generation

Kevin Li, Manuel Brack, Sudeep Katakol, Hareesh Ravi, Ajinkya Kale

机构 * Adobe Applied Research(Adobe应用研究)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);image editing(abstract);分类 cs.CV

Comments Project page at https://thekevinli.github.io/unifusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11117 2025-10-14 cs.CV 85%

Demystifying Numerosity in Diffusion Models -- Limitations and Remedies

Yaqi Zhao, Xiaochen Wang, Li Dong, Wentao Zhang, Yuhui Yuan

机构 * Peking University(北京大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06085 2025-10-10 cs.CV 85%

Feedback Guidance of Diffusion Models

Felix Koulischer, Florian Handke, Johannes Deleu, Thomas Demeester, Luca Ambrogioni

机构 * Ghent University - imec(根特大学 - imec) Donders Institute for Brain Cognition and Behaviour(大脑认知与行为研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Article accepeted as poster at the 39th Annual Conference on Neural Information Processing Systems (NeurIPS25). Code is available at: https://github.com/FelixKoulischer/FBG_using_edm2

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14815 2025-10-07 cs.LG cs.AI cs.CR cs.CV 85%

What Lurks Within? Concept Auditing for Shared Diffusion Models at Scale

Xiaoyong Yuan, Xiaolong Ma, Linke Guo, Lan Zhang

机构 * Clemson University(克莱姆森大学) The University of Arizona(亚利桑那大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Extended version of the paper accepted at CCS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02296 2025-10-07 cs.LG cs.CV 85%

Continual Personalization for Diffusion Models

Yu-Chien Liao, Jr-Jen Chen, Chi-Pin Huang, Ci-Siang Lin, Meng-Lin Wu, Yu-Chiang Frank Wang

机构 * National Taiwan University(国立台湾大学) Qualcomm Technologies, Inc.(高通技术公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Journal ref ICCV-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25180 2025-10-02 cs.CV cs.AI 85%

DC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Space

Wenkun He, Yuchao Gu, Junyu Chen, Dongyun Zou, Yujun Lin, Zhekai Zhang, Haocheng Xi, Muyang Li, Ligeng Zhu, Jincheng Yu, Junsong Chen, Enze Xie, Song Han, Han Cai

机构 * NVIDIA

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments Tech Report. The first three authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09622 2025-09-30 cs.CV 85%

LoRACLR: Contrastive Adaptation for Customization of Diffusion Models

Enis Simsar, Thomas Hofmann, Federico Tombari, Pinar Yanardag

机构 * ETH Zürich(苏黎世联邦理工学院) TU Munich(慕尼黑技术大学) Google(谷歌) Virginia Tech(弗吉尼亚理工大学)

专题命中 扩散模型 :diffusion(title);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

Comments Accepted to CVPR'25. Project page: https://loraclr.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15809 2025-09-26 cs.CV 85%

MMaDA: Multimodal Large Diffusion Language Models

Ling Yang, Ye Tian, Bowen Li, Xinchen Zhang, Ke Shen, Yunhai Tong, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Peking University(北京大学) Tsinghua University(清华大学) ByteDance Seed(字节跳动种子)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments NeurIPS 2025. Project: https://github.com/Gen-Verse/MMaDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04344 2025-09-25 cs.CV 85%

LEDiT: Your Length-Extrapolatable Diffusion Transformer without Positional Encoding

Shen Zhang, Siyuan Liang, Yaning Tan, Zhaowei Chen, Linze Li, Ge Wu, Yuhao Chen, Shuheng Li, Zhenyu Zhao, Caihua Chen, Jiajun Liang, Yao Tang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06028 2025-09-24 cs.CV 85%

SparseDiT: Token Sparsification for Efficient Diffusion Transformer

Shuning Chang, Pichao Wang, Jiasheng Tang, Fan Wang, Yi Yang

机构 * Zhejiang University(浙江大学) Damo Academy, Alibaba Group(阿里达摩院) Hupan Lab(虎斑实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11196 2025-09-23 cs.CV 85%

DiCo: Revitalizing ConvNets for Scalable and Efficient Diffusion Modeling

Yuang Ai, Qihang Fan, Xuefeng Hu, Zhenheng Yang, Ran He, Huaibo Huang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学技术大学) ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13499 2025-09-23 cs.CV 85%

U-Shape Mamba: State Space Model for faster diffusion

Alex Ergasti, Filippo Botti, Tomaso Fontanini, Claudio Ferrari, Massimo Bertozzi, Andrea Prati

机构 * University of Parma(帕尔马大学) University of Siena(锡耶纳大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted at CVPR 2025 eLVM workshop. The code is here: https://github.com/ErgastiAlex/U-Shape-Mamba

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09610 2025-09-12 cs.CV cs.AI 85%

Mechanistic Learning with Guided Diffusion Models to Predict Spatio-Temporal Brain Tumor Growth

Daria Laslo, Efthymios Georgiou, Marius George Linguraru, Andreas Rauschecker, Sabine Muller, Catherine R. Jutzeler, Sarah Bruningk

机构 * ETH Zurich, 8092 Zurich, Switzerland - SIB Swiss Institue of Bioinformatics, 1015 Lausanne, Switzerland Department of Radiation Oncology, Inselspital, Bern University Hospital University of Bern, Switzerland Sheikh Zayed Institute for Pediatric Surgical Innovation, Children’s National Medical Center, Washington, DC 20010, United States University of California San Francisco, San Francisco, CA 94143, United States University Children's Hospital Zurich, 8008 Zurich, Switzerland

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏