arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86623 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70082 篇

2503.01370 2025-03-24 cs.GR cs.CV cs.MM 85%

Kiss3DGen: Repurposing Image Diffusion Models for 3D Asset Generation

Jiantao Lin, Xin Yang, Meixi Chen, Yingjie Xu, Dongyu Yan, Leyi Wu, Xinli Xu, Lie XU, Shunsi Zhang, Ying-Cong Chen

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV、cs.GR、cs.MM

Comments The first three authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14007 2025-02-24 cs.GR cs.AI cs.CV cs.MM eess.IV 85%

d-Sketch: Improving Visual Fidelity of Sketch-to-Image Translation with Pretrained Latent Diffusion Models without Retraining

Prasun Roy, Saumik Bhattacharya, Subhankar Ghosh, Umapada Pal, Michael Blumenstein

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV、cs.GR、cs.MM

Comments Accepted in The International Conference on Pattern Recognition (ICPR) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12432 2024-12-10 cs.RO 85%

Imagine2Servo: Intelligent Visual Servoing with Diffusion-Driven Goal Generation for Robotic Tasks

Pranjali Pathre, Gunjan Gupta, M. Nomaan Qureshi, Mandyam Brunda, Samarth Brahmbhatt, K. Madhava Krishna

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image editing(abstract)

Comments Published at 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02031 2024-12-09 cs.DC cs.AI cs.LG 85%

SwiftDiffusion: Efficient Diffusion Model Serving with Add-on Modules

Suyi Li, Lingyun Yang, Xiaoxiao Jiang, Hanfeng Lu, Dakai An, Zhipeng Di, Weiyi Lu, Jiawei Chen, Kan Liu, Yinghao Yu, Tao Lan, Guodong Yang, Lin Qu, Liping Zhang, Wei Wang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15798 2024-12-03 cs.LG 85%

BK-SDM: A Lightweight, Fast, and Cheap Version of Stable Diffusion

Bo-Kyeong Kim, Hyoung-Kyu Song, Thibault Castells, Shinkook Choi

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);personalized generation(abstract)

Comments ECCV 2024 Camera-Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08306 2024-08-16 eess.IV 85%

Accelerated Image-Aware Generative Diffusion Modeling

Tanmay Asthana, Yufang Bao, Hamid Krim

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04718 2024-08-12 cs.LG stat.ML 85%

Zero-Shot Uncertainty Quantification using Diffusion Probabilistic Models

Dule Shu, Amir Barati Farimani

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09970 2024-05-28 cs.LG stat.ML 85%

Accelerating Parallel Sampling of Diffusion Models

Zhiwei Tang, Jiasheng Tang, Hao Luo, Fan Wang, Tsung-Hui Chang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.05364 2024-03-08 cs.LG stat.ML 85%

Diffusion Models for Constrained Domains

Nic Fishman, Leo Klarner, Valentin De Bortoli, Emile Mathieu, Michael Hutchinson

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

Comments Published in Transactions on Machine Learning Research (07/2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01639 2024-03-05 cs.LG stat.ML 85%

Theoretical Insights for Diffusion Guidance: A Case Study for Gaussian Mixture Models

Yuchen Wu, Minshuo Chen, Zihao Li, Mengdi Wang, Yuting Wei

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)

Comments 41 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01044 2024-01-03 cs.SD cs.AI cs.CL eess.AS 85%

Auffusion: Leveraging the Power of Diffusion and Large Language Models for Text-to-Audio Generation

Jinlong Xue, Yayue Deng, Yingming Gao, Ya Li

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);inpainting(abstract)

Comments Demo and implementation at https://auffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11311 2023-10-18 cs.LG stat.ML 85%

Elucidating The Design Space of Classifier-Guided Diffusion Generation

Jiajun Ma, Tianyang Hu, Wenjia Wang, Jiacheng Sun

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.02591 2023-08-29 cs.LG cs.AI cs.SI 85%

Generative Diffusion Models on Graphs: Methods and Applications

Chengyi Liu, Wenqi Fan, Yunqing Liu, Jiatong Li, Hang Li, Hui Liu, Jiliang Tang, Qing Li

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);inpainting(abstract)

Comments This survey paper is accepted by IJCAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01193 2023-07-04 cs.LG cs.AI 85%

Squeezing Large-Scale Diffusion Models for Mobile

Jiwoong Choi, Minkyu Kim, Daehyun Ahn, Taesu Kim, Yulhwa Kim, Dongwon Jo, Hyesung Jeon, Jae-Joon Kim, Hyungjun Kim

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract)

Comments 7 pages, 8 figures, ICML 2023 Workshop on Challenges in Deployable Generative AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12502 2023-05-23 cs.CR 85%

Watermarking Diffusion Model

Yugeng Liu, Zheng Li, Michael Backes, Yun Shen, Yang Zhang

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.08942 2023-02-01 cs.LG 85%

Meta-Learning via Classifier(-free) Diffusion Guidance

Elvis Nava, Seijin Kobayashi, Yifei Yin, Robert K. Katzschmann, Benjamin F. Grewe

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03718 2024-09-06 cs.CV cs.GR 84%

Geometry Image Diffusion: Fast and Data-Efficient Text-to-3D with Image-Based Surface Representation

Slava Elizarov, Ciara Rowles, Simon Donné

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR

Comments 11 pages, 9 figures, Project page: https://unity-research.github.io/Geometry-Image-Diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09250 2024-05-30 cs.CV cs.GR cs.LG 84%

Single Mesh Diffusion Models with Field Latents for Texture Generation

Thomas W. Mitchel, Carlos Esteves, Ameesh Makadia

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR

Comments CVPR 2024. Code and additional visualizations available: https://single-mesh-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02490 2024-03-27 cs.CV cs.AI cs.GR cs.NE 84%

Diffusion Models Generate Images Like Painters: an Analytical Theory of Outline First, Details Later

Binxu Wang, John J. Vastola

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV、cs.GR

Comments 44 pages, 28 figures. A briefer version was presented at NeurIPS23 Workshop on Diffusion Models [arXiv:2311.10892]

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.14818 2023-03-22 cs.CV cs.GR cs.LG 84%

Blended Diffusion for Text-driven Editing of Natural Images

Omri Avrahami, Dani Lischinski, Ohad Fried

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV、cs.GR

Comments CVPR 2022. Code is available at: https://omriavrahami.com/blended-diffusion-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30093 2026-05-29 cs.CV 84%

Geometry Matters: 3D Foundation Priors for Learning Semantic Correspondence

几何至关重要:用于学习语义对应的3D基础先验

Artur Jesslen, Olaf Dünkel, Adam Kortylewski

机构 * University of Freiburg(弗赖堡大学) Max Planck Institute for Informatics(马克斯·普朗克信息研究所) CISPA Helmholtz Center for Information Security(CISPA 河岸信息安全中心)

专题命中 扩散模型 :diffusion(summary_cn,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出一种3D感知的后训练框架,利用3D基础模型(SAM3D)估计物体几何和姿态,生成几何感知特征图,结合DINO和Stable Diffusion特征,通过测地距离过滤候选对应,训练轻量适配器改进语义对应。

Comments 9 pages (main paper), 21 pages (total), 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02772 2026-05-29 cs.CV 84%

Linearizing Vision Transformer with Test-Time Training

通过测试时训练线性化视觉Transformer

Yining Li, Dongchen Han, Zeyu Liu, Hanyi Wang, Yulin Wang, Gao Huang

机构 * Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(summary_cn,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出利用测试时训练(TTT)架构与Softmax注意力的结构对齐性,结合键实例归一化和局部性增强模块,实现从预训练Transformer到线性注意力模型的有效权重迁移,在Stable Diffusion 3.5上仅需1小时微调即可达到相近的图像生成质量并加速推理。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19902 2026-04-23 cs.CV cs.AI cs.LG 84%

MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings

MMCORE:多模态连接与表征对齐的潜在嵌入

Zijie Li, Yichun Shi, Jingxiang Sun, Ye Wang, Yixuan Huang, Zhiyao Guo, Xiaochen Lian, Peihao Zhu, Yu Tian, Zhonghua Zhai, Peng Wang

机构 * ByteDance Seed(字节跳动种子)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 MMCORE通过预训练视觉-语言模型生成语义视觉嵌入,结合扩散模型实现多模态图像生成与编辑,提升生成质量并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13432 2026-04-16 cs.CV cs.AI 84%

MaMe & MaRe: Matrix-Based Token Merging and Restoration for Efficient Visual Perception and Synthesis

MaMe & MaRe:基于矩阵的令牌合并与恢复用于高效的视觉感知与合成

Simin Huo, Ning Li

专题命中 扩散模型 :diffusion(summary_cn,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出MaMe和MaRe,通过矩阵运算实现免训练的令牌合并与恢复,提升视觉模型效率,实验显示在ViT-B上吞吐量提升2%且精度下降1.0%,在图像合成中减少Stable Diffusion v2.1生成延迟31%。

Comments 20 pages. Extended version of CVPR 2026 Findings paper. Neurocomputing (Elsevier) under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03850 2025-04-08 cs.CV cs.AI cs.CR cs.LG stat.ML 84%

Detection Limits and Statistical Separability of Tree Ring Watermarks in Rectified Flow-based Text-to-Image Generation Models

Ved Umrajkar, Aakash Kumar Singh

专题命中 扩散模型 :image generation(title);text-to-image(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05444 2025-02-11 eess.IV cs.CV 84%

Diverse Image Generation with Diffusion Models and Cross Class Label Learning for Polyp Classification

Vanshali Sharma, Debesh Jha, M. K. Bhuyan, Pradip K. Das, Ulas Bagci

专题命中 扩散模型 :image generation(title);diffusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13974 2026-07-08 cs.CV cs.AI cs.MM 版本更新 84%

Few Channels Draw The Whole Picture: Revealing Massive Activations in Diffusion Transformers

少量通道绘制整体画面:揭示扩散变换器中的大规模激活

Evelyn Turri, Davide Bucciarelli, Sara Sarto, Lorenzo Baraldi, Marcella Cornia

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 研究扩散变换器中少量关键通道对图像生成的决定性作用,揭示其在功能、空间组织和可迁移性上的核心贡献。

Comments Project page: https://aimagelab.github.io/MAs-DiT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01803 2026-07-07 cs.CV cs.GR cs.RO 新提交 84%

PixGS: Pixel-Space Diffusion for Direct 3D Gaussian Splat Generation

PixGS: 像素空间扩散用于直接三维高斯泼溅生成

Cao Duy, Phong Nguyen-Ha

机构 * Qualcomm AI Research(高通人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 提出单阶段管道PixGS,利用像素空间扩散从文本或图像直接生成高质量3D高斯泼溅,避免潜在压缩伪影,并引入表面法线、深度和高频结构监督,在单张A100 GPU上1秒内生成,性能超越现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17432 2026-06-17 cs.GR cs.CV 新提交 84%

Edit3DGS: Unified Framework for Dynamic Head Editing via 2D Instruction-Guided Diffusion and 3D Gaussian Splatting

Edit3DGS:通过2D指令引导扩散与3D高斯泼溅的动态头部编辑统一框架

Duy-Dat Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM, Ho Chi Minh, Vietnam(越南胡志明市国家大学) Vietnam National University, Ho Chi Minh, Vietnam(越南国家大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR

AI总结 提出Edit3DGS统一框架,结合2D指令引导扩散与3D高斯泼溅,实现动态3D头部的可控编辑,支持表情变换、属性修改等操作,并保持身份与运动动态的一致性。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28762 2026-06-04 cs.CV cs.AI cs.GR cs.LG 84%

On-the-fly Repulsion in the Contextual Space for Rich Diversity in Diffusion Transformers

上下文空间中的即时排斥以实现扩散变换器的丰富多样性

Omer Dahary, Benaya Koren, Daniel Garibi, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学) Snap Research Israel(Snap以色列研究)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 针对文本到图像扩散模型多样性不足的问题,提出在扩散变换器的上下文空间中通过多模态注意力通道施加即时排斥,在不牺牲视觉保真度和语义一致性的前提下显著提升生成多样性,且计算开销小,适用于现代Turbo和蒸馏模型。

Comments SIGGRAPH 2026. Project page: https://contextual-repulsion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏