arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86585 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70051 篇

2605.30230 2026-05-29 cs.CV 87%

IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation

IP-Adapter 就够了:迈向免微调扩散模型的人脸说话视频生成

Hao Wu, Xiangyang Luo, Hao Wang, Jiawei Zhang, Yi Zhang, Jinwei Wang

机构 * Information Engineering University(信息工程大学) Huai’an University(淮安大学) Chongqing University of Post and Telecommunications(重庆邮电大学) Nankai University(南开大学)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 提出一种免微调范式,利用预训练的 Stable Diffusion 和 IP-Adapter,结合三个无参数组件解决身份漂移、同步误差和时间不稳定问题,在唇同步精度和视觉保真度上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24792 2026-05-26 cs.CV cs.AI 87%

Parameter-Efficient VLMs for Gastrointestinal Endoscopy: Medical Image Generation and Clinical Visual Question Answering

用于胃肠内窥镜的参数高效视觉语言模型:医学图像生成与临床视觉问答

Ojonugwa Oluwafemi Ejiga Peter, Frederick Akor Ejiga, Fahmi Khalifa, Md Mahmudur Rahman

机构 * Computer Science Department, Morgan State University(莫尔甘州大学计算机科学系) International Organization for Migration (IOM)(国际移民组织) Electrical & Computer Engineering Department, Morgan State University(莫尔甘州大学电气与计算机工程系)

专题命中 扩散模型 :diffusion(summary_cn,abstract);image generation(title);分类 cs.CV

AI总结 提出双流水线参数高效微调模型,结合Florence-2和LoRA Stable Diffusion,分别解决临床视觉问答和隐私保护合成数据生成问题,在Kvasir-VQA数据集上取得高ROUGE和BLEU分数,并显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22717 2026-05-22 cs.SD cs.AI cs.LG cs.MM 87%

Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators

实时音乐扩散模型:交互式音乐生成扩散模型的高效微调与后训练

Zachary Novack, Stephen Brade, Haven Kim, Hugo Flores García, Nithya Shikarpur, Chinmay Talegaonkar, Suwan Kim, Valerie K. Chen, Julian McAuley, Taylor Berg-Kirkpatrick, Cheng-Zhi Anna Huang

机构 * UC San Diego(加州大学圣迭戈分校) MIT(麻省理工学院) Adobe(Adobe公司)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.MM

AI总结 本文研究了音频扩散模型能否通过块级KV缓存高效地转化为交互式模型,从而在消费级硬件上实现。提出的Live Music Diffusion Models (LMDMs)通过块级KV缓存恢复并超越了离散Live Music Models (LMMs)的推理复杂度,并通过ARC-Forcing范式实现稳定的后训练对齐,从而在无需显式RL或奖励模型的情况下减少误差累积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11494 2026-05-13 cs.CV 87%

STRIDE: Training-Free Diversity Guidance via PCA-Directed Feature Perturbation in Single-Step Diffusion Models

STRIDE:通过PCA引导的特征扰动在单步扩散模型中实现训练自由的多样性指导

Ankit Yadav, Arpit Garg, Ta Duc Huy, Lingqiao Liu

机构 * Australian Institute for Machine Learning, Adelaide University, Australia(澳大利亚机器学习研究所,阿德莱德大学,澳大利亚)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract,abstract_cn);分类 cs.CV

AI总结 针对单步扩散模型多样性不足问题,STRIDE通过PCA引导的特征扰动在单次前向传递中提升多样性,保持文本对齐性,优于现有训练自由基线。

Comments 11 Pages 3 figures 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08276 2026-05-12 cs.CV 87%

Beyond ViT Tokens: Masked-Diffusion Pretrained Convolutional Pathology Foundation Model for Cell-Level Dense Prediction

超越ViT标记:面向细胞级密集预测的掩码扩散预训练卷积病理基础模型

Weiming Chen, Xitong Ling, Zhenyang Cai, Xidong Wang, Jiawen Li, Tian Guan, Benyou Wang, Yonghong He

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Research Institute of Tsinghua, Pearl River Delta(清华大学 Pearl River Delta 研究院) The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳))

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文提出ConvNeXt Masked-Diffusion模型,通过卷积生成预训练框架提升病理图像细胞级密集预测性能,实验表明其在有限标注条件下表现更优,优于现有ViT模型和端到端分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08218 2026-05-12 cs.LG cs.CV 87%

Deep Dreams Are Made of This: Visualizing Monosemantic Features in Diffusion Models

深度梦境由此构成:在扩散模型中可视化单义特征

Adam Szokalski, Mateusz Modrzejewski

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文提出通过优化的潜在可视化(LVO)技术,扩展了用于卷积神经网络的特征可视化方法至潜在扩散模型。通过稀疏自编码器(SAEs)将多义层表示分解为单义特征,展示了在Stable Diffusion 1.5模型上可视化可识别概念的效果,相比基线方法更清晰且具有相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14186 2026-05-11 cs.CV 87%

Setting-Matched and Semantics-Scaled Benchmarking of One-Step Generative Models Against Multistep Diffusion and Flow Models

一步生成模型与多步扩散和流模型的匹配与语义缩放基准测试

Advaith Ravishankar, Serena Liu, Mingyang Wang, Todd Zhou, Jeffrey Zhou, Arnav Sharma, Ziling Hu, Léopold Das, Abdulaziz Sobirov, Faizaan Siddique, Freddy Yu, Seungjoo Baek, Yan Luo, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文通过ImageNet验证集、ImageNetV2和reLAIONet数据集,评估了八种模型在类条件协议下的性能,发现FID和CFG选择在少步情况下可能误导,引入csFID、psFID等指标以诊断语义对齐的图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02493 2026-05-08 cs.CV cs.AI 87%

PixelGen: Improving Pixel Diffusion with Perceptual Supervision

PixelGen: 通过感知监督改进像素扩散

Zehong Ma, Ruihan Xu, Shiliang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 PixelGen通过引入LPIPS和P-DINO损失增强x预测,采用噪声门控策略提升图像质量,在ImageNet-256上取得5.11的FID分数,且在文本到图像生成中表现优异。

Comments Project Pages: https://zehong-ma.github.io/PixelGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26341 2026-04-30 cs.CV 87%

SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness

SpatialFusion:赋予统一图像生成内在三维几何意识

Haiyi Qiu, Kaihang Pan, Jiacheng Li, Juncheng Li, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) HiThink Research(HiThink研究院)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 本文提出SpatialFusion框架,通过引入混合变压器增强MLLM的三维几何建模能力,并利用深度适配器将显式几何约束注入扩散模型,提升空间感知任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19141 2026-04-22 cs.CV 87%

Denoising, Fast and Slow: Difficulty-Aware Adaptive Sampling for Image Generation

去噪、快速与缓慢:面向图像生成的难度感知自适应采样

Johannes Schusterbauer, Ming Gui, Yusong Li, Pingchuan Ma, Felix Krause, Björn Ommer

机构 * CompVis LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 本文提出Patch Forcing框架,通过自适应采样和空间噪声变化提升图像生成效果,优于传统基线方法,适用于分类条件ImageNet和文本到图像生成。

Comments CVPR 2026, Code: https://github.com/CompVis/patch-forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17287 2026-04-21 cs.CV 87%

Spectral Forensics of Diffusion Attention Graphs for Copy-Move Forgery Detection

扩散注意力图的频谱取证用于复制-移动伪造检测

H. M. Shadman Tabib, Tasriad Ahmed Tias, Nafis Tahmid

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.CV

AI总结 本文提出GraphSpecForge框架,通过分析预训练Stable Diffusion U-Net的注意力图频谱结构,检测复制-移动伪造。利用归一化图拉普拉斯矩阵的频谱重分布特性,构建基于Wasserstein距离的异常检测器,无需重新训练,在多个基准数据集上取得良好效果。

Comments Preprint before NeurIPS main track submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12668 2026-04-15 cs.CV 87%

OFA-Diffusion Compression: Compressing Diffusion Model in One-Shot Manner

OFA-Diffusion压缩:以一次训练方式压缩扩散模型

Haoyang Jiang, Zekun Wang, Mingyang Yi, Xiuyu Li, Lanqing Hu, Junxian Cai, Qingbin Liu, Xi Chen, Ju Fan

机构 * Renmin University of China(中国人民大学) Alibaba Inc.(阿里巴巴公司) Tencent Inc.(腾讯公司) Independent researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,title_cn);image generation(abstract);分类 cs.CV

AI总结 本文提出OFA压缩框架,通过一次训练生成不同计算量的子网络,降低重复训练开销,实现高效压缩的扩散模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19206 2026-03-20 cs.CV 87%

RPiAE: A Representation-Pivoted Autoencoder Enhancing Both Image Generation and Editing

RPiAE:一种基于表示的自编码器,同时增强图像生成和编辑

Yue Gong, Hongyu Li, Shanyuan Liu, Bo Cheng, Yuhang Ma, Liebucha Wu, Xiaoyu Wu, Manyuan Zhang, Dawei Leng, Yuhui Yin, Lijun Zhang

机构 * Beihang University(北航大学) AI Research(360人工智能研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 本文提出RPiAE,一种基于表示的自编码器,通过引入表示偏转正则化和变分桥梁,提升图像生成和编辑的性能,实验表明其在文本到图像生成和图像编辑中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00036 2026-02-10 cs.LG cs.CV 87%

A-FloPS: Accelerating Diffusion Models via Adaptive Flow Path Sampler

A-FloPS:通过自适应流路径采样器加速扩散模型

Cheng Jin, Zhenyu Xiao, Yuantao Gu

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 A-FloPS通过自适应流路径采样器提升扩散模型的生成质量和效率,实现低计算成本的高质量生成。

Comments published on AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01609 2026-02-03 cs.CV 87%

Token Pruning for In-Context Generation in Diffusion Transformers

令牌剪枝用于扩散变换器中的上下文生成

Junqing Lin, Xingyu Zheng, Pei Cheng, Bin Fu, Jingwei Sun, Guangzhong Sun

机构 * University of Science and Technology of China, Anhui, China(中国科学技术大学) Beihang University, Beijing, China(北京航空航天大学) Tencent PCG, China(腾讯PCG)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 ToPi通过无训练的令牌剪枝框架提升扩散变换器的上下文生成效率,实现30%以上的推理加速同时保持生成质量。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08250 2025-12-11 cs.CV cs.AI cs.LG 87%

Aligning Text to Image in Diffusion Models is Easier Than You Think

在扩散模型中将文本对齐到图像比你想象的更容易

Jaa-Yeon Lee, Byunghee Cha, Jeongsol Kim, Jong Chul Ye

机构 * Kim Jaechul Graduate School of AI, KAIST(金佳哲人工智能研究生院,韩国科学技术院) Department of Bio and Brain Engineering, KAIST(生物与脑工程系,韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 本文提出SoftREPA方法,通过对比学习提升文本与图像表示的对齐效果,减少计算开销,增强语义一致性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00998 2025-11-18 cs.CV cs.AI 87%

FBSDiff: Plug-and-Play Frequency Band Substitution of Diffusion Features for Highly Controllable Text-Driven Image Translation

Xiang Gao, Jiaying Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

Comments Accepted conference paper of ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18804 2025-10-07 cs.CV cs.LG 87%

Fast constrained sampling in pre-trained diffusion models

Alexandros Graikos, Nebojsa Jojic, Dimitris Samaras

机构 * Stony Brook University(石溪大学) Microsoft Research(微软研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);inpainting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01540 2025-10-03 cs.CV 87%

Towards Better Optimization For Listwise Preference in Diffusion Models

Jiamu Bai, Xin Yu, Meilong Xu, Weitao Lu, Xin Pan, Kiwan Maeng, Daniel Kifer, Jian Wang, Yu Wang

机构 * Penn State University(宾夕法尼亚州立大学) TikTok Inc.(TikTok公司) Stony Brook University(石溪大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16726 2025-08-12 cs.CV cs.LG 87%

EDiT: Efficient Diffusion Transformers with Linear Compressed Attention

Philipp Becker, Abhinav Mehrotra, Ruchika Chavhan, Malcolm Chadwick, Luca Morreale, Mehdi Noroozi, Alberto Gil Ramos, Sourav Bhattacharya

机构 * Samsung, AI Center Cambridge(三星人工智能中心剑桥)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06134 2025-08-12 cs.CV 87%

X2I: Seamless Integration of Multimodal Understanding into Diffusion Transformer via Attention Distillation

Jian Ma, Qirong Peng, Xu Guo, Chen Chen, Haonan Lu, Zhenyu Yang

机构 * OPPO AI Center(OPPO人工智能中心) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.01095 2025-05-20 cs.LG cs.CV 87%

DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models

Cheng Lu, Yuhao Zhou, Fan Bao, Jianfei Chen, Chongxuan Li, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, BNRist Center, THBI Lab(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室) Tsinghua-Bosch Joint ML Center, Tsinghua University, Beijing, 100084 China(清华大学-博世联合机器学习中心,清华大学,北京,100084中国) Gaoling School of Artificial Intelligence, Renmin University of China(北京人工智能学院,中国人民大学) Beijing Key Laboratory of Big Data Management and Analysis Methods, Beijing, China(北京大数据管理与分析方法重点实验室,北京,中国)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

Comments Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20374 2025-04-08 cs.CV cs.LG 87%

FairDiffusion: Enhancing Equity in Latent Diffusion Models via Fair Bayesian Perturbation

Yan Luo, Muhammad Osama Khan, Congcong Wen, Muhammad Muneeb Afzal, Titus Fidelis Wuermeling, Min Shi, Yu Tian, Yi Fang, Mengyu Wang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

Comments Published in Science Advances (https://www.science.org/doi/full/10.1126/sciadv.ads4593). The data and code are made publicly available at https://github.com/Harvard-Ophthalmology-AI-Lab/FairDiffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16822 2025-03-28 cs.CV cs.AI cs.LG 87%

Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers

Haoran You, Connelly Barnes, Yuqian Zhou, Yan Kang, Zhenbang Du, Wei Zhou, Lingzhi Zhang, Yotam Nitzan, Xiaoyang Liu, Zhe Lin, Eli Shechtman, Sohrab Amirghodsi, Yingyan Celine Lin

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);inpainting(abstract)

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12331 2025-03-21 cs.CV cs.AI 87%

I2AM: Interpreting Image-to-Image Latent Diffusion Models via Bi-Attribution Maps

Junseo Park, Hyeryung Jang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);inpainting(abstract)

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08280 2025-03-12 cs.CV cs.AI 87%

OminiControl2: Efficient Conditioning for Diffusion Transformers

Zhenxiong Tan, Qiaochu Xue, Xingyi Yang, Songhua Liu, Xinchao Wang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02098 2025-03-05 cs.CV cs.LG 87%

EC-DIT: Scaling Diffusion Transformers with Adaptive Expert-Choice Routing

Haotian Sun, Tao Lei, Bowen Zhang, Yanghao Li, Haoshuo Huang, Ruoming Pang, Bo Dai, Nan Du

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10496 2024-11-19 cs.CV 87%

Vision-guided and Mask-enhanced Adaptive Denoising for Prompt-based Image Editing

Kejie Wang, Xuemeng Song, Meng Liu, Jin Yuan, Weili Guan

专题命中 扩散模型 :image editing(title,abstract);image generation(abstract);text-to-image(abstract);diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09608 2024-10-16 cs.CV 87%

Faster Diffusion: Rethinking the Role of the Encoder for Diffusion Model Inference

Senmao Li, Taihang Hu, Joost van de Weijer, Fahad Shahbaz Khan, Tao Liu, Linxuan Li, Shiqi Yang, Yaxing Wang, Ming-Ming Cheng, Jian Yang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);personalized generation(abstract)

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17547 2024-10-11 cs.CV 87%

Diffusion Model Compression for Image-to-Image Translation

Geonung Kim, Beomsu Kim, Eunhyeok Park, Sunghyun Cho

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

Comments ACCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏