arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2512.20233 2025-12-24 cs.LG cs.CV 83%

How I Met Your Bias: Investigating Bias Amplification in Diffusion Models

如何遇见你的偏见:调查扩散模型中的偏见放大

Nathan Roos, Ekaterina Iakovleva, Ani Gjergji, Vito Paolo Pastore, Enzo Tartaglione

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI、 Télécom Paris、 Institut Polytechnique de Paris) MaLGa-DIBRIS, University of Genova(MaLGa-DIBRIS、乌尔比诺大学) AIGO, Istituto Italiano di Tecnologia(AIGO、意大利技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本研究探讨扩散模型中采样算法和超参数对偏见放大影响,通过实验展示超参数可调节偏见程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19479 2025-12-23 cs.CV 83%

Emotion-Director: Bridging Affective Shortcut in Emotion-Oriented Image Generation

情绪导演:在情绪导向图像生成中弥合情感捷径

Guoli Jia, Junyao Hu, Xinwei Long, Kai Tian, Kaiyan Zhang, KaiKai Zhao, Ning Ding, Bowen Zhou

机构 * Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学) China Unicom(中国联合通信) Shanghai Artificial Intelligence Lab(上海人工智能实验室)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 Emotion-Director通过跨模态协作框架,结合MC-Diffusion和MC-Agent,提升情绪导向图像生成的准确性和表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18254 2025-12-23 cs.CV 83%

Loom: Diffusion-Transformer for Interleaved Generation

Loom:用于交错生成的扩散-变压器

Mingcheng Ye, Jiaming Liu, Yiren Song

机构 * Beijing Institute of Technology(北京理工大学) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 Loom通过统一的扩散-变压器框架实现交错生成,提供更高效和可控的长周期生成,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18161 2025-12-23 cs.CV 83%

Local Patches Meet Global Context: Scalable 3D Diffusion Priors for Computed Tomography Reconstruction

局部片段与全局上下文:用于计算机断层扫描重建的可扩展3D扩散先验

Taewon Yang, Jason Hu, Jeffrey A. Fessler, Liyue Shen

机构 * EECS Department, University of Michigan(密歇根大学电子工程与计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出一种3D片段基扩散模型,通过学习3D片段先验实现高效高分辨率3D CT重建,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17782 2025-12-22 cs.CV 83%

UrbanDIFF: A Denoising Diffusion Model for Spatial Gap Filling of Urban Land Surface Temperature Under Dense Cloud Cover

UrbanDIFF: 一种用于密集云覆盖下城市地表温度空间填补的去噪扩散模型

Arya Chavoshi, Hassan Dashtian, Naveen Sudharsan, Dev Niyogi

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 UrbanDIFF是一种基于去噪扩散模型的城市地表温度空间填补方法,通过静态城市结构信息和监督像素引导细化步骤,有效应对密集云覆盖下的LST重建问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17578 2025-12-22 cs.CV 83%

3One2: One-step Regression Plus One-step Diffusion for One-hot Modulation in Dual-path Video Snapshot Compressive Imaging

3One2: 一步回归加一步扩散用于双路径视频压缩成像中的one-hot调制

Ge Wang, Xing Liu, Xin Yuan

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 3One2通过结合一步回归和一步扩散方法,解决双路径视频压缩成像中的one-hot调制问题,实现高效的时间解耦和空间增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17573 2025-12-22 cs.CV 83%

RoomEditor++: A Parameter-Sharing Diffusion Architecture for High-Fidelity Furniture Synthesis

RoomEditor++: 一种用于高保真家具合成的参数共享扩散架构

Qilong Wang, Xiaofan Ming, Zhenyi Lin, Jinwen Li, Dongwei Ren, Wangmeng Zuo, Qinghua Hu

机构 * School of Artificial Intelligence, Tianjin University(天津大学人工智能学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Engineering Research Center of City Intelligence and Digital Governance, Ministry of Education(教育部城市智能与数字治理工程研究中心)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 RoomEditor++通过参数共享的扩散架构实现高保真家具合成,提供公开数据集并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07449 2025-12-22 cs.CV 83%

Tracing the Roots: Leveraging Temporal Dynamics in Diffusion Trajectories for Origin Attribution

追溯根源:利用扩散轨迹的时间动态性进行起源归因

Andreas Floros, Seyed-Mohsen Moosavi-Dezfooli, Pier Luigi Dragotti

机构 * Imperial College London(伦敦帝国学院)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出利用扩散轨迹的时间动态性,解决图像起源归因问题,挑战现有成员推断方法,并提出统一的数据来源框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16586 2025-12-19 cs.CV cs.AI 83%

Yuan-TecSwin: A text conditioned Diffusion model with Swin-transformer blocks

Yuan-TecSwin: 一种基于Swin-transformer块的文本条件扩散模型

Shaohua Wu, Tong Yu, Shenling Wang, Xudong Zhao

机构 * Yuan-Tec(元 Tec)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 Yuan-TecSwin通过引入Swin-transformer块替代CNN,提升文本条件扩散模型在图像生成中的非局部建模能力,达到ImageNet生成基准的最优FID分数1.37。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05005 2025-12-18 cs.CV cs.LG cs.RO 83%

Diff-2-in-1: Bridging Generation and Dense Perception with Diffusion Models

Diff-2-in-1:通过扩散模型弥合生成与密集感知的鸿沟

Shuhong Zheng, Zhipeng Bao, Ruoyu Zhao, Martial Hebert, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 Diff-2-in-1通过结合扩散模型的生成与感知能力,实现多模态数据生成与密集视觉感知的统一框架,提升视觉感知的判别能力。

Comments 26 pages, 14 figures

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07345 2025-12-17 cs.CV 83%

Debiasing Diffusion Priors via 3D Attention for Consistent Gaussian Splatting

通过3D注意力解偏扩散先验以实现一致的高斯点散布

Shilong Jin, Haoran Duan, Litao Hua, Wentao Huang, Yuan Zhou

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 通过3D注意力解偏扩散先验以实现一致的高斯点散布,解决T2I模型中的视角偏见问题,提升3D任务的多视角一致性。

Comments Accepted by AAAI 2026, Code is available at: https://github.com/kimslong/AAAI26-TDAttn

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13991 2025-12-17 cs.CV 83%

Repurposing 2D Diffusion Models for 3D Shape Completion

将2D扩散模型用于3D形状补全

Yao He, Youngjoong Kwon, Tiange Xiang, Wenxiao Cai, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出利用2D扩散模型进行3D形状补全,通过Shape Atlas实现模态对齐,提升生成效果并验证其在点云补全和网格生成中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11203 2025-12-16 cs.CV 83%

AutoRefiner: Improving Autoregressive Video Diffusion Models via Reflective Refinement Over the Stochastic Sampling Path

AutoRefiner: 通过在随机采样路径上的反思细化改进自回归视频扩散模型

Zhengyang Yu, Akio Hayakawa, Masato Ishii, Qingtao Yu, Takashi Shibuya, Jing Zhang, Yuki Mitsufuji

机构 * Australian National University(澳大利亚国立大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 AutoRefiner通过路径噪声细化和反射式KV缓存改进AR-VDMs的样本保真度

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08987 2025-12-16 cs.CV 83%

WDT-MD: Wavelet Diffusion Transformers for Microaneurysm Detection in Fundus Images

WDT-MD:用于视网膜图像微动脉瘤检测的小波扩散变换器

Yifei Sun, Yuzhi He, Junhao Jia, Jinhong Wang, Ruiquan Ge, Changmiao Wang, Hongxia Xu

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 WDT-MD 通过小波扩散变换器框架,解决微动脉瘤检测中的身份映射、区分困难和重建效果差问题,提升视网膜图像筛查性能。

Comments 9 pages, 6 figures, 8 tables, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13080 2025-12-16 cs.CV 83%

Counting Hallucinations in Diffusion Models

扩散模型中hallucination的计数

Shuai Fu, Jian Zhou, Qi Chen, Huang Jing, Huy Anh Nguyen, Xiaohan Liu, Zhixiong Zeng, Lin Ma, Quanshi Zhang, Qi Wu

机构 * University of Adelaide(阿德莱德大学) Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出了一种针对扩散模型中计数hallucination的评估方法,通过构建CountHalluSet数据集,系统分析不同采样条件对hallucination的影响,并揭示FID等指标无法捕捉计数hallucination的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10041 2025-12-15 cs.CV cs.AI 83%

MetaVoxel: Joint Diffusion Modeling of Imaging and Clinical Metadata

MetaVoxel:联合图像与临床元数据的扩散建模

Yihao Liu, Chenyu Gao, Lianrui Zuo, Michael E. Kim, Brian D. Boyd, Lisa L. Barnes, Walter A. Kukull, Lori L. Beason-Held, Susan M. Resnick, Timothy J. Hohman, Warren D. Taylor, Bennett A. Landman

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 MetaVoxel通过联合扩散建模统一图像与临床元数据,实现图像生成、年龄估计和性别预测,性能媲美传统任务特定模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13387 2025-12-15 cs.CV cs.AI 83%

Generalized Denoising Diffusion Codebook Models (gDDCM): Tokenizing images using a pre-trained diffusion model

通用去噪扩散代码本模型(gDDCM):利用预训练扩散模型进行图像分词

Fei Kong

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 gDDCM通过统一框架和回溯策略提升图像分词效率,实现对主流扩散模型的兼容性与高质量重建

Comments in Chinese language

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02899 2025-12-12 cs.CV 83%

Glance: Accelerating Diffusion Models with 1 Sample

Glance: 通过1个样本加速扩散模型

Zhuobai Dong, Rui Zhao, Songjie Wu, Junchao Yi, Linjie Li, Zhengyuan Yang, Lijuan Wang, Alex Jinpeng Wang

机构 * WHU(武汉大学) NUS(国立新加坡大学) CSU(中国科学技术大学) UESTC(电子科技大学) Microsoft(微软公司)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出通过轻量LoRA适配器实现扩散模型的高效加速,仅需1个样本训练即可获得强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10177 2025-12-12 cs.LG cond-mat.stat-mech cs.CV stat.ML 83%

Geometric Regularity in Deterministic Sampling Dynamics of Diffusion-based Generative Models

扩散生成模型确定性采样动态中的几何正则性

Defang Chen, Zhenyu Zhou, Can Wang, Siwei Lyu

机构 * University at Buffalo, State University of New York(纽约州立大学布法罗分校) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文揭示了扩散生成模型采样轨迹的几何正则性,提出动态规划方案提升图像生成性能。

Comments 57 pages. Accepted by Journal of Statistical Mechanics: Theory and Experiment (2025). The short version was published in ICML 2024. arXiv admin note: text overlap with arXiv:2405.11326

Journal ref J. Stat. Mech. (2025) 124002

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17230 2025-12-12 cs.CV 83%

ObjectAdd: Adding Objects into Image via a Training-Free Diffusion Modification Fashion

ObjectAdd:通过一种无需训练的扩散修改方法将对象添加到图像中

Ziyue Zhang, Mingbao Lin, Quanjian Song, Yuxin Zhang, Rongrong Ji

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 ObjectAdd通过无需训练的扩散修改方法,实现用户指定区域内的对象添加,保持图像一致性与无缝融合。

Comments 12 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09247 2025-12-11 cs.CV 83%

OmniPSD: Layered PSD Generation with Diffusion Transformer

OmniPSD:基于扩散变换器的分层PSD生成

Cheng Liu, Yiren Song, Haofan Wang, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) Lovart AI

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 OmniPSD通过扩散变换器实现文本到PSD生成和图像到PSD分解,提升分层设计的生成与编辑能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02483 2025-12-09 cs.CV 83%

Event-Customized Image Generation

事件定制图像生成

Zhen Wang, Yilei Jiang, Dong Zheng, Jun Xiao, Long Chen

机构 * Zhejiang University, Hangzhou, China(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出FreeEvent方法,通过引入实体切换和事件转移路径,实现事件定制化图像生成,提升复杂场景下的定制化能力。

Journal ref ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06353 2025-12-09 cs.CV 83%

TreeQ: Pushing the Quantization Boundary of Diffusion Transformer via Tree-Structured Mixed-Precision Search

TreeQ: 通过树结构混合精度搜索推动扩散变换器的量化边界

Kaicheng Yang, Kaisen Yang, Baiting Wu, Xun Zhang, Qianrui Yang, Haotong Qin, He Zhang, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) Adobe Research(Adobe研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 TreeQ通过树结构混合精度搜索方法,首次在DiT模型上实现接近无损的4位PTQ性能,解决了DiT量化中的关键挑战。

Comments Code and Supplementary Material could be found at https://github.com/racoonykc/TreeQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01498 2025-12-08 cs.CV cs.AI 83%

AortaDiff: A Unified Multitask Diffusion Framework For Contrast-Free AAA Imaging

AortaDiff:一种用于无对比剂AAA成像的统一多任务扩散框架

Yuxuan Ou, Ning Bi, Jiazhen Pan, Jiancheng Yang, Boliang Yu, Usama Zidan, Regent Lee, Vicente Grau

机构 * Department of Engineering Science, University of Oxford, United Kingdom(牛津大学工程科学系) Nuffield Department of Surgical Sciences, University of Oxford, United Kingdom(牛津大学外科科学努尔菲尔德系) Technical University of Munich, Germany(慕尼黑技术大学) ELLIS Institute Finland, Finland(芬兰ELLIS研究所) Aalto University, Finland(阿alto大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 AortaDiff通过统一多任务扩散框架实现无对比剂AAA成像,同时生成合成CECT图像并分割主动脉腔和血栓,提升了分割精度和临床测量准确性。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11056 2025-12-04 cs.CV 83%

Flow to the Mode: Mode-Seeking Diffusion Autoencoders for State-of-the-Art Image Tokenization

流到模式:用于最新图像标记化的模式寻求扩散自编码器

Kyle Sargent, Kyle Hsu, Justin Johnson, Li Fei-Fei, Jiajun Wu

机构 * Stanford University(斯坦福大学) University of Michigan(密歇根大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 FlowMo是一种基于Transformer的扩散自编码器,通过模式匹配和模式寻求阶段实现图像标记化的新SOTA,无需卷积、对抗损失等。

Comments ICCV 2025, 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06424 2025-12-04 cs.CV 83%

Margin-aware Preference Optimization for Aligning Diffusion Models without Reference

基于边界的偏好优化:无需参考的扩散模型对齐

Jiwoo Hong, Sayak Paul, Noah Lee, Kashif Rasul, James Thorne, Jongheon Jeong

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出MaPO,一种无需参考的扩散模型对齐方法,通过优化偏好输出与非偏好输出之间的边界,提升T2I任务的适应性能,减少训练时间并优于现有方法。

Comments Accepted to AAAI 2026 Main Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17636 2025-12-03 cs.CV cs.AI 83%

Aligning Diffusion Models with Noise-Conditioned Perception

对扩散模型进行噪声条件感知对齐

Alexander Gambashidze, Anton Kulikov, Yuriy Sosnin, Ilya Makarov

机构 * Artificial Intelligence Research Institute (AIRI)(人工智能研究 institute(AIRI)) Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所) HSE University(俄罗斯高等经济学院) Research Center for Trusted Artificial Intelligence, ISP RAS(可信人工智能研究中心,信息与通信技术研究院) ISP RAS(信息与通信技术研究院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究提出在扩散模型的U-Net嵌入空间中使用感知目标,以提升人类偏好对齐的效率和质量,并减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01426 2025-12-02 cs.CV 83%

ResDiT: Evoking the Intrinsic Resolution Scalability in Diffusion Transformers

ResDiT: 在扩散变换器中激发内在分辨率可扩展性

Yiyang Ma, Feng Zhou, Xuedan Yin, Pu Cao, Yonghao Dang, Jianqin Yin

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 ResDiT通过改进位置嵌入和局部增强机制,实现了无需训练的高分辨率图像生成,有效解决空间布局崩溃和纹理保真度下降问题。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00532 2025-12-02 cs.CV cs.RO 83%

Image Generation as a Visual Planner for Robotic Manipulation

图像生成作为机器人操作的视觉规划器

Ye Pang

机构 * Southern China University of Technology(华南理工大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出利用图像生成模型作为机器人视觉规划器,通过轻度微调实现时间连贯的机器人操作视频生成。

Comments 11 pages 9 figures Under review at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13625 2025-12-02 cs.CV cs.CR 83%

DiffProtect: Generate Adversarial Examples with Diffusion Models for Facial Privacy Protection

DiffProtect: 用扩散模型生成对抗示例以保护面部隐私

Jiang Liu, Chun Pong Lau, Zhongliang Guo, Yuxiang Guo, Zhaoyang Wang, Rama Chellappa

机构 * Johns Hopkins University(约翰霍普金斯大学) City University of Hong Kong(香港城市大学) University of St Andrews(圣安德鲁大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 DiffProtect利用扩散模型生成高质量对抗示例,提升面部隐私保护的视觉质量和攻击成功率

Comments Code is at https://github.com/joellliu/DiffProtect/

详情

展开后加载摘要…

URL PDF HTML 收藏