arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1802 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 1384 篇

2512.14008 2026-07-17 cs.CV 版本更新 87%

Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models

稀疏-LaViDa:稀疏多模态离散扩散语言模型

Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

机构 * Adobe(Adobe公司) UCLA(加州大学洛杉矶分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 针对掩码离散扩散模型推理速度慢的问题,提出Sparse-LaViDa框架,通过动态截断冗余掩码令牌加速采样,引入专用寄存器令牌和注意力掩码保证质量与一致性,基于LaViDa - O构建,在多任务中实现加速且保持质量。

Comments 18 pages (12 pages for the main paper and 6 pages for the appendix), 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02211 2026-07-07 cs.CV 版本更新 87%

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers

TexTailor:用于多模态扩散变压器的推理时文本引导剪裁

Binglei Li, Mengping Yang, Zhiyu Tan, Junping Zhang, Hao Li

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 研究基于变压器的扩散模型中不同模块与文本条件的交互。通过系统管道分析各模块功能,提出推理时逐块文本引导剪裁方法,提升文本图像对齐,有多种下游应用,实验表明优于基线。

Comments To appear in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16325 2026-07-02 cs.CV 版本更新 87%

UltraImageGen: Efficient Ultra-High-Resolution Image Generation with Hierarchical Local Attention

UltraImageGen: 高效超高清图像生成与层级局部注意力

Yuyao Zhang, Yu-Wing Tai

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 提出UltraImageGen框架,通过层级局部注意力和低分辨率全局引导,将预训练扩散模型扩展到8K以上分辨率,实现近线性复杂度、10倍加速和更低内存占用。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13079 2026-08-17 cs.LG 版本更新 87%

Learning Discrete Decisions for MIPs with Constraint-Aware Diffusion

基于约束感知扩散的混合整数规划离散决策学习

Vincenzo Di Vito, Mehdi Taghizadeh, Deepjyoti Deka, Kaarthik Sundar, Ferdinando Fioretto

机构 * University of Virginia(弗吉尼亚大学) MIT(麻省理工学院) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 该研究提出Constrained Graph Diffusion(CGD)框架,结合图扩散模型与可行性投影算子求解混合整数规划,在两类任务上较基线方法提升可行性与质量,且最高加速425倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17353 2026-06-16 cs.LG cs.AI 版本更新 87%

Learning Permutation Distributions via Reflected Diffusion on Ranks

通过秩上的反射扩散学习排列分布

Sizhuang He, Yangtian Zhang, Shiyang Zhang, David van Dijk

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 提出Soft-Rank Diffusion框架,通过将排列松弛为软秩实现平滑扩散,并引入上下文广义Plackett-Luce去噪器,在排序和组合优化任务上优于现有扩散方法。

Comments 18 pages including the appendix, 7 figures, 9 tables, Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20889 2026-06-23 cs.CV cs.AI cs.LG 版本更新 86%

Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation

文本到图像扩散模型的测试时对齐:通过空文本嵌入优化

Taehoon Kim, Henry Gouk, Timothy Hospedales

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Samsung AI Center, Cambridge(三星人工智能中心)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title);分类 cs.CV

AI总结 提出Null-TTA方法,通过优化无分类器引导中的无条件嵌入实现测试时对齐,避免奖励黑客问题,在保持语义一致性的同时达到最先进性能。

Journal ref Published at CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01134 2026-08-14 cs.GR cs.CV 版本更新 86%

RealMat: Realistic Materials with Diffusion and Reinforcement Learning

RealMat:结合扩散模型与强化学习的真实材质生成器

Xilong Zhou, Pedro Figueiredo, Miloš Hašan, Valentin Deschaintre, Paul Guerrero, Yiwei Hu, Nima Khademi Kalantari

机构 * Max Planck Institute for Informatics Saarbrücken Germany Texas A\&M University College Station USA Adobe Research San Jose USA Adobe Research London UK Max Planck Institute for Informatics Texas A\&M University Adobe Research

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 针对材质生成的合成数据真实感不足、真实数据规模有限的问题,提出结合SDXL微调与强化学习的RealMat,有效提升了生成材质的真实性。

Comments 12 pages, 12 figures

Journal ref Computer Graphics Forum 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16491 2026-08-18 physics.med-ph 版本更新 86%

Continuous 3-D Latent Diffusion for Medical Image Generation and Reconstruction

用于医学生成与重建的连续3D潜扩散

Youness Mellak, Antoine De Paepe, Dimitris Visvikis, Alexandre Bousse

专题命中 扩散模型 :diffusion(title,abstract);image generation(title)

AI总结 研究针对高分辨率三维医学扩散模型成本问题,提出连续3D潜扩散模型框架,核心是含特定解码器的紧凑自动编码器,经实验评估,该框架在计算效率、内存使用和重建效果间达平衡,能支持多种医学影像任务。

Comments 14 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21913 2026-07-24 physics.med-ph cs.AI 版本更新 86%

Equivariant Conditional Diffusion Model for Head and Neck CT Image Synthesis from CBCT

用于从CBCT合成头颈CT图像的等变条件扩散模型

Alzahra Altalib, Chunhui Li, Alessandro Perelli

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title)

AI总结 针对CBCT图像有伪影、CT图像难捕捉治疗中解剖变化的问题,提出EqDiff-CT模型,基于扩散概率模型和群等变条件U-Net主干,从CBCT合成高质量CT图像,经实验验证在多方面有显著提升,为CBCT改进提供框架。

Comments 43 pages, 9 figures, 6 tables, accepted in Medical Physics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11546 2026-08-14 cs.CV 版本更新 85%

Through Van Gogh's Eyes: Global Style Transfer with Diffusion Model

透过梵高的眼睛:基于扩散模型的全局风格迁移

Jeongha Lee, Yujin Kim, Ghazanfar Ali, Suhyun Kim, Jae-In Hwang

机构 * Korea Institute of Science and Technology(韩国科学技术研究院) University of Science and Technology(科技大学) Korea University(高丽大学) Gachon University(嘉泉大学) Kyung Hee University(庆熙大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 该研究针对现有艺术图像合成方法难以捕捉艺术家全局风格的问题,提出多对一的全局风格迁移范式及对应的全局风格引导、内容对齐引导方法,在WikiArt上验证了其在风格保真度等指标上的优势。

Comments Published at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14270 2026-08-03 cs.CV 版本更新 85%

Diagnosing and Correcting Concept Omission in Multimodal Diffusion Transformers

诊断和纠正多模态扩散Transformer中的概念遗漏

Kanghyun Baek, Jaihyun Lew, Chaehun Shin, Jungbeom Lee, Sungroh Yoon

机构 * Interdisciplinary Program in Artificial Intelligence, Seoul National University, Seoul, South Korea Department of Electrical Computer Engineering, Seoul National University, Seoul, South Korea Department of Computer Science \& Engineering, Korea University, Seoul, South Korea ISRC, Seoul National University, Seoul, South Korea

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文通过线性探测发现文本嵌入中存在表征目标概念缺失的“遗漏信号”,并提出遗漏信号干预(OSI)方法放大该信号以主动催化缺失概念的生成,在FLUX.1-Dev和SD3.5-Medium上显著缓解了概念遗漏问题。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03434 2026-08-03 cs.GR cs.DC cs.LG 版本更新 85%

Paris: A Decentralized Trained Open-Weight Diffusion Model

巴黎:一种去中心化训练的开放权重扩散模型

Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy

机构 * Bagel Labs(Bagel实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.GR

AI总结 Paris是一种通过去中心化训练实现高质量文本到图像生成的开放权重扩散模型,无需专用GPU集群,使用更少的数据和计算资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24800 2026-07-30 cs.CV 版本更新 85%

Calibri: Enhancing Diffusion Transformers via Parameter-Efficient Calibration

Calibri: 通过参数高效校准增强扩散变换器

Danil Tokhchukov, Aysel Mirzoeva, Andrey Kuznetsov, Konstantin Sobolev

机构 * MSU(莫斯科国立大学) FusionBrain Lab, AXXX(FusionBrain实验室,AXXX)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文通过深入分析去噪过程,提出Calibri方法,通过引入单个学习缩放参数提升DiT性能,优化校准以提高生成质量,减少推理步骤并保持高质量输出。

Comments Project page: https://v-gen-ai.github.io/Calibri-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07773 2026-07-13 cs.CV 版本更新 85%

Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training?

自我超越:外部特征引导是否对于加速扩散变换器训练是必不可少的?

Lingchen Sun, Rongyuan Wu, Zhengqiang Zhang, Ruibin Li, Yujing Sun, Shuaizheng Liu, Lei Zhang

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出SelfTranscendence方法,通过内部特征监督实现快速收敛,无需外部特征引导,在图像生成任务中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28421 2026-07-09 cs.CV cs.AI 版本更新 85%

JuZhou 1.0 Technical Report: The First Edge-Native Text-to-Image Foundation Model Trained Entirely on China-Developed AI Accelerators

JuZhou 1.0 技术报告:首个完全在中国开发的AI加速器上训练的边缘原生文本到图像基础模型

Ce Chen, Congrui Wang, Yonglin Li, Zhenchen Wan, Mingyang Geng, Junhao Xiao, Zhengpeng Xing, Yaqing Hu, Yao Wu, Zhaoyang Qu, Long Lan, Xinwang Liu, Yingqi Peng, Shijia Li, Zufeng Zhang, Chen Ma, Jingjing Zhou, Xingyu Wang, Qilin Lu, Bin Jiang, Qilin Sun, Shanzhi Gu, Yaoguang Jin, Tongliang Liu, Kede Ma, Yifan Peng

专题命中 扩散模型 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出JuZhou 1.0,一个超轻量级文本到图像基础模型,通过紧凑骨干网络、Rectified Flow训练、DMD2蒸馏和中文语义对齐,实现完全离线设备端运行,性能优于SDXL等模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09740 2026-07-07 cs.CV cs.AI 版本更新 85%

ELBO-T2IAlign: A Generic ELBO-Based Method for Calibrating Pixel-level Text-Image Alignment in Diffusion Models

ELBO-T2IAlign:一种基于通用ELBO的方法,用于校准扩散模型中的像素级文本-图像对齐

Qin Zhou, Zhiyang Zhang, Jinglong Wang, Xiaobin Li, Jing Zhang, Qian Yu, Lu Sheng, Dong Xu

机构 * School of Software, Beihang University(北航软件学院) College of Computer and Cyber Security, Hebei Normal University(河北师范大学计算机与网络安全学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 研究利用零样本指称图像分割评估扩散模型像素级图像与文本对齐,分析训练数据偏差导致的不对齐问题,提出ELBO-T2IAlign方法校准像素-文本对齐,无需额外标注等,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23426 2026-07-03 cs.CV 版本更新 85%

Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision

直接扩散分数偏好优化:通过逐步对比策略对监督

Dohyun Kim, Seungwoo Lyu, Seung Wook Kim, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(韩国大学计算机科学与工程系) NVIDIA

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出DDSPO方法,通过对比策略对直接监督反向去噪步骤,无需奖励建模或人工标注,在文本-图像对齐和美学质量任务上优于现有方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18521 2026-07-01 cs.CV 版本更新 85%

Improved Immiscible Diffusion: Accelerate Diffusion Training by Reducing Its Miscibility

改进的不可混扩散:通过降低可混性加速扩散训练

Yiheng Li, Feng Liang, Dan Kondratyuk, Masayoshi Tomizuka, Kurt Keutzer, Chenfeng Xu

机构 * UC Berkeley(加州大学伯克利分校) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 提出通过降低任意层级的可混性来加速扩散模型训练,实现多种实现方式(如KNN噪声选择和图像缩放),在多种任务上获得高达4倍以上的训练加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09052 2026-06-25 cs.CV cs.LG 版本更新 85%

Contrastive Conditional-Unconditional Alignment for Long-tailed Diffusion Model

对比条件-无条件对齐用于长尾扩散模型

Fang Chen, Alex Villa, Gongbo Liang, Fuxing Li, Xiaoyi Lu, Meng Tang

机构 * University of California Merced(加州大学默塞德分校) Oregon State University(俄勒冈州立大学) University of Florida(佛罗里达大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对长尾分布下条件扩散模型的模式坍塌问题,提出对比条件-无条件对齐方法,通过对齐损失和对比损失提升尾部类别的多样性与保真度。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23332 2026-06-23 cs.CV 版本更新 85%

TraceMark-LDM: Authenticatable Watermarking for Latent Diffusion Models via Binary-Guided Rearrangement

TraceMark-LDM:通过二进制引导重排实现潜在扩散模型的可认证水印

Wenhao Luo, Zhangyi Shen, Ye Yao, Feng Ding, Guopu Zhu, Weizhi Meng

机构 * Hangzhou Dianzi University(杭州电子科技大学) Nanchang University(南昌大学) School of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术学院,哈尔滨工业大学) School of Computing and Communications, Lancaster University(计算与通信学院,兰卡斯特大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出TraceMark-LDM算法,利用水印引导重排高斯随机变量,结合分组重排和编码器微调,在不影响生成质量的前提下实现图像归属,鲁棒性优于现有方法。

Comments This paper has been accepted by Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06806 2026-06-17 cs.CV cs.LG 版本更新 85%

RAIGen: Rare Attribute Identification in Text-to-Image Generative Models

RAIGen: 文本到图像生成模型中的罕见属性识别

Silpa Vadakkeeveetil Sreelatha, Dan Wang, Serge Belongie, Muhammad Awais, Anjan Dutta

机构 * University of California, Berkeley(加州大学伯克利分校) UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出RAIGen框架,利用Matryoshka稀疏自编码器和新颖的少数度量,在无标签条件下发现扩散模型中的罕见属性,并支持属性放大。

Comments Accepted at ICML 2026. Webpage and code available at https://github.com/VSSILPA/RAIGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05356 2026-06-09 cs.CV cs.LG 版本更新 85%

Mitigating Diffusion Model Hallucinations with Dynamic Guidance

通过动态引导缓解扩散模型幻觉

Kostas Triaridis, Alexandros Graikos, Aggelina Chatziagapi, Grigorios G. Chrysos, Dimitris Samaras

机构 * Stony Brook University(石溪大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对扩散模型因分数函数过度平滑导致的幻觉问题,提出动态引导方法,沿预定方向选择性锐化分数函数,保留有效语义变化,显著减少幻觉。

Comments Project page: https://cvlab-stonybrook.github.io/DynamicGuidance/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12401 2026-08-06 cs.LG cs.AI 版本更新 85%

Beyond the Dirac Delta: Mitigating Diversity Collapse in Reinforcement Fine-Tuning for Versatile Image Generation

超越狄拉克 delta:缓解强化微调中的多样性崩溃以实现多功能图像生成

Jinmei Liu, Haoru Li, Zhenhong Sun, Chaofeng Chen, Yatao Bian, Bo Wang, Daoyi Dong, Chunlin Chen, Zhi Wang

机构 * Nanjing University(南京大学) Australia National University(澳大利亚国立大学) Wuhan University(武汉大学) National University of Singapore(新加坡国立大学) University of Technology Sydney(技术科技大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract)

AI总结 DRIFT通过激励输出多样性缓解强化微调中的多样性崩溃,提升图像生成的多样性和任务对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24357 2026-06-17 cs.LG cs.AI 版本更新 85%

DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Diffusion Language Models

DPRM: 一种用于扩散语言模型的即插即用Doob h变换诱导的令牌排序模块

Dake Bu, Wei Huang, Andi Han, Hau-San Wong, Qingfu Zhang, Taiji Suzuki, Atsushi Nitanda

机构 * City University of Hong Kong(香港城市大学) The Institute of Statistical Mathematics(统计数学研究所) University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 提出DPRM模块,通过在线估计从置信度驱动排序逐步过渡到过程奖励引导排序,改进扩散语言模型的令牌排序策略,在九种任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13974 2026-07-08 cs.CV cs.AI cs.MM 版本更新 84%

Few Channels Draw The Whole Picture: Revealing Massive Activations in Diffusion Transformers

少量通道绘制整体画面:揭示扩散变换器中的大规模激活

Evelyn Turri, Davide Bucciarelli, Sara Sarto, Lorenzo Baraldi, Marcella Cornia

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.MM

AI总结 研究扩散变换器中少量关键通道对图像生成的决定性作用,揭示其在功能、空间组织和可迁移性上的核心贡献。

Comments Project page: https://aimagelab.github.io/MAs-DiT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06577 2026-07-07 cs.CV 版本更新 84%

Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion

全模态扩散:基于掩码离散扩散的统一多模态理解与生成

Lijiang Li, Zuwei Long, Yunhang Shen, Heting Gao, Haoyu Cao, Xing Sun, Caifeng Shan, Ran He, Chaoyou Fu

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯云科技实验室) CASIA(中国科学院自动化研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 受离散扩散模型在多领域成功应用启发,提出全模态扩散模型,基于掩码离散扩散模型构建,统一文本、语音和图像的理解与生成,用统一模型直接捕捉离散多模态令牌联合分布,性能优于现有多模态系统。

Comments Accepted to ICML 2026. This version updates the ICML submission with an optimized model checkpoint. Project page: https://omni-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03929 2026-08-17 cs.LG cs.CV 版本更新 83%

Latent Reward Registers for Diffusion Preference Alignment

用于扩散偏好对齐的潜在奖励寄存器

Yuanshen Guan, Zipeng Feng, Chengru Song, Zhiwei Xiong, Peiqin Sun

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散模型偏好对齐的时间信用分配挑战,提出Latent Reward Registers机制,结合RG-OPD和RGS策略,在高噪声下实现最优性能且大幅降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06526 2026-08-17 cs.CV 版本更新 83%

Concept Unlearning by Modeling Key Steps of Diffusion Process

通过建模扩散过程关键步骤实现的概念遗忘

Chaoshuo Zhang, Chenhao Lin, Zhengyu Zhao, Le Yang, Qian Wang, Chao Shen

机构 * School of Cyber Science and Engineering, Xi’an Jiaotong University(网络安全科学与工程学院,西安交通大学) Wuhan University(武汉大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对文本到图像扩散模型概念遗忘时的灾难性遗忘问题,提出KSCU方法,通过动态隔离优化至概念特定活跃区域,实现了更优的概念擦除与效用保留权衡,在多类任务中性能领先。

Comments Accepted by T-IFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.08063 2026-08-14 cs.CV 版本更新 83%

Interpretable ODE-style Generative Diffusion Model via Force Field Construction

基于力场构造的可解释ODE式生成扩散模型

Weiyang Jin, Yongpei Zhu, Yuxi Peng

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文从数学视角识别适配的物理模型,归纳出统一的ODE式生成扩散模型方法,在CIFAR-10实验中验证了该方法在生成速度、Inception分数和FID分数上的优异性能,提升了扩散模型的可解释性。

Comments This is empirical reproducing and experimental tries of Jianlin Su's blog use ChatGPT and Newbeing: https://kexue.fm/archives/9370 https://kexue.fm/archives/9379 https://kexue.fm/archives/9467 We make the mistakes to cite them and this paper need to be withdrawn to clearify this. We thank Jianlin reached out us and give us chance to claim

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17585 2026-08-13 cs.CV 版本更新 83%

Pixel-Space Diffusion Transformers

像素空间扩散变换器

Renye Yan, Jikang Cheng, You Wu, Ling Liang, Wei Peng, Athanasios V. Vasilakos, Qingyu Zhao, Yu Zhang, Yimao Cai, Kilian M. Pohl, Guoying Zhao

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学) Cornell University(康奈尔大学) University of Oulu(奥卢大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文探讨像素空间扩散变换器,针对潜在扩散模型的局限,研究直接对原始像素建模的像素空间扩散方法,介绍其在高维建模中的挑战与多模态建模优势,从多方面回顾pDiTs,总结方法、识别挑战并展望未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏