arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3055 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2337 篇

2607.09787 2026-07-14 cs.CV cs.LG 新提交 86%

Adversarially Guided Diffusion for LiDAR Range Image Synthesis

用于激光雷达距离图像合成的对抗引导扩散

Stavros Bouras, Antonios Makris, Alexandros Gkillas, Aris S. Lalos, Konstantinos Tserpes

机构 * School of Electrical and Computer Engineering, National Technical University of Athens(雅典国立技术大学电气与计算机工程学院) Industrial Systems Institute, Athena Research Center(雅典娜研究中心工业系统研究所)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 研究针对二维距离图像分割的无限制对抗攻击,提出基于扩散并利用分割损失对抗引导的方法,在SemanticKITTI数据集实验,能跨架构转移,相比基线在有效性与现实性间有独特权衡,实现可控退化。

Comments Accepted at the 1st Workshop on Secure and Trustworthy AI (STAI 2026), co-located with the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML PKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28094 2026-06-29 cs.CV cs.AI 新提交 86%

OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removal

OSOR: 一步扩散修复用于效果感知的对象移除

Qinming Zhou, Chenxi Sun, Deyang Kong, Junhao He, Xiangheng Tang, Peike Yu, Haotian Wu, Leilei Cao, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Xidian University(西安电子科技大学) Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学) Transsion(传音控股)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title);分类 cs.CV

AI总结 提出一步扩散模型OSOR,通过占用引导判别器、alpha头和语义锚定验证管道,实现高效、效果感知且对不完美掩码鲁棒的对象移除,速度提升4-30倍。

Comments Code and resources are available at https://github.com/Zhouqm-Git/osor

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22924 2026-06-23 cs.CV 新提交 86%

MythraGen: Two-Stage Retrieval Augmented Art Generation Framework

MythraGen:两阶段检索增强艺术生成框架

Quang-Khai Le, Cong-Long Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh city, Vietnam(胡志明市科学大学) Vietnam National University, Ho Chi Minh city, Vietnam(越南国家大学)

专题命中 扩散模型 :diffusion(summary_cn,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出MythraGen框架,结合艺术检索与LoRA微调,通过检索与提示最相似的艺术图像微调Stable Diffusion,在WikiArt数据集上生成高质量、风格匹配的艺术作品。

Comments SOICT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14727 2026-06-16 cs.CV 新提交 86%

FairGen: Preference-Aligned Diffusion for Demographically Equitable Medical Image Synthesis

FairGen: 用于人口统计公平医学图像生成的偏好对齐扩散模型

Zhimin Li, Ruichen Zhang, Zhen Tan, Howard J Aizenstein, Jingtong Hu, Tianlong Chen

机构 * University of Pittsburgh, Swanson School of Engineering(匹兹堡大学斯旺森工程学院) The University of North Carolina at Chapel Hill, Department of Computer Science(北卡罗来纳大学教堂山分校计算机科学系) Arizona State University, School of Computing and Augmented Intelligence(亚利桑那州立大学计算与增强智能学院) University of Pittsburgh, Department of Psychiatry(匹兹堡大学精神病学系)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 提出FairGen框架,通过将医生偏好嵌入扩散模型生成过程,合成人口统计平衡的医学图像,在皮肤、胸片和脑MRI任务上分别实现95.9%、80.0%和35.2%的公平性提升,同时保持诊断准确性。

Comments Accepted for publication in npj Digital Medicine. 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10653 2026-06-10 cs.CV 新提交 86%

STEDiff: Strengthening Text Embedding for Text-to-Image Alignment in Diffusion Model

STEDiff: 增强文本嵌入以提升扩散模型中文本到图像的对齐

Hailan Zhang, Haipeng Liu, Bo Fu, Yang Wang

机构 * Hailan Zhang, Haipeng Liu, Yang Wang(未明确机构) Bo Fu(未明确机构)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title);分类 cs.CV

AI总结 提出训练免费的STEDiff方法,通过利用[EOT]令牌增强子句语义并引入语义增强损失,在文本嵌入空间中改善扩散模型对复杂提示的语义对齐,无需微调或布局先验。

Comments 8 pages, 8 figures, to appear at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13247 2026-06-12 cs.AI 新提交 86%

EPIG: Emotion-Based Prompting for Personalised Image Generation

EPIG:基于情感提示的个性化图像生成

Emna Othmen, Mohamed Yassine Landolsi, Lotfi Ben Romdhane

机构 * MARS Research Lab LR17ES05, ISITCom, University of Sousse(苏塞大学ISITCom学院MARS研究实验室LR17ES05)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract,comments);diffusion(abstract,comments)

AI总结 提出EPIG方法,利用心理学效价-唤醒模型在提示层面增强情感表达,无需训练即可控制生成图像的唤醒度,在10个多样化提示上平均唤醒误差降低14%-17%。

Comments Submitted to arXiv. 20 pages, 4 figures. Work on emotion-based prompt engineering for text-to-image diffusion models with applications in personalized image generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19344 2026-07-22 cs.CV cs.AI cs.GR 新提交 86%

Appearance Pointers -- Multimodal Region Control of Diffusion Transformers

外观指针——扩散变压器的多模态区域控制

Rahul Sajnani, Yulia Gryaditskaya, Radomír Měch, Srinath Sridhar, Matheus Gadelha

机构 * Brown University(布朗大学) Adobe Research(Adobe 研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV、cs.GR

AI总结 针对可控图像生成难题,提出外观指针方法,通过区域对应网络和空间聚合机制生成并细化指针,为扩散变压器引入模态无关的局部多模态控制接口,单一模型性能达或超现有技术。

Comments 38 Pages, Preprint with supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20334 2026-08-21 cs.CV 新提交 85%

Swift-Image: Exploring the Performance Frontier of Compact Unified Image Generation Models

Swift-Image:探索紧凑统一图像生成模型的性能前沿

Taihang Hu, Zhao Wang, Zuan Gao, Tao Liu, Hao Yan, Zhengze Xu, Yuhang Yu, Yongchao Du, Xingjian Wang, Jun Zheng, Qinye Zhou, Zhengrui Chen, Chao Lin, Yefeng Shen, Zhengtao Wu, Ge Wu, Xiaoli Xu, Denghui Yang, Huayu Zhang, Mingzhou Zhang, Mengting Chen

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 本研究提出紧凑统一图像生成模型Swift-Image,采用6B单流DiT等技术,实现领先综合性能,压缩后3B模型无明显损失,还总结了相关实用经验。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18076 2026-08-19 cs.CV cs.AI 新提交 85%

From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation

从语料到协同进化的能力:面向通用图像生成的以能力为中心的数据设计

Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Qing Jin, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Xiaoli Xu, Zhengze Xu, Hao Yan, Yuhang Yu, Mingzhou Zhang, Mengting Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究提出能力驱动的数据基础设施,构建三类监督引擎,整理大规模图像语料,训练多模态扩散模型,在CPI-Bench等评估中展现良好生成与迁移能力。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09438 2026-08-11 cs.CV 新提交 85%

Unveiling the Secret of AdaLN-Zero in Diffusion Transformer

揭示扩散Transformer中AdaLN-Zero的秘密

Jie Zhu, Mingyu Ding, Boqiang Duan, Leye Wang, Jingdong Wang

机构 * Peking University(北京大学) UC Berkeley(加州大学伯克利分校) Baidu(百度)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究探究扩散Transformer(DiT)中AdaLN-Zero性能优于AdaLN的原因,发现零初始化是关键要素,提出AdaLN-Gaussian初始化策略与SE-adaLN-Zero机制,经多数据集实验验证其有效性与泛化性。

Comments Accept by IEEE TPAMI 2026, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23488 2026-07-28 cs.LG cs.CV 新提交 85%

Learning Sampling Parameters for Diffusion Models

学习扩散模型的采样参数

Arisrei Lim, Yossi Gandelsman

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究针对扩散模型推理时采样参数固定的问题,提出LeSAMP框架,将参数选择转化为强化学习问题,通过人类偏好模型和VLM评判优化,实验表明该方法相比基线有更高胜率,为改进扩散模型输出提供补充途径。

Comments Code will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09067 2026-07-13 cs.CV 新提交 85%

Probing Diffusion Denoising Dynamics for Contrastive Representation Learning

探索用于对比表示学习的扩散去噪动力学

Yasong Dai, Zeeshan Hayder, David Ahmedt-Aristizabal, Hongdong Li

机构 * Australian National University(澳大利亚国立大学) CSIRO Data61(联邦科学与工业研究组织数据61实验室) Amazon(亚马逊)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究如何让预训练扩散模型的去噪动力学适应判别表示学习,提出D³CL方法,通过结合对比目标与去噪重建损失,利用LoRA更新保持轻量级,实验证明该方法能使重建与对比目标互补,是高效参数适应框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08794 2026-07-13 cs.GR cs.AI 新提交 85%

Multi-Conditioned Diffusion Synthesis of Sand Boils for Low-Resource Earthen-Levee Inspection

用于低资源土堤检查的砂沸多条件扩散合成

Padam Jung Thapa, Abdullah Bin Naeem, Ayon Dey, Anav Katwal, Md Tamjidul Hoque

机构 * University of Louisiana at Lafayette(路易斯安那州立大学拉斐特分校) Department of Computer Science, Louisiana State University New Orleans(路易斯安那州立大学新奥尔良分校计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.GR

AI总结 针对土堤砂沸像素级检测因注释稀缺受限的问题,提出基于扩散的合成管道,用多分支ControlNet堆栈等技术生成合成图像,经评估各预设利弊后发布标签可靠预设,为低资源土堤检查提供合成图像,限于图像质量等方面,代码等可复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00817 2026-07-02 cs.CV 新提交 85%

Training-Free Debiasing of Diffusion Models via CLIP-Guided Denoising Optimization

无需训练的扩散模型去偏方法:基于CLIP引导的去噪优化

Dain Kim, Jinseo Kim, Sungyong Baik

机构 * Dept. of Artificial Intelligence, Hanyang University(汉阳大学人工智能系) Dept. of Data Science, Hanyang University(汉阳大学数据科学系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出TES框架,通过扩散过程中优化文本嵌入来缓解人口统计偏见,无需重新训练,使用两阶段策略(早期全局对齐+迭代去噪时CLIP反馈)实现稳定可控的属性引导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28144 2026-06-29 cs.CV 新提交 85%

Monocular Avatar Reconstruction via Cascaded Diffusion Priors and UV-Space Differentiable Shading

基于级联扩散先验和UV空间可微分着色的单目虚拟人重建

Hong Li, Minqi Meng, Yanjun Liang, Chongjie Ye, Houyuan Chen, Weiqing Xiao, Xianda Guo, Guojun Lei, Xuhui Liu, Chaojie Yang, Yanlun Peng, Hao Zhao, Baochang Zhang

机构 * Beihang University(北航) Great Wall Motors(长城汽车) CUHK-Shenzhen(香港科技大学深圳研究院) HKUST(香港科技大学) Nanjing University(南京大学) Wuhan University(武汉大学) Zhejiang University(浙江大学) KAUST(王国 Abdullah 基础科学研究院) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract,abstract_cn);分类 cs.CV

AI总结 提出数据高效框架,利用统一预训练扩散模型的鲁棒先验,通过级联LoRA依次处理纹理补全、去光照和材质分解,结合UV空间可微分BRDF着色损失,从单张野外图像重建高保真可重光照3D虚拟人。

Comments Accepted by ECCV 2026. Project page: https://luh1124.github.io/MARCUS-Avatar-Projectpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27696 2026-06-29 cs.LG cs.AI cs.CV 新提交 85%

Class-frequency Guided Noise Schedule for Diffusion Models

面向扩散模型的类别频率引导噪声调度

Jiequan Cui, Beier Zhu, Qingshan Xu, Xiaojuan Qi, Bei Yu, Hanwang Zhang

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对低频类别在扩散模型中因低密度区域导致评分估计不准和生成质量差的问题,提出类别频率引导的噪声调度(CFRG),为低频类别分配更大尺度噪声,在CIFAR-100-LT和ImageNet-LT上显著提升生成质量。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27089 2026-06-26 cs.CV 新提交 85%

TMP: Tree-structured Mixed-policy Pruning for Large-scale Image Generation and Editing

TMP:面向大规模图像生成与编辑的树结构混合策略剪枝

Peizhen Zhang, Yang Li, Xunsong Li, Songtao Liu, Zewen Liu, Qiangqiang Hu, Guotong Guo, Jupeng Ding, Yifu Sun, coopersli, Jian Zhang, Zhao Zhong, Liefeng Bo

机构 * Multimodal Model Department, Tencent(腾讯多模态模型部)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出首个树结构混合策略剪枝框架TMP,适用于文本到图像和文本引导图像到图像任务及MoE/DiT架构,以75%压缩比将HunyuanImage 3.0从80B降至20B参数,并在单张4090 GPU上推理。

Comments 10 pages, 3 figures, 3 tables, tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24888 2026-06-24 cs.CV 新提交 85%

DiffusionBench: On Holistic Evaluation of Diffusion Transformers

DiffusionBench: 扩散变换器的整体评估

Xingjian Leng, Jaskirat Singh, Zhanhao Liang, Ethan Smith, Martin Bell, Aninda Saha, Yuhui Yuan, Liang Zheng

机构 * Australian National University(澳大利亚国立大学) Canva Research(Canva研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出NanoGen统一框架,训练21个潜在扩散模型后发现ImageNet与文本到图像生成的方法排名无强相关性,因此建立DiffusionBench基准,建议同时评估两项任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15590 2026-06-16 cs.CV 新提交 85%

Unlocking Diffusion Hierarchies: Adaptive Timestep Selection for Zero-Shot Segmentation

解锁扩散层次:自适应时间步选择用于零样本分割

Ramin Nakhli, Mahesh Ramachandran, Luca Ballan

机构 * Google(谷歌)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出自适应时间步选择机制,利用扩散模型去噪过程中的层次语义进展,结合上下文相似度图融合高分辨率注意力与U-Net特征,实现零样本分割性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11289 2026-06-11 cs.CV 新提交 85%

i1: A Simple and Fully Open Recipe for Strong Text-to-Image Models

i1: 一种简单且完全开放的强文本到图像模型配方

Boya Zeng, Tianze Luo, Shu Pu, Jucheng Shen, Taiming Lu, Gabriel Sarch, Zhuang Liu

机构 * Princeton University(普林斯顿大学)

专题命中 扩散模型 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文通过300多次控制实验系统研究文本到图像扩散模型的设计选择,提出i1模型,仅用公开数据集训练3B参数模型,在五个基准上平均超越现有最佳完全开放模型29.5个百分点。

Comments Project page at https://zlab-princeton.github.io/i1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09273 2026-06-09 cs.CV 新提交 85%

EditSSC: Toward Editable Semantic Occupancy Scenes with Unconditional Diffusion Models

EditSSC: 基于无条件扩散模型的可编辑语义占用场景

Fatima Balde, Raoul de Charette, Alexandre Boulch

机构 * Inria(法国国家信息与自动化研究所) Valeo.ai(法雷奥人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 提出EditSSC方法,利用2D BEV表示和现成潜扩散网络实现3D语义场景生成与免训练编辑,在SemanticKITTI上优于现有3D专用基线。

Comments Accepted at CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21606 2026-07-27 cs.AI 新提交 85%

TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward

TILT:使用模型内在奖励改进扩散模型中的组合生成

Debottam Dutta, Jaehoon Hahm, Jianchong Chen, Romit Roy Choudhury

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 研究如何改进扩散模型的组合生成,提出无训练框架TILT,通过测试时奖励对齐,将组合失败解释为分布重叠模式并定义固有奖励,产生KL约束目标及指导步骤,实验表明该方法能在保图质时提升组合对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19919 2026-07-23 cs.RO cs.LG 新提交 85%

Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction

扩散重滚动:用于机器人序列预测的可修正去噪

Seonsoo Kim, Seongil Hong, Jun-Gill Kang

机构 * Agency for Defense Development(国防发展局)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 研究提出扩散重滚动框架用于机器人序列预测,能选择性重新去噪局部稳定区域,实现跨视野迭代修正。通过与其他方法对比评估,在多任务基准测试中取得更好性能,支持结构化重新去噪是可修正机器人序列生成的有效机制。

Comments Project Page: https://seonsoo-p1.github.io/DiffusionReRoll/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13955 2026-06-15 cs.LG 新提交 85%

Smoothing Dark Areas in Molecular Latent Diffusion

分子潜在扩散中的暗区平滑

Xi Wang, Jiahan Li, Yuxuan Xia, Yingcheng Wu, Shaoyi Zheng, Shengjie Wang

机构 * New York University(纽约大学) Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);inpainting(abstract)

AI总结 针对分子潜在扩散中存在的暗区问题,提出拓扑优化VAE(TopVAE),通过训练时内化结构和化学约束,减少暗区,提升离后验鲁棒性,在QM9和GEOM-Drugs上取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01803 2026-07-07 cs.CV cs.GR cs.RO 新提交 84%

PixGS: Pixel-Space Diffusion for Direct 3D Gaussian Splat Generation

PixGS: 像素空间扩散用于直接三维高斯泼溅生成

Cao Duy, Phong Nguyen-Ha

机构 * Qualcomm AI Research(高通人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 提出单阶段管道PixGS,利用像素空间扩散从文本或图像直接生成高质量3D高斯泼溅,避免潜在压缩伪影,并引入表面法线、深度和高频结构监督,在单张A100 GPU上1秒内生成,性能超越现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17432 2026-06-17 cs.GR cs.CV 新提交 84%

Edit3DGS: Unified Framework for Dynamic Head Editing via 2D Instruction-Guided Diffusion and 3D Gaussian Splatting

Edit3DGS:通过2D指令引导扩散与3D高斯泼溅的动态头部编辑统一框架

Duy-Dat Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM, Ho Chi Minh, Vietnam(越南胡志明市国家大学) Vietnam National University, Ho Chi Minh, Vietnam(越南国家大学)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.GR

AI总结 提出Edit3DGS统一框架,结合2D指令引导扩散与3D高斯泼溅,实现动态3D头部的可控编辑,支持表情变换、属性修改等操作,并保持身份与运动动态的一致性。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10853 2026-07-14 cs.CV cs.LG 新提交 84%

Diversify Diffusion with Temperature Sampling and Variance-Corrective Time Shifting

通过温度采样和方差校正时间偏移实现扩散多样化

Peizhuo Li, Emre Aksan, Alexandru-Eugen Ichim, Thabo Beeler, Olga Sorkine-Hornung

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对扩散模型难以达到罕见模式的问题,提出方差校正时间偏移方法,并结合温度采样,无需重新训练就能提升样本多样性,在多个模型中以低成本实现质量和保真度提升,还能实现从粗到细的控制。

Comments Webpage: https://peizhuoli.github.io/diversify-diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28489 2026-07-31 cs.IT math.IT 新提交 83%

Forecasting Land Art Under Climate Scenarios

气候情景下的大地艺术预测

Alev Cinbarci, Sean Kalaycioglu

专题命中 扩散模型 :diffusion(summary_cn,abstract);image synthesis(abstract)

AI总结 本文基于《螺旋防波堤》的遥感数据,构建两阶段预测流程,结合IPCC气候情景与Stable Diffusion XL模型,预测该大地艺术的图像复杂性及暴露状态,并探讨文化遗产伦理问题。

Comments 15 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19504 2026-08-21 cs.CV 新提交 83%

A Plug-in Interpretation of Conditioning in Score-Based Diffusion Models

基于分数的扩散模型中条件作用的插件式解释

Libo Chen, Souvik Ghosh, Teo Deveney, Chris Budd, Vinay P. Namboodiri

机构 * International Institute of Information Technology Hyderabad(国际信息技术学院海得拉巴分校) University of Bath(巴斯大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 该研究提出基于多速度联合扩散的插件式条件机制,推导相关SDE与ODE并引入对数福克-普朗克残差正则化,在条件图像生成任务中验证了方法的有效性。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17747 2026-08-19 cs.CV 新提交 83%

TINA+: Probing Residual Visual Knowledge in Unlearned Diffusion Models via Diffusion-Consistent Text-Free Inversion

TINA+: 通过扩散一致无文本反演探测未学习的扩散模型中的残留视觉知识

Qianlong Xiang, Miao Zhang, Kun Wang, Haoyu Zhang, Junhui Hou, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) City University of Hong Kong(香港城市大学) Shenzhen Loop Area Institute(深圳河套学院) National University of Singapore(新加坡国立大学) Pengcheng Laboratory(鹏城实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究提出TINA+,一种扩散一致无文本反演攻击,可探测未学习的扩散模型中残留的视觉知识,实验表明现有概念擦除方法多切断文本-图像链接而非消除视觉知识。

Comments The project page is https://qianlong0502.github.io/TINA-Plus-Homepage/

详情

展开后加载摘要…

URL PDF HTML 收藏