arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70196 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70196 篇

2601.09806 2026-01-16 cs.CV cs.AI 79%

Diffusion-Driven Deceptive Patches: Adversarial Manipulation and Forensic Detection in Facial Identity Verification

扩散驱动的欺骗性补丁:面部身份验证中的对抗操纵与取证检测

Shahrzad Sayyafzadeh, Hongmei Chi, Shonda Bernadin

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散模型的对抗性补丁生成与检测方法,通过FGSM和ViT-GPT2模型提升对抗性攻击的隐蔽性与有效性,并实现了高SSIM的检测性能。

Comments This manuscript is a preprint. A revised version of this work has been accepted for publication in the Springer Nature book Artificial Intelligence-Driven Forensics. This version includes one additional figure for completeness

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08546 2026-01-16 eess.IV cs.CV 79%

End-to-End PET Image Reconstruction via a Posterior-Mean Diffusion Model

通过后验均值扩散模型实现端到端的PET图像重建

Yiran Sun, Osama Mawlawi

机构 * Department of Electrical and Computer Engineering, Rice University, Houston, USA(电气与计算机工程系,里士大学,美国休斯顿) Department of Imaging Physics, University of Texas MD Anderson Cancer Center, Houston, USA(影像物理系,德克萨斯大学MD安德森癌症中心,美国休斯顿)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PMDM-PET通过后验均值扩散模型实现端到端PET图像重建,兼顾感知质量与失真控制,优于现有最先进方法。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09697 2026-01-15 cs.CV 79%

Efficient Camera-Controlled Video Generation of Static Scenes via Sparse Diffusion and 3D Rendering

通过稀疏扩散和3D渲染实现静态场景的高效摄像机控制视频生成

Jieying Chen, Jeffrey Hu, Joan Lasenby, Ayush Tewari

机构 * University of Cambridge(剑桥大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SRENDER方法,通过稀疏扩散和3D渲染生成静态场景的高效视频,使视频生成速度提升40倍,保持高质量和稳定性。

Comments Project page: https://ayushtewari.com/projects/srender/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21032 2026-01-15 cs.CV cs.AI cs.LG 79%

FeatInv: Spatially resolved mapping from feature space to input space using conditional diffusion models

FeatInv: 通过条件扩散模型实现从特征空间到输入空间的空间解析映射

Nils Neukirch, Johanna Vielhaben, Nils Strodthoff

机构 * Division AI4Health(AI4Health部门) Carl von Ossietzky Universität Oldenburg(奥尔登堡卡尔·冯·奥西特齐克大学) Explainable Artificial Intelligence Group(可解释人工智能小组) Fraunhofer Heinrich-Hertz-Institute(弗劳恩霍夫海因里希-赫兹研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FeatInv通过条件扩散模型实现从特征空间到输入空间的空间解析映射,提升深度学习模型的可解释性与理解能力。

Comments Version published by Transactions on Machine Learning Research in 2025 (TMLR ISSN 2835-8856) at https://openreview.net/forum?id=UtE1YnPNgZ. 32 pages, 27 figures. This work builds on an earlier manuscript (arXiv:2505.21032) and crucially extends it. Code is available at https://github.com/AI4HealthUOL/FeatInv

Journal ref Version published by Transactions on Machine Learning Research in 2025 (TMLR ISSN 2835-8856) https://openreview.net/forum?id=UtE1YnPNgZ

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09333 2026-01-15 cs.SD cs.MM 79%

Research on Piano Timbre Transformation System Based on Diffusion Model

基于扩散模型的钢琴音色转换系统研究

Chun-Chieh Hsu, Tsai-Ling Hsu, Chen-Chen Yeh, Shao-Chien Lu, Cheng-Han Wu, Bing-Ze Liu, Timothy K. Shih, Yu-Cheng Lin

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 本文提出基于扩散模型的钢琴音色转换系统,通过提取音高和响度特征实现高质量音乐转换,适用于多种音乐风格和场景,未来将拓展至更多音色转换任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09044 2026-01-15 eess.IV cs.CV 79%

POWDR: Pathology-preserving Outpainting with Wavelet Diffusion for 3D MRI

POWDR: 基于小波扩散的病理保持3D MRI外推

Fei Tan, Ashok Vardhan Addala, Bruno Astuto Arouche Nunes, Xucheng Zhu, Ravi Soni

机构 * GE HealthCare(GE健康护理)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 POWDR通过小波扩散模型生成病理保持的3D MRI外推数据,解决医学影像数据稀缺和类别不平衡问题,提升肿瘤分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01761 2026-01-15 cs.CV 79%

Adverse Weather Conditions Augmentation of LiDAR Scenes with Latent Diffusion Models

基于潜在扩散模型的激光雷达场景在恶劣天气下的增强

Andrea Matteazzi, Pascal Colling, Michael Arnold, Dietmar Tutsch

机构 * University of Wuppertal(乌珀塔尔大学) Aptiv Services Deutschland GmbH(Aptiv Services德国公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于潜在扩散模型的方法,通过生成模型增强激光雷达场景在恶劣天气下的真实性,提升自动驾驶系统的鲁棒性。

Comments This is an intermediate version of our work

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15054 2026-01-14 cs.CV 79%

Structure-guided Diffusion Transformer for Low-Light Image Enhancement

结构引导的扩散变换器用于低光照图像增强

Xiangchen Yin, Zhenda Yu, Longtao Jiang, Xin Gao, Xiao Sun, Zhi Liu, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院) Anhui University(安徽大学) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动技术学院) State Key Laboratory of Automotive Safety and Energy, Tsinghua University(清华大学汽车安全与能源国家重点实验室) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) Department of Computer and Network Engineering, The University of Electro-Communications(电通大学计算机与网络工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出结构引导的扩散变换器框架,通过小波变换和结构增强模块提升低光照图像增强效果,实现SOTA性能。

Comments Accepted by IEEE Transactions on Multimedia (TMM)

Journal ref IEEE Transactions on Multimedia, Vol. 27, pp. 9505 - 9515, 22 September 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08022 2026-01-14 cs.CV 79%

Training Free Zero-Shot Visual Anomaly Localization via Diffusion Inversion

无需训练的零样本视觉异常定位 via 扩散倒置

Samet Hicsonmez, Abd El Rahman Shabayek, Djamila Aouada

机构 * University of Luxembourg(卢森堡大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出无需训练的视觉-only零样本异常检测框架,通过扩散倒置技术实现高精度异常定位,无需细粒度提示,提升零样本检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07287 2026-01-13 cs.CV 79%

Focal Guidance: Unlocking Controllability from Semantic-Weak Layers in Video Diffusion Models

焦点引导:从语义弱层中解锁视频扩散模型的可控性

Yuanyang Yin, Yufan Deng, Shenghai Yuan, Kaipeng Zhang, Xiao Yang, Feng Zhao

机构 * MoE Key Lab of BIPC, USTC(BIPC联合实验室,中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) ByteDance China(字节跳动中国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Focal Guidance方法,通过细粒度语义引导和注意力缓存增强视频扩散模型中语义弱层的可控性,提升对文本提示的遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07253 2026-01-13 cs.CV cs.CR 79%

Universal Adversarial Purification with DDIM Metric Loss for Stable Diffusion

通用对抗净化与DDIM度量损失用于稳定扩散

Li Zheng, Liangbin Xie, Jiantao Zhou, He YiMin

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UDAP通过DDIM度量损失去除稳定扩散中的对抗噪声,提升模型鲁棒性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03030 2026-01-13 cs.CV cs.LG physics.comp-ph 79%

Flow Matching and Diffusion Models via PointNet for Generating Fluid Fields on Irregular Geometries

通过PointNet生成不规则几何上流场的流匹配与扩散模型

Ali Kashefi

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过PointNet生成不规则几何上流场的流匹配与扩散模型,提升流体预测精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17068 2026-01-13 cs.CV cs.AI 79%

ReBrain: Brain MRI Reconstruction from Sparse CT Slice via Retrieval-Augmented Diffusion

ReBrain: 通过检索增强扩散模型从稀疏CT切片重建脑部MRI

Junming Liu, Yifei Sun, Weihua Cheng, Yujin Kang, Yirong Chen, Ding Wang, Guosun Zeng

机构 * Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ReBrain通过检索增强扩散模型从稀疏CT切片重建脑部MRI,利用BBDM和ControlNet实现结构连续性,提升稀疏条件下的跨模态重建性能。

Comments 16 pages, 12 figures, 7 tables; Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06228 2026-01-13 cs.CV cs.AI 79%

Synthetic FMCW Radar Range Azimuth Maps Augmentation with Generative Diffusion Model

合成FMCW雷达距离方位图与生成扩散模型

Zhaoze Wang, Changxu Zhang, Tai Fei, Christopher Grimm, Yi Jin, Claas Tebruegge, Ernst Warsitz, Markus Gardill

机构 * 1HELLA GmbH \& Co. KGaA, Lippstadt, Germany 2Dortmund University of Applied Sciences

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于生成扩散模型的雷达数据合成方法,通过置信度图和几何感知条件生成逼真雷达图,提升模型在环境感知任务中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05852 2026-01-12 cs.CV 79%

Kidney Cancer Detection Using 3D-Based Latent Diffusion Models

基于3D的潜在扩散模型用于肾癌检测

Jen Dusseljee, Sarah de Boer, Alessa Hering

机构 * Department of Medical Imaging, Radboudumc, Nijmegen, The Netherlands(医学影像系,拉德堡德大学医学中心,尼迈根,荷兰)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于3D潜在扩散模型的肾癌检测方法,结合DDPMs、DDIMs和VQ-GANs,通过弱监督实现高效异常检测。

Comments 8 pages, 2 figures. This paper has been accepted at Bildverarbeitung für die Medizin (BVM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05722 2026-01-12 cs.CV 79%

Rotate Your Character: Revisiting Video Diffusion Models for High-Quality 3D Character Generation

旋转你的角色:重新审视视频扩散模型用于高质量3D角色生成

Jin Wang, Jianxiang Lu, Comi Chen, Guangzheng Xu, Haoyu Yang, Peng Chen, Na Zhang, Yifan Xu, Longhuang Wu, Shuai Shao, Qinglin Lu, Ping Luo

机构 * Hunyuan, Tencent(腾讯文予实验室) The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出RCM模型,通过旋转角色姿势实现高质量3D角色生成和新视角合成,支持多视角输入和高分辨率视频生成。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21986 2026-01-12 cs.CV 79%

Sprint: Sparse-Dense Residual Fusion for Efficient Diffusion Transformers

Sprint: 基于稀疏-密集残差融合的高效扩散变换器

Dogyun Park, Moayed Haji-Ali, Yanyu Li, Willi Menapace, Sergey Tulyakov, Hyunwoo J. Kim, Aliaksandr Siarohin, Anil Kag

机构 * Snap Inc.(Snap公司) Korea University(韩国大学) KAIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SPRINT通过稀疏-密集残差融合实现高效扩散变换器训练,实现高达75%的标记丢弃率,同时保持生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21855 2026-01-12 cs.CV 79%

ReVision: Refining Video Diffusion with Explicit 3D Motion Modeling

ReVision: 通过显式3D运动建模改进视频扩散

Qihao Liu, Ju He, Qihang Yu, Liang-Chieh Chen, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ReVision通过整合参数化的3D运动模型,提升视频生成中复杂动作和交互的真实性和可控性。

Comments TMLR camera-ready version. Project Page: https://revision-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03979 2026-01-09 cs.CV cs.AI 79%

BlurDM: A Blur Diffusion Model for Image Deblurring

BlurDM: 一种用于图像去模糊的模糊扩散模型

Jin-Ting He, Fu-Jen Tsai, Yan-Tsung Peng, Min-Hung Chen, Chia-Wen Lin, Yen-Yu Lin

机构 * National Yang Ming Chiao Tung University(国家阳明交通大学) National Tsing Hua University(国立清华大学) National Chengchi University(国立成功大学) NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 BlurDM通过双扩散方案整合模糊形成过程,实现图像去模糊,提升去模糊效果。

Comments NeurIPS 2025. Project Page: https://jin-ting-he.github.io/BlurDM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04342 2026-01-09 cs.CV 79%

ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformers

ReHyAt:用于视频扩散变换器的递归混合注意力

Mohsen Ghafoorian, Amirhossein Habibian

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ReHyAt通过结合softmax和线性注意力,实现高效的视频扩散模型,降低训练成本并提升长序列生成的可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03959 2026-01-08 cs.CV 79%

FUSION: Full-Body Unified Motion Prior for Body and Hands via Diffusion

FUSION: 全身统一运动先验用于身体和手部的扩散模型

Enes Duran, Nikos Athanasiou, Muhammed Kocabas, Michael J. Black, Omid Taheri

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tübingen(图宾根大学) Meshcapade GmbH(Meshcapade公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FUSION提出首个基于扩散的全身运动先验模型,联合建模身体和手部运动,实现更自然的运动生成和多样化应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18455 2026-01-08 cs.CV 79%

Plasticine: A Traceable Diffusion Model for Medical Image Translation

Plasticine: 一种用于医学图像翻译的可追溯扩散模型

Tianyang Zhang, Xinxing Cheng, Jun Cheng, Shaoming Zheng, He Zhao, Huazhu Fu, Alejandro F Frangi, Jiang Liu, Jinming Duan

机构 * Department of Computer Science, University of Birmingham(计算机科学系,伯明翰大学) Institute for Infocomm Research, A*STAR(信息与通信研究所,A*STAR) Imperial College London(伦敦帝国学院) Department of Eye and Vision Science, University of Liverpool(眼科与视觉科学系,利物浦大学) Institute of High Performance Computing, A*STAR(高性能计算研究所,A*STAR) Department of Computer Science, and the Division of Informatics, Imaging and Data Sciences, School of Health Sciences, The University of Manchester(计算机科学系,信息、成像与数据科学分会,健康科学学院,曼彻斯特大学) Southern University of Science and Technology(南方科技大学) University of Birmingham(伯明翰大学) University of Manchester(曼彻斯特大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Plasticine是一种以可追溯性为核心目标的端到端医学图像翻译框架,通过结合强度翻译和空间变换,在去噪扩散框架中生成具有可解释性强度过渡和空间一致变形的合成图像。

Comments Accepted by IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09996 2026-01-08 cs.CV q-bio.NC q-bio.QM 79%

Leveraging Swin Transformer for enhanced diagnosis of Alzheimer's disease using multi-shell diffusion MRI

利用Swin Transformer提升多壳扩散MRI在阿尔茨海默病诊断中的应用

Quentin Dessain, Nicolas Delinte, Bernard Hanseeuw, Laurence Dricot, Benoît Macq

机构 * ICTEAM Institute, UCLouvain(ICTEAM研究院,UCLouvain大学) Institute of Neuroscience (IoNS), UCLouvain(神经科学研究所(IoNS),UCLouvain大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究利用Swin Transformer模型,通过多壳扩散MRI数据提升阿尔茨海默病诊断和淀粉样蛋白检测的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18414 2026-01-08 cs.CV 79%

U-REPA: Aligning Diffusion U-Nets to ViTs

U-REPA: 对齐扩散U-Net与ViT

Yuchuan Tian, Hanting Chen, Mengyu Zheng, Yuchen Liang, Chao Xu, Yunhe Wang

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能通用基础理论国家重点实验室,智能科学与技术学院,北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室) The University of Sydney(悉尼大学) School of Mathematical Sciences, Peking University(数学科学学院,北京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 U-REPA通过改进的表示对齐方法,提升扩散模型在U-Net架构中的生成质量和收敛速度。

Comments 22 pages, 8 figures

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03305 2026-01-08 cs.CV cs.AI cs.CY 79%

Mass Concept Erasure in Diffusion Models with Concept Hierarchy

扩散模型中的概念擦除与概念层次

Jiahang Tu, Ye Li, Yiming Wu, Hanbin Zhao, Chao Zhang, Hui Qian

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于概念层次的扩散模型擦除方法,通过群体擦除和超类型保留低秩适应技术,提高擦除效率并减少生成质量退化。

Comments This paper has been accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12631 2026-01-08 cs.CV cs.AI 79%

Multivariate Diffusion Transformer with Decoupled Attention for High-Fidelity Mask-Text Collaborative Facial Generation

多变量扩散变换器与解耦注意力用于高保真遮罩-文本协同面部生成

Yushe Cao, Dianxi Shi, Xing Fu, Xuechao Zou, Haikuo Peng, Xueqi Li, Chun Yu, Junliang Xing

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MDiTFace通过解耦注意力机制和多变量变换块提升遮罩-文本协同面部生成的保真度与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00412 2026-01-08 cs.CV 79%

Sortblock: Similarity-Aware Feature Reuse for Diffusion Model

Sortblock: 基于相似性的特征重用以提升扩散模型

Hanqi Chen, Xu Zhang, Xiaoliu Guan, Lielin Jiang, Guanzhong Wang, Zeyu Chen, Yi Liu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Sortblock通过动态缓存块级特征和轻量级预测机制,实现扩散模型的高效推理加速,提升生成质量的同时显著减少推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09632 2026-01-08 cs.RO cs.CV 79%

Adaptive Anomaly Recovery for Telemanipulation: A Diffusion Model Approach to Vision-Based Tracking

适应性异常恢复用于远程操控:一种基于扩散模型的视觉跟踪方法

Haoyang Wang, Haoran Guo, Lingfeng Tao, Zhengxiong Li

机构 * Oklahoma State University(俄克拉荷马州立大学) University of Colorado Denver(科罗拉多大学丹佛分校) Kennesaw State University(凯斯威克州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的DET框架,通过帧差检测技术识别和分割视频流中的异常,利用扩散模型重建异常片段以提升远程操控在复杂视觉条件下的鲁棒性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03178 2026-01-07 cs.CV 79%

DiffBench Meets DiffAgent: End-to-End LLM-Driven Diffusion Acceleration Code Generation

DiffBench 与 DiffAgent:端到端的 LLM 驱动扩散加速代码生成

Jiajun jiao, Haowei Zhu, Puyuan Yang, Jianghui Wang, Ji Liu, Ziqiong Liu, Dong Li, Yuejian Fang, Junhai Yong, Bin Wang, Emad Barsoum

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DiffBench和DiffAgent,通过LLM驱动的闭环流程,实现端到端的扩散模型加速代码生成,显著提升生成策略的有效性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02881 2026-01-07 cs.CV 79%

Towards Agnostic and Holistic Universal Image Segmentation with Bit Diffusion

面向无偏和整体通用图像分割的位差分扩散

Jakob Lønborg Christensen, Morten Rieger Hannemose, Anders Bjorholm Dahl, Vedrana Andersen Dahl

机构 * Technical University of Denmark(丹麦技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散的通用图像分割框架,通过位置感知调色板和tanh激活函数提升性能,缩小了与基于掩码方法的性能差距,并引入了原理化的模糊建模能力。

Comments Accepted at NLDL 26

详情

展开后加载摘要…

URL PDF HTML 收藏