arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86872 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2503.11181 2026-02-02 cs.CV cs.AI 79%

Multi-Stage Generative Upscaler: Reconstructing Football Broadcast Images via Diffusion Models

多阶段生成放大器:通过扩散模型重建足球转播图像

Luca Martini, Daniele Zolezzi, Saverio Iacono, Gianni Viardo Vercelli

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出多阶段生成放大框架,利用扩散模型提升足球转播图像质量,通过ControlNet和LoRA实现细节与特定元素的精准重建。

Journal ref Scientific Reports volume 16, Article number: 1882 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22468 2026-02-02 cs.CV cs.AI 79%

Training-Free Representation Guidance for Diffusion Models with a Representation Alignment Projector

无需训练的表示引导用于扩散模型的表示对齐投影器

Wenqiang Zu, Shenghao Xie, Bo Lei, Lei Ma

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出无需训练的表示引导方法,通过引入表示对齐投影器提升扩散模型的语义对齐与图像一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22275 2026-02-02 cs.CV cs.AI 79%

VMonarch: Efficient Video Diffusion Transformers with Structured Attention

VMonarch:具有结构注意力的高效视频扩散变换器

Cheng Liang, Haoxian Chen, Liang Hou, Qi Fan, Gangshan Wu, Xin Tao, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 VMonarch通过结构化注意力机制提升视频扩散变换器的效率,减少计算量并提高处理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02291 2026-02-02 cs.LG cs.CV stat.ML 79%

Test-Time Anchoring for Discrete Diffusion Posterior Sampling

测试时锚定用于离散扩散后验采样

Litu Rout, Andreas Lugmayr, Yasamin Jafarian, Srivatsan Varadharajan, Constantine Caramanis, Sanjay Shakkottai, Ira Kemelmacher-Shlizerman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Google(谷歌)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出锚定后验采样方法,通过量化期望和锚定重掩码实现离散扩散模型在后验采样中的高效和精确采样,提升图像生成和文本引导编辑的性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21922 2026-01-30 cs.CV 79%

Zero-Shot Video Restoration and Enhancement with Assistance of Video Diffusion Models

借助视频扩散模型的零样本视频修复与增强

Cong Cao, Huanjing Yue, Shangbin Xie, Xin Liu, Jingyu Yang

机构 * School of Electrical and Information Engineering, Tianjin University(电子信息工程学院,天津大学) Computer Vision and Pattern Recognition Laboratory, School of Engineering Science, Lappeenranta-Lahti University of Technology LUT(计算机视觉与模式识别实验室,工程科学学院,拉佩兰塔-拉赫蒂技术大学LUT)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无训练的框架,利用视频扩散模型提升零样本视频修复与增强的时序一致性,通过潜在融合与后处理策略增强效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21857 2026-01-30 cs.CV 79%

Trajectory-Guided Diffusion for Foreground-Preserving Background Generation in Multi-Layer Documents

轨迹引导扩散:多层文档中保留前景的背景生成

Taewon Kang

机构 * University of Maryland at College Park(马里兰大学学院市分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出轨迹引导扩散方法,通过潜在空间设计实现多层文档中前景保留和背景生成的风格一致性。

Comments 47 pages, 36 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21248 2026-01-30 cs.CV 79%

NFCDS: A Plug-and-Play Noise Frequency-Controlled Diffusion Sampling Strategy for Image Restoration

NFCDS: 一种插件式噪声频率控制扩散采样策略用于图像修复

Zhen Wang, Hongyi Liu, Jianing Li, Zhihui Wei

机构 * Nanjing University of Science and Technology(南京理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 NFCDS通过控制噪声频率提升图像修复的保真度与感知质量,无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17868 2026-01-30 cs.CV cs.AI 79%

VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding

VidLaDA:双向扩散大型语言模型用于高效视频理解

Zhihao He, Tieyuan Chen, Kangyu Wang, Ziran Qin, Yang Shao, Chaofan Gan, Shijie Li, Zuxuan Wu, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) ZhongguanCun Academy(中关村学院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 VidLaDA通过双向注意力和MARS-Cache技术,提升视频理解效率,实现比现有方法更优的性能与速度

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11229 2026-01-30 cs.CV cs.SD 79%

REST: Diffusion-based Real-time End-to-end Streaming Talking Head Generation via ID-Context Caching and Asynchronous Streaming Distillation

REST:基于扩散模型的实时端到端流式说话人生成方法:通过ID上下文缓存和异步流式蒸馏

Haotian Wang, Yuzhe Weng, Jun Du, Haoran Xu, Xiaoyan Wu, Shan He, Bing Yin, Cong Liu, Qingfeng Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 REST通过ID-Context缓存和异步流式蒸馏,实现高效实时端到端流式说话人生成。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25731 2026-01-30 cs.CV 79%

LaTo: Landmark-tokenized Diffusion Transformer for Fine-grained Human Face Editing

LaTo:基于地标token化的扩散变换器用于精细的人脸编辑

Zhenghao Zhang, Ziying Zhang, Junchao Liao, Xiangyu Meng, Qiang Hu, Siyu Zhu, Xiaoyun Zhang, Long Qin, Weizhi Wang

机构 * Alibaba Cloud Computing(阿里云计算) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LaTo通过地标token化扩散变换器实现精细的人脸编辑,提升身份保持与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06625 2026-01-30 cs.CV 79%

CycleDiff: Cycle Diffusion Models for Unpaired Image-to-image Translation

CycleDiff: 基于循环扩散模型的无配对图像到图像翻译

Shilong Zou, Yuhang Huang, Renjiao Yi, Chenyang Zhu, Kai Xu

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) College of Future Information Technology, Fudan University(未来信息技术学院,复旦大学) School of Computer, National University of Defense Technology(计算机学院,国防科技大学) Xiangjiang Laboratory(湘江实验室) Institute of AI for Industries, Chinese Academy of Sciences(产业人工智能研究院,中国科学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CycleDiff通过联合学习扩散与翻译过程,提升跨域图像翻译的全局优化与生成质量。

Comments Accepted by IEEE TIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07720 2026-01-30 cs.CV 79%

ACDiT: Interpolating Autoregressive Conditional Modeling and Diffusion Transformer

ACDiT:插值自回归条件建模与扩散变换器

Jinyi Hu, Shengding Hu, Yuxuan Song, Yufei Huang, Mingxuan Wang, Hao Zhou, Zhiyuan Liu, Wei-Ying Ma, Maosong Sun

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ACDiT通过结合自回归和扩散范式,实现连续视觉信息的灵活插值生成,优于现有自回归基线,在视觉生成任务中表现最佳。

Comments TMLR camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20857 2026-01-29 cs.CV 79%

FreeFix: Boosting 3D Gaussian Splatting via Fine-Tuning-Free Diffusion Models

FreeFix: 通过无微调扩散模型提升3D高斯散射

Hongyu Zhou, Zisen Shao, Sheng Miao, Pan Wang, Dongfeng Bai, Bingbing Liu, Yiyi Liao

机构 * Zhejiang University(浙江大学) University of Maryland, College Park(马里兰大学学院 park 分校) Huawei(华为)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FreeFix通过无微调扩散模型提升3D高斯散射,实现高质量视图合成与强泛化能力。

Comments Our project page is at https://xdimlab.github.io/freefix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20791 2026-01-29 cs.CV cs.AI 79%

FAIRT2V: Training-Free Debiasing for Text-to-Video Diffusion Models

FAIRT2V:无需训练的文本到视频扩散模型去偏框架

Haonan Zhong, Wei Song, Tingxu Han, Maurice Pagnucco, Jingling Xue, Yang Song

机构 * School of Computer Science and Engineering, University of New South Wales, Australia.(新南威尔士大学计算机科学与工程学院,澳大利亚) State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FAIRT2V通过无需训练的去偏框架减少文本到视频扩散模型中的性别偏见,通过中和提示嵌入和动态去噪计划实现,有效降低偏见同时保持视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08005 2026-01-29 cs.LG cs.CV 79%

DiffRatio: Training One-Step Diffusion Models Without Teacher Supervision

DiffRatio: 无需教师监督训练一步扩散模型

Wenlin Chen, Mingtian Zhang, Jiajun He, Zijing Ou, José Miguel Hernández-Lobato, Bernhard Schölkopf, David Barber

机构 * Bosch (China) Investment Ltd.(博世(中国)投资有限公司) University of Cambridge(剑桥大学) Imperial College London(伦敦帝国理工学院) Max Planck Institute for Intelligent Systems, Tübingen(智能系统马克斯·普朗克研究所,图宾根)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffRatio通过直接估计分数差来训练一步扩散模型,减少梯度偏差并提升生成质量,同时提高计算效率。

Comments 22 pages, 8 figures, 5 tables, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20564 2026-01-29 cs.CV 79%

DiffVC-RT: Towards Practical Real-Time Diffusion-based Perceptual Neural Video Compression

DiffVC-RT: 向实用的实时扩散式感知神经视频压缩迈进

Wenzhuo Ma, Zhenzhong Chen

机构 * School of Remote Sensing and Information Engineering, Wuhan University, Wuhan, China(遥感与信息工程学院,武汉大学,武汉,中国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffVC-RT通过高效架构、显式隐式一致性建模和异步并行解码实现实时扩散式视频压缩,显著提升压缩效率和质量。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20499 2026-01-29 cs.CV 79%

Efficient Autoregressive Video Diffusion with Dummy Head

高效的自回归视频扩散模型与Dummy头

Hang Guo, Zhaoyang Jia, Jiahao Li, Bin Li, Yuanhao Cai, Jiangshan Wang, Yawei Li, Yan Lu

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院) Johns Hopkins University(约翰霍普金斯大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Dummy Forcing方法,通过优化多头自注意力机制的内存分配和上下文管理,提升视频扩散模型的生成速度,同时保持高质量输出。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20310 2026-01-29 cs.CR cs.CV cs.LG 79%

SemBind: Binding Diffusion Watermarks to Semantics Against Black-Box Forgery Attacks

SemBind: 通过学习语义遮罩将潜在信号绑定到图像语义以对抗黑盒伪造攻击

Xin Zhang, Zijin Yang, Kejiang Chen, Linfeng Ma, Weiming Zhang, Nenghai Yu

机构 * School of Cyber Science and Technology, University of Science and Technology of China, Anhui, China(中国科学技术大学网络安全学院) Anhui Province Key Laboratory of Digital Security, Anhui, China(安徽省数字安全重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SemBind通过学习语义遮罩将潜在信号绑定到图像语义,以对抗黑盒伪造攻击,提高水印的抗伪造能力和鲁棒性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20304 2026-01-29 cs.CV cs.AI 79%

Structure-constrained Language-informed Diffusion Model for Unpaired Low-dose Computed Tomography Angiography Reconstruction

结构约束的语言引导扩散模型用于无配对低剂量计算机断层扫描血管造影重建

Genyuan Zhang, Zihao Wang, Zhifan Gao, Lei Xu, Zhen Zhou, Haijun Yu, Jianjia Zhang, Xiujian Liu, Weiwei Zhang, Shaoyu Wang, Huazhu Fu, Fenglin Liu, Weiwen Wu

机构 * Key Lab of Optoelectronic Technology and Systems and Engineering Research Center of Industrial Computed Tomography Nondestructive Testing, Ministry of Education, Chongqing University(光电技术与系统国家重点实验室和工业计算机断层非破坏检测工程研究中心,教育部,重庆大学) School of Biomedical Engineering, Sun Yat-sen University(中山大学生物医学工程学院) Department of Radiology, Beijing Anzhen Hospital, Capital Medical University(北京安贞医院放射科,首都医科大学) School of Information Engineering, Nanchang, Jiangxi(信息工程学院,南昌,江西) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR)(高性能计算研究所(IHPC),科技研究局(A*STAR))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出结构约束的语言引导扩散模型,通过整合结构协同和空间智能,提升低剂量CT血管造影重建的准确性与对比度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19785 2026-01-29 cs.CV 79%

GeoDiff3D: Self-Supervised 3D Scene Generation with Geometry-Constrained 2D Diffusion Guidance

GeoDiff3D: 基于几何约束的2D扩散引导的自监督3D场景生成

Haozhi Zhu, Miaomiao Zhao, Dingyao Liu, Runze Tian, Yan Zhang, Jie Guo, Fenggen Yu

机构 * Nanjing University(南京大学) Simon Fraser university(西蒙弗雷泽大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GeoDiff3D通过几何约束的2D扩散模型和自监督机制,实现高效且高质量的3D场景生成,减少对标注数据的依赖,提升复杂场景的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19073 2026-01-29 cs.CV eess.IV eess.SP 79%

WaveletGaussian: Wavelet-domain Diffusion for Sparse-view 3D Gaussian Object Reconstruction

WaveletGaussian: 基于小波域的稀疏视角3D高斯物体重建

Hung Nguyen, Runfa Li, An Le, Truong Nguyen

机构 * Video Processing Lab, UC San Diego(UC San Diego视频处理实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 WaveletGaussian通过将扩散模型应用于小波域的低分辨率子带,结合高效在线随机掩码策略,实现了更高效的稀疏视角3D高斯物体重建。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10601 2026-01-29 q-bio.QM cs.CV cs.LG eess.IV stat.ME 79%

AGFS-Tractometry: A Novel Atlas-Guided Fine-Scale Tractometry Approach for Enhanced Along-Tract Group Statistical Comparison Using Diffusion MRI Tractography

AGFS-束测:一种基于图谱的精细束测方法,用于利用弥散MRI束图进行增强的沿束群体统计比较

Ruixi Zheng, Wei Zhang, Yijie Li, Xi Zhu, Zhou Lan, Jarrett Rushmore, Yogesh Rathi, Nikos Makris, Lauren J. O'Donnell, Fan Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里奇曼妇女医院) Boston University(波士顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 AGFS-束测提出了一种基于图谱的精细束测方法,通过利用弥散MRI束图信息和排列检验,提高沿束群体统计比较的敏感性和特异性,有效识别白质群体差异。

Comments 31 pages and 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16512 2026-01-29 cs.CV cs.AI 79%

Beyond Face Swapping: A Diffusion-Based Digital Human Benchmark for Multimodal Deepfake Detection

超越人脸交换:一种基于扩散模型的多模态深度伪造检测基准

Jiaxin Liu, Jia Wang, Saihui Hou, Min Ren, Huijia Wu, Long Ma, Renwang Pei, Zhaofeng He

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DigiFakeAV数据集和DigiShield检测模型,用于多模态深度伪造检测,通过融合时空和跨模态特征提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22349 2026-01-29 cs.CV 79%

GCRayDiffusion: Pose-Free Surface Reconstruction via Geometric Consistent Ray Diffusion

GCRayDiffusion:基于几何一致射线扩散的无姿态表面重建

Li-Heng Chen, Zi-Xin Zou, Chang Liu, Tianjiao Jing, Yan-Pei Cao, Shi-Sheng Huang, Hongbo Fu, Hua Huang

机构 * Beijing Normal University(北京师范大学) VAST(中国科学院软件研究所) Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GCRayDiffusion通过几何一致射线扩散实现无姿态表面重建,提升稀疏视角下的3D一致性与精度。

Journal ref Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit. (ICCV), 2025, pp. 25335-25345

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01262 2026-01-29 cs.CV cs.LG 79%

Improving Fine-Grained Control via Aggregation of Multiple Diffusion Models

通过聚合多个扩散模型实现更精细的控制

Conghan Yue, Zhengwei Peng, Shiyan Du, Zhi Ji, Chuangjian Cai, Le Wan, Dongyu Zhang

机构 * Sun Yat-Sen University(中山大学) Game AI Center, Tencent(腾讯游戏AI中心) University of Toronto(多伦多大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AMDM算法,通过聚合多个扩散模型实现无需训练的细粒度生成控制,提升生成质量和一致性,减少复杂数据集和模型架构设计的需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02625 2026-01-29 cs.CV 79%

Diffusion Noise Feature: Accurate and Fast Generated Image Detection

扩散噪声特征:准确且快速的生成图像检测

Yichi Zhang, Xiaogang Xu

机构 * Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出扩散噪声特征(DNF)以提高生成图像检测的准确性和泛化能力,通过训练ResNet-50实现高鲁棒性的检测。

Comments Accepted by ECAI 2025

Journal ref ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03252 2026-01-28 cs.LG cs.AI cs.CV 79%

Universal Multi-Domain Translation via Diffusion Routers

通用多领域翻译 via 扩散路由器

Duc Kieu, Kien Do, Tuan Hoang, Thao Minh Le, Tung Kieu, Dang Nguyen, Thin Nguyen

机构 * Applied Artificial Intelligence Initiative, Deakin University, Australia(德肯大学应用人工智能计划,澳大利亚) Pennsylvania State University, USA(宾夕法尼亚州立大学,美国) Aalborg University, Denmark(奥胡斯大学,丹麦)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出扩散路由器(DR)框架,通过中心域路由实现多领域翻译,实现通用多领域翻译任务,提升翻译效率与任务多样性。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15809 2026-01-28 cs.CV cs.LG physics.geo-ph stat.AP 79%

Diffusion models for multivariate subsurface generation and efficient probabilistic inversion

扩散模型用于多变量地下生成及高效的概率反演

Roberto Miele, Niklas Linde

机构 * Institute of Earth Sciences University of Lausanne(地球科学研究所 雅各布大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散模型的多变量地下生成与高效概率反演方法,通过改进的后验采样方法提升了统计鲁棒性和计算效率。

Comments 35 p., 16 figs. This updated version corrects an error with the analysis of the denoising scores' magnitudes in the results section. The discussion and conclusions of our study remain unchanged. The scores' trends were erroneously reported with inverted time-step order, now fixed in Figure 5a and b (now with the correct increasing trends) and in the corresponding analysis in the Results section

Journal ref Comput. Geosci. 207 (2026) 106076

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01573 2026-01-28 cs.CV 79%

A Gift from the Integration of Discriminative and Diffusion-based Generative Learning: Boundary Refinement Remote Sensing Semantic Segmentation

整合判别与基于扩散的生成学习:边界细化遥感语义分割

Hao Wang, Keyan Hu, Xin Guo, Haifeng Li, Chao Tao

机构 * School of Geosciences and Info-Physics, Central South University(地质科学与信息物理学院,中南大学) College of Computer Science, Inner Mongolia University(计算机学院,内蒙古大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出IDGBR框架,整合判别与生成学习,通过粗分割图与原始图像的联合学习,利用迭代去噪扩散过程实现遥感图像边界精细化分割。

Comments Accepted for publication in IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03623 2026-01-28 cs.CV 79%

Bounding Box-Guided Diffusion for Synthesizing Industrial Images and Segmentation Map

边界框引导的扩散模型用于合成工业图像和分割图

Emanuele Caruso, Alessandro Simoni, Francesco Pelosin

机构 * Covision Lab(科维森实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的边界框引导方法,用于生成高保真的工业图像和分割图,提升缺陷一致性和空间准确性,通过定量指标评估方法有效性,推动更可靠的分割模型发展。

Comments Accepted at Synthetic Data for Computer Vision Workshop - CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏