arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70159 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70159 篇

2603.24260 2026-03-26 cs.CV cs.AI 79%

Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep

通过异构缓存加速基于扩散的视频编辑:超越采样去噪时间步的全计算

Tianyi Liu, Ye Lu, Linfeng Zhang, Chen Cai, Jianjun Gao, Yi Wang, Kim-Hui Yap, Lap-Pui Chau

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HetCache框架,通过利用扩散基于掩码视频到视频生成中的异构性,减少冗余注意力运算,提升视频编辑效率与质量。

Comments 10 pages, 6 figures, accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21591 2026-03-26 cs.CV 79%

CADC: Content Adaptive Diffusion-Based Generative Image Compression

CADC: 基于内容自适应的扩散生成图像压缩

Xihua Sheng, Lingyu Zhu, Tianyu Zhang, Dong Liu, Shiqi Wang, Jing Wang

机构 * City University of Hong Kong(香港城市大学) University of Science and Technology of China(中国科学技术大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CADC,通过三种创新方法解决现有图像压缩在内容自适应中的不足,实现动态对齐图像语义与结构特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21542 2026-03-26 cs.RO cs.AI cs.CV cs.LG 79%

E0: Enhancing Generalization and Fine-Grained Control in VLA Models via Tweedie Discrete Diffusion

E0: 通过 Tweedie 离散扩散增强 VLA 模型的泛化能力与细粒度控制

Zhihao Zhan, Jiaying Zhou, Likui Zhang, Qinhan Lv, Hao Liu, Jusheng Zhang, Weizheng Li, Ziliang Chen, Tianshui Chen, Ruifeng Zhai, Keze Wang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出 E0 框架,通过离散扩散方法提升 VLA 模型在多任务和多视角下的泛化能力,并实现精细可控的动作生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23874 2026-03-26 cs.CV 79%

EnvSocial-Diff: A Diffusion-Based Crowd Simulation Model with Environmental Conditioning and Individual-Group Interaction

EnvSocial-Diff: 一种基于扩散的群体模拟模型,包含环境条件和个体-群体交互

Bingxue Zhao, Qi Zhang, Hui Huang

机构 * VCC, College of Computer Science and Software Engineering, Shenzhen University(VCC,计算机科学与软件工程学院,深圳大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出EnvSocial-Diff模型,结合社会物理和环境条件,通过环境编码模块和个体-群体交互模块提升群体模拟的现实性,实验表明其优于现有方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23845 2026-03-26 cs.CV 79%

3D-LLDM: Label-Guided 3D Latent Diffusion Model for Improving High-Resolution Synthetic MR Imaging in Hepatic Structure Segmentation

3D-LLDM:基于标签的3D潜在扩散模型用于提高肝结构分割的高分辨率合成MR影像

Kyeonghun Kim, Jaehyeok Bae, Youngung Han, Joo Young Bae, Seoyoung Ju, Junsu Lim, Gyeongmin Kim, Nam-Joon Kim, Woo Kyoung Jeong, Ken Ying-Kai Liao, Won Jae Lee, Pa Hong, Hyuk-Jae Lee

机构 * OUTTA, Republic of Korea(韩国OUTTA) Stanford University(斯坦福大学) Seoul National University(首尔国立大学) Sangmyung University(Sangmyung大学) Chung-Ang University(Chung-Ang大学) Samsung Medical Center(三星医疗中心) NVIDIA Sungkyunkwan University School of Medicine(成均馆大学医学院) Samsung Changwon Hospital(三星昌原医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出3D-LLDM模型,通过标签引导生成高质量合成MR影像,提升肝结构分割的精度,实验表明其在数据增强中提升了肝细胞癌分割的Dice得分。

Comments Accepted to ISBI 2026 (Oral). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18719 2026-03-26 cs.CV cs.AI 79%

Ontology-Guided Diffusion for Zero-Shot Visual Sim2Real Transfer

基于本体引导的扩散模型用于零样本视觉sim2real迁移

Mohamed Youssef, Mayar Elfares, Anna-Maria Meer, Matteo Bortoletto, Andreas Bulling

机构 * University of Stuttgart, Germany(斯图加特大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出OGD框架,通过本体引导扩散模型实现零样本sim2real迁移,利用知识图谱和符号规划器提升图像真实感识别与生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20592 2026-03-26 cs.LG cs.CV 79%

Latent Diffusion Inversion Requires Understanding the Latent Space

潜在扩散倒置需要理解潜在空间

Mingxing Rao, Bowen Qu, Daniel Moyer

机构 * Vanderbilt University(范德比大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了扩散模型在潜在空间中的记忆现象,发现潜在空间中记忆分布不均,提出通过排序潜在维度来提升模型性能,实验显示在多个数据集上性能提升显著。

Comments 14 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00430 2026-03-26 cs.LG cs.AI cs.CV 79%

PromptLoop: Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment

PromptLoop: 通过潜在反馈实现扩散模型对齐的即插即用提示精炼

Suhyeon Lee, Jong Chul Ye

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PromptLoop通过引入潜在反馈的逐步提示精炼方法,提升扩散模型在奖励优化、泛化能力及对抗奖励黑客方面的性能,同时保持灵活性和通用性。

Comments CVPR26 poster. 25 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23499 2026-03-25 cs.CV 79%

DA-Flow: Degradation-Aware Optical Flow Estimation with Diffusion Models

DA-Flow:基于扩散模型的降质感知光流估计

Jaewon Min, Jaeeun Lee, Yeji Choi, Paul Hyunbin Cho, Jin Hyeon Kim, Tae-Young Lee, Jongsik Ahn, Hwayeong Lee, Seonghyun Park, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能实验室) Hanwha Systems(韩华系统)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DA-Flow,通过融合扩散模型与卷积特征,提升在真实世界降质视频中的光流估计精度,优于现有方法。

Comments Project page: https://cvlab-kaist.github.io/DA-Flow

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23246 2026-03-25 cs.CV 79%

GO-Renderer: Generative Object Rendering with 3D-aware Controllable Video Diffusion Models

GO-Renderer: 基于3D感知的可控视频扩散模型生成物体渲染

Zekai Gu, Shuoxuan Feng, Yansong Wang, Hanzhuo Huang, Zhongshuo Du, Chengfeng Zhao, Chengwei Ren, Peng Wang, Yuan Liu

机构 * HKUST(香港科技大学) VAST(中国航空无线电电子研究所) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) ShanghaiTech University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GO-Renderer框架,结合重建的3D模型引导视频生成模型,实现高质物体在任意视角和光照下的渲染,无需显式建模复杂材质和光照。

Comments Project page: https://igl-hkust.github.io/GO-Renderer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22509 2026-03-25 cs.CV 79%

Sketch2CT: Multimodal Diffusion for Structure-Aware 3D Medical Volume Generation

Sketch2CT:多模态扩散用于结构感知的3D医学体积生成

Delin An, Chaoli Wang

机构 * University of Notre Dame(诺特大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Sketch2CT通过结合用户提供的2D草图和文本描述,利用多模态扩散框架生成结构一致的3D医学体积,提升生成质量与可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22458 2026-03-25 cs.CV 79%

MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding

MinerU-Diffusion:通过扩散解码重新思考文档OCR作为逆向渲染

Hejun Dong, Junbo Niu, Bin Wang, Weijun Zeng, Wentao Zhang, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Peking University(北京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出MinerU-Diffusion,通过扩散解码替代自回归解码,提升文档OCR的鲁棒性和效率,实验表明其在长序列推理中速度提升3.2倍,且在视觉OCR能力上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19643 2026-03-25 cs.CV cs.AI 79%

OmniDiT: Extending Diffusion Transformer to Omni-VTON Framework

OmniDiT:将扩散变换器扩展到Omni-VTON框架

Weixuan Zeng, Pengcheng Wei, Huaiqing Wang, Boheng Zhang, Jia Sun, Dewen Fan, Lin HE, Long Chen, Qianqian Gan, Fan Yang, Tingting Gao

机构 * The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳)) Beihang University(北京航空航天大学) KuaiShou(快手)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出OmniDiT框架,通过自进化数据采集管道构建大规模VTON数据集,结合多参考条件和Shifted Window Attention提升生成质量,在复杂场景中实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07057 2026-03-25 cs.CV 79%

SODA: Sensitivity-Oriented Dynamic Acceleration for Diffusion Transformer

SODA:面向敏感性的动态加速方法用于扩散变换器

Tong Shao, Yusen Fu, Guoying Sun, Jingde Kong, Zhuotao Tian, Jingyong Su

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SODA通过细粒度敏感性分析动态调整缓存与剪枝策略,提升扩散变换器在可控加速比下的生成质量,实验表明其生成保真度达到最优。

Comments 23 pages, CVPR 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18993 2026-03-25 cs.CV 79%

SeaCache: Spectral-Evolution-Aware Cache for Accelerating Diffusion Models

SeaCache: 基于频谱演化的缓存加速扩散模型

Jiwoo Chung, Sangeek Hyun, MinKyu Lee, Byeongju Han, Geonho Cha, Dongyoon Wee, Youngjun Hong, Jae-Pil Heo

机构 * Sungkyunkwan University(顺天乡大学) NAVER Cloud(NAVER云)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SeaCache缓存机制,通过频谱对齐表示提升扩散模型推理效率,实验证明其在延迟与质量之间取得最优平衡。

Comments Accepted to CVPR 2026. Project page:https://jiwoogit.github.io/SeaCache

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08325 2026-03-25 cs.CV 79%

GeoDiffMM: Geometry-Guided Conditional Diffusion for Motion Magnification

GeoDiffMM:基于几何的条件扩散运动放大

Xuedeng Liu, Jiabao Guo, Zheng Zhang, Fei Wang, Zhi Liu, Dan Guo

机构 * School of Computer Science(计算机科学学院) Information Engineering(信息工程) Hefei University of Technology(合肥工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GeoDiffMM提出一种基于扩散的拉格朗日运动放大框架,利用光流作为几何线索,通过噪声自由光流增强策略和扩散运动放大器,实现结构一致的运动放大,提升微运动放大效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02505 2026-03-25 cs.CV 79%

GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding

GeoDiT:一种基于扩散的视觉-语言模型,用于地理空间理解

Jiaqi Liu, Ronghao Fu, Haoran Liu, Lang Sun, Bo Yang

机构 * College of Computer Science and Technology, Jilin University, Changchun 130012, China(吉林大学计算机科学与技术学院,长春 130012,中国) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GeoDiT,一种基于扩散的视觉-语言模型,用于地理空间理解。该模型通过并行细化过程实现整体粗到细的合成,解决了传统自回归模型在结构化输出生成中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22316 2026-03-25 cs.LG cs.AI cs.CV cs.SD 79%

ST-GDance++: A Scalable Spatial-Temporal Diffusion for Long-Duration Group Choreography

ST-GDance++: 一种可扩展的时空扩散模型用于长时长群体舞蹈编排

Jing Xu, Weiqiang Wang, Cunjian Chen, Jun Liu, Qiuhong Ke

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ST-GDance++模型,通过解耦空间和时间依赖性,实现高效且碰撞感知的群体舞蹈生成,解决了传统方法在长序列和多舞者协调中的效率与稳定性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21856 2026-03-24 cs.CV 79%

Climate Prompting: Generating the Madden-Julian Oscillation using Video Diffusion and Low-Dimensional Conditioning

气候提示:利用视频扩散和低维条件生成 Madden-Julian 振荡

Sulian Thual, Feiyang Cai, Jingjing Wang, Feng Luo

机构 * School of Computing(计算学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用视频扩散模型生成MJO序列,通过低维指标条件化生成MJO,并通过理想化条件分析其物理驱动机制,为热带大气预测提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21547 2026-03-24 cs.CV 79%

PROBE: Diagnosing Residual Concept Capacity in Erased Text-to-Video Diffusion Models

PROBE: 诊断 erased 文本到视频扩散模型中的残余概念容量

Yiwei Xie, Zheng Zhang, Ping Liu

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) Department of Computer Science and Engineering, University of Nevada(内华达大学计算机科学与工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PROBE 通过多级评估框架揭示文本到视频扩散模型中被擦除概念的残余容量,发现所有测试方法留有可测量的残余能力,且其鲁棒性与干预深度相关,指出当前擦除方法仅实现输出级抑制而非表征移除。

Comments This preprint was posted after submission to IEEE Transactions

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16296 2026-03-24 cs.CV cs.AI cs.LG 79%

Memory-V2V: Memory-Augmented Video-to-Video Diffusion for Consistent Multi-Turn Editing

Memory-V2V: 通过记忆增强的视频到视频扩散模型实现一致的多轮编辑

Dohun Lee, Chun-Hao Paul Huang, Xuelin Chen, Jong Chul Ye, Duygu Ceylan, Hyeonho Jeong

机构 * Adobe Research(Adobe研究实验室) KAIST AI(韩国科学技术院人工智能研究所) Adobe Internship(Adobe实习) Project Lead(项目负责人)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Memory-V2V通过引入外部记忆模块,解决多轮视频编辑中的跨轮一致性问题,提升编辑连贯性并保持视觉质量,优于现有基线模型。

Comments Project page: https://dohunlee1.github.io/MemoryV2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04619 2026-03-24 cs.CV 79%

Denoise to Track: Harnessing Video Diffusion Priors for Robust Correspondence

去噪以跟踪:利用视频扩散先验进行鲁棒对应

Tianyu Yuan, Yuanbo Yang, Lin-Zhuo Chen, Yao Yao, Zhuzhong Qian

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HeFT框架,利用预训练视频扩散模型的视觉先验进行零样本点跟踪,通过分析内部表示揭示注意力头在匹配、语义理解和位置编码中的不同专长,并提出基于头和频率的特征选择策略提升跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17699 2026-03-24 cs.CV cs.LG 79%

GAS: Improving Discretization of Diffusion ODEs via Generalized Adversarial Solver

GAS:通过通用对抗求解器改进扩散ODE的离散化

Aleksandr Oganov, Ilya Bykov, Eva Neudachina, Mishan Aliev, Alexander Tolmachev, Alexander Sidorov, Aleksandr Zuev, Andrey Okhotin, Denis Rakitin, Aibek Alanov

机构 * HSE University(俄罗斯高等经济学院) Lomonosov Moscow State University(莫斯科罗蒙诺索夫莫斯科国立大学) FusionBrain Lab(FusionBrain实验室) Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通用对抗求解器,通过结合原蒸馏损失与对抗训练,提升扩散模型细节保真度,无需复杂训练技巧,实现更高效的ODE离散化。

Comments Accepted to ICLR 2026. Camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04597 2026-03-24 cs.CV 79%

DisPatch: Disarming Adversarial Patches in Object Detection with Diffusion Models

DisPatch:基于扩散模型的物体检测对抗性补丁消除方法

Jin Ma, Mohammed Aldeen, Christopher Salas, Feng Luo, Mashrur Chowdhury, Mert Pesé, Long Cheng

机构 * Clemson University(克莱姆森大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DisPatch,一种基于扩散模型的物体检测防御框架,通过再生和修正策略消除对抗性补丁,有效提升检测鲁棒性,实验表明其在隐藏攻击和生成攻击中均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21166 2026-03-24 cs.CV 79%

Training-Free Instance-Aware 3D Scene Reconstruction and Diffusion-Based View Synthesis from Sparse Images

无需训练的实例感知3D场景重建与基于扩散的视图合成从稀疏图像

Jiatong Xia, Lingqiao Liu

机构 * The University of Adelaide(阿德莱德大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无需训练的系统,从稀疏未定位RGB图像重建、理解并渲染3D室内场景,通过点云重建、2D到3D实例提升和扩散模型渲染实现高保真结果,支持实例编辑。

Comments Accepted by SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21129 2026-03-24 cs.CV 79%

ReDiffuse: Rotation Equivariant Diffusion Model for Multi-focus Image Fusion

ReDiffuse:用于多焦点图像融合的旋转等价扩散模型

Bo Li, Tingting Bao, Lingling Zhang, Weiping Fu, Yaxian Wang, Jun Liu

机构 * School of Computer Science and Technology, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院) School of Information Engineering, Chang'an University(长安大学信息工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ReDiffuse模型,通过在扩散网络中嵌入旋转等价性,解决多焦点图像融合中因模糊导致的结构失真问题,提升融合图像的结构一致性。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20868 2026-03-24 cs.CV 79%

TAFG-MAN: Timestep-Adaptive Frequency-Gated Latent Diffusion for Efficient and High-Quality Low-Dose CT Image Denoising

TAFG-MAN:时间自适应频率门控潜在扩散用于高效高质量低剂量CT图像去噪

Tangtangfang Fang, Yang Jiao, Xiangjian He, Jingxi Hu, Jiaqi Yang

机构 * University of Nottingham Ningbo China(宁波大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TAFG-MAN框架,结合感知优化的自动编码器和紧凑潜在空间中的条件潜在扩散修复,以及轻量级时间自适应频率门控设计,提升低剂量CT图像去噪的效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20584 2026-03-24 cs.CV 79%

Improving Diffusion Generalization with Weak-to-Strong Segmented Guidance

通过弱到强分段引导提升扩散模型泛化能力

Liangyu Yuan, Yufei Huang, Mingkun Lei, Tong Zhao, Ruoyu Wang, Changxi Chi, Yiwei Wang, Chi Zhang

机构 * Westlake University(西湖大学) Tongji University(同济大学) Zhejiang University(浙江大学) University of California at Merced(加州大学默塞德分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SGG方法,通过弱到强原则结合CFG和AG的优势,提升扩散模型泛化能力,并在训练和推理阶段验证其有效性。

Comments 22 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05264 2026-03-24 cs.CV cs.AI 79%

SGDFuse: SAM-Guided Diffusion Model for High-Fidelity Infrared and Visible Image Fusion

SGDFuse: 基于SAM的扩散模型用于高保真红外与可见图像融合

Xiaoyang Zhang, jinjiang Li, Guodong Fan, Yakun Ju, Linwei Fan, Jun Liu, Alex C. Kot

机构 * School of Computer Science(计算机科学学院) Business University, Yantai, China(烟台商学院) College of Computer and Data Science(计算机与数据科学学院) Fuzhou University, Fuzhou, China(福州大学) School of Computing and Mathematical Sciences(计算与数学科学学院) University of Leicester, Leicester, United Kingdom(莱斯特大学) School of Computing and Artificial Intelligence(计算与人工智能学院) Director of the Rapid-Rich Object Search Laboratory(快速丰富对象搜索实验室主任) NTU-PKU Joint Research Institute, Nanyang Technological University, Singapore(NTU-PKU联合研究机构,新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SGDFuse,通过结合SAM的高阶语义先验与扩散模型的高保真生成能力,解决红外与可见图像融合中的语义盲问题,提升图像质量和下游任务性能。

Comments Published in Information Fusion

Journal ref Information Fusion, 2026: 104290

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16474 2026-03-24 cs.CV 79%

Foresight Diffusion: Improving Sampling Consistency in Predictive Diffusion Models

前瞻性扩散:改进预测扩散模型中的采样一致性

Yu Zhang, Xingzhuo Guo, Haoran Xu, Jialong Wu, Mingsheng Long

机构 * School of Software, BNRist, Tsinghua University(软件学院,BNRist,清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Foresight Diffusion,通过解耦条件理解和目标去噪提升预测扩散模型的采样一致性,实验显示其在机器人视频预测和科学时空预测中表现优异。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏