arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86872 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2603.19643 2026-03-25 cs.CV cs.AI 79%

OmniDiT: Extending Diffusion Transformer to Omni-VTON Framework

OmniDiT:将扩散变换器扩展到Omni-VTON框架

Weixuan Zeng, Pengcheng Wei, Huaiqing Wang, Boheng Zhang, Jia Sun, Dewen Fan, Lin HE, Long Chen, Qianqian Gan, Fan Yang, Tingting Gao

机构 * The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳)) Beihang University(北京航空航天大学) KuaiShou(快手)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出OmniDiT框架,通过自进化数据采集管道构建大规模VTON数据集,结合多参考条件和Shifted Window Attention提升生成质量,在复杂场景中实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07057 2026-03-25 cs.CV 79%

SODA: Sensitivity-Oriented Dynamic Acceleration for Diffusion Transformer

SODA:面向敏感性的动态加速方法用于扩散变换器

Tong Shao, Yusen Fu, Guoying Sun, Jingde Kong, Zhuotao Tian, Jingyong Su

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SODA通过细粒度敏感性分析动态调整缓存与剪枝策略,提升扩散变换器在可控加速比下的生成质量,实验表明其生成保真度达到最优。

Comments 23 pages, CVPR 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18993 2026-03-25 cs.CV 79%

SeaCache: Spectral-Evolution-Aware Cache for Accelerating Diffusion Models

SeaCache: 基于频谱演化的缓存加速扩散模型

Jiwoo Chung, Sangeek Hyun, MinKyu Lee, Byeongju Han, Geonho Cha, Dongyoon Wee, Youngjun Hong, Jae-Pil Heo

机构 * Sungkyunkwan University(顺天乡大学) NAVER Cloud(NAVER云)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SeaCache缓存机制,通过频谱对齐表示提升扩散模型推理效率,实验证明其在延迟与质量之间取得最优平衡。

Comments Accepted to CVPR 2026. Project page:https://jiwoogit.github.io/SeaCache

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08325 2026-03-25 cs.CV 79%

GeoDiffMM: Geometry-Guided Conditional Diffusion for Motion Magnification

GeoDiffMM:基于几何的条件扩散运动放大

Xuedeng Liu, Jiabao Guo, Zheng Zhang, Fei Wang, Zhi Liu, Dan Guo

机构 * School of Computer Science(计算机科学学院) Information Engineering(信息工程) Hefei University of Technology(合肥工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GeoDiffMM提出一种基于扩散的拉格朗日运动放大框架,利用光流作为几何线索,通过噪声自由光流增强策略和扩散运动放大器,实现结构一致的运动放大,提升微运动放大效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02505 2026-03-25 cs.CV 79%

GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding

GeoDiT:一种基于扩散的视觉-语言模型,用于地理空间理解

Jiaqi Liu, Ronghao Fu, Haoran Liu, Lang Sun, Bo Yang

机构 * College of Computer Science and Technology, Jilin University, Changchun 130012, China(吉林大学计算机科学与技术学院,长春 130012,中国) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GeoDiT,一种基于扩散的视觉-语言模型,用于地理空间理解。该模型通过并行细化过程实现整体粗到细的合成,解决了传统自回归模型在结构化输出生成中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22316 2026-03-25 cs.LG cs.AI cs.CV cs.SD 79%

ST-GDance++: A Scalable Spatial-Temporal Diffusion for Long-Duration Group Choreography

ST-GDance++: 一种可扩展的时空扩散模型用于长时长群体舞蹈编排

Jing Xu, Weiqiang Wang, Cunjian Chen, Jun Liu, Qiuhong Ke

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ST-GDance++模型,通过解耦空间和时间依赖性,实现高效且碰撞感知的群体舞蹈生成,解决了传统方法在长序列和多舞者协调中的效率与稳定性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21856 2026-03-24 cs.CV 79%

Climate Prompting: Generating the Madden-Julian Oscillation using Video Diffusion and Low-Dimensional Conditioning

气候提示:利用视频扩散和低维条件生成 Madden-Julian 振荡

Sulian Thual, Feiyang Cai, Jingjing Wang, Feng Luo

机构 * School of Computing(计算学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用视频扩散模型生成MJO序列,通过低维指标条件化生成MJO,并通过理想化条件分析其物理驱动机制,为热带大气预测提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21547 2026-03-24 cs.CV 79%

PROBE: Diagnosing Residual Concept Capacity in Erased Text-to-Video Diffusion Models

PROBE: 诊断 erased 文本到视频扩散模型中的残余概念容量

Yiwei Xie, Zheng Zhang, Ping Liu

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) Department of Computer Science and Engineering, University of Nevada(内华达大学计算机科学与工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PROBE 通过多级评估框架揭示文本到视频扩散模型中被擦除概念的残余容量,发现所有测试方法留有可测量的残余能力,且其鲁棒性与干预深度相关,指出当前擦除方法仅实现输出级抑制而非表征移除。

Comments This preprint was posted after submission to IEEE Transactions

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04619 2026-03-24 cs.CV 79%

Denoise to Track: Harnessing Video Diffusion Priors for Robust Correspondence

去噪以跟踪:利用视频扩散先验进行鲁棒对应

Tianyu Yuan, Yuanbo Yang, Lin-Zhuo Chen, Yao Yao, Zhuzhong Qian

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HeFT框架,利用预训练视频扩散模型的视觉先验进行零样本点跟踪,通过分析内部表示揭示注意力头在匹配、语义理解和位置编码中的不同专长,并提出基于头和频率的特征选择策略提升跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17699 2026-03-24 cs.CV cs.LG 79%

GAS: Improving Discretization of Diffusion ODEs via Generalized Adversarial Solver

GAS:通过通用对抗求解器改进扩散ODE的离散化

Aleksandr Oganov, Ilya Bykov, Eva Neudachina, Mishan Aliev, Alexander Tolmachev, Alexander Sidorov, Aleksandr Zuev, Andrey Okhotin, Denis Rakitin, Aibek Alanov

机构 * HSE University(俄罗斯高等经济学院) Lomonosov Moscow State University(莫斯科罗蒙诺索夫莫斯科国立大学) FusionBrain Lab(FusionBrain实验室) Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通用对抗求解器,通过结合原蒸馏损失与对抗训练,提升扩散模型细节保真度,无需复杂训练技巧,实现更高效的ODE离散化。

Comments Accepted to ICLR 2026. Camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04597 2026-03-24 cs.CV 79%

DisPatch: Disarming Adversarial Patches in Object Detection with Diffusion Models

DisPatch:基于扩散模型的物体检测对抗性补丁消除方法

Jin Ma, Mohammed Aldeen, Christopher Salas, Feng Luo, Mashrur Chowdhury, Mert Pesé, Long Cheng

机构 * Clemson University(克莱姆森大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DisPatch,一种基于扩散模型的物体检测防御框架,通过再生和修正策略消除对抗性补丁,有效提升检测鲁棒性,实验表明其在隐藏攻击和生成攻击中均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21166 2026-03-24 cs.CV 79%

Training-Free Instance-Aware 3D Scene Reconstruction and Diffusion-Based View Synthesis from Sparse Images

无需训练的实例感知3D场景重建与基于扩散的视图合成从稀疏图像

Jiatong Xia, Lingqiao Liu

机构 * The University of Adelaide(阿德莱德大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种无需训练的系统,从稀疏未定位RGB图像重建、理解并渲染3D室内场景,通过点云重建、2D到3D实例提升和扩散模型渲染实现高保真结果,支持实例编辑。

Comments Accepted by SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21129 2026-03-24 cs.CV 79%

ReDiffuse: Rotation Equivariant Diffusion Model for Multi-focus Image Fusion

ReDiffuse:用于多焦点图像融合的旋转等价扩散模型

Bo Li, Tingting Bao, Lingling Zhang, Weiping Fu, Yaxian Wang, Jun Liu

机构 * School of Computer Science and Technology, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院) School of Information Engineering, Chang'an University(长安大学信息工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ReDiffuse模型,通过在扩散网络中嵌入旋转等价性,解决多焦点图像融合中因模糊导致的结构失真问题,提升融合图像的结构一致性。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20868 2026-03-24 cs.CV 79%

TAFG-MAN: Timestep-Adaptive Frequency-Gated Latent Diffusion for Efficient and High-Quality Low-Dose CT Image Denoising

TAFG-MAN:时间自适应频率门控潜在扩散用于高效高质量低剂量CT图像去噪

Tangtangfang Fang, Yang Jiao, Xiangjian He, Jingxi Hu, Jiaqi Yang

机构 * University of Nottingham Ningbo China(宁波大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TAFG-MAN框架,结合感知优化的自动编码器和紧凑潜在空间中的条件潜在扩散修复,以及轻量级时间自适应频率门控设计,提升低剂量CT图像去噪的效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20584 2026-03-24 cs.CV 79%

Improving Diffusion Generalization with Weak-to-Strong Segmented Guidance

通过弱到强分段引导提升扩散模型泛化能力

Liangyu Yuan, Yufei Huang, Mingkun Lei, Tong Zhao, Ruoyu Wang, Changxi Chi, Yiwei Wang, Chi Zhang

机构 * Westlake University(西湖大学) Tongji University(同济大学) Zhejiang University(浙江大学) University of California at Merced(加州大学默塞德分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SGG方法,通过弱到强原则结合CFG和AG的优势,提升扩散模型泛化能力,并在训练和推理阶段验证其有效性。

Comments 22 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05264 2026-03-24 cs.CV cs.AI 79%

SGDFuse: SAM-Guided Diffusion Model for High-Fidelity Infrared and Visible Image Fusion

SGDFuse: 基于SAM的扩散模型用于高保真红外与可见图像融合

Xiaoyang Zhang, jinjiang Li, Guodong Fan, Yakun Ju, Linwei Fan, Jun Liu, Alex C. Kot

机构 * School of Computer Science(计算机科学学院) Business University, Yantai, China(烟台商学院) College of Computer and Data Science(计算机与数据科学学院) Fuzhou University, Fuzhou, China(福州大学) School of Computing and Mathematical Sciences(计算与数学科学学院) University of Leicester, Leicester, United Kingdom(莱斯特大学) School of Computing and Artificial Intelligence(计算与人工智能学院) Director of the Rapid-Rich Object Search Laboratory(快速丰富对象搜索实验室主任) NTU-PKU Joint Research Institute, Nanyang Technological University, Singapore(NTU-PKU联合研究机构,新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SGDFuse,通过结合SAM的高阶语义先验与扩散模型的高保真生成能力,解决红外与可见图像融合中的语义盲问题,提升图像质量和下游任务性能。

Comments Published in Information Fusion

Journal ref Information Fusion, 2026: 104290

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16474 2026-03-24 cs.CV 79%

Foresight Diffusion: Improving Sampling Consistency in Predictive Diffusion Models

前瞻性扩散:改进预测扩散模型中的采样一致性

Yu Zhang, Xingzhuo Guo, Haoran Xu, Jialong Wu, Mingsheng Long

机构 * School of Software, BNRist, Tsinghua University(软件学院,BNRist,清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Foresight Diffusion,通过解耦条件理解和目标去噪提升预测扩散模型的采样一致性,实验显示其在机器人视频预测和科学时空预测中表现优异。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20382 2026-03-24 cs.CV 79%

Uni-Classifier: Leveraging Video Diffusion Priors for Universal Guidance Classifier

Uni-Classifier: 利用视频扩散先验进行通用引导分类器

Yujie Zhou, Pengyang Ling, Jiazi Bu, Bingjie Gao, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Uni-Classifier,通过利用视频扩散先验引导前序模型的去噪过程,提升生成质量,适用于视频和3D生成任务。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02284 2026-03-24 cs.CV cs.AI cs.LG 79%

Learning to Generate Rigid Body Interactions with Video Diffusion Models

通过视频扩散模型学习生成刚体交互

David Romero, Ariana Bermudez, Viacheslav Iablochnikov, Hao Li, Fabio Pizzati, Ivan Laptev

机构 * MBZUAI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出KineMask方法,通过视频生成实现刚体交互的逼真控制与模拟,结合低级运动控制与高级文本条件,提升动态现象合成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20188 2026-03-23 cs.CV 79%

Wildfire Spread Scenarios: Increasing Sample Diversity of Segmentation Diffusion Models with Training-Free Methods

野火蔓延场景:通过无训练方法增加分割扩散模型的样本多样性

Sebastian Gerard, Josephine Sullivan

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通过无训练方法提升分割扩散模型样本多样性,验证了粒子引导和SPELL等技术在野火蔓延场景中的有效性,提升了HM IoU指标。

Comments Accepted at NLDL 2026. This version contains small corrections compared to the initial publication, see appendix for details

Journal ref Proceedings of the 7th Northern Lights Deep Learning Conference (NLDL), PMLR, Jan. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20155 2026-03-23 cs.LG cs.CV stat.ML 79%

Beyond Single Tokens: Distilling Discrete Diffusion Models via Discrete MMD

超越单个标记:通过离散MMD蒸馏离散扩散模型

Emiel Hoogeboom, David Ruhe, Jonathan Heek, Thomas Mensink, Tim Salimans

机构 * Google DeepMind Amsterdam(谷歌深思亚马逊)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出D-MMD方法,通过离散MMD蒸馏离散扩散模型,实现高质量和多样性的生成,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20005 2026-03-23 cs.CV 79%

NEC-Diff: Noise-Robust Event-RAW Complementary Diffusion for Seeing Motion in Extreme Darkness

NEC-Diff: 用于极端黑暗中感知运动的噪声鲁棒事件-RAW互补扩散

Haoyue Liu, Jinghan Xu, Luxin Feng, Hanyu Zhou, Haozhi Zhao, Yi Chang, Luxin Yan

机构 * National Key Lab of Multispectral Information Intelligent Processing Technology(多谱信息智能处理技术国家级重点实验室) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 NEC-Diff通过结合RAW图像的线性光响应和事件的亮度变化特性,提出一种新型扩散框架,以在极低光照条件下实现高保真视觉重建。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04803 2026-03-23 cs.CV cs.AI cs.LG 79%

Guiding Diffusion-based Reconstruction with Contrastive Signals for Balanced Visual Representation

通过对比信号引导扩散重建以实现平衡的视觉表示

Boyu Han, Qianqian Xu, Shilong Bao, Zhiyong Yang, Ruochen Cui, Xilin Zhao, Qingming Huang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) School of Computer Science and Tech., University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Information Engineering, CAS(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出通过对比信号优化扩散重建,以提升CLIP中判别能力和细节感知能力,解决传统方法在平衡视觉表示上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19337 2026-03-23 cs.CV cs.AI 79%

Diffusion-Guided Semantic Consistency for Multimodal Heterogeneity

扩散引导的语义一致性用于多模态异质性

Jing Liu, Zhengliang Guo, Yan Wang, Xiaoguang Zhu, Yao Du, Zehua Wang, Victor C. M. Leung

机构 * The University of British Columbia(不列颠哥伦比亚大学) Fudan University(复旦大学) Duke Kunshan University(杜克昆山大学) East China Normal University(华东师范大学) University of California, Davis(加州大学戴维斯分校) China University of Mining and Technology(中国矿业大学) SMBU Shenzhen University(深圳大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出SemanticFL框架,利用预训练扩散模型的语义表示,通过跨模态对比学习提升联邦学习在多模态异质数据中的鲁棒性,实验表明其在CIFAR-10等数据集上准确率提升达5.49%。

Comments Accepted by IEEE ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19232 2026-03-20 cs.CV 79%

Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

三次离散扩散:高维表示上的离散视觉生成

Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Carnegie Mellon University(卡内基梅隆大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CubiD,首个高维表示离散生成模型,通过精细掩码实现高维离散表示的生成,具备固定步数的生成能力,且在ImageNet-256上达到SOTA性能,验证离散token保留原始表示能力。

Comments Accepted by CVPR 2026 main track; Code: https://github.com/YuqingWang1029/CubiD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18991 2026-03-20 cs.CV cs.LG 79%

CRAFT: Aligning Diffusion Models with Fine-Tuning Is Easier Than You Think

CRAFT:将扩散模型对齐与微调比你想象的更容易

Zening Sun, Zhengpeng Xie, Lichen Bai, Shitong Shao, Shuo Yang, Zeke Xie

机构 * HKUST (GZ)(香港科技大学(广州)) HIT (SZ)(哈尔滨工业大学(深圳))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CRAFT方法,通过复合奖励过滤技术构建高质量训练数据集,结合改进的SFT实现高效微调,证明其优化了群体强化学习下界,实验表明其在少量样本下优于传统方法。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18896 2026-03-20 cs.CV cs.AI 79%

Translating MRI to PET through Conditional Diffusion Models with Enhanced Pathology Awareness

通过增强病理意识的条件扩散模型将MRI翻译为PET

Yitong Li, Igor Yakushev, Dennis M. Hedderich, Christian Wachinger

机构 * Lab for Artificial Intelligence in Medical Imaging, Institute for Diagnostic and Interventional Radiology, School of Medicine and Health, TUM Klinikum, Technical University of Munich (TUM)(人工智能医学成像实验室,诊断与介入放射学研究所,医学院与健康学院,TUM医院,慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Department of Nuclear Medicine, School of Medicine and Health(核医学系,医学院与健康学院) Department of Neuroradiology, School of Medicine and Health(神经放射学系,医学院与健康学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出PASTA框架,利用条件扩散模型生成高质量3D PET图像,通过双臂架构和多模态条件整合提升结构与病理细节的保留,使合成PET在阿尔茨海默病诊断中性能优于MRI,接近真实PET。

Comments Accepted by Medical Image Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16340 2026-03-20 cs.CV 79%

Iris: Bringing Real-World Priors into Diffusion Model for Monocular Depth Estimation

Iris:将现实先验引入扩散模型以进行单目深度估计

Xinhao Cai, Gensheng Pei, Zeren Sun, Yazhou Yao, Fumin Shen, Wenguan Wang

机构 * Nanjing University of Science and Technology(南京理工大学) State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(先进施工机械智能制造国家重点实验室) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系) University of Electronic Science and Technology of China(电子科技大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Iris提出一种确定性框架,整合现实先验到扩散模型中,解决单目深度估计中细节保留和现实场景泛化问题。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18089 2026-03-20 cs.CV cs.AI cs.LG 79%

CytoSyn: a Foundation Diffusion Model for Histopathology -- Tech Report

CytoSyn:一种用于病理学的基准扩散模型——技术报告

Thomas Duboudin, Xavier Fontaine, Etienne Andrier, Lionel Guillou, Alexandre Filiot, Thalyssa Baiocco-Rodrigues, Antoine Olivier, Alberto Romagnoni, John Klein, Jean-Baptiste Schiratti

机构 * Owkin, Inc(Owkin公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CytoSyn,一种先进的潜在扩散模型,用于生成高真实性和多样性的病理H&E染色图像,通过改进方法和训练策略,对比PixCell模型,展示了对预处理细节的敏感性。

Comments 21 pages, 5 figures, tech report, model page: https://huggingface.co/Owkin-Bioptimus/CytoSyn

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21276 2026-03-20 cs.CV 79%

GriDiT: Factorized Grid-Based Diffusion for Efficient Long Image Sequence Generation

GriDiT: 基于网格的因子化扩散用于高效长图像序列生成

Snehal Singh Tomar, Alexandros Graikos, Arjun Krishna, Dimitris Samaras, Klaus Mueller

机构 * Department of Computer Science Stony Brook University(计算机科学系石溪大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GriDiT方法,通过因子化生成长图像序列,先生成低分辨率粗序列再高分辨率细化,利用Diffusion Transformer的自注意力机制提升生成质量与效率。

Comments Transactions on ML Research (TMLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏