arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70196 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70196 篇

2512.16023 2025-12-19 cs.CV 79%

CoVAR: Co-generation of Video and Action for Robotic Manipulation via Multi-Modal Diffusion

CoVAR: 通过多模态扩散生成视频与动作用于机器人操作

Liudi Yang, Yang Bai, George Eskandar, Fengyi Shen, Mohammad Altillawi, Dong Chen, Ziyuan Liu, Abhinav Valada

机构 * University of Freiburg(弗赖堡大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Technical University of Munich(慕尼黑技术大学) Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CoVAR通过多模态扩散模型生成视频与动作,解决机器人操作中动作标注不足的问题,提升视频生成质量与动作精度。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15022 2025-12-18 cs.CV 79%

LoRAverse: A Submodular Framework to Retrieve Diverse Adapters for Diffusion Models

LoRAverse:一种子模框架用于检索扩散模型的多样化适配器

Mert Sonmezer, Matthew Zheng, Pinar Yanardag

机构 * Middle East Technical University(美索不达米亚技术大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LoRAverse通过子模框架解决从大量LoRA适配器中检索多样化模型的问题,提升扩散模型的个性化应用效果。

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 17879-17888

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14760 2025-12-18 cs.CV 79%

AquaDiff: Diffusion-Based Underwater Image Enhancement for Addressing Color Distortion

AquaDiff:基于扩散的水下图像增强以解决颜色失真

Afrah Shaahid, Muzammil Behzad

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 AquaDiff通过融合色先验和条件扩散过程,有效纠正水下图像颜色失真,提升整体图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14235 2025-12-17 cs.CV 79%

4D-RaDiff: Latent Diffusion for 4D Radar Point Cloud Generation

4D-RaDiff:用于4D雷达点云生成的潜在扩散

Jimmie Kwok, Holger Caesar, Andras Palffy

机构 * Delft University of Technology(代尔夫特理工大学) Perciv AI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 4D-RaDiff通过潜在扩散生成4D雷达点云,提升目标检测性能并减少标注数据需求

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14068 2025-12-17 cs.CV cs.AI 79%

SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding

SDAR-VL: 稳定且高效的块状扩散用于视觉语言理解

Shuang Cheng, Yuhua Jiang, Zineng Zhou, Dawei Liu, Wang Tao, Linfeng Zhang, Biqing Qi, Bowen Zhou

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SDAR-VL通过高效的块状扩散方法,在视觉语言理解中实现了更高的训练效率、收敛稳定性及任务性能,优于传统块扩散并匹敌强AR基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11872 2025-12-17 cs.RO cs.AI cs.CV 79%

WAM-Diff: A Masked Diffusion VLA Framework with MoE and Online Reinforcement Learning for Autonomous Driving

WAM-Diff: 一种结合MoE和在线强化学习的掩码扩散VLA框架用于自动驾驶

Mingwang Xu, Jiahao Cui, Feipeng Cai, Hanlin Shang, Zhihao Zhu, Shan Luan, Yifang Xu, Neng Zhang, Yaoyi Li, Jia Cai, Siyu Zhu

机构 * Fudan University(复旦大学) Yinwang Intelligent Technology Co., Ltd(云网智能科技有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 WAM-Diff通过结合MoE和在线强化学习的掩码扩散框架,提升自动驾驶轨迹生成的性能与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13290 2025-12-16 cs.CV cs.AI cs.LG 79%

LINA: Learning INterventions Adaptively for Physical Alignment and Generalization in Diffusion Models

LINA: 为扩散模型中的物理对齐和泛化学习适应性干预

Shu Yu, Chaochao Lu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LINA通过学习适应性干预,提升扩散模型在物理对齐和超出分布指令跟随方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03439 2025-12-16 cs.CV 79%

CleanDIFT: Diffusion Features without Noise

CleanDIFT: 没有噪声的扩散特征

Nick Stracke, Stefan Andreas Baumann, Kolja Bauer, Frank Fundel, Björn Ommer

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CleanDIFT通过无监督微调方法,实现无噪声的高质量扩散特征,显著提升多种任务的性能。

Comments for the project page and code, view https://compvis.github.io/cleandift/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12604 2025-12-16 cs.CV 79%

No Cache Left Idle: Accelerating diffusion model via Extreme-slimming Caching

无空闲缓存:通过极端瘦身缓存加速扩散模型

Tingyan Wen, Haoyu Li, Yihuang Chen, Xing Zhou, Lifei Zhu, Xueqian Wang

机构 * Tsinghua University(清华大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 X-Slim通过双阈值缓存策略,高效利用时间步、块和令牌层面的冗余,实现扩散模型加速,减少延迟并提升生成质量。

Comments Project page: https://thu-accdiff.github.io/xslim-page/ Code: https://github.com/THU-AccDiff/xslim

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12386 2025-12-16 cs.CV 79%

Speedrunning ImageNet Diffusion

ImageNet Diffusion 的速run

Swayam Bhanded

机构 * Swayam Bhanded(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SR-DiT通过整合多种技术,在140M参数模型下达到ImageNet-256的优异性能,为扩散模型研究提供了新的基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12375 2025-12-16 cs.CV 79%

V-Warper: Appearance-Consistent Video Diffusion Personalization via Value Warping

V-Warper:通过价值扭曲实现外观一致的视频扩散个性化

Hyunkoo Lee, Wooseok Jang, Jini Yang, Taehwan Kim, Sangoh Kim, Sangwon Jung, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Korea University(韩国大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 V-Warper通过价值扭曲实现视频扩散模型的无训练粗到细个性化,提升外观一致性与生成质量。

Comments Project Page: https://cvlab-kaist.github.io/V-Warper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12339 2025-12-16 cs.CV cs.LG 79%

Unified Control for Inference-Time Guidance of Denoising Diffusion Models

统一控制用于去噪扩散模型推理时的引导

Maurya Goyal, Anuj Singh, Hadi Jamali-Rad

机构 * Delft University of Technology(代尔夫特理工大学) Shell Global Solutions International B.V.(壳牌全球解决方案国际有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 UniCoDe通过整合采样和梯度引导的方法,实现了更高效的去噪扩散模型推理时引导,提升了任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19004 2025-12-16 cs.CV 79%

A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation

一种用于真实文本到LiDAR场景生成的自条件表示引导扩散模型

Wentao Qu, Guofeng Mei, Yang Wu, Yongshun Gong, Xiaoshui Huang, Liang Xiao

机构 * NJUST(南京理工大学) FBK(弗拉·恩里科·拉达基金会) SDU(山东大学) SJTU(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出T2LDM模型,通过自条件表示引导技术提升文本到LiDAR场景生成的质量和可控性,构建了T2nuScenes基准并改进了生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21531 2025-12-16 eess.IV cs.CV 79%

Patch-Based Diffusion for Data-Efficient, Radiologist-Preferred MRI Reconstruction

基于补丁的扩散模型用于数据高效、放射科医师偏好的MRI重建

Rohan Sanda, Asad Aali, Andrew Johnston, Eduardo Reis, Gordon Wetzstein, Sara Fridovich-Keil

机构 * Stanford University(斯坦福大学) Stanford University School of Medicine(斯坦福大学医学院) Stanford Center for Artificial Intelligence in Medicine and Imaging(斯坦福大学医学与成像人工智能中心) Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于补丁的扩散模型用于高效MRI重建,在小数据集上表现优于现有方法,且被放射科医师认为诊断效果更优。

Comments Code is available at: https://github.com/voilalab/PaDIS-MRI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08783 2025-12-16 cs.CV 79%

DiffPose-Animal: A Language-Conditioned Diffusion Framework for Animal Pose Estimation

DiffPose-Animal: 一种基于语言条件的扩散框架用于动物姿态估计

Tianyu Xiong, Dayi Tan, Wei Tian

机构 * Guanghua Cambridge International School Shanghai(广华剑桥国际学校上海) Shanghai World Foreign Language Academy, WFLA(上海世界外语学院,WFLA) School of Automotive Studies Tongji University(同济大学汽车学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffPose-Animal提出了一种基于语言条件的扩散框架,通过结合大型语言模型和交叉注意力模块,提升动物姿态估计的鲁棒性和泛化能力。

Comments 13pages,2figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20506 2025-12-16 cs.CV 79%

DPBridge: Latent Diffusion Bridge for Dense Prediction

DPBridge: 用于密集预测的潜在扩散桥梁

Haorui Ji, Taojun Lin, Hongdong Li

机构 * The Australian National University(澳大利亚国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DPBridge通过整合结构化视觉先验和改进的反向转移核,提出首个用于密集预测的潜在扩散桥梁框架,有效提升深度估计和表面法线预测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21600 2025-12-16 eess.IV cs.AI cs.CV eess.SP physics.med-ph 79%

Robust Simultaneous Multislice MRI Reconstruction Using Slice-Wise Learned Generative Diffusion Priors

基于切片学习生成扩散先验的鲁棒同时多切片MRI重建

Shoujin Huang, Guanxiong Luo, Yunlin Zhao, Yilong Liu, Yuwan Wang, Kexin Yang, Jingzhe Liu, Hua Guo, Min Wang, Lingyan Zhang, Mengye Lyu

机构 * College of Health Science and Environmental Engineering, Shenzhen Technology University(深圳科技大学健康科学与环境工程学院) University Medical Center Göttingen(哥廷根大学医学中心) Guangdong-Hongkong-Macau CNS Regeneration Institute, Key Laboratory of CNS Regeneration (Jinan University)-Ministry of Education, Jinan University(广东-港澳-澳门神经科学再生研究所,神经科学再生重点实验室(暨南大学)-教育部,暨南大学) Department of Radiology, The First Hospital of Tsinghua University(清华大学第一医院放射科) Center for Biomedical Imaging Research, Department of Biomedical Engineering, School of Medicine, Tsinghua University(清华大学生物医学成像研究中心,生物医学工程系,医学院) Key Laboratory for Biomedical Engineering of Ministry of Education, College of Biomedical Engineering and Instrument Science, Zhejiang University(教育部生物医学工程重点实验室,生物医学工程与仪器科学学院,浙江大学) Department of Endocrinology and Metabolism, Sir Run Run Shaw Hospital, Zhejiang University School of Medicine(浙江大学医学院邵逸夫医院内分泌科) Lab of Molecular Imaging and Medical Intelligence, Department of Radiology, Longgang Central Hospital of Shenzhen (Shenzhen Clinical Medical College, Guangzhou University of Chinese Medicine(分子成像与医学智能实验室,放射科,深圳龙岗中心医院(深圳临床医学院,广州中医药大学;龙岗临床学院,汕头大学医学院)) Longgang Clinical Institute of Shantou University Medical College)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ROGER通过深度生成先验和低频增强模块,实现鲁棒的同时多切片MRI重建,提升解剖和功能成像质量。

Journal ref Published in Medical Image Analysis, Volume 108, 2026, 103851

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13199 2025-12-16 eess.IV cs.CV 79%

Tau Anomaly Detection in PET Imaging via Bilateral-Guided Deterministic Diffusion Model

通过双侧引导确定性扩散模型进行PET成像中的Tau异常检测

Lujia Zhong, Shuo Huang, Jiaxin Yue, Jianwei Zhang, Zhiwei Deng, Wenhao Chi, Yonggang Shi

机构 * Stevens Neuroimaging and Informatics Institute, Keck School of Medicine, University of Southern California(斯蒂文斯神经影像与信息学研究所,凯克医学院,南加州大学) Ming Hsieh Department of Electrical and Computer Engineering, Viterbi School of Engineering, University of Southern California(明希部门电气与计算机工程系,维特比工程学院,南加州大学) Alfred E. Mann Department of Biomedical Engineering, Viterbi School of Engineering, University of Southern California(阿尔弗雷德·E·曼生物医学工程系,维特比工程学院,南加州大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出双侧引导确定性扩散模型,用于提高tau PET成像中局部tau病理的异常检测精度,并在前期筛查中展现应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08930 2025-12-16 cs.CV cs.AI 79%

PADS: Plug-and-Play 3D Human Pose Analysis via Diffusion Generative Modeling

PADS: 通过扩散生成建模实现即插即用的3D人体姿态分析

Haorui Ji, Hongdong Li

机构 * The Australian National University(澳大利亚国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PADS通过扩散生成建模提出了一种即插即用的3D人体姿态分析框架,能够在无需任务特定监督的情况下适应多种姿态分析任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12080 2025-12-16 cs.CV cs.LG 79%

BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models

BAgger: 逆向聚合用于缓解自回归视频扩散模型中的漂移

Ryan Po, Eric Ryan Chan, Changan Chen, Gordon Wetzstein

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 BAgger通过自监督方法缓解自回归视频扩散模型中的漂移问题,利用标准分数或流匹配目标提升长期运动稳定性与视觉一致性。

Comments Project page here: https://ryanpo.com/bagger

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11928 2025-12-16 cs.CV cs.AI 79%

MONET -- Virtual Cell Painting of Brightfield Images and Time Lapses Using Reference Consistent Diffusion

MONET -- 利用参考一致扩散进行明场图像和时间序列的虚拟细胞成像

Alexander Peysakhovich, William Berman, Joseph Rufo, Felix Wong, Maxwell Z. Wilson

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MONET通过参考一致扩散模型从明场图像预测细胞成像通道,解决细胞成像的劳动密集和化学固定限制,实现动态细胞研究的虚拟成像技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07935 2025-12-16 cs.CV cs.AI 79%

DiffRegCD: Integrated Registration and Change Detection with Diffusion Features

DiffRegCD:集成注册与变化检测的扩散特征

Seyedehanita Madani, Rama Chellappa, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffRegCD通过结合扩散特征与分类任务,实现统一的注册与变化检测,提升在复杂场景下的鲁棒性和精度。

Comments 10 pages, 6 figures. Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14505 2025-12-16 cs.CV cs.AI cs.LG 79%

MusicInfuser: Making Video Diffusion Listen and Dance

MusicInfuser: 使视频扩散模型听音乐并跳舞

Susung Hong, Ira Kemelmacher-Shlizerman, Brian Curless, Steven M. Seitz

机构 * University of Washington(华盛顿大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MusicInfuser通过调整预训练视频扩散模型,使视频能与指定音乐同步生成舞蹈,无需运动数据,训练高效且泛化能力强。

Comments Project page: https://susunghong.github.io/MusicInfuser

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11763 2025-12-15 cs.CV 79%

Reducing Domain Gap with Diffusion-Based Domain Adaptation for Cell Counting

通过扩散域适应减少领域差距用于细胞计数

Mohammad Dehghanmanshadi, Wallapak Tavanapong

机构 * Computer Science Department , Iowa State University, IA, USA(计算机科学系,爱荷华州立大学,IA,USA)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究通过基于InST的风格迁移方法,有效减少合成与真实显微镜数据间的领域差距,提升细胞计数性能,同时减少人工标注工作量。

Comments Accepted at ICMLA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11274 2025-12-15 cs.CV 79%

FilmWeaver: Weaving Consistent Multi-Shot Videos with Cache-Guided Autoregressive Diffusion

FilmWeaver: 通过缓存引导自回归扩散编织一致的多镜头视频

Xiangyang Luo, Qingyu Li, Xiaokun Liu, Wenyu Qin, Miao Yang, Meng Wang, Pengfei Wan, Di Zhang, Kun Gai, Shao-Lun Huang

机构 * Kling Team, Kuaishou Technology(快手科技 Kling Team)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FilmWeaver通过缓存引导自回归扩散模型实现多镜头视频的一致性生成,支持灵活交互和多任务应用。

Comments AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07500 2025-12-15 cs.CV 79%

MultiMotion: Multi Subject Video Motion Transfer via Video Diffusion Transformer

多主体视频动作迁移:通过视频扩散变换器实现

Penghui Liu, Jiangshan Wang, Yutong Shen, Shanhui Mo, Chenyang Qi, Yue Ma

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MultiMotion通过视频扩散变换器实现多主体视频动作迁移,引入AMF和RectPC提升动作解纠缠与生成效率,构建首个专用基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07410 2025-12-15 cs.CV 79%

InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs

InterAgent:基于物理的多智能体命令执行通过交互图上的扩散

Bin Li, Ruichi Zhang, Han Liang, Jingyan Zhang, Juze Zhang, Xin Chen, Lan Xu, Jingyi Yu, Jingya Wang

机构 * ShanghaiTech University(上海科技大学) University of Pennsylvania(宾夕法尼亚大学) ByteDance(字节跳动) Stanford University(斯坦福大学) InstAdapt

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 InterAgent通过交互图上的扩散模型实现了基于物理的多智能体协调控制,能够从文本提示中生成连贯且物理合理的多代理行为。

Comments Project page: https://binlee26.github.io/InterAgent-Page

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11330 2025-12-15 cs.CV 79%

Noise Matters: Optimizing Matching Noise for Diffusion Classifiers

噪声至关重要:优化扩散分类器的匹配噪声

Yanghao Wang, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出NoOp方法,通过频率匹配和空间匹配原则优化扩散分类器的噪声,以提升分类稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23834 2025-12-15 eess.IV cs.CV 79%

Denoising Diffusion Models for Anomaly Localization in Medical Images

医学图像中异常定位的去噪扩散模型

Cosmin I. Bercea, Philippe C. Cattin, Julia A. Schnabel, Julia Wolleb

机构 * School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院) Institute of Machine Learning in Biomedical Imaging, Helmholtz Munich, Germany(生物医学影像机器学习研究所,海德堡慕尼黑德国) Department of Biomedical Engineering, University of Basel, Allschwil, Switzerland(巴塞尔大学生物医学工程系,瑞士Allschwil) School of Biomedical Engineering and Imaging Sciences, King’s College London, United Kingdom(伦敦国王学院生物医学工程与影像科学学院,英国) Department of Biomedical Informatics and Data Science, Yale University School of Medicine, New Haven, CT, USA(耶鲁大学医学院生物医学信息学与数据科学系,美国新罕布什尔州新 Haven) Yale Biomedical Imaging Institute, Yale University, New Haven, CT, USA(耶鲁大学生物医学影像研究院,美国新罕布什尔州新 Haven)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文探讨了利用去噪扩散模型在医学图像中实现异常定位的方法,分析了不同监督方案的有效性及挑战,指出扩散模型在该领域的应用潜力。

Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2025:030

Journal ref Machine.Learning.for.Biomedical.Imaging. 3 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10038 2025-12-12 cs.CV cs.CL 79%

Diffusion Is Your Friend in Show, Suggest and Tell

在展示、建议和告知中,扩散是你的朋友

Jia Cheng Hu, Roberto Cavicchioli, Alessandro Capotondi

机构 * Department of Physics, Informatics and Mathematics(物理、信息学与数学系) Department of Communication and Economics(通信与经济学系) University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Show,Suggest和Tell模型,通过结合扩散模型与自回归生成,实现COCO数据集上的先进结果,无需强化学习。

Journal ref 2025 IEEE International Conference on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏