arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86872 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2504.11946 2026-01-28 cs.CV 79%

R-Meshfusion: Reinforcement Learning Powered Sparse-View Mesh Reconstruction with Diffusion Priors

R-Meshfusion:基于强化学习的扩散先验的稀疏视图网格重建

Haoyang Wang, Liming Liu, Peiheng Wang, Junlin Hao, Jiangkai Wu, Xinggong Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 R-Meshfusion通过扩散模型与强化学习结合,提升稀疏视图下网格重建的几何与渲染质量。

Comments needs to be revised and updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09665 2026-01-28 cs.CV 79%

Revealing Subtle Phenotypes in Small Microscopy Datasets Using Latent Diffusion Models

利用潜在扩散模型揭示小样本显微图像中的细微表型

Anis Bourou, Biel Castaño Segade, Thomas Boyer, Valérie Mezger, Auguste Genovesio

机构 * Ecole Normale Supérieure(法国国家科学研究院) Université Paris Cité(巴黎cité大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用预训练的潜在扩散模型,在小样本显微图像中有效检测细微表型变化。

Comments Published to CVPR CVDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23530 2026-01-28 cs.CV cs.AI 79%

There and Back Again: On the relation between Noise and Image Inversions in Diffusion Models

往返之间:关于扩散模型中噪声与图像逆向之间的关系

Łukasz Staniszewski, Łukasz Kuciński, Kamil Deja

机构 * Warsaw University of Technology(华沙技术大学) IDEAS Research Institute(IDEAS研究机构) University of Warsaw(华沙大学) Institute of Mathematics, Polish Academy of Sciences(波兰科学院数学研究所) IDEAS NCBR

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了扩散模型中噪声与图像逆向之间的关系,通过替换DDIM逆向步骤为正向扩散过程,解相关潜在编码并提升编辑与插值质量。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04560 2026-01-28 cs.CV 79%

Joint Diffusion for Universal Hand-Object Grasp Generation

联合扩散用于通用手-物体抓取生成

Jinkun Cao, Jingyuan Liu, Kris Kitani, Yi Zhou

机构 * Carnegie Mellon University(卡内基梅隆大学) Adobe(Adobe公司) Roblox(Roblox公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出联合手-物体扩散模型,通过统一潜在表示生成手和物体的抓取,利用大规模物体数据提升通用性,实现无条件和条件抓取生成。

Comments accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18556 2026-01-27 cs.CV cs.LG 79%

Generative Diffusion Augmentation with Quantum-Enhanced Discrimination for Medical Image Diagnosis

生成扩散增强与量子增强判别用于医学图像诊断

Jingsong Xia, Siqi Wang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SDA-QEC通过生成扩散增强与量子增强判别技术,提升医学图像分类的诊断准确性与平衡性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18168 2026-01-27 cs.CV 79%

TempDiffReg: Temporal Diffusion Model for Non-Rigid 2D-3D Vascular Registration

TempDiffReg:用于非刚性2D-3D血管配准的时序扩散模型

Zehua Liu, Shihao Zou, Jincai Huang, Yanfang Zhang, Chao Tong, Weixin Si

机构 * School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(北京航空航天大学虚拟现实技术与系统国家重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(中国科学院深圳先进技术研究所) School of Computer Science and Control Engineering, Shenzhen University of Advanced Technology, Shenzhen, China(深圳先进技术大学计算机科学与控制工程学院) Department of Interventional Radiology, Shenzhen People’s Hospital, Shenzhen, China(深圳人民医院介入放射科)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 TempDiffReg通过时序扩散模型和结构感知视角n点模块,实现高精度的2D-3D血管配准,提升TACE手术的准确性和安全性。

Comments Accepted by IEEE BIBM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18832 2026-01-27 cs.CV 79%

Localizing Knowledge in Diffusion Transformers

在扩散变换器中定位知识

Arman Zarei, Samyadeep Basu, Keivan Rezaei, Zihao Lin, Sayan Nag, Soheil Feizi

机构 * University of Maryland(马里兰大学) University of California, Davis(加州大学戴维斯分校) Adobe(Adobe公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种方法,用于在扩散变换器中定位特定类型的知识,通过评估不同模型和知识类别,实现了高效且有针对性的模型更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17228 2026-01-27 cs.CV q-bio.QM 79%

Semi-Supervised Domain Adaptation with Latent Diffusion for Pathology Image Classification

半监督域适应与潜在扩散用于病理图像分类

Tengyue Zhang, Ruiwen Ding, Luoting Zhuang, Yuxiao Wu, Erika F. Rodriguez, William Hsu

机构 * Medical & Imaging Informatics, Department of Radiological Sciences, David Geffen School of Medicine, University of California, Los Angeles(医学与影像信息学系,放射科学系,大卫·盖弗医学院,加州大学洛杉矶分校) Bioengineering Department, Henry Samueli School of Engineering, UCLA(生物工程系,亨利·萨缪尔西工程学院,UCLA) Department of Pathology & Laboratory Sciences, David Geffen School of Medicine, UCLA(病理学与实验室科学系,大卫·盖弗医学院,UCLA)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出利用潜在扩散模型生成目标领域意识的合成数据,提升计算病理学中的域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10917 2026-01-27 cs.CV cs.AI cs.LG 79%

Self-learned representation-guided latent diffusion model for breast cancer classification in deep ultraviolet whole surface images

自学习表征引导的潜在扩散模型用于深紫外全表面图像中的乳腺癌分类

Pouya Afshin, David Helminiak, Tianling Niu, Julie M. Jorns, Tina Yen, Bing Yu, Dong Hye Ye

机构 * Department of Computer Science, Georgia State University(计算机科学系,佐治亚州立大学) Department of Electrical and Computer Engineering, Marquette University(电气与计算机工程系,马基特大学) Joint Dept. of Biomedical Eng., Marquette Univ. and Med. Coll. of Wisconsin(马基特大学与威斯康星医学院联合生物医学工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出自监督学习引导的潜在扩散模型,通过生成高质量合成数据提升深紫外全表面图像中乳腺癌分类的准确率和FID分数。

Comments This paper has been accepted for the IEEE International Symposium on Biomedical Imaging (ISBI) 2026, London, UK, and will be presented in the corresponding session

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03502 2026-01-27 eess.IV cs.AI cs.GR 79%

DC-VSR: Spatially and Temporally Consistent Video Super-Resolution with Video Diffusion Prior

DC-VSR: 基于视频扩散先验的时空一致视频超分辨率

Janghyeok Han, Gyujin Sim, Geonung Kim, Hyun-seung Lee, Kyuha Choi, Youngseok Han, Sunghyun Cho

机构 * POSTECH Visual Display Business, Samsung Electronics(视觉显示业务,三星电子)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 DC-VSR通过引入空间和时间注意力传播机制及细节抑制自注意力引导,实现了视频超分辨率的时空一致性与高质量纹理恢复。

Comments Equal contributions from first two authors

Journal ref In Proceedings of the Special Interest Group on Computer Graphics and Interactive Techniques Conference Conference Papers (SIGGRAPH Conference Papers 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12948 2026-01-26 cs.CV 79%

GazeD: Context-Aware Diffusion for Accurate 3D Gaze Estimation

GazeD: 基于上下文的扩散模型用于精确的3D凝视估计

Riccardo Catalini, Davide Di Nucci, Guido Borghi, Davide Davoli, Lorenzo Garattoni, Gianpiero Francesca, Yuki Kawana, Roberto Vezzani

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) Toyota Motor Europe(丰田欧洲公司) Woven by Toyota(丰田编织)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 GazeD通过结合扩散模型和上下文信息,实现了精确的3D凝视估计,超越了依赖时间信息的方法。

Comments Accepted at 3DV 2026. Project page: https://aimagelab.ing.unimore.it/go/gazed

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10940 2026-01-26 cs.CV cs.AI 79%

OmniView: An All-Seeing Diffusion Model for 3D and 4D View Synthesis

OmniView: 一种用于3D和4D视图合成的全视角扩散模型

Xiang Fan, Sharath Girish, Vivek Ramanujan, Chaoyang Wang, Ashkan Mirzaei, Petr Sushko, Aliaksandr Siarohin, Sergey Tulyakov, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Snap Inc.(Snap公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OmniView是一种统一的扩散模型,能够泛化多种4D一致性任务,通过空间、时间和视图条件的灵活组合提升视频生成质量与相机控制精度。

Comments Project page: https://snap-research.github.io/OmniView/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05964 2026-01-26 cs.CV 79%

T-LoRA: Single Image Diffusion Model Customization Without Overfitting

T-LoRA: 单张图像扩散模型定制化无需过拟合

Vera Soboleva, Aibek Alanov, Andrey Kuznetsov, Konstantin Sobolev

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 T-LoRA通过时间步依赖的低秩适应框架实现单张图像扩散模型定制化,有效避免过拟合,提升概念保真度与文本对齐的平衡。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15441 2026-01-23 cs.LG cs.CV 79%

CASL: Concept-Aligned Sparse Latents for Interpreting Diffusion Models

CASL: 用于解释扩散模型的概念对齐稀疏潜在表示

Zhenghao He, Guangzhi Xiong, Boyang Wang, Sanchit Sinha, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CASL通过监督框架将扩散模型的稀疏潜在维度与语义概念对齐,提升生成图像的解释性和编辑精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15250 2026-01-22 cs.CV cs.RO 79%

FlowSSC: Universal Generative Monocular Semantic Scene Completion via One-Step Latent Diffusion

FlowSSC: 通过一步潜在扩散实现通用生成单目语义场景补全

Zichen Xi, Hao-Xiang Chen, Nan Xue, Hongyu Yan, Qi-Yuan Feng, Levent Burak Kara, Joaquim Jorge, Qun-Ce Xu

机构 * Ant Group(蚂蚁集团) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Instituto Superior Técnico(里斯本大学理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 FlowSSC通过一步潜在扩散模型实现高效单目语义场景补全,显著提升性能并适用于自动驾驶系统。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15221 2026-01-22 cs.CV 79%

ScenDi: 3D-to-2D Scene Diffusion Cascades for Urban Generation

ScenDi: 3D到2D场景扩散级联用于城市生成

Hanlei Guo, Jiahao Shao, Xinya Chen, Xiyang Tan, Sheng Miao, Yujun Shen, Yiyi Liao

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ScenDi通过整合3D和2D扩散模型,解决3D城市生成中外观细节与相机可控性的平衡问题,实现高质量场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14791 2026-01-22 cs.CV cs.LG 79%

Synthetic Data Augmentation for Multi-Task Chinese Porcelain Classification: A Stable Diffusion Approach

多任务中国瓷器分类的合成数据增强:一种稳定扩散方法

Ziyao Ling, Silvia Mirri, Paola Salomoni, Giovanni Delnevo

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究利用稳定扩散与LoRA生成合成数据,提升多任务中国瓷器分类的性能,验证了合成数据在增强真实数据集中的有效性及任务特定的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14625 2026-01-22 cs.CV stat.ML 79%

Diffusion Epistemic Uncertainty with Asymmetric Learning for Diffusion-Generated Image Detection

扩散epistemic不确定性与非对称学习用于扩散生成图像检测

Yingsong Huang, Hui Guo, Jing Huang, Bing Bai, Qi Xiong

机构 * Tencent Inc.(腾讯公司) Hikvision(海康威视) Microsoft MAI(微软MAI)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DEUA框架,通过非对称学习和扩散epistemic不确定性估计,提升扩散生成图像检测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09572 2026-01-22 cs.CV 79%

Trustworthy Longitudinal Brain MRI Completion: A Deformation-Based Approach with KAN-Enhanced Diffusion Model

可信的纵向脑部MRI补全:基于变形的KAN增强扩散模型

Tianli Tao, Ziyang Wang, Delong Yang, Han Zhang, Le Zhang

机构 * School of Biomedical Engineering and Imaging Science, King's College London, London, UK(生物医学工程与成像科学学院,伦敦国王学院) School of Biomedical Engineering, ShanghaiTech University, Shanghai, China(生物医学工程学院,上海科技大学) School of Computer Science and Digital Technologies, Aston University, Birmingham, UK(计算机科学与数字技术学院,阿斯顿大学) Kunming Medical University, Kunming, China(昆明医学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DF-DiffCom模型,通过KAN增强扩散模型结合变形场,实现纵向脑部MRI补全,提升图像保真度和应用灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07062 2026-01-22 cs.CV cs.AI 79%

$\mathrm{D}^\mathrm{3}$-Predictor: Noise-Free Deterministic Diffusion for Dense Prediction

D³-预测器:无噪声确定性扩散用于密集预测

Changliang Xia, Chengyou Jia, Minnan Luo, Zhuohang Dang, Xin Shen, Bowen Ping

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 D³-预测器通过无噪声确定性扩散模型解决密集预测中随机噪声导致的几何结构破坏问题,实现高效且高质量的密集预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23885 2026-01-22 cs.CV cs.AI 79%

Extendable Generalization Self-Supervised Diffusion for Low-Dose CT Reconstruction

可扩展泛化自监督扩散用于低剂量CT重建

Guoquan Wei, Liu Shi, Zekun Zhou, Mohan Li, Cunfeng Wei, Wenzhe Shan, Qiegen Liu

机构 * School of Information Engineering, Nanchang University(南昌大学信息工程学院) School of Mathematics and Computer Sciences, Nanchang University(南昌大学数学与计算机科学学院) Jinan Laboratory of Applied Nuclear Science(济南应用核科学实验室) Institute of High Energy Physics, Chinese Academy of Sciences(中国科学院高能物理研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出EGenDiff方法,通过自增强相似性策略和像素级自校正融合技术,实现仅用单剂量数据训练的低剂量CT重建,显著提升多剂量泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14161 2026-01-21 cs.CV 79%

One-Shot Refiner: Boosting Feed-forward Novel View Synthesis via One-Step Diffusion

单步扩散提升馈送式新视角合成

Yitong Dong, Qi Zhang, Minchao Jiang, Zhiqiang Wu, Qingnan Fan, Ying Feng, Huaqi Zhang, Hujun Bao, Guofeng Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过单步扩散提升馈送式新视角合成,解决高分辨率图像处理与高频细节保留问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14030 2026-01-21 cs.CV 79%

Likelihood-Separable Diffusion Inference for Multi-Image MRI Super-Resolution

基于似然分离的扩散推理用于多图像MRI超分辨率

Samuel W. Remedios, Zhangxing Bian, Shuwen Wei, Aaron Carass, Jerry L. Prince, Blake E. Dewey

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散模型的多图像MRI超分辨率方法,通过分离似然校正实现高效推理,显著提升了各向异性退化下的超分辨率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13371 2026-01-21 cs.CV 79%

Spherical Geometry Diffusion: Generating High-quality 3D Face Geometry via Sphere-anchored Representations

球面几何扩散:通过球锚定表示生成高质量3D人脸几何

Junyi Zhang, Yiming Wang, Yunhong Lu, Qichao Wang, Wenzhe Qian, Xiaoyin Xu, David Gu, Min Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出球面几何扩散方法,通过球锚定表示生成高质量3D人脸几何,结合2D生成模型实现可控生成。

Comments Association for the Advancement of Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21498 2026-01-21 cs.LG cs.CV 79%

SlimDiff: Training-Free, Activation-Guided Hands-free Slimming of Diffusion Models

SlimDiff: 不需要训练的激活引导式扩散模型无手瘦身

Arani Roy, Shristi Das Biswas, Kaushik Roy

机构 * Purdue University(普渡大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SlimDiff通过激活引导的结构压缩方法,无需训练即可显著提升扩散模型的效率,实现参数减少和加速,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12761 2026-01-21 cs.CV 79%

Moaw: Unleashing Motion Awareness for Video Diffusion Models

Moaw:释放视频扩散模型中的运动感知

Tianqi Zhang, Ziyi Wang, Wenzhao Zheng, Weiliang Chen, Yuanhui Huang, Zhengyang Huang, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) Beihang University(北航)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Moaw通过训练视频扩散模型进行运动感知,实现零样本运动迁移,推动生成建模与运动理解的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09527 2026-01-21 cs.CV 79%

Generative Diffusion Contrastive Network for Multi-View Clustering

多视图聚类的生成扩散对比网络

Jian Zhu, Xin Zou, Xi Wang, Lei Liu, Chang Tang, Li-Rong Dai

机构 * Zhejiang Lab(浙江实验室) Hong Kong University of Science and Technology(香港科技大学) University of Science and Technology of China(中国科学技术大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出生成扩散对比网络GDCN,通过多重生成机制解决多视图聚类中的低质量数据问题,实现深度多视图聚类任务的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05685 2026-01-21 cs.GR 79%

DogFit: Domain-guided Fine-tuning for Efficient Transfer Learning of Diffusion Models

DogFit: 域引导微调用于扩散模型高效迁移学习

Yara Bahram, Mohammadhadi Shateri, Eric Granger

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 DogFit通过域感知引导微调提升扩散模型在小目标领域迁移学习的效率与效果,减少计算开销并提高生成质量。

Comments Accepted for poster presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12233 2026-01-21 cs.CV 79%

DiffusionQC: Artifact Detection in Histopathology via Diffusion Model

DiffusionQC:通过扩散模型在病理学中检测伪影

Zhenzhen Wang, Zhongliang Zhou, Zhuoyu Wen, Jeong Hwan Kook, John B Wojcik, John Kang

机构 * Johns Hopkins University Dept. of Biomedical Engineering(约翰霍普金斯大学生物医学工程系) Merck & Co., Inc. Biometrics Research(默克公司生物度量研究) Merck & Co., Inc. Translational Medicine(默克公司转化医学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffusionQC通过扩散模型检测病理学图像中的伪影,无需大量标注数据,实现高效且泛化的伪影识别。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12020 2026-01-21 cs.CV 79%

DIAMOND-SSS: Diffusion-Augmented Multi-View Optimization for Data-efficient SubSurface Scattering

DIAMOND-SSS: 用于数据高效次表面散射的扩散增强多视图优化

Guillermo Figueroa-Araneda, Iris Diana Jimenez, Florian Hofherr, Manny Ko, Hector Andrade-Loarca, Daniel Cremers

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DIAMOND-SSS通过扩散模型实现高保真透明重建,利用极稀疏监督生成逼真增强效果,将实际捕获需求降低90%。

详情

展开后加载摘要…

URL PDF HTML 收藏