arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70196 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70196 篇

2510.19022 2025-10-23 cs.CV 79%

MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models

Aritra Bhowmik, Denis Korzhenkov, Cees G. M. Snoek, Amirhossein Habibian, Mohsen Ghafoorian

机构 * University of Amsterdam(阿姆斯特丹大学) Qualcomm AI Research(高通AI研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13579 2025-10-23 cs.LG cs.AI cs.CL cs.CV 79%

Flexible-length Text Infilling for Discrete Diffusion Models

Andrew Zhang, Anushka Sivakumar, Chiawei Tang, Chris Thomas

机构 * Department of Computer Science(计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Major edit of methodology section. Matches EMNLP camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07634 2025-10-23 eess.AS cs.MM 79%

SongBloom: Coherent Song Generation via Interleaved Autoregressive Sketching and Diffusion Refinement

Chenyu Yang, Shuai Wang, Hangting Chen, Wei Tan, Jianwei Yu, Haizhou Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

Comments Accepted by NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10483 2025-10-23 cs.CV cs.LG 79%

REPA-E: Unlocking VAE for End-to-End Tuning with Latent Diffusion Transformers

Xingjian Leng, Jaskirat Singh, Yunzhong Hou, Zhenchang Xing, Saining Xie, Liang Zheng

机构 * Australian National University(澳大利亚国立大学) Data61 CSIRO(Data61澳大利亚联邦科学与工业研究组织) New York University(纽约大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18521 2025-10-22 cs.CV 79%

RayPose: Ray Bundling Diffusion for Template Views in Unseen 6D Object Pose Estimation

Junwen Huang, Shishir Reddy Vutukur, Peter KT Yu, Nassir Navab, Slobodan Ilic, Benjamin Busam

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) XYZ Robotics(XYZ机器人)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18446 2025-10-22 cs.CV 79%

LAND: Lung and Nodule Diffusion for 3D Chest CT Synthesis with Anatomical Guidance

Anna Oliveras, Roger Marí, Rafael Redondo, Oriol Guardià, Ana Tost, Bhalaji Nagarajan, Carolina Migliorelli, Vicent Ribas, Petia Radeva

机构 * Eurecat, Centre Tecnològic de Catalunya(埃鲁卡特技术中心,加泰罗尼亚技术中心) Dept. de Matemàtiques i Informàtica, Universitat de Barcelona(巴塞罗那大学数学与计算机系) Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18291 2025-10-22 cs.CV 79%

GeoDiff: Geometry-Guided Diffusion for Metric Depth Estimation

Tuan Pham, Thanh-Tung Le, Xiaohui Xie, Stephan Mandt

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepted to ICCV Findings 2025. The first two authors contributed equally. The last two authors share co-corresponding authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12201 2025-10-22 cs.CV math.OC 79%

RODS: Robust Optimization Inspired Diffusion Sampling for Detecting and Reducing Hallucination in Generative Models

Yiqi Tian, Pengfei Jin, Mingze Yuan, Na Li, Bo Zeng, Quanzheng Li

机构 * Center for Advanced Medical Computing and Analysis, Massachusetts General Hospital and Harvard Medical School(先进医学计算与分析中心,麻省总医院和哈佛医学院) Department of Industrial Engineering, University of Pittsburgh(工业工程系,匹兹堡大学) School of Engineering and Applied Sciences, Harvard University(工程与应用科学学院,哈佛大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15625 2025-10-22 cs.CV 79%

HOIDiNi: Human-Object Interaction through Diffusion Noise Optimization

Roey Ron, Guy Tevet, Haim Sawdayee, Amit H. Bermano

机构 * Tel-Aviv University(特拉维夫大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Project page: https://hoidini.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16757 2025-10-22 cs.CV 79%

ITVTON: Virtual Try-On Diffusion Transformer Based on Integrated Image and Text

Haifeng Ni, Ming Xu

机构 * School of Software Engineering, East China Normal University, Shanghai, China(软件工程学院,东华大学,上海,中国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepted by PRCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17858 2025-10-22 cs.CV cs.LG 79%

Shortcutting Pre-trained Flow Matching Diffusion Models is Almost Free Lunch

Xu Cai, Yang Wu, Qianli Chen, Haoran Wu, Lichuan Xiang, Hongkai Wen

机构 * AI Research Center, iHuman Inc.(人工智能研究中心,iHuman公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17137 2025-10-21 cs.CV 79%

KineDiff3D: Kinematic-Aware Diffusion for Category-Level Articulated Object Shape Reconstruction and Generation

WenBo Xu, Liu Liu, Li Zhang, Ran Zhang, Hao Wu, Dan Guo, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09121 2025-10-21 cs.CV cs.AI 79%

MSDM: Generating Task-Specific Pathology Images with a Multimodal Conditioned Diffusion Model for Cell and Nuclei Segmentation

Dominik Winter, Mai Bui, Monica Azqueta Gavaldon, Nicolas Triltsch, Marco Rosati, Nicolas Brieu

机构 * AstraZeneca Computational Pathology GmbH(阿斯利康计算病理学 GmbH)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18060 2025-10-21 cs.CV 79%

BokehDiff: Neural Lens Blur with One-Step Diffusion

Chengxuan Zhu, Qingnan Fan, Qi Zhang, Jinwei Chen, Huaqi Zhang, Chao Xu, Boxin Shi

机构 * National Key Lab of General AI, School of Intelligence Science and Technology, Peking University(国家关键人工智能实验室,智能科学与技术学院,北京大学) Vivo Mobile Communication Co., Ltd.(Vivo移动通信有限公司) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(视觉技术国家工程研究中心,计算机科学学院,北京大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16091 2025-10-21 eess.IV cs.CV 79%

OSCAR: One-Step Diffusion Codec Across Multiple Bit-rates

Jinpei Guo, Yifei Ji, Zheng Chen, Kai Liu, Min Liu, Wang Rao, Wenbo Li, Yong Guo, Yulun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) Joy Future Academy(京东探索研究院) South China University of Technology(华南理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15905 2025-10-21 cs.CV cs.AI 79%

Jasmine: Harnessing Diffusion Prior for Self-supervised Depth Estimation

Jiyuan Wang, Chunyu Lin, Cheng Guan, Lang Nie, Jing He, Haodong Li, Kang Liao, Yao Zhao

机构 * BJTU(北京工业大学) NTU(国立台湾大学) HKUST(香港科技大学) CQUPT(重庆邮电大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025. 23 pages, with the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15868 2025-10-20 cs.CV 79%

LightsOut: Diffusion-based Outpainting for Enhanced Lens Flare Removal

Shr-Ruei Tsai, Wei-Cheng Chang, Jie-Ying Lee, Chih-Hai Su, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(国家阳明交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments ICCV 2025. Project page: https://ray-1026.github.io/lightsout/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15761 2025-10-20 cs.CV cs.LG 79%

QSilk: Micrograin Stabilization and Adaptive Quantile Clipping for Detail-Friendly Latent Diffusion

Denis Rychkovskiy

机构 * DZRobo

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Preprint. Qualitative side-by-side comparisons (fixed seeds); 3 figures with subfigures; 1 algorithm. CADE 2.5 / SDXL integration; sample images included. Code and presets planned for release upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15556 2025-10-20 cs.CV 79%

Diffusion Bridge Networks Simulate Clinical-grade PET from MRI for Dementia Diagnostics

Yitong Li, Ralph Buchert, Benita Schmitz-Koep, Timo Grimmer, Björn Ommer, Dennis M. Hedderich, Igor Yakushev, Christian Wachinger

机构 * Lab for AI in Medical Imaging, Institute for Diagnostic and Interventional Radiology, School of Medicine and Health(人工智能在医学影像中的实验室,诊断与介入放射学研究所,医学院与健康学院) Technical University of Munich (TUM)(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University Medical Center Hamburg-Eppendorf(汉堡-埃本达大学医学中心) Department of Neuroradiology, TUM University Hospital, School of Medicine and Health(神经放射学部,慕尼黑技术大学医院,医学院与健康学院) Department of Neurology, TUM University Hospital, School of Medicine and Health(神经病学部,慕尼黑技术大学医院,医学院与健康学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15400 2025-10-20 cs.CV cs.AI physics.med-ph 79%

Robust High-Resolution Multi-Organ Diffusion MRI Using Synthetic-Data-Tuned Prompt Learning

Chen Qian, Haoyu Zhang, Junnan Ma, Liuhong Zhu, Qingrui Cai, Yu Wang, Ruibo Song, Lv Li, Lin Mei, Xianwang Jiang, Qin Xu, Boyu Jiang, Ran Tao, Chunmiao Chen, Shufang Chen, Dongyun Liang, Qiu Guo, Jianzhong Lin, Taishan Kang, Mengtian Lu, Liyuan Fu, Ruibin Huang, Huijuan Wan, Xu Huang, Jianhua Wang, Di Guo, Hai Zhong, Jianjun Zhou, Xiaobo Qu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments 43 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15392 2025-10-20 cs.CV cs.LG 79%

LILAC: Long-sequence Incremental Low-latency Arbitrary Motion Stylization via Streaming VAE-Diffusion with Causal Decoding

Peng Ren, Hai Yang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12954 2025-10-20 cs.CV 79%

CADE 2.5 - ZeResFDG: Frequency-Decoupled, Rescaled and Zero-Projected Guidance for SD/SDXL Latent Diffusion Models

Denis Rychkovskiy

机构 * DZRobo

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments 8 pages, 3 figures. Endorsed by Dr. Seyedmorteza Sadat (ETH Zurich). The work introduces CADE 2.5 with ZeResFDG as a practical inference-time guidance stack for SD/SDXL. Code and visual examples to be released on GitHub and Hugging Face

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24644 2025-10-20 cs.CV 79%

RIFLE: Removal of Image Flicker-Banding via Latent Diffusion Enhancement

Libo Zhu, Zihan Zhou, Xiaoyang Liu, Weihang Zhang, Keyu Shi, Yifan Fu, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06619 2025-10-20 cs.CV 79%

Unleashing the Potential of Pre-Trained Diffusion Models for Generalizable Person Re-Identification

Jiachen Li, Xiaojin Gong

机构 * College of Information Science and Electronic Engineering, Zhejiang University(信息科学与电子工程学院,浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19789 2025-10-20 cs.LG cs.CV stat.ML 79%

DiffEnc: Variational Diffusion with a Learned Encoder

Beatrix M. G. Nielsen, Anders Christensen, Andrea Dittadi, Ole Winther

机构 * Copenhagen University Hospital(哥本哈根大学医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Journal ref International Conference on Representation Learning 2024 (ICLR 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14962 2025-10-17 cs.CV 79%

RainDiff: End-to-end Precipitation Nowcasting Via Token-wise Attention Diffusion

Thao Nguyen, Jiaqi Ma, Fahad Shahbaz Khan, Souhaib Ben Taieb, Salman Khan

机构 * Mohamed Bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14634 2025-10-17 cs.CV 79%

SteeringTTA: Guiding Diffusion Trajectories for Robust Test-Time-Adaptation

Jihyun Yu, Yoojin Oh, Wonho Bae, Mingyu Kim, Junhyug Noh

机构 * Department of Artificial Intelligence, Ewha Womans University, Seoul, Republic of Korea(人工智能系,世ultan大学,韩国首尔) Department of Computer Science, University of British Columbia, Vancouver, Canada(计算机科学系,不列颠哥伦比亚大学,加拿大温哥华)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14314 2025-10-17 cs.CV 79%

A Multi-domain Image Translative Diffusion StyleGAN for Iris Presentation Attack Detection

Shivangi Yadav, Arun Ross

机构 * Michigan State University(密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07944 2025-10-17 cs.CV 79%

CVD-STORM: Cross-View Video Diffusion with Spatial-Temporal Reconstruction Model for Autonomous Driving

Tianrui Zhang, Yichen Liu, Zilin Guo, Yuxin Guo, Jingcheng Ni, Chenjing Ding, Dan Xu, Lewei Lu, Zehuan Wu

机构 * Sensetime Research(商汤科技研究院) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10569 2025-10-17 cs.CR cs.AI cs.MM 79%

MarkDiffusion: An Open-Source Toolkit for Generative Watermarking of Latent Diffusion Models

Leyi Pan, Sheng Guan, Zheyu Fu, Luyang Si, Huan Wang, Zian Wang, Hanqian Li, Xuming Hu, Irwin King, Philip S. Yu, Aiwei Liu, Lijie Wen

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) The Chinese University of Hong Kong(香港中文大学) University of Illinois at Chicago(伊利诺伊大学香槟分校) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

Comments 23 pages, 13 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏