arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 70277 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 70277 篇

2502.05749 2025-06-09 cs.CV cs.AI cs.SY eess.SY 79%

UniDB: A Unified Diffusion Bridge Framework via Stochastic Optimal Control

Kaizhen Zhu, Mokai Pan, Yuexin Ma, Yanwei Fu, Jingyi Yu, Jingya Wang, Ye Shi

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08435 2025-06-09 cs.SD cs.AI cs.LG cs.MM eess.AS 79%

Efficient Fine-Grained Guidance for Diffusion Model Based Symbolic Music Generation

Tingyu Zhu, Haoyu Liu, Ziyu Wang, Zhimin Jiang, Zeyu Zheng

机构 * Tingyu Zhu(丁宇 Zhu) Haoyu Liu(刘浩宇 Liu) Ziyu Wang(王子宇 Wang) Zhimin Jiang(江志敏 Jiang) Zeyu Zheng(郑泽宇 Zheng)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05573 2025-06-09 cs.CV 79%

PartCrafter: Structured 3D Mesh Generation via Compositional Latent Diffusion Transformers

Yuchen Lin, Chenguo Lin, Panwang Pan, Honglei Yan, Yiqiang Feng, Yadong Mu, Katerina Fragkiadaki

机构 * Peking University(北京大学) ByteDance(字节跳动) Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Project Page: https://wgsxm.github.io/projects/partcrafter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04648 2025-06-09 cs.CV 79%

FPSAttention: Training-Aware FP8 and Sparsity Co-Design for Fast Video Diffusion

Akide Liu, Zeyu Zhang, Zhexin Li, Xuehai Bai, Yizeng Han, Jiasheng Tang, Yuanjie Xing, Jichao Wu, Mingyang Yang, Weihua Chen, Jiahao He, Yuanyu He, Fan Wang, Gholamreza Haffari, Bohan Zhuang

机构 * Monash University(墨尔本大学) DAMO Academy, Alibaba Group(阿里云图学院) ZIP Lab, Zhejiang University(浙江大学ZIP实验室) Hupan Lab(汇磐实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Project Page: https://fps.ziplab.co

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02951 2025-06-09 eess.IV cs.CV 79%

LDPM: Towards undersampled MRI reconstruction with MR-VAE and Latent Diffusion Prior

Xingjian Tang, Jingwei Guan, Linge Li, Ran Shi, Youmei Zhang, Mengye Lyu, Li Yan

机构 * Shenzhen Technology University(深圳科技大学) Shenzhen University(深圳大学) Huawei(华为) Nanjing University of Science and Technology(南京理工大学) Qilu University of Technology(齐鲁工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments accepted as oral presentation at EMBC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04716 2025-06-06 cs.CV 79%

Learning dissection trajectories from expert surgical videos via imitation learning with equivariant diffusion

Hongyu Wang, Yonghao Long, Yueyao Chen, Hon-Chi Yip, Markus Scheppach, Philip Wai-Yan Chiu, Yeung Yam, Helen Mei-Ling Meng, Qi Dou

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04641 2025-06-06 cs.CV 79%

Text-Aware Real-World Image Super-Resolution via Diffusion Model with Joint Segmentation Decoders

Qiming Hu, Linlong Fan, Yiyan Luo, Yuhang Yu, Xiaojie Guo, Qingnan Fan

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) vivo Mobile Communication Co. Ltd(vivo移动通信有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04351 2025-06-06 cs.CV 79%

HuGeDiff: 3D Human Generation via Diffusion with Gaussian Splatting

Maksym Ivashechkin, Oscar Mendez, Richard Bowden

机构 * CVSSP, University of Surrey(CVSSP、萨里大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04213 2025-06-06 cs.CV 79%

FullDiT2: Efficient In-Context Conditioning for Video Diffusion Transformers

Xuanhua He, Quande Liu, Zixuan Ye, Weicai Ye, Qiulin Wang, Xintao Wang, Qifeng Chen, Pengfei Wan, Di Zhang, Kun Gai

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Kuaishou Technology(快手科技)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03979 2025-06-06 cs.LG cs.CV cs.NA eess.IV math.NA stat.ML 79%

Solving Inverse Problems via Diffusion-Based Priors: An Approximation-Free Ensemble Sampling Approach

Haoxuan Chen, Yinuo Ren, Martin Renqiang Min, Lexing Ying, Zachary Izzo

机构 * ICME Stanford University(ICME 斯坦福大学) Stanford University(斯坦福大学) Machine Learning Department NEC Labs America(机器学习部门 NEC 美国实验室) NEC Labs America(NEC 美国实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments 45 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02444 2025-06-06 cs.CV 79%

SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios

Lingwei Dang, Ruizhi Shao, Hongwen Zhang, Wei Min, Yebin Liu, Qingyao Wu

机构 * School of Software Engineering, South China University of Technology(华南理工大学软件工程学院) Department of Automation, Tsinghua University(清华大学自动化系) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10723 2025-06-06 eess.IV cs.CV 79%

Eddeep: Fast eddy-current distortion correction for diffusion MRI with deep learning

Antoine Legouhy, Ross Callaghan, Whitney Stee, Philippe Peigneux, Hojjat Azadbakht, Hui Zhang

机构 * Centre for Medical Image Computing & Department of Computer Science, University College London(医学影像计算中心及计算机科学系,伦敦大学学院) AINOSTICS ltd.(AINOSTICS有限公司) UR2NF-Neuropsychology and Functional Neuroimaging Research Unit affiliated at CRCN – Centre for Research in Cognition and Neurosciences and UNI - ULB Neuroscience Institute, Université Libre de Bruxelles (ULB)(神经心理学与功能神经影像研究单位,布鲁塞尔自由大学(ULB)) GIGA - Cyclotron Research Centre - In Vivo Imaging, University of Liège (ULiège)(GIGA-回旋加速器研究中心-活体成像,利耶大学(ULiège))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepted in MICCAI 2024 conference (without rebuttal). Github repo: https://github.com/CIG-UCL/eddeep

Journal ref Lecture Notes in Computer Science, vol 15002. Springer, Cham. (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02906 2025-06-06 cs.CV cs.LG 79%

ViewFusion: Learning Composable Diffusion Models for Novel View Synthesis

Bernard Spiegl, Andrea Perin, Stéphane Deny, Alexander Ilin

机构 * Aalto University(阿alto大学) System 2 AI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Version accepted to TMLR

Journal ref Transactions on Machine Learning Research, May 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04225 2025-06-05 cs.CV 79%

Voyager: Long-Range and World-Consistent Video Diffusion for Explorable 3D Scene Generation

Tianyu Huang, Wangguandong Zheng, Tengfei Wang, Yuhao Liu, Zhenwei Wang, Junta Wu, Jie Jiang, Hui Li, Rynson W. H. Lau, Wangmeng Zuo, Chunchao Guo

机构 * Harbin Institute of Technology China(哈尔滨工业大学) Southeast University China(东南大学) Tencent Hunyuan China(腾讯幻境) City University of Hong Kong China(香港城市大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04211 2025-06-05 cs.CV 79%

Diffusion Domain Teacher: Diffusion Guided Domain Adaptive Object Detector

Boyong He, Yuxiang Ji, Zhuoyue Tan, Liaoni Wu

机构 * Xiamen University Institute of Artifcial Intelligence(厦门大学人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments MM2024 poster, with appendix and codes

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03275 2025-06-05 cs.CV cs.AI 79%

Chipmunk: Training-Free Acceleration of Diffusion Transformers with Dynamic Column-Sparse Deltas

Austin Silveria, Soham V. Govande, Daniel Y. Fu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Together AI Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16933 2025-06-05 cs.LG cs.CL cs.CV 79%

LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning

Zebin You, Shen Nie, Xiaolu Zhang, Jun Hu, Jun Zhou, Zhiwu Lu, Ji-Rong Wen, Chongxuan Li

机构 * Gaoling School of AI, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心,教育部) Ant Group(蚂蚁集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Project page and codes: \url{https://ml-gsai.github.io/LLaDA-V-demo/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02101 2025-06-05 cs.CV 79%

Generalized Diffusion Detector: Mining Robust Features from Diffusion Models for Domain-Generalized Detection

Boyong He, Yuxiang Ji, Qianwen Ye, Zhuoyue Tan, Liaoni Wu

机构 * Institute of Artifcial Intelligence, Xiamen University(厦门大学人工智能学院) School of Aerospace Engineering, Xiamen University(厦门大学航空航天工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments CVPR2025 camera-ready version with supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14706 2025-06-05 cs.CV 79%

EnergyMoGen: Compositional Human Motion Generation with Energy-Based Diffusion Model in Latent Space

Jianrong Zhang, Hehe Fan, Yi Yang

机构 * ReLER, AAII, University of Technology Sydney(技术悉尼大学) CCAI, Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepted to CVPR 2025. Project page: https://jiro-zhang.github.io/EnergyMoGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03065 2025-06-04 cs.CV cs.AI cs.LG 79%

Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers

Pengtao Chen, Xianfang Zeng, Maosen Zhao, Peng Ye, Mingzhu Shen, Wei Cheng, Gang Yu, Tao Chen

机构 * Fudan University(复旦大学) StepFun The Chinese University of Hong Kong(香港中文大学) Imperial College London(伦敦帝国理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02781 2025-06-04 cs.CV 79%

FreeScene: Mixed Graph Diffusion for 3D Scene Synthesis from Free Prompts

Tongyuan Bai, Wangyuanfan Bai, Dong Chen, Tieru Wu, Manyi Li, Rui Ma

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) School of Software, Shandong University(山东大学软件学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(知识驱动人机智能工程研究中心,教育部,中国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02221 2025-06-04 cs.CV cs.LG 79%

Diff2Flow: Training Flow Matching Models via Diffusion Model Alignment

Johannes Schusterbauer, Ming Gui, Frank Fundel, Björn Ommer

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21179 2025-06-04 cs.CV 79%

Normalized Attention Guidance: Universal Negative Guidance for Diffusion Models

Dar-Yen Chen, Hmrishav Bandyopadhyay, Kai Zou, Yi-Zhe Song

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19381 2025-06-04 cs.AI cs.CV cs.RO 79%

DiffVLA: Vision-Language Guided Diffusion Planning for Autonomous Driving

Anqing Jiang, Yu Gao, Zhigang Sun, Yiru Wang, Jijun Wang, Jinghao Chai, Qian Cao, Yuweng Heng, Hao Jiang, Yunda Dong, Zongzheng Zhang, Xianda Guo, Hao Sun, Hao Zhao

机构 * RIX, Bosch(博世 RIX) AIR, Tsinghua University(清华大学人工智能研究院) Shanghai University(上海大学) Shanghai Jiao Tong University(上海交通大学) Southeast University Team(东南大学团队)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments 4pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18913 2025-06-04 cs.CV 79%

Rethinking Diffusion Posterior Sampling: From Conditional Score Estimator to Maximizing a Posterior

Tongda Xu, Xiyan Cai, Xinjie Zhang, Xingtong Ge, Dailan He, Ming Sun, Jingjing Liu, Ya-Qin Zhang, Jian Li, Yan Wang

机构 * Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) New York University(纽约大学) Hong Kong University of Science and Technology(香港科学与技术大学) SenseTime Research(商汤科技研究院) The Chinese University of Hong Kong(香港中文大学) Kuaishou Technology(快手科技) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02416 2025-06-04 cs.LG cs.CV 79%

Eliminating Oversaturation and Artifacts of High Guidance Scales in Diffusion Models

Seyedmorteza Sadat, Otmar Hilliges, Romann M. Weber

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Published as a conference paper at ICLR 2025

Journal ref The Thirteenth International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02687 2025-06-04 cs.LG cs.CV 79%

No Training, No Problem: Rethinking Classifier-Free Guidance for Diffusion Models

Seyedmorteza Sadat, Manuel Kansy, Otmar Hilliges, Romann M. Weber

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Published as a conference paper at ICLR 2025

Journal ref The Thirteenth International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00591 2025-06-03 eess.IV cs.CV 79%

MR2US-Pro: Prostate MR to Ultrasound Image Translation and Registration Based on Diffusion Models

Xudong Ma, Nantheera Anantrasirichai, Stefanos Bolomytis, Alin Achim

机构 * Visual Information Laboratory, University of Bristol(布里斯托大学视觉信息实验室) Southmead Hospital, North Bristol NHS Trust(北布里斯托NHS信托南梅德医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15791 2025-06-03 cs.CV cs.LG 79%

VARD: Efficient and Dense Fine-Tuning for Diffusion Models with Value-based RL

Fengyuan Dai, Zifeng Zhuang, Yufei Huang, Siteng Huang, Bangyan Liao, Donglin Wang, Fajie Yuan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11981 2025-06-03 cs.CR cs.CV cs.LG 79%

Certified Robustness to Clean-Label Poisoning Using Diffusion Denoising

Sanghyun Hong, Nicholas Carlini, Alexey Kurakin

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏