arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-08-05 至 2025-08-05 共收录 106 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 9 篇

2508.01605 2025-08-05 cs.CR 89%

Practical, Generalizable and Robust Backdoor Attacks on Text-to-Image Diffusion Models

Haoran Dai, Jiawen Wang, Ruo Yang, Manali Sharma, Zhonghao Liao, Yuan Hong, Binghui Wang

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01008 2025-08-05 cs.CV 88%

ROVI: A VLM-LLM Re-Captioned Dataset for Open-Vocabulary Instance-Grounded Text-to-Image Generation

Cihang Peng, Qiming Hou, Zhong Ren, Kun Zhou

机构 * State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13298 2025-08-05 cs.CV cs.AI 88%

Fair Generation without Unfair Distortions: Debiasing Text-to-Image Generation with Entanglement-Free Attention

Jeonghoon Park, Juyoung Lee, Chaeyeon Chung, Jaeseong Lee, Jaegul Choo, Jindong Gu

机构 * KAIST(韩国科学技术院) Kakao Corp.(韩国 Kakao 公司) Yonsei University(延世大学) University of Oxford(牛津大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06453 2025-08-05 cs.CR 88%

Efficient Input-level Backdoor Defense on Text-to-Image Synthesis via Neuron Activation Variation

Shengfang Zhai, Jiajun Li, Yue Liu, Huanran Chen, Zhihua Tian, Wenjie Qu, Qingni Shen, Ruoxi Jia, Yinpeng Dong, Jiaheng Zhang

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title);diffusion(abstract)

Comments 20 pages. ICCV 2025 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02004 2025-08-05 cs.CV 85%

Devil is in the Detail: Towards Injecting Fine Details of Image Prompt in Image Generation via Conflict-free Guidance and Stratified Attention

Kyungmin Jo, Jooyeol Yun, Jaegul Choo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07730 2025-08-05 cs.CV 79%

Democratizing Text-to-Image Masked Generative Models with Compact Text-Aware One-Dimensional Tokens

Dongwon Kim, Ju He, Qihang Yu, Chenglin Yang, Xiaohui Shen, Suha Kwak, Liang-Chieh Chen

机构 * ByteDance Seed(字节跳动种子) POSTECH

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

Comments ICCV 2025. Project page at https://tacju.github.io/projects/maskgen.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02324 2025-08-05 cs.CV 77%

Qwen-Image Technical Report

Chenfei Wu, Jiahao Li, Jingren Zhou, Junyang Lin, Kaiyuan Gao, Kun Yan, Sheng-ming Yin, Shuai Bai, Xiao Xu, Yilei Chen, Yuxiang Chen, Zecheng Tang, Zekai Zhang, Zhengyi Wang, An Yang, Bowen Yu, Chen Cheng, Dayiheng Liu, Deqing Li, Hang Zhang, Hao Meng, Hu Wei, Jingyuan Ni, Kai Chen, Kuan Cao, Liang Peng, Lin Qu, Minggang Wu, Peng Wang, Shuting Yu, Tingkun Wen, Wensen Feng, Xiaoxiao Xu, Yi Wang, Yichang Zhang, Yongqiang Zhu, Yujia Wu, Yuxuan Cai, Zenan Liu

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV

Comments https://github.com/QwenLM/Qwen-Image

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19233 2025-08-05 cs.CV cs.AI cs.MM eess.IV 76%

RAISE: Realness Assessment for Image Synthesis and Evaluation

Aniruddha Mukherjee, Spriha Dubey, Somdyuti Paul

机构 * Department of Computer Science and Engineering, Kalinga Institute of Industrial Technology(计算机科学与工程系,卡林加工业技术学院) Department of Metallurgical and Materials Engineering, Indian Institute of Technology Kharagpur(冶金与材料工程系,印度理工学院卡里格普分校) Department of Artificial Intelligence, Indian Institute of Technology Kharagpur(人工智能系,印度理工学院卡里格普分校)

专题命中 文生图 :image synthesis(title);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09509 2025-08-05 cs.LG 50%

EQ-VAE: Equivariance Regularized Latent Space for Improved Generative Image Modeling

Theodoros Kouzelis, Ioannis Kakogeorgiou, Spyros Gidaris, Nikos Komodakis

机构 * Archimedes,Athena Reaserch Center, Greece(阿基米德、阿泰纳研究中心) National Technical University of Athens, Greece(雅典技术大学) University of Crete, Greece(克里特大学)

专题命中 文生图 :image synthesis(abstract)

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 2 篇

2504.13490 2025-08-05 cs.CV 87%

Early Timestep Zero-Shot Candidate Selection for Instruction-Guided Image Editing

Joowon Kim, Ziseok Lee, Donghyeon Cho, Sanghyun Jo, Yeonsung Jung, Kyungsu Kim, Eunho Yang

机构 * KAIST(韩国科学技术院) Seoul National University(首尔国立大学) OGQ

专题命中 图像编辑 :image editing(title,abstract);image generation(abstract);text-to-image(abstract);diffusion(abstract)

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01215 2025-08-05 cs.CV 57%

StyDeco: Unsupervised Style Transfer with Distilling Priors and Semantic Decoupling

Yuanlin Yang, Quanjian Song, Zhexian Gao, Ge Wang, Shanshan Li, Xiaoyan Zhang

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

Comments 9 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 70 篇

2503.11972 2025-08-05 cs.DC 89%

MoDM: Efficient Serving for Image Generation via Mixture-of-Diffusion Models

Yuchen Xia, Divyam Sharma, Yichao Yuan, Souvik Kundu, Nishil Talati

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract)

Comments To appear in ASPLOS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13023 2025-08-05 cs.CV cs.AI cs.MM 88%

Anti-Inpainting: A Proactive Defense Approach against Malicious Diffusion-based Inpainters under Unknown Conditions

Yimao Guo, Zuomin Qu, Wei Lu, Xiangyang Luo

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10340 2025-08-05 cs.CV 85%

Text Embedding Knows How to Quantize Text-Guided Diffusion Models

Hongjae Lee, Myungjun Son, Dongjea Kang, Seung-Won Jung

机构 * Korea University(韩国大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19853 2025-08-05 cs.CV cs.GR cs.LG 84%

Conditional Balance: Improving Multi-Conditioning Trade-Offs in Image Generation

Nadav Z. Cohen, Oron Nir, Ariel Shamir

机构 * Reichman University(里奇曼大学) Microsoft Corporation(微软公司)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR

Comments Conference paper at CVPR 2025. Project page: https://nadavc220.github.io/conditional-balance.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23268 2025-08-05 cs.CV 84%

PixNerd: Pixel Neural Field Diffusion

Shuai Wang, Ziteng Gao, Chenhui Zhu, Weilin Huang, Limin Wang

机构 * Nanjing University(南京大学) ByteDance Seed(字节跳动种子) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments a single-scale, single-stage, efficient, end-to-end pixel space diffusion model

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15580 2025-08-05 cs.CV 83%

TKG-DM: Training-free Chroma Key Content Generation Diffusion Model

Ryugo Morita, Stanislav Frolov, Brian Bernhard Moser, Takahiro Shirakawa, Ko Watanabe, Andreas Dengel, Jinjia Zhou

机构 * Faculty of Science and Engineering(科学与工程学部) RPTU Kaiserslautern-Landau & DFKI GmbH(科隆-兰道大学与DFKI GmbH)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Accepted to CVPR2025(Highlight). Code at: https://github.com/ryugo417/TKG-DM

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18092 2025-08-05 cs.CV cs.AI cs.RO 83%

DiffSSC: Semantic LiDAR Scan Completion using Denoising Diffusion Probabilistic Models

Helin Cao, Sven Behnke

机构 * Autonomous Intelligent Systems group, Computer Science Institute VI – Intelligent Systems and Robotics – and the Center for Robotics and the Lamarr Institute for Machine Learning and Artificial Intelligence, University of Bonn, Germany(自主智能系统组,计算机科学研究所VI——智能系统与机器人——和机器人中心以及拉马尔人工智能与机器学习研究所,波恩大学,德国)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025), Hangzhou, China, Oct 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01130 2025-08-05 cs.CV 83%

Joint Generative Modeling of Grounded Scene Graphs and Images via Diffusion Models

Bicheng Xu, Qi Yan, Renjie Liao, Lele Wang, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(人工智能向量研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02528 2025-08-05 eess.IV cs.CV 79%

From Pixels to Pathology: Restoration Diffusion for Diagnostic-Consistent Virtual IHC

Jingsong Liu, Xiaofeng Deng, Han Li, Azar Kazemi, Christian Grashei, Gesa Wilkens, Xin You, Tanja Groll, Nassir Navab, Carolin Mogler, Peter J. Schüffler

机构 * organization= Institute of Pathology, Technical University of Munich, TUM School of Medicine organization= Computer Aided Medical Procedures (CAMP), TU Munich , city= Munich , country= Germany organization= Munich Center for Machine Learning (MCML) , city= Munich , country= Germany organization= TUM School of Computation, Information organization= Department of Medical Informatics, School of Medicine, Mashhad University of Medical Sciences , city= Mashhad , country= Iran organization= Munich Data Science Institute (MDSI) , city= Munich , country= Germany

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02323 2025-08-05 cs.CV 79%

Dream-to-Recon: Monocular 3D Reconstruction with Diffusion-Depth Distillation from Single Images

Philipp Wulff, Felix Wimbauer, Dominik Muhle, Daniel Cremers

机构 * Technical University of Munich(慕尼黑技术大学) MCML SE3 Labs(SE3实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments ICCV 2025. Website: https://philippwulff.github.io/dream-to-recon

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01058 2025-08-05 eess.IV cs.CV 79%

ReCoSeg++:Extended Residual-Guided Cross-Modal Diffusion for Brain Tumor Segmentation

Sara Yavari, Rahul Nitin Pandya, Jacob Furst

机构 * School of Computing, DePaul University(计算学院,德保罗大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00896 2025-08-05 cs.CV cond-mat.mtrl-sci eess.IV 79%

Phase-fraction guided denoising diffusion model for augmenting multiphase steel microstructure segmentation via micrograph image-mask pair synthesis

Hoang Hai Nam Nguyen, Minh Tien Tran, Hoheok Kim, Ho Won Lee

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00443 2025-08-05 cs.CV 79%

SDMatte: Grafting Diffusion Models for Interactive Matting

Longfei Huang, Yu Liang, Hao Zhang, Jinwei Chen, Wei Dong, Lunde Chen, Wanyu Liu, Bo Li, Peng-Tao Jiang

机构 * Shanghai University(上海大学) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepted at ICCV 2025, 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12049 2025-08-05 cs.CV 79%

TACO: Taming Diffusion for in-the-wild Video Amodal Completion

Ruijie Lu, Yixin Chen, Yu Liu, Jiaxiang Tang, Junfeng Ni, Diwen Wan, Gang Zeng, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) State Key Laboratory of General Artificial Intelligence, BIGAI(BIGAI 通用人工智能国家重点实验室) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2025.Project page: https://jason-aplp.github.io/TACO

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01835 2025-08-05 cs.CV 79%

Diffusion-based 3D Hand Motion Recovery with Intuitive Physics

Yufei Zhang, Zijun Cui, Jeffrey O. Kephart, Qiang Ji

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) Michigan State University(密歇根州立大学) IBM Research(IBM研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01778 2025-08-05 cs.CV cs.RO 79%

DiffSemanticFusion: Semantic Raster BEV Fusion for Autonomous Driving via Online HD Map Diffusion

Zhigang Sun, Yiru Wang, Anqing Jiang, Shuo Wang, Yu Gao, Yuwen Heng, Shouyi Zhang, An He, Hao Jiang, Jinhao Chai, Zichong Gu, Wang Jijun, Shichen Tang, Lavdim Halilaj, Juergen Luettin, Hao Sun

机构 * Bosch Corporate Research, Bosch (China) Investment Ltd.(博世企业研究院、博世(中国)投资有限公司) School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) Shanghai Jiaotong University(上海交通大学) AIR, Tsinghua University(清华大学人工智能研究院) Robert Bosch GmbH(罗伯特·博世集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01698 2025-08-05 cs.CV 79%

Versatile Transition Generation with Image-to-Video Diffusion

Zuhao Yang, Jiahui Zhang, Yingchen Yu, Shijian Lu, Song Bai

机构 * Nanyang Technological University(南洋理工大学) ByteDance Inc.(字节跳动公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01230 2025-08-05 physics.comp-ph cs.CV 79%

Point-wise Diffusion Models for Physical Systems with Shape Variations: Application to Spatio-temporal and Large-scale system

Jiyong Kim, Sunwoong Yang, Namwoo Kang

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00941 2025-08-05 cs.CV 79%

Latent Diffusion Based Face Enhancement under Degraded Conditions for Forensic Face Recognition

Hassan Ugail, Hamad Mansour Alawar, AbdulNasser Abbas Zehi, Ahmed Mohammad Alkendi, Ismail Lujain Jaleel

机构 * Centre for Visual Computing and Intelligent Systems(视觉计算与智能系统中心) Unviversity of Bradford(布拉德福德大学) General Department of Forensic Science and Criminology(法医学与犯罪学部门) Dubai Police Headquarters(迪拜警察总部) theCircle Ltd(theCircle公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏