arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-09-29 至 2025-09-29 共收录 90 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 13 篇

2412.03255 2025-09-29 cs.CV 89%

DynamicControl: Adaptive Condition Selection for Improved Text-to-Image Generation

Qingdong He, Jinlong Peng, Pengcheng Xu, Boyuan Jiang, Xiaobin Hu, Donghao Luo, Yong Liu, Yabiao Wang, Chengjie Wang, Xiangtai Li, Jiangning Zhang

机构 * Youtu Lab, Tencent(腾讯优图实验室) Western University(西部大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);image synthesis(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21375 2025-09-29 cs.CV cs.AI 89%

Automated Prompt Generation for Creative and Counterfactual Text-to-image Synthesis

Aleksa Jelaca, Ying Jiao, Chang Tian, Marie-Francine Moens

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title);image generation(abstract,comments);分类 cs.CV

Comments text-to-image generation, automatic prompt, DPO, Counterfactual

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21008 2025-09-29 cs.CV 88%

A Single Neuron Works: Precise Concept Erasure in Text-to-Image Diffusion Models

Qinqin He, Jiaqi Weng, Jialing Tao, Hui Xue

机构 * Alibaba Group(阿里巴巴集团)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22485 2025-09-29 cs.CV 79%

Group Critical-token Policy Optimization for Autoregressive Image Generation

Guohui Zhang, Hu Yu, Xiaoxiao Ma, JingHao Zhang, Yaning Pan, Mingde Yao, Jie Xiao, Linjiang Huang, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) CUHK(香港中文大学) Beihang University(北京航空航天大学)

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

Comments Code is available at https://github.com/zghhui/GCPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21360 2025-09-29 cs.CV cs.AI 79%

Multimodal Prompt Decoupling Attack on the Safety Filters in Text-to-Image Models

Xingkai Peng, Jun Jiang, Meng Tong, Shuai Li, Weiming Zhang, Nenghai Yu, Kejiang Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22635 2025-09-29 cs.CV cs.LG 70%

Training-Free Synthetic Data Generation with Dual IP-Adapter Guidance

Luc Boudier, Loris Manganelli, Eleftherios Tsonis, Nicolas Dufour, Vicky Kalogeiton

机构 * LIX, École Polytechnique, IP Paris, CNRS(LIX,巴黎高等师范学院,IP巴黎,法国国家科学研究中心) LIGM École des Ponts, IP Paris, CNRS, UGE DIPSY(LIGM 巴黎综合理工学院,IP巴黎,法国国家科学研究中心,UGE DIPSY)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments BMVC 2025. Project page: https://www.lix.polytechnique.fr/vista/projects/2025_bmvc_dipsy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21995 2025-09-29 cs.CV 70%

FailureAtlas:Mapping the Failure Landscape of T2I Models via Active Exploration

Muxi Chen, Zhaohua Zhang, Chenchen Zhao, Mingyang Chen, Wenyu Jiang, Tianwen Jiang, Jianhuan Zhuo, Yu Tang, Qiuyong Xiao, Jihong Zhang, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent(腾讯) Nanjing University(南京大学) Dalian University of Technology(大连理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22638 2025-09-29 cs.CL cs.AI cs.LG 67%

Language Models Can Learn from Verbal Feedback Without Scalar Rewards

Renjie Luo, Zichen Liu, Xiangyan Liu, Chao Du, Min Lin, Wenhu Chen, Wei Lu, Tianyu Pang

机构 * Sea AI Lab(海智实验室) SUTD(新加坡科技设计大学) NUS(国立大学) NTU(南洋理工大学) University of Waterloo(滑铁卢大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22394 2025-09-29 eess.IV cs.AI cs.CV 57%

Deep Learning-Based Cross-Anatomy CT Synthesis Using Adapted nnResU-Net with Anatomical Feature Prioritized Loss

Javier Sequeiro González, Arthur Longuefosse, Miguel Díaz Benito, Álvaro García Martín, Fabien Baldacci

机构 * Univ. Bordeaux, CNRS, LaBRI, UMR 5800, F-33400 Talence, France(波尔多大学,法国国家科学研究中心,LaBRI研究院,UMR 5800) Universidad Autónoma de Madrid, Madrid, 28049, Spain(马德里自治大学,西班牙) Pazmany Peter Catholic University, Budapest, 1083, Hungary(佩斯大学,匈牙利) RIKEN Center for Integrative Medical Sciences, Medical Data Deep Learning Team, Tokyo, Japan(日本再生医学科学中心,医学数据深度学习团队)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21997 2025-09-29 cs.CV 57%

Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchors

Youxu Shi, Suorong Yang, Dong Liu

机构 * University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21473 2025-09-29 cs.LG cs.AI cs.CL cs.CV stat.ML 57%

Are Hallucinations Bad Estimations?

Hude Liu, Jerry Yao-Chieh Hu, Jennifer Yuntong Zhang, Zhao Song, Han Liu

机构 * Center for Foundation Models and Generative AI, Northwestern University(基础模型与生成式人工智能中心,西北大学) Department of Computer Science, Northwestern University(计算机科学系,西北大学) Ensemble AI Engineering Science, University of Toronto(工程科学,多伦多大学) University of California, Berkeley(加州大学伯克利分校) Department of Statistics and Data Science, Northwestern University(统计与数据科学系,西北大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Code is available at https://github.com/MAGICS-LAB/hallucination

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21466 2025-09-29 cs.CV cs.AI cs.CL 57%

Gender Stereotypes in Professional Roles Among Saudis: An Analytical Study of AI-Generated Images Using Language Models

Khaloud S. AlKhalifah, Malak Mashaabi, Hend Al-Khalifa

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21874 2025-09-29 cs.LG 50%

Abductive Logical Rule Induction by Bridging Inductive Logic Programming and Multimodal Large Language Models

Yifei Peng, Yaoli Liu, Enbo Xia, Yu Jin, Wang-Zhou Dai, Zhong Ren, Yao-Xiang Ding, Kun Zhou

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室) National Key Laboratory for Novel Software Technology(新型软件技术国家实验室)

专题命中 文生图 :text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 4 篇

2509.21905 2025-09-29 cs.CV 83%

TDEdit: A Unified Diffusion Framework for Text-Drag Guided Image Manipulation

Qihang Wang, Yaxiong Wang, Lechao Cheng, Zhun Zhong

机构 * Hefei University of Technology(合肥工业大学)

专题命中 图像编辑 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15216 2025-09-29 cs.CV 79%

UIP2P: Unsupervised Instruction-based Image Editing via Edit Reversibility Constraint

Enis Simsar, Alessio Tonioni, Yongqin Xian, Thomas Hofmann, Federico Tombari

机构 * ETH Zürich - DALAB(苏黎世联邦理工学院- DALAB) Technical University of Munich(慕尼黑技术大学) Google Switzerland(瑞士谷歌)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

Comments Accepted to ICCV'25. Project page: https://uip2p.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20761 2025-09-29 cs.CV 70%

Unforgettable Lessons from Forgettable Images: Intra-Class Memorability Matters in Computer Vision

Jie Jing, Yongjian Huang, Serena J. -W. Wang, Shuangpeng Han, Lucia Schiatti, Yen-Ling Kuo, Qing Lin, Mengmi Zhang

机构 * Nanyang Technological University(南洋理工大学) Sichuan University(四川大学) Massachusetts Institute of Technology(麻省理工学院) Istituto Italiano di Tecnologia(意大利理工学院) University of Virginia(弗吉尼亚大学)

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21917 2025-09-29 cs.CV cs.MM 62%

Taming Flow-based I2V Models for Creative Video Editing

Xianghao Kong, Hansheng Chen, Yuwei Guo, Lvmin Zhang, Gordon Wetzstein, Maneesh Agrawala, Anyi Rao

机构 * HKUST(香港科技大学) Stanford University(斯坦福大学) CUHK(香港中文大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 57 篇

2501.12976 2025-09-29 cs.CV 89%

LiT: Delving into a Simple Linear Diffusion Transformer for Image Generation

Jiahao Wang, Ning Kang, Lewei Yao, Mengzhao Chen, Chengyue Wu, Songyang Zhang, Shuchen Xue, Yong Liu, Taiqiang Wu, Xihui Liu, Kaipeng Zhang, Shifeng Zhang, Wenqi Shao, Zhenguo Li, Ping Luo

机构 * HKU(香港大学) Shanghai AI Lab(上海人工智能实验室) Huawei Noah’s Ark Lab(华为诺亚实验室) UCAS(中国科学院大学) THUsz(华中科技大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments 20 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21887 2025-09-29 cs.CV cs.MM 84%

StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing

Liyang Chen, Tianze Zhou, Xu He, Boshi Tang, Zhiyong Wu, Yang Huang, Yang Wu, Zhongqian Sun, Wei Yang, Helen Meng

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22300 2025-09-29 cs.CV cs.AI cs.LG 83%

HiGS: History-Guided Sampling for Plug-and-Play Enhancement of Diffusion Models

Seyedmorteza Sadat, Farnood Salehi, Romann M. Weber

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05827 2025-09-29 cs.CV 83%

Self-Guidance: Boosting Flow and Diffusion Generation on Their Own

Tiancheng Li, Weijian Luo, Zhiyang Chen, Liyuan Ma, Guo-Jun Qi

机构 * Zhejiang University(浙江大学) MAPLE Lab, Westlake University(西湖大学MAPLE实验室) Peking University(北京大学) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖研究院先进技术研究所)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13674 2025-09-29 cs.CV cs.AI 83%

Diffusion Curriculum: Synthetic-to-Real Data Curriculum via Image-Guided Diffusion

Yijun Liang, Shweta Bhardwaj, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

Comments Accepted in ICCV2025. 22 pages, including references and appendix. Code is available at http://github.com/tianyi-lab/DisCL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08074 2025-09-29 cs.LG cs.CR cs.CV 83%

Unstable Unlearning: The Hidden Risk of Concept Resurgence in Diffusion Models

Vinith M. Suriyakumar, Rohan Alur, Ayush Sekhari, Manish Raghavan, Ashia C. Wilson

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments 30 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22636 2025-09-29 cs.CV cs.LG 79%

Scale-Wise VAR is Secretly Discrete Diffusion

Amandeep Kumar, Nithin Gopalakrishnan Nair, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

Comments Technical Reports

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22323 2025-09-29 cs.CV 79%

RAPID^3: Tri-Level Reinforced Acceleration Policies for Diffusion Transformer

Wangbo Zhao, Yizeng Han, Zhiwei Tang, Jiasheng Tang, Pengfei Zhou, Kai Wang, Bohan Zhuang, Zhangyang Wang, Fan Wang, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Hupan Lab(鸿篇实验室) ZIP Lab, Zhejiang University(浙江大学ZIP实验室) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22049 2025-09-29 eess.IV cs.CV cs.LG 79%

Comparative Analysis of GAN and Diffusion for MRI-to-CT translation

Emily Honey, Anders Helbo, Jens Petersen

机构 * Department of Computer Science, University of Copenhagen, Copenhagen, Denmark(哥本哈根大学计算机科学系) Department of Oncology, Rigshospitalet, Copenhagen, Denmark(哥本哈根医院肿瘤科)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21565 2025-09-29 cs.CV cs.AI cs.LG 79%

No Alignment Needed for Generation: Learning Linearly Separable Representations in Diffusion Models

Junno Yun, Yaşar Utku Alçalar, Mehmet Akçakaya

机构 * Department of Electrical & Computer Engineering, University of Minnesota(电气与计算机工程系,明尼苏达大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17427 2025-09-29 cs.CV 79%

Single-Image Depth from Defocus with Coded Aperture and Diffusion Posterior Sampling

Hodaka Kawachi, Jose Reinaldo Cunha Santos A. V. Silva Neto, Yasushi Yagi, Hajime Nagahara, Tomoya Nakamura

机构 * SANKEN, The University of Osaka(SANKEN,大阪大学) The University of Osaka(大阪大学) D3 center, The University of Osaka(D3中心,大阪大学) Graduate School of Engineering Science, The University of Osaka(工程科学研究院,大阪大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17560 2025-09-29 cs.CV 79%

Deeper Diffusion Models Amplify Bias

Shahin Hakemi, Naveed Akhtar, Ghulam Mubashar Hassan, Ajmal Mian

机构 * The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00220 2025-09-29 cs.LG cs.AI cs.CV 79%

Can Diffusion Models Disentangle? A Theoretical Perspective

Liming Wang, Muhammad Jehanzeb Mirza, Yishu Gong, Yuan Gong, Jiaqi Zhang, Brian H. Tracey, Katerina Placek, Marco Vilela, James R. Glass

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏