arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-09-30 至 2025-09-30 共收录 173 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 12 篇

2506.16853 2025-09-30 cs.LG 89%

Reward-Agnostic Prompt Optimization for Text-to-Image Diffusion Models

Semin Kim, Yeonwoo Cha, Jaehoon Yoo, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract)

Comments 29 pages, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23457 2025-09-30 cs.CV 86%

No Concept Left Behind: Test-Time Optimization for Compositional Text-to-Image Generation

Mohammad Hossein Sameti, Amir M. Mansourian, Arash Marioriyad, Soheil Fadaee Oshyani, Mohammad Hossein Rohban, Mahdieh Soleymani Baghshah

机构 * Sharif University of Technology(沙里夫技术大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

Comments 8 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22793 2025-09-30 cs.CV 85%

DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models

Komal Kumar, Rao Muhammad Anwer, Fahad Shahbaz Khan, Salman Khan, Ivan Laptev, Hisham Cholakkal

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

Comments 13 Figures, 21 pages, accepted in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21956 2025-09-30 cs.CV cs.AI cs.CL cs.LG 85%

Cross-modal RAG: Sub-dimensional Text-to-Image Retrieval-Augmented Generation

Mengdan Zhu, Senhao Cheng, Guangji Bai, Yifei Zhang, Liang Zhao

机构 * Emory University(埃默里大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01812 2025-09-30 cs.CV 85%

Leveraging BEV Paradigm for Ground-to-Aerial Image Synthesis

Junyan Ye, Jun He, Weijia Li, Zhutao Lv, Yi Lin, Jinhua Yu, Haote Yang, Conghui He

机构 * Sun Yat-Sen University(中山大学) Shanghai AI Laboratory(上海人工智能实验室) Sensetime Research(商汤科技研究院)

专题命中 文生图 :image synthesis(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to ICCV 2025, 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25027 2025-09-30 cs.CV 83%

STAGE: Stable and Generalizable GRPO for Autoregressive Image Generation

Xiaoxiao Ma, Haibo Qiu, Guohui Zhang, Zhixiong Zeng, Siqi Yang, Lin Ma, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Code available at https://github.com/krennic999/STAGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23639 2025-09-30 cs.CV cs.AI cs.LG 83%

LightFair: Towards an Efficient Alternative for Fair T2I Diffusion via Debiasing Pre-trained Text Encoders

Boyu Han, Qianqian Xu, Shilong Bao, Zhiyong Yang, Kangli Zi, Qingming Huang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) School of Computer Science and Tech., University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Peng Cheng Laboratory(鹏城实验室)

专题命中 文生图 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25122 2025-09-30 cs.CV 57%

Triangle Splatting+: Differentiable Rendering with Opaque Triangles

Jan Held, Renaud Vandeghen, Sanghyun Son, Daniel Rebain, Matheus Gadelha, Yi Zhou, Ming C. Lin, Marc Van Droogenbroeck, Andrea Tagliasacchi

机构 * University of Liège(利根大学) Simon Fraser University(西蒙弗雷泽大学) University of Maryland(马里兰大学) University of British Columbia(不列颠哥伦比亚大学) University of Toronto(多伦多大学) Adobe Research(Adobe研究)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments 9 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23555 2025-09-30 cs.CV 57%

From Fields to Splats: A Cross-Domain Survey of Real-Time Neural Scene Representations

Javed Ahmad, Penggang Gao, Donatien Delehelle, Mennuti Canio, Nikhil Deshpande, Jesús Ortiz, Darwin G. Caldwell, Yonas Teodros Tefera

机构 * Advanced Robotics, Istituto Italiano di Tecnologia (IIT)(先进机器人技术,意大利技术研究院) Istituto Nazionale per l’Assicurazione contro gli Infortuni sul Lavoro (INAIL)(国家职业伤害保险研究所) School of Computer Science, University of Nottingham(计算机科学学院,诺丁汉大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22940 2025-09-30 cs.CL cs.CV 57%

LLMs Behind the Scenes: Enabling Narrative Scene Illustration

Melissa Roemmele, John Joon Young Chung, Taewook Kim, Yuqian Sun, Alex Calderwood, Max Kreminski

机构 * Midjourney Northwestern University(西北大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18699 2025-09-30 cs.CV 57%

AGSwap: Overcoming Category Boundaries in Object Fusion via Adaptive Group Swapping

Zedong Zhang, Ying Tai, Jianjun Qian, Jian Yang, Jun Li

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Accepted to SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18450 2025-09-30 cs.CL 50%

BRIT: Bidirectional Retrieval over Unified Image-Text Graph

Ainulla Khan, Yamada Moyuru, Srinidhi Akella

机构 * Fujitsu Research India(富士通印度研究)

专题命中 文生图 :text-to-image(abstract)

Comments Accepted in EMNLP-2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 5 篇

2410.05694 2025-09-30 cs.CV 88%

DiffusionGuard: A Robust Defense Against Malicious Diffusion-based Image Editing

June Suk Choi, Kyungmin Lee, Jongheon Jeong, Saining Xie, Jinwoo Shin, Kimin Lee

机构 * KAIST(韩国国立科学技术院) Korea University(韩国大学) NYU(纽约大学)

专题命中 图像编辑 :diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02366 2025-09-30 cs.CV 86%

GenMix: Effective Data Augmentation with Generative Diffusion Model Image Editing

Khawar Islam, Muhammad Zaigham Zaheer, Arif Mahmood, Karthik Nandakumar, Naveed Akhtar

机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算与信息系统学院) Mohamed bin Zayed University of Artificial Intelligence, UAE(人工智能 Mohamed bin Zayed 大学) Information Technology University, Punjab, Pakistan(巴基斯坦旁遮普信息科技大学)

专题命中 图像编辑 :image editing(title,abstract);diffusion(title);分类 cs.CV

Comments https://diffusemix.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18159 2025-09-30 cs.CV cs.LG 83%

SpotEdit: Evaluating Visually-Guided Image Editing Methods

Sara Ghazanfari, Wei-An Lin, Haitong Tian, Ersin Yumer

机构 * New York University, US(纽约大学) Adobe Inc(Adobe公司)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24514 2025-09-30 cs.CV 79%

Instruction Guided Multi Object Image Editing with Quantity and Layout Consistency

Jiaqi Tan, Fangyu Li, Yang Liu

机构 * Beijing University of Posts(北京邮电大学) Telecommunications School of Digital Media(电信数字媒体学院)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02109 2025-09-30 cs.LG math.PR stat.ML 50%

Differentiable Expectation-Maximisation and Applications to Gaussian Mixture Model Optimal Transport

Samuel Boïté, Eloi Tanguy, Julie Delon, Agnès Desolneux, Rémi Flamary

机构 * Université Paris Cité, CNRS, MAP5(巴黎大学、国家科学研究中心、MAP5) CNRS(国家科学研究中心) ENS Paris-Saclay(巴黎-萨克雷大学) ECOLE POLYTECHNIQUE(巴黎高等理工学院) Institut Polytechnique de Paris(巴黎理工学院)

专题命中 图像编辑 :image generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 120 篇

2509.24875 2025-09-30 cs.CV cs.LG 88%

Environment-Aware Satellite Image Generation with Diffusion Models

Nikos Kostagiolas, Pantelis Georgiades, Yannis Panagakis, Mihalis A. Nicolaou

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09622 2025-09-30 cs.CV 85%

LoRACLR: Contrastive Adaptation for Customization of Diffusion Models

Enis Simsar, Thomas Hofmann, Federico Tombari, Pinar Yanardag

机构 * ETH Zürich(苏黎世联邦理工学院) TU Munich(慕尼黑技术大学) Google(谷歌) Virginia Tech(弗吉尼亚理工大学)

专题命中 扩散模型 :diffusion(title);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

Comments Accepted to CVPR'25. Project page: https://loraclr.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24369 2025-09-30 cs.CV cs.AI cs.MM 84%

From Satellite to Street: A Hybrid Framework Integrating Stable Diffusion and PanoGAN for Consistent Cross-View Synthesis

Khawlah Bajbaa, Abbas Anwar, Muhammad Saqib, Hafeez Anwar, Nabin Sharma, Muhammad Usman

机构 * Department of Information and Computer Science, King Fahd University of Petroleum and Minerals(信息与计算机科学系,国王法赫德石油与矿物大学) NCMI, CSIRO(CSIRO国家科学机构) Department of Computer Science, National University of Computer and Emerging Sciences (FAST-NUCES)(计算机科学系,国家计算机与新兴科学大学(FAST-NUCES)) Faculty of Engineering and IT, University of Technology Sydney(工程与信息技术学院,技术大学悉尼) Faculty of Science, University of Ontario Institute of Technology(科学学院, Ontario Institute of Technology大学)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.00796 2025-09-30 cs.LG cs.AI cs.CV 84%

Diffusion Models: A Comprehensive Survey of Methods and Applications

Ling Yang, Zhilong Zhang, Yang Song, Shenda Hong, Runsheng Xu, Yue Zhao, Wentao Zhang, Bin Cui, Ming-Hsuan Yang

机构 * Peking University(北京大学) OpenAI University of California, Los Angeles(加州大学洛杉矶分校) Carnegie Mellon University(卡内基梅隆大学) University of California at Merced(加州大学默塞德分校)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

Comments 59 pages, 19 figures, citing 396 (up-to-date) papers, project: https://github.com/YangLing0818/Diffusion-Models-Papers-Survey-Taxonomy, accepted by ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24128 2025-09-30 cs.CV 83%

GANji: A Framework for Introductory AI Image Generation

Chandon Hamel, Mike Busch

机构 * Anderson College of Business and Computing(安德森商学院与计算学院) Regis University(雷吉大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07936 2025-09-30 cs.CV eess.IV 83%

Feature Space Analysis by Guided Diffusion Model

Kimiaki Shirahama, Miki Yanobu, Kaduki Yamashita, Miho Ohsaki

机构 * Department of Information Systems Design, Doshisha University(信息系统设计系,多智大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments 37 pages, 13 figures, codes: https://github.com/KimiakiShirahama/FeatureSpaceAnalysisByGuidedDiffusionModel

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17324 2025-09-30 cs.LG cs.CV 83%

Origins of Creativity in Attention-Based Diffusion Models

Emma Finn, T. Anderson Keller, Manos Theodosis, Demba E. Ba

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22376 2025-09-30 cs.LG cs.AI cs.CL cs.CV 83%

Rare-to-Frequent: Unlocking Compositional Generation Power of Diffusion Models on Rare Concepts with LLM Guidance

Dongmin Park, Sebin Kim, Taehong Moon, Minkyu Kim, Kangwook Lee, Jaewoong Cho

机构 * KRAFTON Seoul National University(首尔国立大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

Comments ICLR 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23605 2025-09-30 cs.CV 83%

VMDiff: Visual Mixing Diffusion for Limitless Cross-Object Synthesis

Zeren Xiong, Yue Yu, Zedong Zhang, Shuo Chen, Jian Yang, Jun Li

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01467 2025-09-30 cs.CV 83%

Representation Entanglement for Generation: Training Diffusion Transformers Is Much Easier Than You Think

Ge Wu, Shen Zhang, Ruijing Shi, Shanghua Gao, Zhenyuan Chen, Lei Wang, Zhaowei Chen, Hongcheng Gao, Yao Tang, Jian Yang, Ming-Ming Cheng, Xiang Li

机构 * NKIARI, Shenzhen Futian(NKIARI,深圳福田) VCIP, CS, Nankai University(VCIP,计算机科学,南开大学) JIIOV Technology(JIIOV技术) Harvard University(哈佛大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21262 2025-09-30 cs.CL 82%

Un-Doubling Diffusion: LLM-guided Disambiguation of Homonym Duplication

Evgeny Kaskov, Elizaveta Petrova, Petr Surovtsev, Anna Kostikova, Ilya Mistiurin, Alexander Kapitanov, Alexander Nagaev

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23718 2025-09-30 cs.GR cs.CV cs.LG 81%

Diff-3DCap: Shape Captioning with Diffusion Models

Zhenyu Shu, Jiawei Wen, Shiyang Li, Shiqing Xin, Ligang Liu

机构 * School of Computer and Data Engineering, NingboTech University(宁波科技学院计算机与数据工程学院) Ningbo Institute, Zhejiang University(浙江大学宁波院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Computer Science and Technology, ShanDong University(山东大学计算机科学与技术学院) Graphics & Geometric Computing Laboratory, School of Mathematical Sciences, University of Science and Technology of China(中国科学技术大学数学科学学院图形与几何计算实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Journal ref IEEE Transactions on Visualization and Computer Graphics. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23709 2025-09-30 cs.GR cs.CV cs.LG 81%

StrucADT: Generating Structure-controlled 3D Point Clouds with Adjacency Diffusion Transformer

Zhenyu Shu, Jiajun Shen, Zhongui Chen, Xiaoguang Han, Shiqing Xin

机构 * School of Computer and Data Engineering, NingboTech University(计算机与数据工程学院,宁波科技学院) Ningbo Institute, Zhejiang University(浙江大学宁波院) School of Software Technology, Zhejiang University(浙江大学软件技术学院) School of Informatics, Xiamen University(厦门大学信息学院) Shenzhen Research Institute of Big Data, Chinese University of Hong Kong(香港中文大学深圳大数据研究院) School of Computer Science and Technology, ShanDong University(山东大学计算机科学与技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

Journal ref IEEE Transactions on Visualization and Computer Graphics. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏