arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-09-30 至 2025-09-30 共收录 12 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 12 篇

2506.16853 2025-09-30 cs.LG 89%

Reward-Agnostic Prompt Optimization for Text-to-Image Diffusion Models

Semin Kim, Yeonwoo Cha, Jaehoon Yoo, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract)

Comments 29 pages, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23457 2025-09-30 cs.CV 86%

No Concept Left Behind: Test-Time Optimization for Compositional Text-to-Image Generation

Mohammad Hossein Sameti, Amir M. Mansourian, Arash Marioriyad, Soheil Fadaee Oshyani, Mohammad Hossein Rohban, Mahdieh Soleymani Baghshah

机构 * Sharif University of Technology(沙里夫技术大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

Comments 8 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22793 2025-09-30 cs.CV 85%

DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models

Komal Kumar, Rao Muhammad Anwer, Fahad Shahbaz Khan, Salman Khan, Ivan Laptev, Hisham Cholakkal

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

Comments 13 Figures, 21 pages, accepted in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21956 2025-09-30 cs.CV cs.AI cs.CL cs.LG 85%

Cross-modal RAG: Sub-dimensional Text-to-Image Retrieval-Augmented Generation

Mengdan Zhu, Senhao Cheng, Guangji Bai, Yifei Zhang, Liang Zhao

机构 * Emory University(埃默里大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01812 2025-09-30 cs.CV 85%

Leveraging BEV Paradigm for Ground-to-Aerial Image Synthesis

Junyan Ye, Jun He, Weijia Li, Zhutao Lv, Yi Lin, Jinhua Yu, Haote Yang, Conghui He

机构 * Sun Yat-Sen University(中山大学) Shanghai AI Laboratory(上海人工智能实验室) Sensetime Research(商汤科技研究院)

专题命中 文生图 :image synthesis(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

Comments Accepted to ICCV 2025, 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25027 2025-09-30 cs.CV 83%

STAGE: Stable and Generalizable GRPO for Autoregressive Image Generation

Xiaoxiao Ma, Haibo Qiu, Guohui Zhang, Zhixiong Zeng, Siqi Yang, Lin Ma, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

Comments Code available at https://github.com/krennic999/STAGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23639 2025-09-30 cs.CV cs.AI cs.LG 83%

LightFair: Towards an Efficient Alternative for Fair T2I Diffusion via Debiasing Pre-trained Text Encoders

Boyu Han, Qianqian Xu, Shilong Bao, Zhiyong Yang, Kangli Zi, Qingming Huang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) School of Computer Science and Tech., University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Peng Cheng Laboratory(鹏城实验室)

专题命中 文生图 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25122 2025-09-30 cs.CV 57%

Triangle Splatting+: Differentiable Rendering with Opaque Triangles

Jan Held, Renaud Vandeghen, Sanghyun Son, Daniel Rebain, Matheus Gadelha, Yi Zhou, Ming C. Lin, Marc Van Droogenbroeck, Andrea Tagliasacchi

机构 * University of Liège(利根大学) Simon Fraser University(西蒙弗雷泽大学) University of Maryland(马里兰大学) University of British Columbia(不列颠哥伦比亚大学) University of Toronto(多伦多大学) Adobe Research(Adobe研究)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments 9 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23555 2025-09-30 cs.CV 57%

From Fields to Splats: A Cross-Domain Survey of Real-Time Neural Scene Representations

Javed Ahmad, Penggang Gao, Donatien Delehelle, Mennuti Canio, Nikhil Deshpande, Jesús Ortiz, Darwin G. Caldwell, Yonas Teodros Tefera

机构 * Advanced Robotics, Istituto Italiano di Tecnologia (IIT)(先进机器人技术,意大利技术研究院) Istituto Nazionale per l’Assicurazione contro gli Infortuni sul Lavoro (INAIL)(国家职业伤害保险研究所) School of Computer Science, University of Nottingham(计算机科学学院,诺丁汉大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22940 2025-09-30 cs.CL cs.CV 57%

LLMs Behind the Scenes: Enabling Narrative Scene Illustration

Melissa Roemmele, John Joon Young Chung, Taewook Kim, Yuqian Sun, Alex Calderwood, Max Kreminski

机构 * Midjourney Northwestern University(西北大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18699 2025-09-30 cs.CV 57%

AGSwap: Overcoming Category Boundaries in Object Fusion via Adaptive Group Swapping

Zedong Zhang, Ying Tai, Jianjun Qian, Jian Yang, Jun Li

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

Comments Accepted to SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18450 2025-09-30 cs.CL 50%

BRIT: Bidirectional Retrieval over Unified Image-Text Graph

Ainulla Khan, Yamada Moyuru, Srinidhi Akella

机构 * Fujitsu Research India(富士通印度研究)

专题命中 文生图 :text-to-image(abstract)

Comments Accepted in EMNLP-2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏