arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-08-26 至 2025-08-26 共收录 10 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 10 篇

2508.17760 2025-08-26 cs.CV cs.CL 92%

CEIDM: A Controlled Entity and Interaction Diffusion Model for Enhanced Text-to-Image Generation

Mingyue Yang, Dianxi Shi, Jialu Zhou, Xinyu Wei, Leqian Li, Shaowu Yang, Chunping Qiu

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17718 2025-08-26 cs.CV cs.AI 89%

Instant Preference Alignment for Text-to-Image Diffusion Models

Yang Li, Songlin Yang, Xiaoxuan Han, Wei Wang, Jing Dong, Yueming Lyu, Ziyu Xue

机构 * New Laboratory of Pattern Recognition, CASIA(模式识别新实验室,中国科学院自动化研究所) The Hong Kong University of Science and Technology(香港科技大学) Nanjing university(南京大学) Academy of Broadcasting Science, NRTA(广播科学研究院,国家广播电视总局)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

Comments 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13195 2025-08-26 cs.CV 88%

CoMPaSS: Enhancing Spatial Understanding in Text-to-Image Diffusion Models

Gaoyang Zhang, Bingtao Fu, Qingnan Fan, Qi Zhang, Runxing Liu, Hong Gu, Huaqi Zhang, Xinguo Liu

机构 * Zhejiang University(浙江大学) vivo Ant Group(蚂蚁集团)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

Comments 21 pages, 12 figures. Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13211 2025-08-26 cs.CV cs.AI 88%

MedLoRD: A Medical Low-Resource Diffusion Model for High-Resolution 3D CT Image Synthesis

Marvin Seyfarth, Salman Ul Hassan Dar, Isabelle Ayx, Matthias Alexander Fink, Stefan O. Schoenberg, Hans-Ulrich Kauczor, Sandy Engelhardt

机构 * Institute for Artificial Intelligence in Cardiovascular Medicine(心血管医学人工智能研究所) Heidelberg University Hospital(海德堡大学医院) AI Health Innovation Cluster (AIH)(人工智能健康创新集群) Heidelberg Faculty of Medicine(海德堡医学院) German Centre for Cardiovascular Research (DZHK)(德国心脏病研究中心) University Medical Center Mannheim(曼海姆大学医学中心) Clinic for Diagnostic and Interventional Radiology(诊断与介入放射科诊所)

专题命中 文生图 :diffusion(title,abstract);image synthesis(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17472 2025-08-26 cs.CV 86%

T2I-ReasonBench: Benchmarking Reasoning-Informed Text-to-Image Generation

Kaiyue Sun, Rongyao Fang, Chengqi Duan, Xian Liu, Xihui Liu

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

Comments Code: https://github.com/KaiyueSun98/T2I-ReasonBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16752 2025-08-26 cs.CV 85%

A Framework for Benchmarking Fairness-Utility Trade-offs in Text-to-Image Models via Pareto Frontiers

Marco N. Bochernitsan, Rodrigo C. Barros, Lucas S. Kupssinskü

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14174 2025-08-26 cs.HC 78%

Steering Large Text-to-Image Model for Abstract Art Synthesis: Preference-based Prompt Optimization and Visualization

Aven-Le Zhou, Wei Wu, Yu-Ao Wang, Kang Zhang

专题命中 文生图 :text-to-image(title,abstract)

Comments arXiv admin note: text overlap with arXiv:2402.06389

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08505 2025-08-26 cs.CV eess.IV 77%

Yuan: Yielding Unblemished Aesthetics Through A Unified Network for Visual Imperfections Removal in Generated Images

Zhenyu Yu, Chee Seng Chan

专题命中 文生图 :text-to-image(abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

Journal ref AAAI 2025, Vol. 39, No. 9, pp. 9716-9724

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03001 2025-08-26 cs.CV cs.MM 73%

One Framework to Rule Them All: Unifying Multimodal Tasks with LLM Neural-Tuning

Hao Sun, Yu Song, Jiaqing Liu, Jihong Hu, Yen-Wei Chen, Lanfen Lin

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12698 2025-08-26 eess.IV cs.CV 70%

Pixel Perfect MegaMed: A Megapixel-Scale Vision-Language Foundation Model for Generating High Resolution Medical Images

Zahra TehraniNasab, Hujun Ni, Amar Kumar, Tal Arbel

机构 * McGill University(麦吉尔大学) MILA-Quebec AI Institute(魁北克AI研究所)

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏