arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-09-22 至 2025-09-22 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 7 篇

2509.15962 2025-09-22 cs.AI 87%

Structured Information for Improving Spatial Relationships in Text-to-Image Generation

Sander Schildermans, Chang Tian, Ying Jiao, Marie-Francine Moens

专题命中 文生图 :text-to-image(title,abstract);image generation(title,comments)

Comments text-to-image generation, structured information, spatial relationship

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16141 2025-09-22 cs.CV 83%

AcT2I: Evaluating and Improving Action Depiction in Text-to-Image Models

Vatsal Malaviya, Agneet Chatterjee, Maitreya Patel, Yezhou Yang, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

Comments Project Page : https://vatsal-malaviya.github.io/AcT2I/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15803 2025-09-22 cs.CV cs.AI 79%

CIDER: A Causal Cure for Brand-Obsessed Text-to-Image Models

Fangjian Shen, Zifeng Liang, Chao Wang, Wushao Wen

机构 * School of Computer Science(计算机科学学院) Engineering, Sun Yat-sen University, Guangzhou, China(工程学院,中山大学,广州,中国)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

Comments 5 pages, 7 figures, submitted to ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16197 2025-09-22 cs.CV cs.CL cs.LG 77%

MANZANO: A Simple and Scalable Unified Multimodal Model with a Hybrid Vision Tokenizer

Yanghao Li, Rui Qian, Bowen Pan, Haotian Zhang, Haoshuo Huang, Bowen Zhang, Jialing Tong, Haoxuan You, Xianzhi Du, Zhe Gan, Hyunjik Kim, Chao Jia, Zhenbang Wang, Yinfei Yang, Mingfei Gao, Zi-Yi Dou, Wenze Hu, Chang Gao, Dongxu Li, Philipp Dufter, Zirui Wang, Guoli Yin, Zhengdong Zhang, Chen Chen, Yang Zhao, Ruoming Pang, Zhifeng Chen

机构 * Apple(苹果公司)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15270 2025-09-22 cs.CV cs.AI 70%

PRISM: Phase-enhanced Radial-based Image Signature Mapping framework for fingerprinting AI-generated images

Emanuele Ricco, Elia Onofri, Lorenzo Cima, Stefano Cresci, Roberto Di Pietro

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15391 2025-09-22 cs.CV 57%

RaceGAN: A Framework for Preserving Individuality while Converting Racial Information for Image-to-Image Translation

Mst Tasnim Pervin, George Bebis, Fang Jiang, Alireza Tavakkoli

机构 * 1 2 4 Department of Computer Science \& Engineering, 3 Department of Psychology, University of Nevada, Reno, USA Email: 1 , 2 , 3 , 4

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

Journal ref ICMLA 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15432 2025-09-22 cs.IR 50%

SERVAL: Surprisingly Effective Zero-Shot Visual Document Retrieval Powered by Large Vision and Language Models

Thong Nguyen, Yibin Lei, Jia-Huei Ju, Andrew Yates

专题命中 文生图 :text-to-image(abstract)

Comments Accepted

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏