arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-11-11 至 2025-11-11 共收录 9 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 9 篇

2511.05616 2025-11-11 cs.CV cs.AI 92%

Personalized Image Editing in Text-to-Image Diffusion Models via Collaborative Direct Preference Optimization

Connor Dunlop, Matthew Zheng, Kavana Venkatesh, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image editing(title,abstract);分类 cs.CV

Comments Published at NeurIPS'25 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19291 2025-11-11 cs.CV cs.AI 90%

TextDiffuser-RL: Efficient and Robust Text Layout Optimization for High-Fidelity Text-to-Image Synthesis

Kazi Mahathir Rahman, Showrin Rahman, Sharmin Sultana Srishty

机构 * BRAC University(布拉克大学)

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);image generation(abstract);diffusion(abstract)

Comments 19 pages, 36 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21227 2025-11-11 cs.CV cs.CL 86%

Evaluating the Evaluators: Metrics for Compositional Text-to-Image Generation

Seyed Amir Kasaei, Ali Aghayari, Arash Marioriyad, Niki Sepasian, MohammadAmin Fazli, Mahdieh Soleymani Baghshah, Mohammad Hossein Rohban

机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工大学计算机工程系)

专题命中 文生图 :image generation(title,abstract);text-to-image(title);分类 cs.CV

Comments Accepted at GenProCC NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06724 2025-11-11 cs.CV cs.DC 83%

Argus: Quality-Aware High-Throughput Text-to-Image Inference Serving System

Shubham Agarwal, Subrata Mitra, Saud Iqbal

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

Comments Accepted at Middleware 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06876 2025-11-11 cs.CV 79%

Generating an Image From 1,000 Words: Enhancing Text-to-Image With Structured Captions

Eyal Gutflaish, Eliran Kachlon, Hezi Zisman, Tal Hacham, Nimrod Sarid, Alexander Visheratin, Saar Huberman, Gal Davidi, Guy Bukchin, Kfir Goldberg, Ron Mokady

机构 * BRIA AI(BRIA人工智能)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21257 2025-11-11 cs.CV cs.CL 79%

Hallucination as an Upper Bound: A New Perspective on Text-to-Image Evaluation

Seyed Amir Kasaei, Mohammad Hossein Rohban

机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工大学计算机工程系)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

Comments Accepted at GenProCC NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06284 2025-11-11 cs.CV cs.CL cs.MM 73%

Enhancing Multimodal Misinformation Detection by Replaying the Whole Story from Image Modality Perspective

Bing Wang, Ximing Li, Yanjun Wang, Changchun Li, Lin Yuanbo Wu, Buyu Wang, Shengsheng Wang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.MM

Comments Accepted by AAAI 2026. 13 pages, 6 figures. Code: https://github.com/wangbing1416/RETSIMD

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05573 2025-11-11 cs.CV cs.AI 70%

Video Text Preservation with Synthetic Text-Rich Videos

Ziyang Liu, Kevin Valencia, Justin Cui

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01894 2025-11-11 cs.CV cs.AI cs.HC 70%

LIVS: A Pluralistic Alignment Dataset for Inclusive Public Spaces

Rashid Mushkani, Shravan Nayak, Hugo Berard, Allison Cohen, Shin Koseki, Hadrien Bertrand

机构 * Mila–Quebec AI Institute(魁北克AI研究所)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏