arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-11 至 2026-02-11 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 5 篇

2602.09165 2026-02-11 cs.CV 89%

All-in-One Conditioning for Text-to-Image Synthesis

文本到图像合成的综合条件化

Hirunima Jayasekara, Chuong Huynh, Yixuan Ren, Christabel Acquaye, Abhinav Shrivastava

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 文生图 :text-to-image(title,abstract);image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出基于场景图的零样本条件化机制,通过轻量级语言模型生成视觉条件,提升文本到图像合成的语义一致性和生成多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22761 2026-02-11 cs.CV cs.AI 83%

MILR: Improving Multimodal Image Generation via Test-Time Latent Reasoning

MILR:通过测试时潜在推理改进多模态图像生成

Yapeng Mi, Yanpeng Zhao, Hengli Li, Chenxi Li, Huimin Wu, Xiaojian Ma, Song-Chun Zhu, Ying Nian Wu, Qing Li

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室) Peking University(北京大学) Tsinghua University(清华大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 文生图 :image generation(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 MILR通过测试时潜在推理提升多模态图像生成性能,实现跨模态推理和统一潜在空间优化。

Comments 21 pages,14 figures,9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09775 2026-02-11 cs.CV 70%

Where Do Images Come From? Analyzing Captions to Geographically Profile Datasets

图像来自哪里?通过分析描述词地理上剖析数据集

Abhipsa Basu, Yugam Bahl, Kirti Bhagat, Preethi Seshadri, R. Venkatesh Babu, Danish Pruthi

机构 * Indian Institute of Science, Bangalore(印度科学研究院,班加罗尔) TNSQ AI(TNSQ人工智能) University of California, Irvine(加州大学尔湾分校)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究通过分析图像描述词地理分布,发现训练数据严重偏向欧美国家,且代表性与GDP正相关,但生成图像的多样性不足。

Comments 41 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09439 2026-02-11 cs.CV 70%

Fine-T2I: An Open, Large-Scale, and Diverse Dataset for High-Quality T2I Fine-Tuning

Fine-T2I: 一个大规模、高质量且多样化的开放数据集用于高质量T2I微调

Xu Ma, Yitian Zhang, Qihua Dong, Yun Fu

机构 * Department of Electrical \& Computer Engineering, Northeastern University, Boston

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 Fine-T2I是一个大规模高质量开放数据集,通过结合合成和真实图像,提升T2I微调的生成质量和指令遵循性。

Comments Dataset: https://huggingface.co/datasets/ma-xu/fine-t2i

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10023 2026-02-11 cs.CL 50%

MEVER: Multi-Modal and Explainable Claim Verification with Graph-based Evidence Retrieval

MEVER:基于图的证据检索的多模态和可解释性声明验证

Delvin Ce Zhang, Suhan Cui, Zhelin Chu, Xianren Zhang, Dongwon Lee

机构 * University of Sheffield(谢菲尔德大学) University of Science and Technology Beijing(北京科技大学) University of California San Diego(加州大学圣地亚哥分校) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 文生图 :text-to-image(abstract)

AI总结 MEVER通过多模态图检索和解释生成,实现了准确且可解释的声明验证,同时创建了AI领域的科学数据集AIChartClaim。

Comments Accepted to EACL-26

详情

展开后加载摘要…

URL PDF HTML 收藏