arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-31 至 2026-08-31 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2608.28206 2026-08-31 cs.CV cs.DB 新提交 79%

NumBench: Diagnosing Counting Failures in Text-to-Image Models

NumBench:诊断文本到图像模型中的计数失败问题

Sandeep Wadhwa, Mayank Vatsa, Richa Singh, Parrva Chirag Shah, Prakhar Galriya

机构 * Indian Institute of Technology Jodhpur(焦特布尔印度理工学院) Shiv Nadar University(希夫·纳达尔大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 该研究推出NumBench基准数据集,构建过程模型与置信度加权数值精确率指标,评估发现文本到图像模型计数性能随请求数增加而下降,50个以上时表现薄弱,且方法可跨模板迁移。

Comments The compiled main paper has seven technical-content pages; references start on page 8. The compiled supplement has three pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28339 2026-08-31 cs.CV 新提交 70%

Abstract4D: A Large-Scale Dataset and Framework for Understanding the Visual Language of Abstract Art

Abstract4D:用于理解抽象艺术视觉语言的大规模数据集与框架

Haowei Zhang, Yuanpei Zhao, Ji-Zhe Zhou, Mao Li

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 该研究推出Abstract4D数据集,通过人机混合注释流程构建超12万张抽象绘画数据,开展语义结构分析并建立基准任务,助力评估AI对抽象艺术视觉语言的表征与解读能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28248 2026-08-31 cs.CV cs.CL 新提交 57%

Synth-JDoc: Synthesizing a Japanese Document Image Dataset for OCR with Diverse Layouts and Embedded Images

Synth-JDoc:用于OCR的、包含多样布局与嵌入图像的日文文档图像数据集合成

Keito Sasagawa, Shuhei Kurita, Daisuke Kawahara

机构 * Waseda University(早稻田大学) NII(信息学研究所) NII LLMC(信息学研究所语言媒体研究中心)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本研究构建了含多样布局与嵌入图像的日文文档合成OCR数据集,可有效提升大型视觉语言模型读取竖排日文文本的性能,相关资源已公开。

Comments Accepted to ICDAR 2026, 17pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28001 2026-08-31 cs.HC cs.MA 新提交 50%

FocusGen: Expanding Visual Design Exploration with a Simulated Focus Group of Persona Agents

FocusGen:通过模拟角色智能体的虚拟焦点小组拓展视觉设计探索

Jaewon Choi, Helena Vasconcelos, Hyun Lee, Carolyn Zou, Tak Yeon Lee, Michael Bernstein

专题命中 文生图 :text-to-image(abstract)

AI总结 FocusGen是引入虚拟角色智能体焦点小组的交互式视觉设计系统,可拓展设计探索、提升输出多样性,助力设计师突破思维定式,同时存在刻板印象风险,为早期构思提供发散支架。

Comments 18 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏