arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-16 至 2026-01-16 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3 篇

2601.10332 2026-01-16 cs.CV 89%

Think-Then-Generate: Reasoning-Aware Text-to-Image Diffusion with LLM Encoders

思考-然后-生成:基于LLM编码器的推理感知文本到图像扩散模型

Siqi Kou, Jiachun Jin, Zetong Zhou, Ye Ma, Yugang Wang, Quan Chen, Peng Jiang, Xiao Yang, Jun Zhu, Kai Yu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技) Tsinghua University(清华大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出基于LLM编码器的推理感知文本到图像扩散模型,通过推理重写提示提升生成质量,达到接近GPT-4的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10061 2026-01-16 cs.CV cs.AI 88%

CoF-T2I: Video Models as Pure Visual Reasoners for Text-to-Image Generation

CoF-T2I: 视频模型作为纯视觉推理器用于文本到图像生成

Chengzhuo Tong, Mingkun Chang, Shenglong Zhang, Yuran Wang, Cheng Liang, Zhizheng Zhao, Ruichuan An, Bohan Zeng, Yang Shi, Yifan Dai, Ziming Zhao, Guanbin Li, Pengfei Wan, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Nanjing University(南京大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 CoF-T2I通过引入链式帧推理提升文本到图像生成的质量,通过逐步视觉细化和显式推理步骤实现高质量图像生成。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12805 2026-01-16 cs.CV 88%

AITTI: Learning Adaptive Inclusive Token for Text-to-Image Generation

AITTI: 学习自适应包容性令牌以生成文本到图像

Xinyu Hou, Xiaoming Li, Chen Change Loy

机构 * Nanyang Technological University(南洋理工大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 AITTI通过学习自适应包容性令牌,有效缓解文本到图像生成中的刻板印象偏见,无需显式属性指定或先验知识。

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏