Text-to-Image Synthesis Based on Machine Generated Captions
专题命中 文生图 :image synthesis(title,abstract);text-to-image(title)
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
专题命中 文生图 :image synthesis(title,abstract);text-to-image(title)
TAMF-VTON:通过高保真图像合成实现纹理感知无掩码虚拟试穿
机构 * State Key Lab of CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) ; Style3D Research China(中国凌迪科技风格实验室)
专题命中 文生图 :image synthesis(title,abstract);diffusion(abstract);inpainting(abstract);分类 cs.CV
AI总结 TAMF-VTON旨在解决虚拟试穿方法局限,通过统一生成管道,含轻量级专家混合适应方案、频域监督机制和强大数据管理管道,实现无掩码、多服装组合、纹理保留及高效推理,优于现有方法,为数字时尚提供可行方案。
用于文本到图像上下文学习的思维树推理
机构 * Korea University(韩国大学)
专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV
AI总结 研究文本到图像上下文学习中模型的推理问题,提出思维树推理框架,通过多阶段推理和选择层减轻提示模糊性与组合错误,实验表明该结构化多分支推理能提升图像生成效果,无需额外训练或微调。
Comments 6 pages, 3 figures, 4 tables. Accepted at IEEE SMC 2026. Code available at https://github.com/Pandastep/ToT-T2I-ICL
GEAR: 引导式端到端自回归图像合成
机构 * Peking University(北京大学) ; Tencent Hunyuan(腾讯混元)
专题命中 文生图 :image synthesis(title);image generation(abstract);text-to-image(abstract);diffusion(abstract)
AI总结 提出GEAR方法,通过表示对齐联合训练VQ分词器和自回归生成器,解决非可微索引导致的梯度问题,实现端到端优化,显著加速ImageNet gFID收敛并提升特征质量。
Qwen-Image-Bench:从生成到创造——文本到图像评估
机构 * Alibaba(阿里巴巴)
专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV
AI总结 针对现有文本到图像评估基准缺乏对真实世界保真度和创造性生成能力的考量,本文提出Qwen-Image-Bench,一个与专业艺术家共同设计的创作者中心基准,通过分层分类体系、1000个分层提示和基于Qwen3.6-27B的统一评判模型Q-Judger,实现细粒度、可归因的诊断,有效区分领先的T2I模型。
文生图模型对文本编码器的依赖比你想象的要少
机构 * Technion – Israel Institute of Technology(技术学院 – 以色列理工学院) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文发现基于扩散Transformer的文生图模型主要依赖文本编码器提供的单词含义和词序信息,而非完整的上下文信息,并通过构建仅含位置标记词袋的嵌入验证了这一观点。
Comments Project webpage: https://nsping13.github.io/contextless-TTI/
SurrogateSHAP:文本到图像(T2I)模型的无训练贡献者归因
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 针对文本到图像扩散模型中数据贡献者公平估值的高计算成本问题,提出基于预训练模型推理的无重训练框架SurrogateSHAP,利用梯度提升树近似效用函数并解析计算Shapley值,在多个任务上以更低开销超越现有方法。
基于超高清图像合成的空间图对齐
机构 * Beihang University(北航大学)
专题命中 文生图 :image synthesis(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出空间图对齐(SGA)方法,通过利用视觉基础模型的表示先验,保留LDMs的生成能力,解决超高清图像合成中生成质量与结构完整性之间的冲突,实现高质量的文本到图像合成。
Comments Technical Report
Z-Erase:在单流扩散变换器中实现概念擦除
机构 * Beijing Advanced Innovation Center for Future Blockchain(未来区块链与隐私计算北京创新中心) ; Privacy Computing, School of Artificial Intelligence, Beihang University(隐私计算,北京航空航天大学人工智能学院) ; University of Science(科学大学) ; Shanghai University(上海大学) ; Tencent(腾讯) ; Beijing Academy of Blockchain(北京区块链研究院)
专题命中 文生图 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 本文提出Z-Erase,一种专为单流T2I模型设计的概念擦除方法,通过解耦更新和平衡擦除与保留的权衡,解决生成崩溃问题,实现SOTA性能。
T2I-BiasBench:一个用于审计文本到图像模型中人口和文化偏见的多指标框架
机构 * Department of Information Technology, Rajkiya Engineering College Banda(拉贾基亚工程学院班达信息科技系) ; School of AI and Data Science, Indian Institute of Technology Jodhpur(印度理工学院乔普拉人工智能与数据科学学院)
专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出T2I-BiasBench框架,通过十三个互补指标评估扩散模型中的偏见、元素缺失和文化崩溃,揭示了开源模型在人口和文化偏见方面的表现。
GLEaN:一种面向公众理解的文本到图像偏见检测方法
机构 * Duke University(杜克大学)
专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 GLEaN通过生成图像和面部特征分析,直观展示文本到图像模型的偏见,使公众能快速理解模型对不同身份提示的偏见表现。
当理解成为风险:新兴图像生成范式中的真实性与安全性风险
机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) ; Xi’an Jiaotong University(西安交通大学) ; Flexera(Flexera公司)
专题命中 文生图 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV
AI总结 本文研究了多模态大语言模型在图像生成中的安全性风险,发现其在语义理解能力上强于扩散模型,但生成不安全内容和伪造图像的风险更高,挑战现有检测方法。
Comments Accepted by CVPR 2026. 15 pages, 11 figures
RAISE:基于需求的进化精炼用于无训练文本到图像对齐
机构 * Department of ECE, University of Alberta, Canada(阿尔伯塔大学电子工程系) ; Huawei Technologies, Canada(华为技术有限公司)
专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 RAISE是一种无训练、需求驱动的进化框架,通过动态调整生成过程实现高效且通用的文本到图像对齐。
Comments CVPR 2026
UniReason 1.0: 一个统一的推理框架,用于世界知识对齐的图像生成与编辑
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; Zhejiang University(浙江大学) ; University of Southern California(美国南加州大学)
专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV
AI总结 UniReason 1.0通过统一推理框架整合图像生成与编辑,利用世界知识增强文本推理和视觉优化,提升复杂合成任务的性能。
PromptRL: 流基于图像生成中强化学习中提示的重要性
机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) ; Meta Superintelligence Labs, USA(Meta超智能实验室)
专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV
AI总结 PromptRL通过整合语言模型作为可训练的提示精修代理,提升流基于图像生成中强化学习的性能和效率。
IRIS:内在奖励图像合成
机构 * Department of Computer Science, University of California, Los Angeles, USA(计算机科学系,加州大学洛杉矶分校)
专题命中 文生图 :image synthesis(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 IRIS通过内在奖励提升自回归T2I模型性能,改进图像生成质量并促进细致推理。
无需训练的文本到图像组合食品生成 via 提示嫁接
机构 * Elmore Family School of Electrical and Computer Engineering, Purdue University(电气与计算机工程学院,普渡大学) ; Department of Systems Design Engineering, University of Waterloo(系统设计工程系,滑铁卢大学)
专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 无需训练的文本到图像组合食品生成方法通过提示嫁接实现对多食物图像生成的可控分离。
Comments Accepted by CAI2026
Speak the Art: 一种直接语音到图像生成框架
专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.MM
AI总结 本文提出Speak the Art框架,通过改进语音嵌入和使用扩散模型,实现更稳定和多样化的语音到图像生成,并验证了多语言扩展的可行性。
通过统一生成模型中的多模态推理链提升图像生成
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV
AI总结 本文通过引入多模态推理链提升统一生成模型的复杂图像生成能力,提出FoXperts架构和MCoT方法,实现更高效的多模态生成。
一层就够:适应预训练视觉编码器进行图像生成
机构 * Apple(苹果公司)
专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 FAE通过单层注意力机制将预训练视觉编码器适应到低维潜在空间,实现高效且高质量的图像生成。
无需调优的色彩-纹理解耦用于风格化图像生成
机构 * Harbin Institute of Technology, China(哈尔滨工业大学) ; VCIP, CS, Nankai University, China(南开大学) ; Computer Vision Center, Spain(西班牙计算机视觉中心) ; Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学) ; Program of Computer Science, City University of Hong Kong (Dongguan), China(香港城市大学(东莞)计算机科学系) ; City University of Hong Kong, HK SAR, China(香港城市大学)
专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出无需调优的SADis方法,通过分离颜色-纹理嵌入提升风格化图像生成的精度与定制能力。
Comments Accepted by NeurIPS2025. Code is available at https://deepffff.github.io/sadis.github.io/
分块进展:用于自回归图像生成的测试时扩展
专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV
AI总结 GridAR通过网格分区逐步生成和布局指定提示重述策略,在有限测试时扩展下提升视觉自回归模型的生成质量与编辑效果。
Comments Project page: https://grid-ar.github.io/
机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ; Insta360 Research(Insta360研究院) ; National University of Singapore(新加坡国立大学) ; The University of Tokyo(东京大学)
专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
Comments NeurIPS 2025
机构 * University of Waterloo(滑铁卢大学) ; Vector Institute(向量研究所) ; Google(谷歌)
专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV
机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)
专题命中 文生图 :image synthesis(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV
机构 * The Chinese University of Hong Kong(香港中文大学) ; University of Oxford(牛津大学) ; University of Cambridge(剑桥大学) ; Trinity College Dublin(都柏林大学三一学院)
专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV
Comments Neurips 2025
机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) ; vivo Mobile Communication Co., Ltd., China(vivo移动通信有限公司)
专题命中 文生图 :image synthesis(title);image generation(abstract);text-to-image(abstract);diffusion(abstract)
Comments Accepted by NeurIPS 2025
机构 * Heidelberg University(海德堡大学)
专题命中 文生图 :image synthesis(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV
机构 * Baidu VIS(百度视觉) ; National University of Singapore(新加坡国立大学)
专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV
Comments 23 pages, 10 figures
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);分类 cs.CV
Comments 13 Figures, 21 pages, accepted in NeurIPS 2025