arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-21 至 2026-01-21 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 7 篇

2504.13745 2026-01-21 cs.CV cs.AI 88%

ESPLoRA: Enhanced Spatial Precision with Low-Rank Adaption in Text-to-Image Diffusion Models for High-Definition Synthesis

ESPLoRA: 基于低秩适应的文本到图像扩散模型中增强空间精度以实现高清晰度合成

Andrea Rigo, Luca Stornaiuolo, Mauro Martino, Bruno Lepri, Nicu Sebe

机构 * DISI, University of Trento(DISI,特伦托大学) Toretei S.r.l.(Toretei公司) Visual AI Lab, MIT-IBM Watson AI Lab(视觉人工智能实验室,MIT-IBM Watson人工智能实验室) Fondazione Bruno Kessler(布鲁诺·凯撒基金会)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 ESPLoRA通过低秩适应提升文本到图像扩散模型的空间一致性,利用改进的评估指标和TORE算法优化生成图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13866 2026-01-21 cs.CV 88%

SAGA: Learning Signal-Aligned Distributions for Improved Text-to-Image Generation

SAGA:学习信号对齐的分布以提高文本到图像生成

Paul Grimal, Michaël Soumm, Hervé Le Borgne, Olivier Ferret, Akihiro Sugimoto

机构 * Université Paris-Saclay, CEA, List(巴黎-萨克雷大学,CEA,List) Télécom Paris(巴黎电信学院) National Institute of Informatics, Japan(日本信息处理研究所)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 SAGA 通过学习信号对齐的分布,提高文本到图像生成的准确性与控制性,支持多种条件模式并优于现有方法。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13462 2026-01-21 cs.AI 88%

SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation

SpatialBench-UC: 文本到图像生成中空间提示遵循的不确定性感知评估

Amine Rostane

机构 * ESIEA

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract)

AI总结 SpatialBench-UC通过评估文本到图像生成中空间提示遵循的不确定性,提出了一个可重复的基准测试,以提高模型在空间指令下的表现和置信度评估。

Comments 19 pages, includes figures and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00591 2026-01-21 cs.CV cs.AI cs.CR 87%

Wukong Framework for Not Safe For Work Detection in Text-to-Image systems

Wukong框架用于文本到图像系统中的不安全内容检测

Mingrui Liu, Sixiao Zhang, Cheng Long

机构 * Nanyang Technological University(南洋理工大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);diffusion(abstract);image synthesis(abstract)

AI总结 Wukong通过利用扩散过程早期的去噪步骤和U-Net的预训练交叉注意力参数,实现高效的不安全内容检测,优于传统文本和图像过滤方法。

Comments Accepted by KDD'26 (round 1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21099 2026-01-21 cs.CV cs.AI cs.CR 86%

Beyond the Safety Tax: Mitigating Unsafe Text-to-Image Generation via External Safety Rectification

超越安全税:通过外部安全校正缓解不安全的文本到图像生成

Xiangtao Meng, Yingkai Dong, Ning Yu, Li Wang, Zheng Li, Shanqing Guo

机构 * Shandong University(山东大学) Netflix Eyeline Studios

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出SafePatch,通过外部安全校正机制有效抑制文本到图像生成中的不安全内容,同时保持生成质量与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11614 2026-01-21 cs.CV cs.LG q-bio.NC 83%

Multi-modal MRI-Based Alzheimer's Disease Diagnosis with Transformer-based Image Synthesis and Transfer Learning

基于多模态MRI的阿尔茨海默病诊断:基于Transformer的图像合成与迁移学习

Jason Qiu

机构 * Marvin Ridge High School(马文岭高中)

专题命中 文生图 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究提出基于Transformer的图像合成方法,利用T1w MRI预测FA和MD,提升AD诊断准确率和MCI检测能力。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08835 2026-01-21 cs.CV cs.AI cs.CL 79%

CulturalFrames: Assessing Cultural Expectation Alignment in Text-to-Image Models and Evaluation Metrics

CulturalFrames: 评估文本到图像模型与评估指标中的文化期望一致性

Shravan Nayak, Mehar Bhatia, Xiaofeng Zhang, Verena Rieser, Lisa Anne Hendricks, Sjoerd van Steenkiste, Yash Goyal, Karolina Stańczak, Aishwarya Agrawal

机构 * Mila – Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) Google Research(谷歌研究) Google DeepMind(谷歌DeepMind) Samsung - SAIT AI Lab(三星-SAIT人工智能实验室) ETH AI Center(苏黎世联邦理工学院人工智能中心)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 CulturalFrames研究了文本到图像模型在文化期望一致性方面的表现,发现模型在显性和隐性文化期望上均存在显著遗漏,揭示了现有评估指标与人类判断的相关性不足,提出了改进文化意识模型的方向。

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏