arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-30 至 2025-12-30 共收录 7 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 7 篇

2511.20821 2025-12-30 cs.CV cs.AI cs.CL cs.LG 92%

Training-Free Diffusion Priors for Text-to-Image Generation via Optimization-based Visual Inversion

无需训练的扩散先验:通过基于优化的视觉反向生成文本到图像

Samuele Dell'Erba, Andrew D. Bagdanov

机构 * University of Florence(佛罗伦萨大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出无需训练的基于优化的视觉反向方法,用于文本到图像生成,通过约束优化提升图像质量,挑战传统先验的必要性。

Comments 13 pages, 7 figures, technical report (preprint)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23546 2025-12-30 cs.CV 88%

PurifyGen: A Risk-Discrimination and Semantic-Purification Model for Safe Text-to-Image Generation

PurifyGen:一种用于安全文本到图像生成的风险判别和语义净化模型

Zongsheng Cao, Yangfan He, Anran Liu, Jun Xie, Feng Chen, Zepeng Wang

机构 * Researcher(研究者)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 PurifyGen通过双阶段策略实现安全文本到图像生成,通过语义距离评估和双空间转换净化危险提示,减少不安全内容生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17851 2025-12-30 cs.CV cs.AI 88%

InfSplign: Inference-Time Spatial Alignment of Text-to-Image Diffusion Models

InfSplign: 文本到图像扩散模型推理时的空间对齐

Sarah Rastegar, Violeta Chatalbasheva, Sieger Falkena, Anuj Singh, Yanbo Wang, Tejas Gokhale, Hamid Palangi, Hadi Jamali-Rad

机构 * Delft University of Technology(代尔夫特理工大学) University of Maryland Baltimore County(马里兰大学巴尔的摩县分校) Shell Information Technology International(壳牌信息科技国际) Google(谷歌)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 InfSplign通过推理时调整噪声的复合损失,提升文本到图像扩散模型的空间对齐性能,实现新的最先进的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13754 2025-12-30 cs.CV 79%

Cross-modal Full-mode Fine-grained Alignment for Text-to-Image Person Retrieval

跨模态全模式细粒度对齐用于文本到图像人物检索

Hao Yin, Xin Man, Feiyu Chen, Jie Shao, Heng Tao Shen

机构 * Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(深圳先进研究所,电子科学与技术大学) University of Electronic Science and Technology of China(电子科学与技术大学) Sichuan Artificial Intelligence Research Institute(四川人工智能研究院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出FMFA框架,通过显式细粒度对齐和隐式关系推理实现文本到图像人物检索的高精度匹配。

Comments accepted by ACM Transactions on Multimedia Computing Communications and Applications in December 2025

Journal ref ACM Transactions on Multimedia Computing Communications and Applications, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09614 2025-12-30 cs.CV cs.CL 78%

RAVEL: Rare Concept Generation and Editing via Graph-driven Relational Guidance

RAVEL:通过图驱动的关系引导进行罕见概念生成与编辑

Kavana Venkatesh, Yusuf Dalva, Ismini Lourentzou, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学) UIUC(伊利诺伊大学香槟分校)

专题命中 文生图 :diffusion(abstract,comments);text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 RAVEL通过图驱动的关系引导方法,提升罕见概念生成与编辑的可控性和可解释性,适用于长尾领域。

Comments Project Page: https://ravel-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23453 2025-12-30 cs.CV cs.AI 57%

CoFi-Dec: Hallucination-Resistant Decoding via Coarse-to-Fine Generative Feedback in Large Vision-Language Models

CoFi-Dec:通过粗到细的生成反馈在大视觉-语言模型中实现抗幻觉解码

Zongsheng Cao, Yangfan He, Anran Liu, Jun Xie, Feng Chen, Zepeng Wang

机构 * Researcher(研究者)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 CoFi-Dec通过粗到细的生成反馈机制,在大视觉-语言模型中减少幻觉,提升解码的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04809 2025-12-30 cs.CV cs.LG 57%

Investigation of the Impact of Synthetic Training Data in the Industrial Application of Terminal Strip Object Detection

终端条目目标检测在工业应用中的合成训练数据影响研究

Nico Baumgart, Markus Lange-Hegermann, Mike Mücke

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文研究了终端条目目标检测中合成训练数据的影响,通过合成图像与真实数据结合,验证了DINO模型在复杂工业环境中的高效检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏