arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-10 至 2026-02-10 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 3 篇

2602.07814 2026-02-10 cs.CV cs.AI 57%

How well are open sourced AI-generated image detection models out-of-the-box: A comprehensive benchmark study

开源生成图像检测模型的即插即用性能如何:一项全面的基准研究

Simiao Ren, Yuchen Zhou, Xingyu Shen, Kidus Zewde, Tommy Duong, George Huang, Hatsanai, Tiangratanakul, Tsang, Ng, En Wei, Jiayu Xue

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文评估了16种最新图像检测模型的即插即用性能,发现无统一最佳模型,训练数据对齐影响显著,现代生成器性能优异,揭示了跨数据集泛化中的系统性故障模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01666 2026-02-10 cs.CV 57%

Moonworks Lunara Aesthetic II: An Image Variation Dataset

月光作品 Lunara 美学 II:一个图像变化数据集

Yan Wang, Partho Hassan, Samiha Sadeka, Nada Soliman, Sayeef Abdullah, Sabit Hassan

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 Lunara Aesthetic II 是一个用于评估图像生成和编辑系统中上下文一致性的公开数据集,通过保持身份的上下文变换提供监督信号,具有高美学评分和稳定的身份特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02115 2026-02-10 eess.AS 50%

Pronunciation Editing for Finnish Speech using Phonetic Posteriorgrams

使用音素后验图进行芬兰语语音编辑

Zirui Li, Lauri Juvela, Mikko Kurimo

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文提出PPG2Speech模型,通过音素后验图编辑生成接近二语语音,适用于资源有限语言如芬兰语的语音合成与编辑。

Comments Accepted by Proceeding of 13th edition of the Speech Synthesis Workshop; 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏