arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-05-19 至 2026-05-19 共收录 3
2605.17309 2026-05-19 cs.CV cs.AI

StyleText: A Large-Scale Dataset and Benchmark for Stylized Scene Text Inpainting

StyleText: 一个大规模数据集和基准,用于具有风格保留的场景文本修复

Aleksandr Simonyan, Nipun Jindal

机构 * Adobe Inc.(Adobe公司)

AI总结 本文提出StyleText,一个用于具有风格保留的场景文本修复的大规模数据集和基准,通过控制评估文本可读性和视觉一致性,利用共享场景上下文。

Comments Accepted at the SynData4CV Workshop, CVPR 2026. 8 pages + 1 page of references, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17085 2026-05-19 cs.SD cs.LG eess.AS

Taming Audio VAEs via Target-KL Regularization

通过目标KL正则化驯服音频VAE

Prem Seetharaman, Rithesh Kumar

机构 * Adobe Research(Adobe研究院)

AI总结 本文提出通过压缩率调节和目标KL正则化训练音频VAE,以解决在音频生成任务中VAE正则化带来的过正则化与欠正则化之间的平衡问题,并构建了音频VAE的率失真曲线。

Comments Accepted at ICASSP 2026 (Barcelona, Spain, 3-8 May 2026). 5 pages, 1 figure, 3 tables

Journal ref Proc. ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12825 2026-05-19 cs.LG cs.AI

Orthrus: Memory-Efficient Parallel Token Generation via Dual-View Diffusion

Orthrus:通过双视角扩散实现内存高效的并行令牌生成

Chien Van Nguyen, Chaitra Hegde, Van Cuong Pham, Ryan A. Rossi, Franck Dernoncourt, Thien Huu Nguyen

机构 * University of Oregon(俄勒冈大学) Google DeepMind(谷歌DeepMind) Adobe Research(Adobe研究)

AI总结 Orthrus结合自回归大语言模型的高保真生成与扩散模型的高速并行生成,通过双视角机制实现高效推理,提升速度7.8倍且内存开销极低。

详情

展开后加载摘要…

URL PDF HTML 收藏