arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

JD(京东)

2026-03-03 至 2026-03-03 共收录 1
2510.26819 2026-03-03 eess.AS cs.AI cs.CV cs.SD

See the Speaker: Crafting High-Resolution Talking Faces from Speech with Prior Guidance and Region Refinement

看清说话者:通过语音优先引导和区域细化生成高分辨率的说话面孔

Jinting Wang, Jun Wang, Hei Victor Cheng, Li Liu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Speech and Acoustic Laboratory, Joy Future Academy, Jingdong Corporation(语音与声学实验室、Joy Future Academy、京东公司) Aarhus University(阿arhus大学)

AI总结 本研究提出一种通过语音直接生成高分辨率说话面孔的方法,结合扩散模型与统计先验,实现高质量视频生成。

Comments 16 pages,15 figures, accepted by TASLP

Journal ref EEE Transactions on Audio, Speech and Language Processing, vol. 33, pp. 4267-4281, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏