See the Speaker: Crafting High-Resolution Talking Faces from Speech with Prior Guidance and Region Refinement
看清说话者:通过语音优先引导和区域细化生成高分辨率的说话面孔
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Speech and Acoustic Laboratory, Joy Future Academy, Jingdong Corporation(语音与声学实验室、Joy Future Academy、京东公司) ; Aarhus University(阿arhus大学)
AI总结 本研究提出一种通过语音直接生成高分辨率说话面孔的方法,结合扩散模型与统计先验,实现高质量视频生成。
Comments 16 pages,15 figures, accepted by TASLP
Journal ref EEE Transactions on Audio, Speech and Language Processing, vol. 33, pp. 4267-4281, 2025