MaskVCT: Masked Voice Codec Transformer for Zero-Shot Voice Conversion With Increased Controllability via Multiple Guidances
MaskVCT:基于多指导的零样本语音转换语音编解码器
机构 * Center for Language and Speech Processing, Johns Hopkins University, Baltimore, MD, USA(语言与语音处理中心,约翰霍普金斯大学,巴尔的摩,马里兰州,美国)
AI总结 MaskVCT通过多指导机制实现零样本语音转换的多因素可控性,提升说话人相似性和语调控制能力。
Comments ICASSP 2026 Accepted