Plug-and-Steer: Decoupling Separation and Selection in Audio-Visual Target Speaker Extraction
Plug-and-Steer:解耦分离与选择的音视频目标说话人提取
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS
AI总结 提出Plug-and-Steer方法,通过解耦分离与目标选择,利用冻结的纯音频骨干网络和潜引导矩阵实现高保真音视频目标说话人提取。
Comments Accepted by Interspeech 2026; demo available https://plugandsteer.github.io