StarTSE: Towards Streaming Target Speaker Extraction via Chunk-wise Interleaved Splicing of Autoregressive Language Model
面向流式目标说话人提取的分块交织拼接自回归语言模型
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; The Chinese University of Hong Kong(香港中文大学) ; SenseTime Research(商汤科技研究院)
AI总结 本文提出一种分块交织拼接方法,用于提升流式目标说话人提取的效率与稳定性,实验表明其在低延迟下保持高性能且优于离线基线。