AI 中文总结
针对跨语言说话人验证中分数可靠性问题,提出AMECxSV方法,该方法通过融合试验分数与元数据进行校准,在特定数据集上降低了等错误率,验证了校准上下文解释及元数据在评分中的作用。
AI 中文摘要
在跨语言自动说话人验证(ASV)中,固定前端分数的可靠性随语言匹配、时长和分数来源而变化。我们提出了AMECxSV,一种适用于有元数据设置的自适应元数据驱动嵌入融合校准后端。AMECxSV将试验分数与元数据融合以产生校准后的目标后验概率,可选择后验置信弃权;元数据用作校准上下文,而非说话人证据。在一个由开发集衍生出的说话人不相交保留分割上,对于官方TidyVoice分数来源,分数+元数据头部将等错误率(EER)从3.15%降至2.42%,对于LI-MSV从0.64%降至0.43%;双分数头部达到0.43%的全覆盖EER。在0.79的覆盖率下,弃权产生0.03%的接受试验EER,这不是全覆盖指标。匹配的仅分数、元数据排列和仅元数据控制支持校准上下文解释,并将主张限制在有元数据评分上。
英文摘要
In X-lingual automatic speaker verification (ASV), fixed front-end scores vary in reliability with language match, duration, and score source. We propose AMECxSV, an adaptive metadata-driven embedding-fusion calibration backend for metadata-available settings. AMECxSV fuses trial scores with metadata to produce calibrated target posteriors, with optional posterior-confidence abstention; metadata serve as calibration context, not speaker evidence. On a development-derived speaker-disjoint held-out split, score+metadata heads reduce equal error rate (EER) from 3.15% to 2.42% for the official TidyVoice score source and from 0.64% to 0.43% for LI-MSV; the dual-score head reaches 0.43% full-coverage EER. At 0.79 coverage, abstention yields 0.03% accepted-trial EER, not a full-coverage metric. Matched score-only, metadata-permutation, and metadata-only controls support a calibration-context interpretation and limit claims to metadata-available scoring.