Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios
多样场景下长篇语音生成的综合基准测试
AI总结 针对现有评估局限于有限领域且忽略一致性与连贯性等问题,提出Swanbench-Speech基准,从声学、语义和表现力三个维度分解长篇语音质量,涵盖17种场景、1101个样本,并定义七项自动评估指标,揭示当前模型在高表现力场景中的不足及与真实录音的差距。
Comments Accepted by ACL 2026(Findings). 36pages, 14figures