Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models
弥合稳定性与表现力之间的差距:低资源口语语言模型的合成数据扩展与偏好对齐
机构 * Beijing University of Posts(北京邮电大学) ; University of California, USA(美国加州大学) ; Northwestern University, USA(美国西北大学) ; Eastern Institute of Technology, Ningbo, China(宁波工程技术学院)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 针对低资源口语语言模型因合成数据导致的表现力崩溃问题,提出两种自对齐框架(DGSA和TDSC)以恢复韵律多样性,实现超越商业系统的性能并首次支持老挝语零样本语音克隆。