Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels
超越独白:基于对话音频上下文感知核的交互式谈话-倾听虚拟角色生成
机构 * University of Science and Technology of China(中国科学技术大学) ; iFLYTEK(科大讯飞)
AI总结 本文提出基于对话音频上下文感知核的交互式虚拟角色生成方法,通过引入多头高斯核解决谈话与倾听行为的时间尺度差异问题,构建了能同时处理双流音频输入的全双工虚拟代理,并在VoxHear数据集上验证了其在生成自然响应的全双工数字人类方面的优越性。