TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation
TAVID:基于文本的音频视觉交互对话生成
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 TAVID通过统一框架同步生成交互面部和对话语音,实现音频视觉多模态对话生成。
Comments Project page: https://mm.kaist.ac.kr/projects/TAVID