SyncVoice: Towards Video Dubbing with Vision-Augmented Pretrained TTS Model
SyncVoice:面向视频配音的视觉增强预训练TTS模型
Kaidi Wang, Yi He, Wenhao Guan, Weijie Wu, Hongwu Ding, Xiong Zhang, Di Wu, Meng Meng, Jian Luan, Lin Li, Qingyang Hong
机构
*
School of Informatics, Xiamen University, China(厦门大学信息学院)
;
MiLM Plus, Xiaomi Inc., China(小米公司)
;
School of Electronic Science and Engineering, Xiamen University, China(厦门大学电子科学与技术学院)
Lyrics Matter: Exploiting the Power of Learnt Representations for Music Popularity Prediction
歌词很重要:利用学习到的表示力预测音乐流行度
Yash Choudhary, Preeti Rao, Pushpak Bhattacharyya
机构
*
Indian Institute of Technology Bombay(印度理工学院班加罗尔)
;
Department of Electrical Engineering, IIT Bombay(印度理工学院班加罗尔电气工程系)
;
CFILT, Department of Computer Science, IIT Bombay(印度理工学院班加罗尔计算机科学系)