ML-SAN: Multi-Level Speaker-Adaptive Network for Emotion Recognition in Conversations
ML-SAN:多级说话人自适应网络用于对话中的情绪识别
Kexue Wang, Yinfeng Yu, Liejun Wang
机构
*
Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学具身智能联合研究实验室)
;
Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(丝绸之路多语种认知计算国际联合研究实验室)
;
School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 Gallagher人工智能学院)
;
SentiPulse
;
College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)
Efficient Training for Cross-lingual Speech Language Models
多语言语音语言模型的高效训练
Yan Zhou, Qingkai Fang, Yun Hong, Yang Feng
机构
*
Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(中国科学院计算技术研究所智能信息处理重点实验室)
;
State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室)
;
University of Chinese Academy of Sciences(中国科学院大学)
CommentsICLR 2026Camera Ready Version. TL;DR: The first multi-person dialogue video generation method from pairs of reference image and audio via explicit layout-aligned condition injection. Project page https://zhenzhiwang.github.io/interacthuman/
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
State Key Laboratory of Internet Architecture, Tsinghua University(清华大学互联网架构国家重点实验室)
;
University of North Texas(北卡罗来纳州立大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Fujian Normal University(福建师范大学)
;
Nanjing University of Aeronautics and Astronautics(南京航空航天大学)