eMotions: A Large-Scale Dataset and Audio-Visual Fusion Network for Emotion Analysis in Short-form Videos
Xuecheng Wu, Dingkang Yang, Danlei Huang, Xinyi Yin, Yifan Wang, Jia Zhang, Jiayu Nie, Liangyu Fu, Yang Liu, Junxiao Xue, Hadi Amirpour, Wei Zhou
机构
*
School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学)
;
College of Intelligent Robotics and Advanced Manufacturing, Fudan University & ByteDance(智能机器人与先进制造学院,复旦大学 & 字节跳动)
;
School of Cyber Science and Engineering, Zhengzhou University(网络科学与工程学院,郑州大学)
;
Institute of Advanced Technology, University of Science and Technology of China(先进技术研究院,中国科学技术大学)
;
Inspur Electronic Information Industry Co., Ltd(Inspur电子信息产业有限公司)
;
Department of Computer Science, The University of Toronto(计算机科学系,多伦多大学)
;
Research Center for Space Computing System, Zhejiang Lab(空间计算系统研究中心,浙江实验室)
;
Institute of Information Technology, University of Klagenfurt(信息技术学院,克雷格福特大学)
;
School of Computer Science and Informatics, Cardiff University(计算机科学与信息学院,卡迪夫大学)
机构
*
East China Normal University(华东师范大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
City University of Hong Kong(香港城市大学)
;
Shanghai University of Electric Power(上海电力大学)
专题命中
音频语音多模态
:multimodal(title,abstract);分类 cs.CV
CommentsThe proposed method achieves first place in the ICCV VQualA 2025 EVQA-SnapUGC Challenge on short-form video engagement prediction