TEn-CATG:Text-Enriched Audio-Visual Video Parsing with Multi-Scale Category-Aware Temporal Graph
机构 * Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(视觉、语音和信号处理中心(CVSSP),萨里大学) ; School of Computer Science and Artificial Intelligence, Wuhan University of Technology(计算机科学与人工智能学院,武汉理工大学) ; National Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室,北京大学智能科学与技术学院) ; College of Information and Electrical Engineering, China Agricultural University(信息与电子工程学院,中国农业大学)
专题命中 视频多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM