HDA-SELD: Hierarchical Cross-Modal Distillation with Multi-Level Data Augmentation for Low-Resource Audio-Visual Sound Event Localization and Detection
Qing Wang, Ya Jiang, Hang Chen, Sabato Marco Siniscalchi, Jun Du, Jianqing Gao
机构
*
University of Science and Technology of China(中国科学技术大学)
;
University of Palermo(巴勒莫大学)
;
iFLYTEK Research(iFLYTEK研究院)
Scalable Audio-Visual Masked Autoencoders for Efficient Affective Video Facial Analysis
Xuecheng Wu, Junxiao Xue, Xinyi Yin, Yunyun Shi, Liangyu Fu, Danlei Huang, Yifan Wang, Jia Zhang, Jiayu Nie, Jun Wang
机构
*
School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)
;
School of Cyber Science and Engineering, Zhengzhou University(郑州大学网络科学与工程学院)
;
School of Software, Northwestern Polytechnical University(西北工业大学软件学院)
;
Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院)
;
Inspur Group(Inspur集团)
;
Research Center for Space Computing System, Zhejiang Lab(浙江实验室空间计算系统研究中心)
DM-Codec: Distilling Multimodal Representations for Speech Tokenization
Md Mubtasim Ahasan, Md Fahim, Tasnim Mohiuddin, A K M Mahbubur Rahman, Aman Chadha, Tariq Iqbal, M Ashraful Amin, Md Mofijul Islam, Amin Ahsan Ali
机构
*
Center for Computational & Data Sciences, Independent University, Bangladesh(计算与数据科学中心,独立大学,孟加拉国)
;
Amazon GenAI(亚马逊生成人工智能)
;
Qatar Computing Research Institute(卡塔尔计算研究所)
;
University of Virginia(弗吉尼亚大学)
AISHELL6-whisper: A Chinese Mandarin Audio-visual Whisper Speech Dataset with Speech Recognition Baselines
Cancan Li, Fei Su, Juan Liu, Hui Bu, Yulong Wan, Hongbin Suo, Ming Li
机构
*
School of Computer Science, Wuhan University(武汉大学计算机学院)
;
School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)
;
Beijing AISHELL Technology Co., Ltd.(北京AISHELL科技有限公司)
;
AI Center, OPPO(OPPO人工智能中心)
机构
*
Xinjiang Multimodal Intelligent Processing and Information Security Engineering Technology Research Center(新疆多模态智能处理与信息安全工程技术研究中心)
;
School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)
;
Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)
;
School of Electrical Engineering and Automation, Tianjin University of Technology(天津理工大学电气工程与自动化学院)
Face-voice Association in Multilingual Environments (FAME) 2026 Challenge Evaluation Plan
Marta Moscati, Ahmed Abdullah, Muhammad Saad Saeed, Shah Nawaz, Rohan Kumar Das, Muhammad Zaigham Zaheer, Junaid Mir, Muhammad Haroon Yousaf, Khalid Malik, Markus Schedl
机构
*
Johannes Kepler University Linz(约翰·凯撒大学林茨分校)
;
National University of Computer and Emerging Sciences(国家计算机与新兴科学大学)
;
University of Michigan(密歇根大学)
;
Fortemedia Singapore(Fortemedia新加坡分公司)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
University of Engineering and Technology Taxila(塔希尔工程与技术大学)
;
Human-centered AI Group(以人为本的人工智能小组)