Speech-Guided Multimodal Learning for Vocal Tract Segmentation in Real-Time MRI
基于语音引导的多模态学习用于实时MRI中的声道分割
Daiqi Liu, Lukas Mulzer, Md Hasan, Nyvenn de Castro, Fangxu Xing, Xingjian Kang, Chengze Ye, Siyuan Mei, Yipeng Sun, Tomás Arias-Vergara, Jana Hutter, Jonghye Woo, Andreas Maier, Paula Andrea Pérez-Toro
机构
*
Harvard Medical School / Massachusetts General Hospital(哈佛医学院/麻省总医院)
;
Institute for Information Processing, Leibniz University Hannover(汉诺威莱布尼茨信息处理研究所)
;
GITA Lab, Facultad de Ingeniería. Universidad de Antioquia UdeA(安提奥基亚大学工程学院GITA实验室)
机构
*
Department of Engineering Science, University of Oxford(牛津大学工程科学系)
;
Australian Institute for Machine Learning, Adelaide University(阿德莱德大学人工智能研究所)
;
Stanford University(斯坦福大学)
;
University of Central Florida(佛罗里达中央大学)
;
University of Surrey(萨里大学)
Qing Zhong, Guodong Ding, Lingqiao Liu, Zaiwen Feng, Lin Yuanbo Wu, Angela Yao
机构
*
College of Informatics, Huazhong Agricultural University, Wuhan, China(华中农业大学信息学院)
;
School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院)
;
School of Computer Science, Adelaide University, Australia(阿德莱德大学计算机科学学院)
;
School of Engineering, University of Warwick, Coventry, UK(沃里克大学工程学院)
;
Zhejiang Yuexiu University, Shaoxing, China(浙江越秀大学)
机构
*
University of Electronic Science and Technology of China(电子科学与技术大学)
;
Peking University(北京大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Zhongguancun Academy(中关村学院)
机构
*
Faculty of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学院)
;
Hanjiang National Laboratory(汉江国家实验室)
;
School of Space Science and Technology, Shandong University (Weihai)(山东大学(威海)空间科学与技术学院)
;
China Waterborne Transport Research Institute(中国水上运输研究院)
;
China Ship Research and Development Academy(中国船舶研究与发展院)
Retrieving to Recover: Towards Incomplete Audio-Visual Question Answering via Semantic-consistent Purification
检索以恢复:通过语义一致的净化实现不完整音频-视觉问答
Jiayu Zhang, Shuo Ye, Qilang Ye, Zihan Song, Jiajian Huang, Zitong Yu
机构
*
School of Computing and Information Technology, Great Bay University(大湾大学计算机与信息学院)
;
Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息科技重点实验室)
;
Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
;
College of Computer Science, Nankai University(南开大学计算机学院)
;
School of mathematics, Sun Yat-sen University(中山大学数学学院)
Cross-Modal Urban Sensing: Evaluating Sound-Vision Alignment Across Street-Level and Aerial Imagery
跨模态城市感知:评估声音与视觉在街道级和航空影像中的对齐情况
Pengyu Chen, Xiao Huang, Teng Fei, Sicheng Wang
机构
*
Department of Geography, University of South Carolina(南卡罗来纳大学地理系)
;
Department of Environmental Sciences, Emory University(埃默里大学环境科学系)
;
University of Canterbury(坎特伯雷大学)
;
School of Resource and Environmental Sciences, Wuhan University(武汉大学资源与环境科学学院)
VocSegMRI: Multimodal Learning for Precise Vocal Tract Segmentation in Real-time MRI
VocSegMRI:多模态学习在实时MRI中的精确声带段分割
Daiqi Liu, Johannes Enk, Maureen Stone, Fangxu Xing, Tomás Arias-Vergara, Jerry L. Prince, Jana Hutter, Jonghye Woo, Andreas Maier, Paula Andrea Pérez-Toro
机构
*
Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃朗根-纽伦堡大学)
;
University of Maryland School of Dentistry(马里兰大学牙科学院)
;
Harvard Medical School/Massachusetts General Hospital(哈佛医学院/麻省总医院)
;
Universidad de Antioquia UdeA(安蒂奥基亚大学 UdeA)
;
Johns Hopkins University(约翰霍普金斯大学)
;
Leibniz University Hannover(汉诺威莱布尼茨大学)
Complementarity-Supervised Spectral-Band Routing for Multimodal Emotion Recognition
互补监督的频带路由用于多模态情感识别
Zhexian Huang, Bo Zhao, Hui Ma, Zhishu Liu, Jie Zhang, Ruixin Zhang, Shouhong Ding, Zitong Yu
机构
*
Great Bay University(大湾大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
City University of Hong Kong (Dongguan)(香港城市大学(东莞))
;
Tencent Youtu Lab(腾讯优图实验室)
Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion
鲁棒的音频视觉目标说话人提取与情感感知多注册融合
Zhan Jin, Bang Zeng, Peijun Yang, Jiarong Du, Wei Ju, Yao Tian, Juan Liu, Ming Li
机构
*
School of Computer Science, Wuhan University, Wuhan, China(1 武汉大学计算机学院,武汉,中国)
;
School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(2 香港中文大学(深圳)人工智能学院,中国)
;
School of Artificial Intelligence, Wuhan University, Wuhan, China(3 武汉大学人工智能学院,武汉,中国)
;
School of Cyber Science and Engineering, Wuhan University, Wuhan, China(4 武汉大学网络科学与工程学院,武汉,中国)
;
Digital Innovation Research Center, Duke Kunshan University, Kunshan, China(5 香港中文大学(深圳)数字创新研究中心,中国)
;
AI Center, OPPO, Beijing, China(6 OPPO人工智能中心,北京,中国)
RA-SSU: Towards Fine-Grained Audio-Visual Learning with Region-Aware Sound Source Understanding
RA-SSU:迈向细粒度音频视觉学习的区域感知声音源理解
Muyi Sun, Yixuan Wang, Hong Wang, Chen Su, Man Zhang, Xingqun Qi, Qi Li, Zhenan Sun
机构
*
School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)
;
Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology(香港科技大学跨学科研究院)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
AV-Unified: A Unified Framework for Audio-visual Scene Understanding
AV-Unified: 一个用于音频-视觉场景理解的统一框架
Guangyao Li, Xin Wang, Wenwu Zhu
机构
*
Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)
;
Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)