DeRA-MOS: Optimizing Text-to-Music Evaluation via Decoupled Listwise Ranking and Modality Alignment
DeRA-MOS:通过解耦列表排序和模态对齐优化文本到音乐评估
Chien-Chun Wang, Hung-Shin Lee, Hsin-Min Wang, Berlin Chen
机构
*
E.SUN Financial Holding Co., Ltd.(E.SUN财务控股公司)
;
United Link Co., Ltd.(联合链接有限公司)
;
Institute of Information Science, Academia Sinica(学术院信息科学研究所)
;
Department of Computer Science and Information Engineering, National Taiwan Normal University(台湾师范大学计算机科学与信息工程系)
Towards Conversational Medical AI with Eyes, Ears and a Voice
面向有眼睛、耳朵和声音的对话式医疗AI
Meet Shah, Jason Gusdorf, Anil Palepu, Chunjong Park, Jack W. O'Sullivan, Vishnu Ravi, Tim Strother, Pavel Dubov, Aliya Rysbek, Toshiyuki Fukuzawa, Yana Lunts, Jan Freyberg, Michael B. Chang, Aniruddh Raghu, David Stutz, Devora Berlowitz, Eliseo Papa, Taylan Cemgil, JD Velasquez, Jack Chen, Arthur Chen, Doug Fritz, Charlie Taylor, Katya Tregubova, Jing Rong Lim, Richard Green, Sara Mahdavi, Mahvish Nagda, Jihyeon Lee, Craig Schiff, Liviu Panait, Sukhdeep Singh, Valentin Liévin, David G. T. Barrett, Hannah Gladman, Anna Cupani, Francesca Pietra, Uchechi Okereke, Katherine Tong, Clemens Meyer, Erwan Rolland, Mili Sanwalka, Michael D. Howell, Shixiang Shane Gu, Bibo Xu, Euan A. Ashley, S. M. Ali Eslami, Gregory Wayne, Pushmeet Kohli, Vivek Natarajan, Adam Rodman, Alan Karthikesalingam, Ryutaro Tanno
机构
*
Google DeepMind(谷歌DeepMind)
;
Google Research(谷歌研究)
;
Beth Israel Deaconess Medical Center, Harvard Medical School(贝塞斯达医院, 哈佛医学院)
;
Stanford University(斯坦福大学)
Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models
穿越不确定性:音频感知大语言模型不确定性估计的实证研究
Chun-Yi Kuan, Wei-Ping Huang, Hung-yi Lee
机构
*
Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾大学通讯工程研究所)
;
Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(台湾大学人工智能卓越研究中心)
Towards Inclusive Communication: A Unified Framework for Generating Spoken Language from Sign, Lip, and Audio
迈向包容性沟通:一种统一框架,用于从手语、唇形和音频生成口语语言
Jeong Hun Yeo, Hyeongseop Rha, Sungjune Park, Junil Won, Yong Man Ro
机构
*
Integrated Vision Language Laboratory, School of Electrical Engineering, Korea Advanced Institue of Science and Technology (KAIST)(整合视觉语言实验室,电气工程学院,韩国科学技术院(KAIST))
Improving Speech Emotion Recognition with Mutual Information Regularized Generative Model
通过互信息正则化生成模型改进语音情感识别
Chung-Soo Ahn, Rajib Rana, Sunil Sivadas, Carlos Busso, Jagath C. Rajapakse
机构
*
College of Computing and Data Science at Nanyang Technological University(南洋理工大学计算机与数据科学学院)
;
University of Southern Queensland(南方昆士兰大学)
;
NCS Group(NCS集团)
;
Language Technologies Institute, School of Computer Science, Carnegie Mellon University(计算机科学学院语言技术研究所,卡内基梅隆大学)
机构
*
Brown University(布朗大学)
;
Warsaw University of Technology(华沙技术大学)
;
Indiana University(印第安纳大学)
;
Singapore University of Technology and Design(新加坡科技设计大学)
LPIPS-AttnWav2Lip: Generic Audio-Driven lip synchronization for Talking Head Generation in the Wild
LPIPS-AttnWav2Lip:通用音频驱动的唇同步生成野态说话人面部图像
Zhipeng Chen, Xinheng Wang, Lun Xie, Haijie Yuan, Hang Pan
机构
*
University of Science and Technology Beijing(北京科技大学)
;
Xiaoduo Intelligent Technology (Beijing) Co., Ltd(小多智能技术(北京)有限公司)
;
Department of Computer Science, Changzhi University(长治大学计算机科学系)