AIVA: An AI-based Virtual Companion for Emotion-aware Interaction
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、cs.AI、eess.AS
机构 * Sizhuo Ma(* 作者单位) ; Hang Hua(* 作者单位) ; Wenjie Li(* 作者单位) ; Jian Wang(* 作者单位) ; Chris Wei Zhou(* 作者单位) ; Fengbin Guan(* 作者单位) ; Xin Li(* 作者单位) ; Zihao Yu(* 作者单位) ; Yiting Lu(* 作者单位) ; Ru-Ling Liao(* 作者单位) ; Yan Ye(* 作者单位) ; Zhibo Chen(* 作者单位) ; Wei Sun(* 作者单位) ; Linhan Cao(* 作者单位) ; Yuqin Cao(* 作者单位) ; Weixia Zhang(* 作者单位) ; Wen Wen(* 作者单位) ; Kaiwei Zhang(* 作者单位) ; Zijian Chen(* 作者单位) ; Fangfang Lu(* 作者单位) ; Xiongkuo Min(* 作者单位) ; Guangtao Zhai(* 作者单位) ; Erjia Xiao(* 作者单位) ; Lingfeng Zhang(* 作者单位) ; Zhenjie Su(* 作者单位) ; Hao Cheng(* 作者单位) ; Yu Liu(* 作者单位) ; Renjing Xu(* 作者单位) ; Long Chen(* 作者单位) ; Xiaoshuai Hao(* 作者单位) ; Zhenpeng Zeng(* 作者单位) ; Jianqin Wu(* 作者单位) ; Xuxu Wang(* 作者单位) ; Qian Yu(* 作者单位) ; Bo Hu(* 作者单位) ; Weiwei Wang(* 作者单位) ; Pinxin Liu(* 作者单位) ; Yunlong Tang(* 作者单位) ; Luchuan Song(* 作者单位) ; Jinxi He(* 作者单位) ; Jiaru Wu(* 作者单位) ; Hanjia Lyu(* 作者单位)
专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.MM
Comments ICCV 2025 VQualA workshop EVQA track
Journal ref ICCV 2025 Workshop
机构 * Stanford University(斯坦福大学) ; University of California, Santa Cruz(加州大学圣克ruz分校) ; Hitachi America, Ltd.(日立美国有限公司)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI
机构 * University of Science and Technology Beijing(北京科技大学) ; Tencent AI Lab(腾讯AI实验室) ; National University of Singapore(新加坡国立大学)
专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS
Comments Accepted by APSIPA ASC2025