Scalable Frameworks for Real-World Audio-Visual Speech Recognition
可扩展的音频视觉语音识别系统框架
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CL、eess.AS
AI总结 本文提出了一种可扩展的音频视觉语音识别系统框架,通过分层方法提升模型在现实环境中的鲁棒性和可扩展性。
Comments PhD Dissertation
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
可扩展的音频视觉语音识别系统框架
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CL、eess.AS
AI总结 本文提出了一种可扩展的音频视觉语音识别系统框架,通过分层方法提升模型在现实环境中的鲁棒性和可扩展性。
Comments PhD Dissertation
多模态对比学习联合框架用于鲁棒的语音术语检测和关键词 spotting
机构 * Electrical Engineering(电子工程) ; Artificial Intelligence(人工智能)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract)
AI总结 本文提出一种联合多模态对比学习框架,通过统一音频和跨模态监督提升语音术语检测和关键词 spotting 的鲁棒性。
机器人面部-语音表达对人类机器人信任动态及信任修复的影响
专题命中 音频语音多模态 :multimodal(abstract)
AI总结 本研究探讨了机器人面部-语音表达对人类信任动态及修复的影响,发现成功提升信任,失败导致信任下降,道歉表达部分恢复信任,且年龄和先前态度影响信任变化的持续时间。