arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-17 至 2025-12-17 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 3 篇

2512.14083 2025-12-17 eess.AS cs.CL cs.LG 84%

Scalable Frameworks for Real-World Audio-Visual Speech Recognition

可扩展的音频视觉语音识别系统框架

Sungnyun Kim

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出了一种可扩展的音频视觉语音识别系统框架,通过分层方法提升模型在现实环境中的鲁棒性和可扩展性。

Comments PhD Dissertation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14115 2025-12-17 cs.SD cs.LG 82%

Joint Multimodal Contrastive Learning for Robust Spoken Term Detection and Keyword Spotting

多模态对比学习联合框架用于鲁棒的语音术语检测和关键词 spotting

Ramesh Gundluru, Shubham Gupta, Sri Rama Murty K

机构 * Electrical Engineering(电子工程) Artificial Intelligence(人工智能)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出一种联合多模态对比学习框架,通过统一音频和跨模态监督提升语音术语检测和关键词 spotting 的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13981 2025-12-17 cs.RO 50%

Impact of Robot Facial-Audio Expressions on Human Robot Trust Dynamics and Trust Repair

机器人面部-语音表达对人类机器人信任动态及信任修复的影响

Hossein Naderi, Alireza Shojaei, Philip Agee, Kereshmeh Afsari, Abiola Akanmu

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本研究探讨了机器人面部-语音表达对人类信任动态及修复的影响,发现成功提升信任,失败导致信任下降,道歉表达部分恢复信任,且年龄和先前态度影响信任变化的持续时间。

详情

展开后加载摘要…

URL PDF HTML 收藏