arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-19 至 2025-11-19 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2408.14595 2025-11-19 cs.CL 88%

Surprisingly Fragile: Assessing and Addressing Prompt Instability in Multimodal Foundation Models

Ian Stewart, Sameera Horawalavithana, Brendan Kennedy, Sai Munikoti, Karl Pazdernik

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CL

Comments arxiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01711 2025-11-19 cs.CV cs.AI 84%

GAIS: Frame-Level Gated Audio-Visual Integration with Semantic Variance-Scaled Perturbation for Text-Video Retrieval

Bowen Yang, Yun Cao, Chen He, Xiaosu Su

机构 * School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05817 2025-11-19 cs.HC cs.MM cs.SD 79%

TalkSketch: Multimodal Generative AI for Real-time Sketch Ideation with Speech

Weiyan Shi, Sunaya Upadhyay, Geraldine Quek, Kenny Tsu Wei Choo

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

Comments Accepted at AAAI 2026 Workshop on Creative AI for Live Interactive Performances (CLIP). To be published in Springer CCIS series

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14255 2025-11-19 cs.CL 57%

AfriSpeech-MultiBench: A Verticalized Multidomain Multicountry Benchmark Suite for African Accented English ASR

Gabrial Zencha Ashungafac, Mardhiyah Sanni, Busayo Awobade, Alex Gichamba, Tobi Olatunji

机构 * Intron Health(Intron健康)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

Comments Accepted As a Conference Paper IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10596 2025-11-19 cs.CY cs.AI cs.HC 57%

GenAI Voice Mode in Programming Education

Sven Jacobs, Natalie Kiesler

机构 * University of Siegen(锡根大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

Comments Accepted for the 25th International Conference on Computing Education Research (Koli Calling '25)

详情

展开后加载摘要…

URL PDF HTML 收藏