arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-24 至 2026-08-24 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2512.17474 2026-08-24 eess.AS cs.SD 版本更新 89%

Benchmarking Commercial Speech Recognition and Multimodal Large Language Models on Dysarthric Speech: Severity-Stratified Baselines and Architecture-Specific Prompting Effects

基于商业自动语音识别和多模态大语言模型的口吃语音零样本识别

Ali Alsayegh, Tariq Masood

专题命中 音频语音多模态 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 eess.AS

AI总结 本研究评估了商业ASR和MLLM在口吃语音识别中的性能,发现GPT-4o在重度口吃情况下显著降低WER,而Gemini变体表现下降,为辅助语音接口技术选择提供实证依据。

Comments 32 pages. Revised peer-reviewed version. Updated dataset filtering and transcript normalization, expanded four-condition prompting ablation and error analysis, and revised statistical reporting. Published in International Journal of Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20387 2026-08-24 cs.CL cs.AI 新提交 62%

Poly-InstructTTS: Learning In-the-Wild Expressive Speech Synthesis from Open-Ended Instructions

Poly-InstructTTS:基于开放式指令学习野外场景下的高表现力语音合成

Junhui Zhang, Qianhui Xu, Qingxiang Guo, Dawei Yang, Ling Miao, Qiangqiang Wang, Yang Song

机构 * ZuoYeBang Technology(作业帮科技)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 针对现有TTS模型难以通过自然语言指令控制细粒度表现力的问题,本文提出Poly-InstructTTS模型,构建1000小时指令标注语料库,采用多模态流水线等技术实现高表现力语音合成,相关成果可在项目页面获取。

Comments Accepted to Interspeech 2026. Demo page: this https URL (https://zhangjh915.github.io/PolyInstructTTS-demo/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20433 2026-08-24 cs.RO cs.HC cs.MM cs.SD 新提交 57%

Humanoid Musical Robots as Experimental Interfaces for Music-Evoked Emotion

类人音乐机器人作为音乐诱发情绪研究的实验接口

Vincent K.M. Cheung, Jia-Yeu Lin

机构 * Sony Computer Science Laboratories(索尼计算机科学实验室) Waseda University(早稻田大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 本文提出将类人音乐机器人作为音乐诱发情绪研究的实验接口,通过WAS-5案例验证其技术可行性,为该领域可控研究提供方法论平台。

Comments Opinion paper accepted for presentation at the Sound and Music Computing (SMC) Conference 2026 (5-7 November in Zagreb, Croatia)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20880 2026-08-24 cs.HC 新提交 50%

Live Artifacts: Authoring Dynamic Media via Live Layers Encapsulating Generative Specifications

动态制品:通过封装生成式规范的实时图层创作动态媒体

Leixian Shen, Haotian Li, Hugo Romat, Fanny Chevalier, Nicolai Marquardt, Nathalie Riche

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 该研究定义了介于静态资源与交互式软件间的Live Artifacts,提出LiveCanvas创作系统,可让创作者通过视觉画布编排动态生成式制品,经评估能帮助用户从创作静态输出转向打造响应式生成式制品。

详情

展开后加载摘要…

URL PDF HTML 收藏