arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-29 至 2025-10-29 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 8 篇

2505.21724 2025-10-29 cs.CV cs.AI cs.HC 86%

OmniResponse: Online Multimodal Conversational Response Generation in Dyadic Interactions

Cheng Luo, Jianghui Wang, Bing Li, Siyang Song, Bernard Ghanem

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24024 2025-10-29 eess.AS cs.CV eess.IV 81%

Listening without Looking: Modality Bias in Audio-Visual Captioning

Yuchi Ishikawa, Toranosuke Manabe, Tatsuya Komatsu, Yoshimitsu Aoki

机构 * LY Corporation(LY公司) Keio University(庆应大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24247 2025-10-29 cs.CL 79%

Abjad AI at NADI 2025: CATT-Whisper: Multimodal Diacritic Restoration Using Text and Speech Representations

Ahmad Ghannam, Naif Alharthi, Faris Alasmary, Kholood Al Tabash, Shouq Sadah, Lahouari Ghouti

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24103 2025-10-29 cs.SD cs.AI cs.MM eess.AS 75%

Model-Guided Dual-Role Alignment for High-Fidelity Open-Domain Video-to-Audio Generation

Kang Zhang, Trung X. Pham, Suyeon Lee, Axi Niu, Arda Senocak, Joon Son Chung

机构 * KAIST, South Korea(韩国釜山国立大学) NWPU, China(中国西北工业大学) UNIST, South Korea(韩国全南国立大学)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.AI、cs.MM、eess.AS

Comments accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24628 2025-10-29 cs.CL 57%

"Mm, Wat?" Detecting Other-initiated Repair Requests in Dialogue

Anh Ngo, Nicolas Rollet, Catherine Pelachaud, Chloe Clavel

机构 * ALMAnaCH, INRIA Paris(ALMAnaCH,INRIA巴黎) Télécom Paris, SES, Institut Polytechnique de Paris, I3-CNRS(Télécom巴黎,SES,巴黎高等理工学院,I3-CNRS) Télécom Paris, LTCI, Institut Polytechnique de Paris(Télécom巴黎,LTCI,巴黎高等理工学院) CNRS, ISIR, Sorbonne University(CNRS,ISIR,索邦大学) ISIR, Sorbonne University(ISIR,索邦大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18195 2025-10-29 eess.AS cs.LG cs.SD 57%

Acoustic and Machine Learning Methods for Speech-Based Suicide Risk Assessment: A Systematic Review

Ambre Marie, Marine Garnier, Thomas Bertin, Laura Machart, Guillaume Dardenne, Gwenolé Quellec, Sofian Berrouiguet

机构 * University of Western Brittany(西部布列塔尼大学) Psychiatry Department, CHU Brest(布列塔尼大学精神科部门)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

Comments Preprint version of a manuscript submitted to the Journal of Affective Disorders

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23887 2025-10-29 cs.HC 50%

MORA: AI-Mediated Story-Based practice for Speech Sound Disorder from Clinic to Home

Sumin Hong, Xavier Briggs, Qingxiao Zheng, Yao Du, Jinjun Xiong, Toby Jia-jun Li

专题命中 音频语音多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24180 2025-10-29 cs.LG 50%

V-SAT: Video Subtitle Annotation Tool

Arpita Kundu, Joyita Chakraborty, Anindita Desarkar, Aritra Sen, Srushti Anil Patil, Vishwanathan Raman

机构 * LTIMindTree

专题命中 音频语音多模态 :audio-visual(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏