arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-21 至 2025-10-21 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2510.16437 2025-10-21 eess.AS 79%

Audio-Visual Speech Enhancement for Spatial Audio - Spatial-VisualVoice and the MAVE Database

Danielle Yaffe, Ferdinand Campe, Prachi Sharma, Dorothea Kolossa, Boaz Rafaely

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16893 2025-10-21 cs.SD cs.AI cs.CL eess.AS 67%

Investigating Safety Vulnerabilities of Large Audio-Language Models Under Speaker Emotional Variations

Bo-Han Feng, Chien-Feng Liu, Yu-Hsuan Li Liang, Chih-Kai Yang, Szu-Wei Fu, Zhehuai Chen, Ke-Han Lu, Sung-Feng Huang, Chao-Han Huck Yang, Yu-Chiang Frank Wang, Yun-Nung Chen, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NVIDIA

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01879 2025-10-21 cs.MM cs.CV cs.SD eess.AS 67%

Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision

Che Liu, Yingji Zhang, Dong Zhang, Weijie Zhang, Chenggong Gong, Yu Lu, Shilin Zhou, Ziliang Gan, Ziao Wang, Haipang Wu, Ji Liu, André Freitas, Qifan Wang, Zenglin Xu, Rongjuncheng Zhang, Yong Dai

机构 * Imperial College London(伦敦帝国学院) University of Manchester(曼彻斯特大学) HiThink Research(HiThink研究院) Soochow University(苏州大学) Hong Kong Baptist University(香港 Baptist大学) Idiap Research Institute(Idiap研究 institute) Meta AI Fudan University(复旦大学)

专题命中 音频语音多模态 :omni-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Project: https://github.com/HiThink-Research/NEXUS-O

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17617 2025-10-21 cs.HC cs.CV 57%

ImaGGen: Zero-Shot Generation of Co-Speech Semantic Gestures Grounded in Language and Image Input

Hendric Voss, Stefan Kopp

机构 * Social Cognitive Systems Group, Bielefeld University(比勒菲尔德大学社会认知系统小组)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏