arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-13 至 2025-08-13 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2504.11002 2025-08-13 cs.SD cs.MM eess.AS 84%

Dopamine Audiobook: A Training-free MLLM Agent for Emotional and Immersive Audiobook Generation

Yan Rong, Shan Yang, Chenxing Li, Dong Yu, Li Liu

专题命中 音频语音多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01384 2025-08-13 cs.CV 83%

MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing

Langyu Wang, Bingke Zhu, Yingying Chen, Yiyuan Zhang, Ming Tang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences, China(中国科学院自动化研究所基础模型研究中心)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

Comments Accpted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03300 2025-08-13 cs.RO cs.LG 78%

Touch and Tell: Multimodal Decoding of Human Emotions and Social Gestures for Robots

Qiaoqiao Ren, Remko Proesmans, Yuanbo Hou, Francis wyffels, Tony Belpaeme

机构 * Faculty of Engineering and Architecture(工程与建筑学院) IDLab-AIRO, Ghent University – imec(IDLab-AIRO,根特大学–imec) Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 音频语音多模态 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15447 2025-08-13 cs.MM cs.CV cs.SD eess.AS 75%

Gotta Hear Them All: Towards Sound Source Aware Audio Generation

Wei Guo, Heng Wang, Jianbo Ma, Weidong Cai

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments 17 pages, 12 figures, source code available at https://github.com/wguo86/SSV2A

详情

展开后加载摘要…

URL PDF HTML 收藏