arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-02 至 2025-12-02 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 6 篇

2512.00120 2025-12-02 cs.SD cs.AI cs.CV cs.LG cs.MM 85%

Art2Music: Generating Music for Art Images with Multi-modal Feeling Alignment

Art2Music: 通过多模态情感对齐生成艺术图像的音乐

Jiaying Hong, Ting Zhu, Thanet Markchom, Huizhi Liang

机构 * School of Computing Newcastle University(计算学院新castle大学) Department of Computer Science University of Reading(计算机科学系阅读大学)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 Art2Music通过多模态情感对齐生成艺术图像的音乐,利用轻量级跨模态框架提升音乐生成的感知自然性和频谱保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00115 2025-12-02 cs.SD cs.CV cs.MM 84%

MoLT: Mixture of Layer-Wise Tokens for Efficient Audio-Visual Learning

MoLT:基于层级令牌的高效音频视觉学习

Kyeongha Rho, Hyeongkeun Lee, Jae Won Cho, Joon Son Chung

机构 * KAIST(韩国科学技术院) Sejong University(世宗大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 MoLT通过层级令牌融合提升音频视觉学习效率,采用轻量适应策略和正交正则化,优于现有方法。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06434 2025-12-02 cs.CL cs.AI cs.MM cs.SD eess.AS 83%

Whispering LLaMA: A Cross-Modal Generative Error Correction Framework for Speech Recognition

Whispering LLaMA: 一种用于语音识别的跨模态生成性错误校正框架

Srijith Radhakrishnan, Chao-Han Huck Yang, Sumeer Ahmad Khan, Rohit Kumar, Narsis A. Kiani, David Gomez-Cabrero, Jesper N. Tegner

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 Whispering LLaMA通过跨模态融合技术提升语音识别的生成性错误校正性能,相较n-best假设提升37.66%的词错误率。

Comments Accepted to EMNLP 2023 as main paper. 10 pages. Revised math notations. GitHub: https://github.com/Srijith-rkr/Whispering-LLaMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00563 2025-12-02 cs.SD cs.AI cs.LG 79%

Explainable Multi-Modal Deep Learning for Automatic Detection of Lung Diseases from Respiratory Audio Signals

可解释的多模态深度学习用于从呼吸音频信号自动检测肺部疾病

S M Asiful Islam Saky, Md Rashidul Islam, Md Saiful Arefin, Shahaba Alam

机构 * Albukhary International University(阿尔布胡亚国际大学)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 本研究提出一种可解释的多模态深度学习框架,通过结合频谱-时间编码器和手工制作的声学特征编码器,利用呼吸音频信号自动检测肺部疾病,实现了高准确率和良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12077 2025-12-02 cs.CV 70%

Learning to Hear by Seeing: It's Time for Vision Language Models to Understand Artistic Emotion from Sight and Sound

通过视觉学习听觉:现在是让视觉语言模型理解艺术情感的时候了

Dengming Zhang, Weitao You, Jingxiong Li, Weishen Lin, Wenda Shi, Xue Zhao, Heda Zuo, Junxian Wu, Lingyun Sun

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 VAEmotionLLM通过两阶段框架,利用有限音频预训练使视觉语言模型理解艺术中的多模态情感

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19361 2025-12-02 cs.CL cs.AI cs.SC cs.SD eess.AS 67%

SpeechIQ: Speech-Agentic Intelligence Quotient Across Cognitive Levels in Voice Understanding by Large Language Models

SpeechIQ: 大型语言模型在语音理解中的跨认知层级语音智能商

Zhen Wan, Chao-Han Huck Yang, Yahan Yu, Jinchuan Tian, Sheng Li, Ke Hu, Zhehuai Chen, Shinji Watanabe, Fei Cheng, Chenhui Chu, Sadao Kurohashi

机构 * Kyoto University(京都大学) NVIDIA Carnegie Mellon University(卡内基梅隆大学) Institute of Science Tokyo(东京科学研究院)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 SpeechIQ是一种基于语音的智能评估框架,通过三个认知层级评估大型语言模型在语音理解中的能力,提供统一的比较和识别标注错误与幻觉。

Comments ACL 2025 main. Our Speech-IQ leaderboard is hosted at huggingface.co/spaces/nvidia/Speech-IQ-leaderboard. Speech-IQ Calculator: https://github.com/YukinoWan/SpeechIQ

详情

展开后加载摘要…

URL PDF HTML 收藏