arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-27 至 2025-08-27 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 3 篇

2508.18734 2025-08-27 cs.CV cs.AI cs.MM eess.AS eess.SP 89%

Improving Noise Robust Audio-Visual Speech Recognition via Router-Gated Cross-Modal Feature Fusion

DongHoon Lim, YoungChae Kim, Dong-Hyun Kim, Da-Hee Yang, Joon-Hyuk Chang

机构 * Dept. Artificial Intelligence(人工智能系) Hanyang University(翰阳大学)

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted to IEEE ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18653 2025-08-27 cs.LG cs.AI cs.SD eess.AS 81%

The Sound of Risk: A Multimodal Physics-Informed Acoustic Model for Forecasting Market Volatility and Enhancing Market Interpretability

Xiaoliang Chen, Xin Yu, Le Chang, Teng Jing, Jiashuai He, Ze Wang, Yangjun Luo, Xingyu Chen, Jiayue Liang, Yuchen Wang, Jiaying Xie

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22863 2025-08-27 cs.HC cs.CL 57%

Large Language Models for Depression Recognition in Spoken Language Integrating Psychological Knowledge

Yupei Li, Shuaijie Shao, Manuel Milling, Björn W. Schuller

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

Journal ref Frontiers in Computer Science, Volume 7, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏