arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-20 至 2025-10-20 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 7 篇

2510.15685 2025-10-20 cs.CL 79%

Leveraging LLMs for Context-Aware Implicit Textual and Multimodal Hate Speech Detection

Joshua Wolfe Brook, Ilia Markov

机构 * Computational Linguistics \& Text Mining Lab Vrije Universiteit Amsterdam

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

Comments 8 pages, 9 figures, submitted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10396 2025-10-20 cs.SD 78%

MRSAudio: A Large-Scale Multimodal Recorded Spatial Audio Dataset with Refined Annotations

Wenxiang Guo, Changhao Pan, Zhiyuan Zhu, Xintong Hu, Yu Zhang, Li Tang, Rui Yang, Han Wang, Zongbao Zhang, Yuhan Wang, Yixuan Chen, Hankun Xu, Ke Xu, Pengfei Fan, Zhetao Chen, Yanhao Yu, Qiange Huang, Fei Wu, Zhou Zhao

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 音频语音多模态 :multimodal(title,abstract)

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10444 2025-10-20 cs.CL cs.AI 62%

Do Audio LLMs Really LISTEN, or Just Transcribe? Measuring Lexical vs. Acoustic Emotion Cues Reliance

Jingyi Chen, Zhimeng Guo, Jiyun Chun, Pichao Wang, Andrew Perrault, Micha Elsner

机构 * Department of Linguistics, The Ohio State University, USA(语言学系,俄亥俄州立大学) Department of Computer Science and Engineering, The Ohio State University, USA(计算机科学与工程系,俄亥俄州立大学) Department of Information Sciences and Technology, Penn State University, USA(信息科学与技术系,宾夕法尼亚州立大学) Amazon, USA(亚马逊公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15757 2025-10-20 cs.LG cs.CV cs.NE 57%

Poultry Farm Intelligence: An Integrated Multi-Sensor AI Platform for Enhanced Welfare and Productivity

Pieris Panagi, Savvas Karatsiolis, Kyriacos Mosphilis, Nicholas Hadjisavvas, Andreas Kamilaris, Nicolas Nicolaou, Efstathios Stavrakis, Vassilis Vassiliades

机构 * CYENS - Centre of Excellence(CYENS 卓越中心) Algolysis Ltd(Algolysis 公司) Department of Computer Science(计算机科学系)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10248 2025-10-20 cs.LG cs.AI 57%

Reasoning-Enhanced Large Language Models for Molecular Property Prediction

Jiaxi Zhuang, Yaorui Shi, Jue Hou, Yunong He, Mingwei Ye, Mingjun Xu, Yuming Su, Linfeng Zhang, Ying Qian, Linfeng Zhang, Guolin Ke, Hengxing Cai

机构 * DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02569 2025-10-20 cs.CL 57%

Transcribe, Translate, or Transliterate: An Investigation of Intermediate Representations in Spoken Language Models

Tolúlopé Ògúnrèmí, Christopher D. Manning, Dan Jurafsky, Karen Livescu

机构 * Stanford University(斯坦福大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

Comments ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00059 2025-10-20 cs.CV cs.LG 57%

Investigating and Enhancing Vision-Audio Capability in Omnimodal Large Language Models

Rui Hu, Delai Qiu, Shuyu Wei, Jiaming Zhang, Yining Wang, Shengping Liu, Jitao Sang

机构 * Beijing Key Lab of Traffic Data Analysis and Mining(北京交通数据挖掘重点实验室) Beijing Jiaotong University(北京交通大学) Unisound AI Technology Co., Ltd.(Unisound人工智能技术有限公司) Peng Cheng Lab(鹏城实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted to ACL 2025 Findings

Journal ref Findings of the Association for Computational Linguistics: ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏