arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-19 至 2025-09-19 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 8 篇

2509.14592 2025-09-19 cs.MM cs.SD 86%

MMED: A Multimodal Micro-Expression Dataset based on Audio-Visual Fusion

Junbo Wang, Yan Zhao, Shuo Li, Shibo Wang, Shigang Wang, Jian Wei

机构 * College of Communication Engineering, Jilin University(吉林大学通信工程学院)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14930 2025-09-19 cs.CL cs.AI 81%

Cross-Modal Knowledge Distillation for Speech Large Language Models

Enzhi Wang, Qicheng Li, Zhiyuan Tang, Yuhang Jia

机构 * TMCC, College of Computer Science, Nankai University, Tianjin, China(TMCC,计算机科学学院,南开大学,天津,中国) Tencent Ethereal Audio Lab, Tencent Corporation, Shenzhen, China(腾讯虚实音频实验室,腾讯公司,深圳,中国)

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14627 2025-09-19 cs.HC cs.AI cs.CL 81%

Towards Human-like Multimodal Conversational Agent by Generating Engaging Speech

Taesoo Kim, Yongsik Jo, Hyunmin Song, Taehwan Kim

机构 * Artificial Intelligence Graduate School(人工智能研究生院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments Published in Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14891 2025-09-19 cs.MM cs.IR cs.SD 79%

Music4All A+A: A Multimodal Dataset for Music Information Retrieval Tasks

Jonas Geiger, Marta Moscati, Shah Nawaz, Markus Schedl

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨) Human-centered AI Group, AI Lab, Linz Institute of Technology(以人为本的人工智能小组、人工智能实验室、林茨技术研究所)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

Comments 7 pages, 6 tables, IEEE International Conference on Content-Based Multimedia Indexing (IEEE CBMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14379 2025-09-19 eess.AS cs.LG 79%

Diffusion-Based Unsupervised Audio-Visual Speech Separation in Noisy Environments with Noise Prior

Yochai Yemini, Rami Ben-Ari, Sharon Gannot, Ethan Fetaya

机构 * Faculty of Engineering, Bar-Ilan University(巴伊兰大学工程学院) OriginAI

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00033 2025-09-19 cs.CV cs.AI 76%

Deep Learning-Driven Multimodal Detection and Movement Analysis of Objects in Culinary

Tahoshin Alam Ishat, Mohammad Abdul Qayum

机构 * Electrical and Computer Engineering(电气与计算机工程) North South University(北南大学) Computer Engineering North South University Dhaka, Bangladesh(北南大学计算机工程系)

专题命中 音频语音多模态 :multimodal(title);分类 cs.CV、cs.AI

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16724 2025-09-19 cs.SD eess.AS 70%

SALM: Spatial Audio Language Model with Structured Embeddings for Understanding and Editing

Jinbo Hu, Yin Cao, Ming Wu, Zhenbo Luo, Jun Yang

机构 * Institute of Acoustics, Chinese Academy of Sciences, China(中国科学院声学研究所) MiLM Plus, Xiaomi Inc., China(小米公司) Xi’an Jiaotong Liverpool University, China(西安交通大学利物浦大学) University of Chinese Academy of Sciences, China(中国科学院大学)

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);分类 eess.AS

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12275 2025-09-19 cs.SD cs.AI eess.AS 62%

Omni-CLST: Error-aware Curriculum Learning with guided Selective chain-of-Thought for audio question answering

Jinghua Zhao, Hang Su, Lichun Fan, Zhenbo Luo, Hui Wang, Haoqin Sun, Yong Qin

机构 * TMCC, College of Computer Science, Nankai University, Tianjin, China(TMCC,计算机科学学院,南开大学,天津,中国) MiLM Plus, Xiaomi Inc.(MiLM Plus,小米公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

Comments 5 pages, 1 figure, 2 tables submitted to icassp, under prereview

详情

展开后加载摘要…

URL PDF HTML 收藏