arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-14 至 2025-08-14 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2508.09913 2025-08-14 cs.CV 79%

SpeechForensics: Audio-Visual Speech Representation Learning for Face Forgery Detection

Yachao Liang, Min Yu, Gang Li, Jianguo Jiang, Boquan Li, Feng Yu, Ning Zhang, Xiang Meng, Weiqing Huang

机构 * Institute of Information Engineering(信息工程研究所) Chinese Academy of Sciences(中国科学院) School of Cyber Security University of Chinese Academy of Sciences(中国科学院网络安全学院) Deakin University(德肯大学) Harbin Engineering University(哈尔滨工程大学) Institute of Computing Technology Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of Forensic Science Ministry of Public Security(公安部刑事科学技术研究所)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024

Journal ref Advances in Neural Information Processing Systems, Volume 37, Pages 86124-86144, Year 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09702 2025-08-14 eess.AS cs.SD 79%

$\text{M}^3\text{PDB}$: A Multimodal, Multi-Label, Multilingual Prompt Database for Speech Generation

Boyu Zhu, Cheng Gong, Muyang Wu, Ruihao Jing, Fan Liu, Xiaolei Zhang, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAl), China Telecom(人工智能研究院(TeleAl),中国电信) School of Marine Science and Technology, Northwestern Polytechnical University(海洋科学与技术学院,西北工业大学)

专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09402 2025-08-14 cs.HC 78%

Realtime Multimodal Emotion Estimation using Behavioral and Neurophysiological Data

Von Ralph Dane Marquez Herbuela, Yukie Nagai

专题命中 音频语音多模态 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12867 2025-08-14 eess.AS cs.AI cs.CL 67%

EmoVoice: LLM-based Emotional Text-To-Speech Model with Freestyle Text Prompting

Guanrou Yang, Chen Yang, Qian Chen, Ziyang Ma, Wenxi Chen, Wen Wang, Tianrui Wang, Yifan Yang, Zhikang Niu, Wenrui Liu, Fan Yu, Zhihao Du, Zhifu Gao, ShiLiang Zhang, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Tongyi Speech Lab(通义语音实验室) Tianjin University(天津大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University, Shanghai Innovation Institute(上海交通大学上海创新研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments Accepted at ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10417 2025-08-14 cs.CL cs.AI cs.SD eess.AS 67%

Leveraging Audio and Text Modalities in Mental Health: A Study of LLMs Performance

Abdelrahman A. Ali, Aya E. Fouda, Radwa J. Hanafy, Mohammed E. Fouda

机构 * Compumacy for Artificial Intelligence solutions(人工智能解决方案公司) Department of Behavioural Health- Saint Elizabeths Hospital(行为健康部门-圣伊丽莎白医院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏