arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-26 至 2025-09-26 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2509.20724 2025-09-26 cs.SI cs.CL cs.CV cs.MM 82%

Visual Authority and the Rhetoric of Health Misinformation: A Multimodal Analysis of Social Media Videos

Mohammad Reza Zarei, Barbara Stead-Coyle, Michael Christensen, Sarah Everts, Majid Komeili

机构 * School of Computer Science(计算机科学学院) Carleton University(卡尔顿大学) Department of Law and Legal Studies(法律与法律研究系) School of Journalism and Communication(新闻与传播学院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20741 2025-09-26 eess.AS cs.ET cs.LG 79%

Real-Time System for Audio-Visual Target Speech Enhancement

T. Aleksandra Ma, Sile Yin, Li-Chia Yang, Shuo Zhang

机构 * Bose Corporation(博世公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

Comments Accepted into WASPAA 2025 demo session

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20467 2025-09-26 cs.CL cs.CV 62%

ShortCheck: Checkworthiness Detection of Multilingual Short-Form Videos

Henrik Vatndal, Vinay Setty

机构 * Factiverse AI University of Stavanger(斯塔万格大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21144 2025-09-26 cs.SD cs.AI 57%

UniSS: Unified Expressive Speech-to-Speech Translation with Your Voice

Sitong Cheng, Weizhen Bian, Xinsheng Wang, Ruibin Yuan, Jianyi Chen, Shunshun Yin, Yike Guo, Wei Xue

机构 * Hong Kong University of Science and Technology(香港理工大学) Soul AI Lab(Soul AI 实验室)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07282 2025-09-26 eess.AS 57%

Lessons Learnt: Revisit Key Training Strategies for Effective Speech Emotion Recognition in the Wild

Jing-Tong Tzeng, Bo-Hao Su, Ya-Tse Wu, Hsing-Hang Chou, Chi-Chun Lee

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

Comments Proceedings of Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏