arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-25 至 2025-09-25 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 3 篇

2509.20140 2025-09-25 cs.MM cs.SD 83%

InconVAD: A Two-Stage Dual-Tower Framework for Multimodal Emotion Inconsistency Detection

Zongyi Li, Junchuan Zhao, Francis Bu Sung Lee, Andrew Zi Han Yee

机构 * Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(南洋理工大学交叉学科研究生项目) School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院) Wee Kim Wee School of Communication and Information, Nanyang Technological University, Singapore(南洋理工大学魏克伟通信与信息学院)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

Comments 5 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19631 2025-09-25 eess.AS cs.AI cs.CL 82%

Advancing Speech Summarization in Multi-modal LLMs with Reinforcement Learning

Shaoshi Ling, Gang Liu, Guoli Ye, Jinyu Li

机构 * Microsoft CoreAI(微软核心人工智能)

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19600 2025-09-25 cs.HC 78%

vashTimer: A Multi-Purpose, Multimodal Mobile App For Maintaining Passage of Time by means of Visual, Auditory, Speech, and Haptic Alerts

Aziz N Zeidieh, Sanchita S. Kamath, JooYoung Seo

专题命中 音频语音多模态 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏