arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-07-30 至 2025-07-30 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2409.09545 2025-07-30 cs.SD cs.LG eess.AS 85%

Multi-Microphone and Multi-Modal Emotion Recognition in Reverberant Environment

Ohad Cohen, Gershon Hazan, Sharon Gannot

机构 * Faculty of Engineering Bar-Ilan University Ramat-Gan, Israel(工程学院 巴伊兰大学 拉马特-甘, 以色列)

专题命中 音频语音多模态 :multi-modal(title,abstract);multimodal(abstract);audio-visual(abstract);分类 eess.AS

Comments 5 pages, 4 figures, 2 tables. Accepted to EUSIPCO 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21588 2025-07-30 cs.AI cs.CV 84%

Progressive Homeostatic and Plastic Prompt Tuning for Audio-Visual Multi-Task Incremental Learning

Jiong Yin, Liang Li, Jiehua Zhang, Yuhan Gao, Chenggang Yan, Xichun Sheng

机构 * Hangzhou Dianzi University(杭州电子科技大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Xi’an Jiaotong University(西安交通大学) Macao Polytechnic University(澳门 polytechnic university)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11274 2025-07-30 cs.CL cs.AI 73%

Task Arithmetic for Language Expansion in Speech Translation

Yao-Fei Cheng, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Wen Shen Teo, Siddhant Arora, Shinji Watanabe

机构 * University of Washington(华盛顿大学) Sony Group Corporation(索尼集团) University of Electro-Communications(电通大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14915 2025-07-30 cs.MM cs.SD eess.AS 62%

Music-Aligned Holistic 3D Dance Generation via Hierarchical Motion Modeling

Xiaojie Li, Ronghui Li, Shukai Fang, Shuzhao Xie, Xiaoyang Guo, Jiaqing Zhou, Junkun Peng, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ByteDance Games(字节跳动游戏)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22008 2025-07-30 cs.CV 57%

VeS: Teaching Pixels to Listen Without Supervision

Sajay Raj

机构 * Indian Institute of Technology, Madras(印度理工学院马德拉斯分校)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

Comments 6 pages, 1 figure, 1 table. Code and models are released

详情

展开后加载摘要…

URL PDF HTML 收藏