arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-15 至 2026-01-15 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2601.08868 2026-01-15 cs.CV cs.AI cs.RO 90%

Residual Cross-Modal Fusion Networks for Audio-Visual Navigation

残差跨模态融合网络用于音频视觉导航

Yi Wang, Yinfeng Yu, Bin Ren

机构 * School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院) Joint International Research Laboratory of Silk Road Multilingual Cognitive(丝绸之路多语认知联合国际实验室) School of Mechatronic Engineering and Automation Shanghai University, Shanghai, China(上海大学机电工程与自动化学院)

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出残差跨模态融合网络,通过双向残差交互实现音频视觉信息互补建模,提升跨域导航性能。

Comments Main paper (10 pages). Accepted for publication by the 14th international conference on Computational Visual Media (CVM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09385 2026-01-15 cs.SD cs.CL cs.MM 84%

SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing

SLAM-LLM: 一种模块化、开源的多模态大语言模型框架及语音、语言、音频和音乐处理的最佳实践

Ziyang Ma, Guanrou Yang, Wenxi Chen, Zhifu Gao, Yexing Du, Xiquan Li, Zhisheng Zheng, Haina Zhu, Jianheng Zhuo, Zheshu Song, Ruiyang Xu, Tiranrui Wang, Yifan Yang, Yanqiao Zhu, Zhikang Niu, Liumeng Xue, Yinghao Ma, Ruibin Yuan, Shiliang Zhang, Kai Yu, Eng Siong Chng, Xie Chen

机构 * X-LANCE Lab, School of Computer Science, MoE Key Lab of Artificial Intelligence Shanghai Jiao Tong University(X-LANCE实验室,计算机科学学院,人工智能教育部重点实验室,上海交通大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Peng Cheng Laboratory(鹏城实验室) University of Texas at Austin(德克萨斯大学奥斯汀分校) Tianjin University(天津大学) Hong Kong University of Science and Technology(香港科学大学) Queen Mary University of London(伦敦玛丽女王大学) Nanyang Technological University(南洋理工大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.MM

AI总结 SLAM-LLM是一种开源多模态大语言模型框架,专注于语音、语言、音频和音乐处理,提供模块化配置和高性能检查点以加速研究开发。

Comments Published in IEEE Journal of Selected Topics in Signal Processing (JSTSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05699 2026-01-15 cs.CL 79%

Afri-MCQA: Multimodal Cultural Question Answering for African Languages

Afri-MCQA:面向非洲语言的多模态文化问答

Atnafu Lambebo Tonja, Srija Anand, Emilio Villa-Cueva, Israel Abebe Azime, Jesujoba Oluwadara Alabi, Muhidin A. Mohamed, Debela Desalegn Yadeta, Negasi Haile Abadi, Abigail Oppong, Nnaemeka Casmir Obiefuna, Idris Abdulmumin, Naome A Etori, Eric Peter Wairagala, Kanda Patrick Tshinu, Imanigirimbabazi Emmanuel, Gabofetswe Malema, Alham Fikri Aji, David Ifeoluwa Adelani, Thamar Solorio

机构 * MBZUAI AI4Bharat Indian Institute of Technology, Madras(印度理工学院马德拉斯分校) Saarland University(萨尔兰大学) Aston University(阿斯顿大学) Addis Ababa University(亚的斯亚贝巴大学) Lesan AI Friedrich-Alexander University(弗里德里希-亚历山大大学) University of Pretoria(比勒陀利亚大学) University of Minneosta -Twin Cities(明尼苏达大学-双城分校) Lelapa AI Tshwane University of Technology(茨瓦内技术大学) Digital Umuganda University of Botswana(博茨瓦纳大学) Mila, McGill University & Canada CIFAR AI Chair(Mila,麦吉尔大学及加拿大CIFAR人工智能主席)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 Afri-MCQA是首个针对非洲语言的多模态文化问答基准,揭示了本地语言在语音和文本任务中与英语的显著性能差距,强调了文化扎根预训练和跨语言文化转移的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07808 2026-01-15 cs.RO 78%

AcoustoBots: A swarm of robots for acoustophoretic multimodal interactions

AcoustoBots:用于声学电势多模交互的机器人群

Narsimlu Kemsaram, James Hardwick, Jincheng Wang, Bonot Gautam, Ceylan Besevli, Giorgos Christopoulos, Sourabh Dogra, Lei Gao, Akin Delibasi, Diego Martinez Plasencia, Orestis Georgiou, Marianna Obrist, Ryuji Hirayama, Sriram Subramanian

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 AcoustoBots通过可移动相位阵列和BeadDispenserBot实现声学电势多模交互,提升机器人群的灵活性和交互能力。

Journal ref Frontiers in Robotics and AI, 12:1537101, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13433 2026-01-15 cs.SD eess.AS 57%

MATS: An Audio Language Model under Text-only Supervision

MATS: 一种基于纯文本监督的音频语言模型

Wen Wang, Ruibing Hou, Hong Chang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, China(中国科学院智能信息处理重点实验室(中国科学院)) University of Chinese Academy of Sciences, China(中国科学院大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 MATS通过纯文本监督训练,实现音频理解能力,无需依赖音频数据,展现出与大规模音频-语言对训练模型相当的性能。

Comments Accepted by ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏