arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-30 至 2025-09-30 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 14 篇

2508.12334 2025-09-30 cs.SD cs.MM 88%

HDA-SELD: Hierarchical Cross-Modal Distillation with Multi-Level Data Augmentation for Low-Resource Audio-Visual Sound Event Localization and Detection

Qing Wang, Ya Jiang, Hang Chen, Sabato Marco Siniscalchi, Jun Du, Jianqing Gao

机构 * University of Science and Technology of China(中国科学技术大学) University of Palermo(巴勒莫大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.MM

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24214 2025-09-30 cs.CV 85%

Scalable Audio-Visual Masked Autoencoders for Efficient Affective Video Facial Analysis

Xuecheng Wu, Junxiao Xue, Xinyi Yin, Yunyun Shi, Liangyu Fu, Danlei Huang, Yifan Wang, Jia Zhang, Jiayu Nie, Jun Wang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Cyber Science and Engineering, Zhengzhou University(郑州大学网络科学与工程学院) School of Software, Northwestern Polytechnical University(西北工业大学软件学院) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) Inspur Group(Inspur集团) Research Center for Space Computing System, Zhejiang Lab(浙江实验室空间计算系统研究中心)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22744 2025-09-30 eess.AS cs.AI cs.MM cs.SD 85%

Index-MSR: A high-efficiency multimodal fusion framework for speech recognition

Jinming Chen, Lu Wang, Zheshu Song, Wei Deng

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM、eess.AS

Comments Submit to icassp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24322 2025-09-30 cs.CL 83%

Multimodal Large Language Models Meet Multimodal Emotion Recognition and Reasoning: A Survey

Yuntao Shou, Tao Meng, Wei Ai, Keqin Li

机构 * Central South University of Forestry and Technology(林业科技大学) State University of New York(纽约州立大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

Comments 35 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23251 2025-09-30 cs.MM cs.SD 83%

XGC-AVis: Towards Audio-Visual Content Understanding with a Multi-Agent Collaborative System

Yuqin Cao, Xiongkuo Min, Yixuan Gao, Wei Sun, Zicheng Zhang, Jinliang Han, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02247 2025-09-30 cs.CV 83%

EgoVIS@CVPR: PAIR-Net: Enhancing Egocentric Speaker Detection via Pretrained Audio-Visual Fusion and Alignment Loss

Yu Wang, Juhyung Ha, David J. Crandall

机构 * Indiana University(印第安纳大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

Comments 4 pages, 1 figure, and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15017 2025-09-30 cs.CL cs.AI cs.SD eess.AS 82%

DM-Codec: Distilling Multimodal Representations for Speech Tokenization

Md Mubtasim Ahasan, Md Fahim, Tasnim Mohiuddin, A K M Mahbubur Rahman, Aman Chadha, Tariq Iqbal, M Ashraful Amin, Md Mofijul Islam, Amin Ahsan Ali

机构 * Center for Computational & Data Sciences, Independent University, Bangladesh(计算与数据科学中心,独立大学,孟加拉国) Amazon GenAI(亚马逊生成人工智能) Qatar Computing Research Institute(卡塔尔计算研究所) University of Virginia(弗吉尼亚大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23833 2025-09-30 eess.AS cs.CV cs.MM cs.SD 82%

AISHELL6-whisper: A Chinese Mandarin Audio-visual Whisper Speech Dataset with Speech Recognition Baselines

Cancan Li, Fei Su, Juan Liu, Hui Bu, Yulong Wan, Hongbin Suo, Ming Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Beijing AISHELL Technology Co., Ltd.(北京AISHELL科技有限公司) AI Center, OPPO(OPPO人工智能中心)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25131 2025-09-30 cs.SD cs.AI cs.CL cs.CV cs.MM 81%

MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech

Chengyao Wang, Zhisheng Zhong, Bohao Peng, Senqiao Yang, Yuqi Liu, Haokun Gui, Bin Xia, Jingyao Li, Bei Yu, Jiaya Jia

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Code is available at https://github.com/dvlab-research/MGM-Omni

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22718 2025-09-30 eess.AS cs.MM cs.SD 81%

PerformSinger: Multimodal Singing Voice Synthesis Leveraging Synchronized Lip Cues from Singing Performance Videos

Ke Gu, Zhicong Wu, Peng Bai, Sitong Qiao, Zhiqi Jiang, Junchen Lu, Xiaodong Shi, Xinyuan Qian

机构 * Xiamen University(厦门大学) University of Science and Technology Beijing(北京科技大学) National University of Singapore(新加坡国立大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22698 2025-09-30 cs.RO cs.AI 79%

Advancing Audio-Visual Navigation Through Multi-Agent Collaboration in 3D Environments

Hailong Zhang, Yinfeng Yu, Liejun Wang, Fuchun Sun, Wendong Zheng

机构 * Xinjiang Multimodal Intelligent Processing and Information Security Engineering Technology Research Center(新疆多模态智能处理与信息安全工程技术研究中心) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Electrical Engineering and Automation, Tianjin University of Technology(天津理工大学电气工程与自动化学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI

Comments Main paper (15 pages). Accepted for publication by ICONIP( International Conference on Neural Information Processing) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19951 2025-09-30 cs.CV cs.AI 73%

Audio-centric Video Understanding Benchmark without Text Shortcut

Yudong Yang, Jimin Zhuang, Guangzhi Sun, Changli Tang, Yixuan Li, Peihan Li, Yifan Jiang, Wei Li, Zejun Ma, Chao Zhang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学) ByteDance(字节跳动)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

Comments Accepted for publication in the Proceedings of EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04592 2025-09-30 cs.CV 70%

Face-voice Association in Multilingual Environments (FAME) 2026 Challenge Evaluation Plan

Marta Moscati, Ahmed Abdullah, Muhammad Saad Saeed, Shah Nawaz, Rohan Kumar Das, Muhammad Zaigham Zaheer, Junaid Mir, Muhammad Haroon Yousaf, Khalid Malik, Markus Schedl

机构 * Johannes Kepler University Linz(约翰·凯撒大学林茨分校) National University of Computer and Emerging Sciences(国家计算机与新兴科学大学) University of Michigan(密歇根大学) Fortemedia Singapore(Fortemedia新加坡分公司) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Engineering and Technology Taxila(塔希尔工程与技术大学) Human-centered AI Group(以人为本的人工智能小组)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

Comments 4 pages, ICASSP'26, SP Grand Challenge'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08753 2025-09-30 cs.CL 57%

Streaming Sequence-to-Sequence Learning with Delayed Streams Modeling

Neil Zeghidour, Eugene Kharitonov, Manu Orsini, Václav Volhejn, Gabriel de Marmiesse, Edouard Grave, Patrick Pérez, Laurent Mazaré, Alexandre Défossez

机构 * Kyutai

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏