arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46122 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4567 篇

2306.10684 2023-06-21 cs.SD cs.CV cs.MM eess.AS 85%

Visually-Guided Sound Source Separation with Audio-Visual Predictive Coding

Zengjie Song, Zhaoxiang Zhang

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted to IEEE Transactions on Neural Networks and Learning Systems (T-NNLS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.10567 2023-06-21 eess.AS cs.CV cs.MM cs.SD 85%

MIR-GAN: Refining Frame-Level Modality-Invariant Representations with Adversarial Network for Audio-Visual Speech Recognition

Yuchen Hu, Chen Chen, Ruizhe Li, Heqing Zou, Eng Siong Chng

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments 14 pages, 5 figures, Accepted by ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.16428 2023-05-30 eess.AS cs.AI cs.MM cs.SD 85%

Visually-Aware Audio Captioning With Adaptive Audio-Visual Attention

Xubo Liu, Qiushi Huang, Xinhao Mei, Haohe Liu, Qiuqiang Kong, Jianyuan Sun, Shengchen Li, Tom Ko, Yu Zhang, Lilian H. Tang, Mark D. Plumbley, Volkan Kılıç, Wenwu Wang

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

Comments INTERSPEECH 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.01836 2023-05-04 cs.CV cs.LG cs.MM cs.SD eess.AS 85%

AV-SAM: Segment Anything Model Meets Audio-Visual Localization and Segmentation

Shentong Mo, Yapeng Tian

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12930 2023-03-27 cs.CV cs.MM cs.SD eess.AS 85%

Dense-Localizing Audio-Visual Events in Untrimmed Videos: A Large-Scale Benchmark and Baseline

Tiantian Geng, Teng Wang, Jinming Duan, Runmin Cong, Feng Zheng

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted by CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13471 2023-03-24 cs.CV cs.MM cs.SD eess.AS 85%

Egocentric Audio-Visual Object Localization

Chao Huang, Yapeng Tian, Anurag Kumar, Chenliang Xu

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted by CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.08536 2023-03-21 cs.MM cs.CV cs.LG cs.SD eess.AS 85%

Watch or Listen: Robust Audio-Visual Speech Recognition with Visual Corruption Modeling and Reliability Scoring

Joanna Hong, Minsu Kim, Jeongsoo Choi, Yong Man Ro

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted at CVPR 2023. Implementation available: https://github.com/joannahong/AV-RelScore

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.13033 2023-02-28 cs.SD cs.CV cs.MM eess.AS 85%

Speaker Recognition in Realistic Scenario Using Multimodal Data

Saqlain Hussain Shah, Muhammad Saad Saeed, Shah Nawaz, Muhammad Haroon Yousaf

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted at the International Conference on Artificial Intelligence (ICAI'2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.01083 2023-02-28 cs.CV cs.CL cs.SD eess.AS 85%

Cross-Modal Mutual Learning for Cued Speech Recognition

Lei Liu, Li Liu

专题命中 音频语音多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、eess.AS

Comments Accepted to ICASSP2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07940 2022-10-17 cs.CV cs.AI cs.CL cs.LG 85%

AVLEN: Audio-Visual-Language Embodied Navigation in 3D Environments

Sudipta Paul, Amit K. Roy-Chowdhury, Anoop Cherian

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted at NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07055 2022-10-14 cs.CV cs.LG cs.MM cs.SD eess.AS 85%

Sparse in Space and Time: Audio-visual Synchronisation with Trainable Selectors

Vladimir Iashin, Weidi Xie, Esa Rahtu, Andrew Zisserman

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted as a spotlight presentation for the BMVC 2022. Code: https://github.com/v-iashin/SparseSync Project page: https://v-iashin.github.io/SparseSync

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.11420 2022-04-26 cs.CV cs.MM cs.SD eess.AS 85%

Audio-Visual Scene Classification Using A Transfer Learning Based Joint Optimization Strategy

Chengxin Chen, Meng Wang, Pengyuan Zhang

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments 5 pages, 2 figures, based on the work that won first place in the challenge of DCASE2021 Task 1B

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.08509 2022-02-18 cs.SD cs.AI cs.CV cs.LG eess.AS 85%

A Study of Designing Compact Audio-Visual Wake Word Spotting System Based on Iterative Fine-Tuning in Neural Network Pruning

Hengshun Zhou, Jun Du, Chao-Han Huck Yang, Shifu Xiong, Chin-Hui Lee

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI、eess.AS

Comments Accepted to ICASSP 2022. H. Zhou et al

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.01697 2021-12-06 cs.CV cs.CL cs.LG cs.SD eess.AS 85%

LMR-CBT: Learning Modality-fused Representations with CB-Transformer for Multimodal Emotion Recognition from Unaligned Multimodal Sequences

Ziwang Fu, Feng Liu, Hanyang Wang, Siyuan Shen, Jiahao Zhang, Jiayin Qi, Xiangling Fu, Aimin Zhou

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、eess.AS

Comments 9 pages ,Figure 2, Table 5

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.13180 2021-07-29 cs.MM cs.CV cs.SD eess.AS eess.IV 85%

Squeeze-Excitation Convolutional Recurrent Neural Networks for Audio-Visual Scene Classification

Javier Naranjo-Alcazar, Sergi Perez-Castanos, Aaron Lopez-Garcia, Pedro Zuccarello, Maximo Cobos, Francesc J. Ferri

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.08510 2021-04-26 cs.MM cs.CV cs.SD eess.AS 85%

Exploring Deep Learning for Joint Audio-Visual Lip Biometrics

Meng Liu, Longbiao Wang, Kong Aik Lee, Hanyi Zhang, Chang Zeng, Jianwu Dang

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.13780 2021-04-23 cs.CV cs.CL cs.SD eess.AS 85%

Cross-modal Speaker Verification and Recognition: A Multilingual Perspective

Muhammad Saad Saeed, Shah Nawaz, Pietro Morerio, Arif Mahmood, Ignazio Gallo, Muhammad Haroon Yousaf, Alessio Del Bue

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL、eess.AS

Comments Accepted: CVPRW

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.07074 2020-11-05 cs.SD cs.CV cs.MM eess.AS 85%

FaceFilter: Audio-visual speech separation using still images

Soo-Whan Chung, Soyeon Choe, Joon Son Chung, Hong-Goo Kang

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Under submission as a conference paper. Video examples: https://youtu.be/ku9xoLh62E

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.05789 2020-08-19 cs.MM cs.AI cs.CV cs.LG 85%

Look, Listen, and Attend: Co-Attention Network for Self-Supervised Audio-Visual Representation Learning

Ying Cheng, Ruize Wang, Zhihao Pan, Rui Feng, Yuejie Zhang

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by the 28th ACM International Conference on Multimedia (ACM MM 2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.00251 2020-02-04 cs.MM cs.CV cs.IR cs.SD eess.AS 85%

Multi-Modal Music Information Retrieval: Augmenting Audio-Analysis with Visual Computing for Improved Music Video Analysis

Alexander Schindler

专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Dissertation at TU Wien

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.10131 2019-12-27 cs.MM cs.CL cs.SD eess.AS 85%

Leveraging Topics and Audio Features with Multimodal Attention for Audio Visual Scene-Aware Dialog

Shachi H Kumar, Eda Okur, Saurav Sahay, Jonathan Huang, Lama Nachman

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL、cs.MM、eess.AS

Comments Presented at the 3rd Visually Grounded Interaction and Language (ViGIL) Workshop, NeurIPS 2019, Vancouver, Canada. arXiv admin note: substantial text overlap with arXiv:1812.08407, arXiv:1912.10132

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.05250 2019-04-24 cs.CL cs.CV cs.SD eess.AS 85%

Modality Attention for End-to-End Audio-visual Speech Recognition

Pan Zhou, Wenwen Yang, Wei Chen, Yanfeng Wang, Jia Jia

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、eess.AS

Comments accepted by ICASSP2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03739 2025-10-22 cs.CL cs.AI 84%

VITA-Audio: Fast Interleaved Cross-Modal Token Generation for Efficient Large Speech-Language Model

Zuwei Long, Yunhang Shen, Chaoyou Fu, Heting Gao, Lijiang Li, Peixian Chen, Mengdan Zhang, Hang Shao, Jian Li, Jinlong Peng, Haoyu Cao, Ke Li, Rongrong Ji, Xing Sun

机构 * Tencent Youtu Lab(腾讯优图实验室) Nanjing University(南京大学) Xiamen University(厦门大学)

专题命中 音频语音多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CL、cs.AI;MLLM(comments)

Comments Training and Inference Codes: https://github.com/VITA-MLLM/VITA-Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07016 2025-06-17 cs.CV cs.AI 84%

MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks

Sanjoy Chowdhury, Mohamed Elmoghany, Yohan Abeysinghe, Junjie Fei, Sayan Nag, Salman Khan, Mohamed Elhoseiny, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学College Park分校) KAUST(卡尔斯兰大学) MBZUAI(马克斯·普朗克人工智能研究所) University of Toronto(多伦多大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

Comments Audio-visual learning, Audio-Visual RAG, Multi-Video Linkage

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.09579 2022-08-23 cs.CV cs.AI 84%

Learning in Audio-visual Context: A Review, Analysis, and New Perspective

Yake Wei, Di Hu, Yapeng Tian, Xuelong Li

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments https://gewu-lab.github.io/audio-visual-learning/

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.11583 2021-04-08 cs.CV cs.LG cs.RO cs.SD eess.AS 84%

Semantic Audio-Visual Navigation

Changan Chen, Ziad Al-Halah, Kristen Grauman

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS

Comments Project page: http://vision.cs.utexas.edu/projects/semantic-audio-visual-navigation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07355 2026-05-29 cs.MM cs.SD 84%

AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues

AV-EMO-Reasoning: 在具有视听线索的全模态大语言模型中基准测试情感推理能力

Dingkun Zhou, Krish Patel, Ajay Kankipati, Akshaj Gupta, Zeyi Austin Li, Mohul Shukla, Vibhor Narang, Sara Kofman, Zongli Ye, Grace Wang, Xiaoyu Shi, Tingle Li, Guan-Ting Lin, Kan Jen Cheng, Huang-Cheng Chou, Jiachen Lian, Gopala Anumanchipalli

机构 * UC Berkeley(加州大学伯克利分校) South China University of Technology(华南理工大学) Zhejiang University(浙江大学) National Taiwan University(台湾大学) University of Southern California(美国南加州大学)

专题命中 音频语音多模态 :audio-visual(title);omni-modal(title);分类 cs.MM

AI总结 提出AV-EMO-Reasoning基准,通过合成和真实世界的视听对话数据集及情感感知与交互推理指标,系统评估全模态大语言模型的情感推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01278 2026-05-05 cs.AI 84%

Valley3: Scaling Omni Foundation Models for E-commerce

Valley3:面向电商的多模态大语言模型规模化

Zeyu Chen, Guanghao Zhou, Qixiang Yin, Ziwang Zhao, Huanjin Yao, Pengjiu Xia, Min Yang, Cen Chen, Minghui Qiu

机构 * Valley Team, ByteDance Group(字节跳动集团山谷团队)

专题命中 音频语音多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);audio-visual(abstract)

AI总结 Valley3通过四阶段预训练管道,融合多模态能力与电商知识,实现跨模态指令跟随和长链推理,构建了涵盖6个任务的电商基准测试,展现出在电商场景中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20267 2026-04-23 cs.SD cs.AI 84%

ATIR: Towards Audio-Text Interleaved Contextual Retrieval

ATIR:面向音频-文本交错上下文检索

Tong Zhao, Chenghao Zhang, Yutao Zhu, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 音频语音多模态 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文提出ATIR任务,通过整合ASR、QA和检索数据集构建基准,解决现有音频检索数据集在语义检索上的局限,引入新的token压缩机制提升MLLM在ATIR中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16102 2025-10-27 cs.CV cs.RO 84%

HAVT-IVD: Heterogeneity-Aware Cross-Modal Network for Audio-Visual Surveillance: Idling Vehicles Detection With Multichannel Audio and Multiscale Visual Cues

Xiwen Li, Xiaoya Tang, Tolga Tasdizen

机构 * Scientific Computing and Imaging Institute(科学计算与成像研究所) Department of Electrical and Computer Engineering(电气与计算机工程系) University of Utah(犹他大学)

专题命中 音频语音多模态 :cross-modal(title);audio-visual(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏