arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4585 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4585 篇

2307.12236 2023-07-25 cs.LG cs.CV 79%

Multi-Modal Machine Learning for Assessing Gaming Skills in Online Streaming: A Case Study with CS:GO

Longxiang Zhang, Wenping Wang

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.02609 2023-07-07 cs.CV 79%

MRecGen: Multimodal Appropriate Reaction Generator

Jiaqi Xu, Cheng Luo, Weicheng Xie, Linlin Shen, Xiaofeng Liu, Lu Liu, Hatice Gunes, Siyang Song

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09947 2023-06-19 eess.AS 79%

Knowledge Distillation for Efficient Audio-Visual Video Captioning

Özkan Çaylı, Xubo Liu, Volkan Kılıç, Wenwu Wang

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

Comments European Signal Processing Conference (EUSIPCO 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12831 2023-06-13 eess.AS cs.SD 79%

Target Active Speaker Detection with Audio-visual Cues

Yidi Jiang, Ruijie Tao, Zexu Pan, Haizhou Li

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

Comments Accepted to INTERSPEECH2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06652 2023-06-13 cs.SD eess.AS 79%

Audio-Visual Mandarin Electrolaryngeal Speech Voice Conversion

Yung-Lun Chien, Hsin-Hao Chen, Ming-Chi Yen, Shu-Wei Tsai, Hsin-Min Wang, Yu Tsao, Tai-Shih Chi

专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract);分类 eess.AS

Comments Accepted to INTERSPEECH 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06495 2023-06-13 eess.AS cs.SD 79%

Audio-Visual Speech Enhancement With Selective Off-Screen Speech Extraction

Tomoya Yoshinaga, Keitaro Tanaka, Shigeo Morishima

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

Comments Accepted by EUSIPCO 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06036 2023-06-12 cs.AI 79%

SNeL: A Structured Neuro-Symbolic Language for Entity-Based Multimodal Scene Understanding

Silvan Ferreira, Allan Martins, Ivanovitch Silva

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02625 2023-06-06 cs.SD eess.AS 79%

Rethinking the visual cues in audio-visual speaker extraction

Junjie Li, Meng Ge, Zexu pan, Rui Cao, Longbiao Wang, Jianwu Dang, Shiliang Zhang

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

Comments Accepted in Interspeech 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01432 2023-06-05 eess.AS cs.LG 79%

Audio-Visual Speech Enhancement with Score-Based Generative Models

Julius Richter, Simone Frintrop, Timo Gerkmann

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

Comments Submitted to ITG Conference on Speech Communication

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01100 2023-06-05 eess.AS cs.LG cs.SD 79%

ALO-VC: Any-to-any Low-latency One-shot Voice Conversion

Bohan Wang, Damien Ronssin, Milos Cernak

专题命中 音频语音多模态 :any-to-any(title,abstract);分类 eess.AS

Comments Accepted to Interspeech 2023. Some audio samples are available at https://bohan7.github.io/ALO-VC-demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00160 2023-06-02 eess.AS cs.LG cs.SD 79%

Audio-Visual Speech Separation in Noisy Environments with a Lightweight Iterative Model

Héctor Martel, Julius Richter, Kai Li, Xiaolin Hu, Timo Gerkmann

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

Comments Accepted by Interspeech 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07677 2023-05-26 cs.SD cs.CL cs.LG 79%

Masked Audio Text Encoders are Effective Multi-Modal Rescorers

Jinglun Cai, Monica Sunkara, Xilai Li, Anshu Bhatia, Xiao Pan, Sravan Bodapati

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15084 2023-05-25 cs.CV 79%

Audio-Visual Dataset and Method for Anomaly Detection in Traffic Videos

Błażej Leporowski, Arian Bakhtiarnia, Nicole Bonnici, Adrian Muscat, Luca Zanella, Yiming Wang, Alexandros Iosifidis

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11310 2023-05-22 cs.HC cs.LG cs.SD eess.AS 79%

AMII: Adaptive Multimodal Inter-personal and Intra-personal Model for Adapted Behavior Synthesis

Jieyeon Woo, Mireille Fares, Catherine Pelachaud, Catherine Achard

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10773 2023-05-19 eess.SP cs.AI 79%

Rate-Adaptive Coding Mechanism for Semantic Communications With Multi-Modal Data

Yangshuo He, Guanding Yu, Yunlong Cai

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.13115 2023-05-15 cs.CV 79%

AVFace: Towards Detailed Audio-Visual 4D Face Reconstruction

Aggelina Chatziagapi, Dimitris Samaras

专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract);分类 cs.CV

Comments Accepted by CVPR 2023. Project page: https://aggelinacha.github.io/AVFace/

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06315 2023-05-02 eess.SP cs.SD eess.AS q-bio.NC 79%

Brain Connectivity Features-based Age Group Classification using Temporal Asynchrony Audio-Visual Integration Task

Prerna Singh, Ayush Tripathi, Lalan Kumar, Tapan Kumar Gandhi

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.01080 2023-04-04 cs.SD cs.RO eess.AS 79%

LIPSFUS: A neuromorphic dataset for audio-visual sensory fusion of lip reading

Antonio Rios-Navarro, Enrique Piñero-Fuentes, Salvador Canas-Moreno, Aqib Javed, Jin Harkin, Alejandro Linares-Barranco

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

Comments Submitted to ISCAS2023, 4 pages, plus references, github link provided

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.09406 2023-04-04 cs.LG cs.MM 79%

Dance Style Transfer with Cross-modal Transformer

Wenjie Yin, Hang Yin, Kim Baraka, Danica Kragic, Mårten Björkman

专题命中 音频语音多模态 :cross-modal(title);multimodal(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.15430 2023-03-30 cs.CL cs.LG 79%

TextMI: Textualize Multimodal Information for Integrating Non-verbal Cues in Pre-trained Language Models

Md Kamrul Hasan, Md Saiful Islam, Sangwu Lee, Wasifur Rahman, Iftekhar Naim, Mohammed Ibrahim Khan, Ehsan Hoque

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.01767 2023-03-29 cs.CV 79%

Self-Supervised Video Forensics by Audio-Visual Anomaly Detection

Chao Feng, Ziyang Chen, Andrew Owens

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.11302 2023-03-28 cs.CV 79%

Learning Audio-Visual Source Localization via False Negative Aware Contrastive Learning

Weixuan Sun, Jiayi Zhang, Jianyuan Wang, Zheyuan Liu, Yiran Zhong, Tianpeng Feng, Yandong Guo, Yanhao Zhang, Nick Barnes

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.14240 2023-03-24 eess.AS 79%

Dialogue Enhancement and Listening Effort in Broadcast Audio: A Multimodal Evaluation

Matteo Torcoli, Thomas Robotham, Emanuël A. P. Habets

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

Comments Paper accepted to 14th International Conference on Quality of Multimedia Experience (QoMEX), Lippstadt, Germany, 2022 - version 2 fixes some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10033 2023-03-20 cs.CV 79%

Multi-modal Expression Recognition with Ensemble Method

Chuanhe Liu, Xinjie Zhang, Xiaolong Liu, Tenggan Zhang, Liyu Meng, Yuchen Liu, Yuanyuan Deng, Wenqiang Jiang

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09057 2023-03-17 eess.AS cs.SD 79%

TriAAN-VC: Triple Adaptive Attention Normalization for Any-to-Any Voice Conversion

Hyun Joon Park, Seok Woo Yang, Jin Sob Kim, Wooseok Shin, Sung Won Han

专题命中 音频语音多模态 :any-to-any(title,abstract);分类 eess.AS

Comments To appear in ICASSP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.08295 2023-03-16 eess.SP cs.SD eess.AS 79%

A large-scale multimodal dataset of human speech recognition

Yao Ge, Chong Tang, Haobo Li, Zikang Zhang, Wenda Li, Kevin Chetty, Daniele Faccio, Qammer H. Abbasi, Muhammad Imran

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07005 2023-03-14 eess.AS 79%

Real-Time Audio-Visual End-to-End Speech Enhancement

Zirun Zhu, Hemin Yang, Min Tang, Ziyi Yang, Sefik Emre Eskimez, Huaming Wang

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

Comments Accepted by ICASSP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02348 2023-03-07 cs.SD eess.AS 79%

The DKU Post-Challenge Audio-Visual Wake Word Spotting System for the 2021 MISP Challenge: Deep Analysis

Haoxu Wang, Ming Cheng, Qiang Fu, Ming Li

专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract);分类 eess.AS

Comments Accepted by ICASSP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.11532 2023-02-28 cs.SD eess.AS 79%

Key-Sparse Transformer for Multimodal Speech Emotion Recognition

Weidong Chen, Xiaofeng Xing, Xiangmin Xu, Jichen Yang, Jianxin Pang

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

Comments This paper was accepted by ICASSP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.06127 2023-02-20 eess.AS cs.SD eess.SP 79%

MM-ALT: A Multimodal Automatic Lyric Transcription System

Xiangming Gu, Longshen Ou, Danielle Ong, Ye Wang

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

Comments Accepted by ACM Multimedia 2022. Camera ready version and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏