arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2409.11449 2024-09-19 cs.LG cs.AI cs.IR cs.SD eess.AS 62%

Evaluation of pretrained language models on music understanding

Yannis Vasilakis, Rachel Bittner, Johan Pauwels

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09823 2024-09-17 cs.SD cs.MM eess.AS 62%

Efficient Video to Audio Mapper with Visual Scene Detection

Mingjing Yi, Ming Li

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09289 2024-09-17 cs.SD cs.MM eess.AS 62%

DSCLAP: Domain-Specific Contrastive Language-Audio Pre-Training

Shengqiang Liu, Da Liu, Anna Wang, Zhiyu Zhang, Jie Gao, Yali Li

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09213 2024-09-17 eess.AS cs.CL cs.SD 62%

ReCLAP: Improving Zero Shot Audio Classification by Describing Sounds

Sreyan Ghosh, Sonal Kumar, Chandra Kiran Reddy Evuru, Oriol Nieto, Ramani Duraiswami, Dinesh Manocha

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

Comments Code and Checkpoints: https://github.com/Sreyan88/ReCLAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08795 2024-09-17 eess.AS cs.MM 62%

LLaQo: Towards a Query-Based Coach in Expressive Music Performance Assessment

Huan Zhang, Vincent Cheung, Hayato Nishioka, Simon Dixon, Shinichi Furuya

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08907 2024-09-16 cs.AI cs.CL cs.CY 62%

Affective Computing Has Changed: The Foundation Model Disruption

Björn Schuller, Adria Mallol-Ragolta, Alejandro Peña Almansa, Iosif Tsangko, Mostafa M. Amin, Anastasia Semertzidou, Lukas Christ, Shahin Amiriparian

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06348 2024-09-11 cs.SD cs.AI cs.CR eess.AS 62%

VoiceWukong: Benchmarking Deepfake Voice Detection

Ziwei Yan, Yanjie Zhao, Haoyu Wang

专题命中 音频语音多模态 :MLLM(abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03715 2024-09-06 cs.SD cs.AI eess.AS 62%

Applications and Advances of Artificial Intelligence in Music Generation:A Review

Yanxu Chen, Linshu Huang, Tian Gou

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02245 2024-09-05 cs.SD cs.AI cs.LG eess.AS stat.ML 62%

FastVoiceGrad: One-step Diffusion-Based Voice Conversion with Adversarial Conditional Diffusion Distillation

Takuhiro Kaneko, Hirokazu Kameoka, Kou Tanaka, Yuto Kondo

专题命中 音频语音多模态 :any-to-any(abstract);分类 cs.AI、eess.AS

Comments Accepted to Interspeech 2024. Project page: https://www.kecl.ntt.co.jp/people/kaneko.takuhiro/projects/fastvoicegrad/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21646 2024-09-02 cs.CL cs.SD eess.AS 62%

Towards Achieving Human Parity on End-to-end Simultaneous Speech Translation via LLM Agent

Shanbo Cheng, Zhichao Huang, Tom Ko, Hang Li, Ningxin Peng, Lu Xu, Qini Zhang

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

Comments Authors are listed in alphabetical order by last name. Demonstrations and human-annotated test sets are available at https://byteresearchcla.github.io/clasi

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18470 2024-09-02 cs.CE cs.AI cs.CL q-fin.RM q-fin.TR 62%

ECC Analyzer: Extract Trading Signal from Earnings Conference Calls using Large Language Model for Stock Performance Prediction

Yupeng Cao, Zhi Chen, Qingyun Pei, Nathan Jinseok Lee, K. P. Subbalakshmi, Papa Momar Ndiaye

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 9 pages, 1 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13608 2024-08-28 cs.MM cs.CL 62%

SpeechCraft: A Fine-grained Expressive Speech Dataset with Natural Language Description

Zeyu Jin, Jia Jia, Qixin Wang, Kehan Li, Shuoyi Zhou, Songtao Zhou, Xiaoyu Qin, Zhiyong Wu

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.MM

Comments Accepted by ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03900 2024-08-08 cs.CL cs.SD eess.AS 62%

Speech-MASSIVE: A Multilingual Speech Dataset for SLU and Beyond

Beomseok Lee, Ioan Calapodescu, Marco Gaido, Matteo Negri, Laurent Besacier

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Accepted at INTERSPEECH 2024. This version includes the same content but with additional appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03284 2024-08-07 cs.CV cs.GR cs.MM 62%

ReSyncer: Rewiring Style-based Generator for Unified Audio-Visually Synced Facial Performer

Jiazhi Guan, Zhiliang Xu, Hang Zhou, Kaisiyuan Wang, Shengyi He, Zhanwang Zhang, Borong Liang, Haocheng Feng, Errui Ding, Jingtuo Liu, Jingdong Wang, Youjian Zhao, Ziwei Liu

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM

Comments Accepted to European Conference on Computer Vision (ECCV), 2024. Project page: https://guanjz20.github.io/projects/ReSyncer

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18302 2024-08-07 cs.CV cs.RO eess.AS eess.IV 62%

EchoTrack: Auditory Referring Multi-Object Tracking for Autonomous Driving

Jiacheng Lin, Jiajun Chen, Kunyu Peng, Xuan He, Zhiyong Li, Rainer Stiefelhagen, Kailun Yang

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

Comments Accepted to IEEE Transactions on Intelligent Transportation Systems (T-ITS). The source code and datasets are available at https://github.com/lab206/EchoTrack

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18324 2024-07-29 cs.LG cs.CL eess.AS q-fin.CP q-fin.ST 62%

AMA-LSTM: Pioneering Robust and Fair Financial Audio Analysis for Stock Volatility Prediction

Shengkun Wang, Taoran Ji, Jianfeng He, Mariam Almutairi, Dan Wang, Linhan Wang, Min Zhang, Chang-Tien Lu

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13083 2024-07-23 cs.SD cs.CV eess.AS 62%

Modeling and Driving Human Body Soundfields through Acoustic Primitives

Chao Huang, Dejan Markovic, Chenliang Xu, Alexander Richard

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

Comments ECCV 2024. Project Page: https://wikichao.github.io/Acoustic-Primitives/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13782 2024-07-22 eess.AS cs.AI cs.SD 62%

Self-supervised ASR Models and Features For Dysarthric and Elderly Speech Recognition

Shujie Hu, Xurong Xie, Mengzhe Geng, Zengrui Jin, Jiajun Deng, Guinan Li, Yi Wang, Mingyu Cui, Tianzi Wang, Helen Meng, Xunying Liu

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI、eess.AS

Comments IEEE/ACM Transactions on Audio, Speech, and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09802 2024-07-19 eess.AS cs.CV cs.SD 62%

Efficient Training for Multilingual Visual Speech Recognition: Pre-training with Discretized Visual Speech Representation

Minsu Kim, Jeong Hun Yeo, Se Jin Park, Hyeongseop Rha, Yong Man Ro

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

Comments ACMMM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11855 2024-07-17 cs.CL cs.CV cs.LG 62%

Scaling Sign Language Translation

Biao Zhang, Garrett Tanzer, Orhan Firat

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10759 2024-07-16 eess.AS cs.CL cs.LG 62%

Qwen2-Audio Technical Report

Yunfei Chu, Jin Xu, Qian Yang, Haojie Wei, Xipin Wei, Zhifang Guo, Yichong Leng, Yuanjun Lv, Jinzheng He, Junyang Lin, Chang Zhou, Jingren Zhou

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

Comments https://github.com/QwenLM/Qwen2-Audio. Checkpoints, codes and scripts will be opensoursed soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04533 2024-07-10 cs.CL cs.SD eess.AS 62%

Performance Analysis of Speech Encoders for Low-Resource SLU and ASR in Tunisian Dialect

Salima Mdhaffar, Haroun Elleuch, Fethi Bougares, Yannick Estève

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Accepted in ArabicNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05368 2024-07-09 cs.SD cs.AI cs.IR eess.AS 62%

Music Era Recognition Using Supervised Contrastive Learning and Artist Information

Qiqi He, Xuchen Song, Weituo Hao, Ju-Chiang Wang, Wei-Tsung Lu, Wei Li

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01751 2024-07-09 cs.CV cs.SD eess.AS 62%

T-VSL: Text-Guided Visual Sound Source Localization in Mixtures

Tanvir Mahmud, Yapeng Tian, Diana Marculescu

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

Comments Accepted in CVPR-2024. Code: https://github.com/enyac-group/T-VSL/tree/main

Journal ref IEEE/CVF Computer Vision and Pattern Recognition (CVPR) Conference, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02318 2024-07-03 cs.SD cs.CV cs.LG eess.AS 62%

The Solution for Temporal Sound Localisation Task of ICCV 1st Perception Test Challenge 2023

Yurui Huang, Yang Yang, Shou Chen, Xiangyu Wu, Qingguo Chen, Jianfeng Lu

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01494 2024-07-02 cs.CV cs.SD eess.AS 62%

FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds

Yiming Zhang, Yicheng Gu, Yanhong Zeng, Zhening Xing, Yuancheng Wang, Zhizheng Wu, Kai Chen

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

Comments Project page: https://foleycrafter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17667 2024-06-26 cs.SD cs.CL eess.AS 62%

This Paper Had the Smartest Reviewers -- Flattery Detection Utilising an Audio-Textual Transformer-Based Approach

Lukas Christ, Shahin Amiriparian, Friederike Hawighorst, Ann-Kathrin Schill, Angelo Boutalikakis, Lorenz Graf-Vlachy, Andreas König, Björn W. Schuller

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Interspeech 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10993 2024-06-18 cs.CL cs.LG cs.SD eess.AS 62%

CoSTA: Code-Switched Speech Translation using Aligned Speech-Text Interleaving

Bhavani Shankar, Preethi Jyothi, Pushpak Bhattacharyya

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06786 2024-06-17 cs.SD cs.AI eess.AS 62%

BTS: Bridging Text and Sound Modalities for Metadata-Aided Respiratory Sound Classification

June-Woo Kim, Miika Toikkanen, Yera Choi, Seoung-Eun Moon, Ho-Young Jung

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

Comments Accepted INTERSPEECH 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07801 2024-06-13 cs.CL cs.SD eess.AS 62%

PolySpeech: Exploring Unified Multitask Speech Models for Competitiveness with Single-task Models

Runyan Yang, Huibao Yang, Xiqing Zhang, Tiantian Ye, Ying Liu, Yingying Gao, Shilei Zhang, Chao Deng, Junlan Feng

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏