arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4597 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2103.01894 2021-03-03 cs.SD cs.CL eess.AS 62%

Investigations on Audiovisual Emotion Recognition in Noisy Conditions

Michael Neumann, Ngoc Thang Vu

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Published at the IEEE workshop on Spoken Language Technology (SLT) 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.09281 2021-02-19 cs.LG cs.CV cs.SD eess.AS 62%

DINO: A Conditional Energy-Based GAN for Domain Translation

Konstantinos Vougioukas, Stavros Petridis, Maja Pantic

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、eess.AS

Comments Accepted to ICLR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.08639 2021-02-15 cs.CV cs.SD eess.AS 62%

Detecting Adversarial Attacks On Audiovisual Speech Recognition

Pingchuan Ma, Stavros Petridis, Maja Pantic

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、eess.AS

Comments Accepted to ICASSP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.05894 2021-02-12 cs.SD cs.AI eess.AS 62%

CASA-Based Speaker Identification Using Cascaded GMM-CNN Classifier in Noisy and Emotional Talking Conditions

Ali Bou Nassif, Ismail Shahin, Shibani Hamsa, Nawel Nemmour, Keikichi Hirose

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI、eess.AS

Comments Published in Applied Soft Computing journal

Journal ref Applied Soft Computing, Elsevier, 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.10203 2021-02-12 cs.LG cs.CL cs.SD eess.AS 62%

Replacing Human Audio with Synthetic Audio for On-device Unspoken Punctuation Prediction

Daria Soboleva, Ondrej Skopek, Márius Šajgalík, Victor Cărbune, Felix Weissenberger, Julia Proskurnia, Bogdan Prisacari, Daniel Valcarce, Justin Lu, Rohit Prabhavalkar, Balint Miklos

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

Comments Accepted to IEEE ICASSP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.02028 2021-02-04 cs.SD cs.CV eess.AS 62%

Music source separation conditioned on 3D point clouds

Francesc Lluís, Vasileios Chatziioannou, Alex Hofmann

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.13872 2020-12-29 cs.CL cs.AI cs.CY 62%

My Teacher Thinks The World Is Flat! Interpreting Automatic Essay Scoring Mechanism

Swapnil Parekh, Yaman Kumar Singla, Changyou Chen, Junyi Jessy Li, Rajiv Ratn Shah

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.05158 2020-11-11 cs.SD cs.AI cs.LG eess.AS 62%

GANterpretations

Pablo Samuel Castro

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI、eess.AS

Comments In 4th Workshop on Machine Learning for Creativity and Design at NeurIPS 2020, Vancouver, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.06686 2020-11-04 eess.AS cs.CL cs.LG cs.SD stat.ML 62%

Perception of prosodic variation for speech synthesis using an unsupervised discrete representation of F0

Zack Hodari, Catherine Lai, Simon King

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

Comments Published to the 10th ISCA International Conference on Speech Prosody (SP2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.14565 2020-10-29 cs.SD cs.MM eess.AS 62%

Remixing Music with Visual Conditioning

Li-Chia Yang, Alexander Lerch

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM、eess.AS

Journal ref 2020 IEEE International Symposium on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.13035 2020-10-27 cs.HC cs.MM cs.SD eess.AS 62%

Enactive Mandala: Audio-visualizing Brain Waves

Tomohiro Tokunaga, Michael J. Lyons

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM、eess.AS

Comments 2 pages, 2 figures

Journal ref Proceedings of the International Conference on New Interfaces for Musical Expression, 2013

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.05163 2020-09-24 cs.CL cs.AI cs.LG 62%

ConfNet2Seq: Full Length Answer Generation from Spoken Questions

Vaishali Pal, Manish Shrivastava, Laurent Besacier

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments Accepted at Text, Speech and Dialogue, 2020

Journal ref ConfNet2Seq, Text, Speech, and Dialogue - 23rd International Conference, {TSD}, Brno, Czech Republic, September 8-11, 2020, Proceedings, 12284, 2020, 524-531 (2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.02814 2020-08-06 eess.AS cs.CL cs.LG cs.SD 62%

CSTNet: Contrastive Speech Translation Network for Self-Supervised Speech Representation Learning

Sameer Khurana, Antoine Laurent, James Glass

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.08005 2020-07-17 eess.AS cs.CL cs.LG cs.SD 62%

Xiaomingbot: A Multilingual Robot News Reporter

Runxin Xu, Jun Cao, Mingxuan Wang, Jiaze Chen, Hao Zhou, Ying Zeng, Yuping Wang, Li Chen, Xiang Yin, Xijin Zhang, Songcheng Jiang, Yuxuan Wang, Lei Li

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Accepted to ACL 2020 - system demonstration

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.08449 2020-07-17 cs.CV cs.LG cs.MM 62%

Cross-Task Transfer for Geotagged Audiovisual Aerial Scene Recognition

Di Hu, Xuhong Li, Lichao Mou, Pu Jin, Dong Chen, Liping Jing, Xiaoxiang Zhu, Dejing Dou

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments ECCV 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.10981 2020-06-29 cs.SD cs.CV cs.LG eess.AS 62%

AutoFoley: Artificial Synthesis of Synchronized Sound Tracks for Silent Videos with Deep Learning

Sanchita Ghose, John J. Prevost

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、eess.AS

Comments 14 pages, 14 figures

Journal ref IEEE TRANSACTIONS ON MULTIMEDIA, 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.06175 2020-06-15 cs.CV cs.SD eess.AS 62%

Telling Left from Right: Learning Spatial Correspondence of Sight and Sound

Karren Yang, Bryan Russell, Justin Salamon

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

Comments CVPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.12501 2020-05-27 cs.AI cs.CL cs.HC 62%

History-Aware Question Answering in a Blocks World Dialogue System

Benjamin Kane, Georgiy Platonov, Lenhart K. Schubert

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.09812 2020-05-21 cs.CV cs.SD eess.AS 62%

Active Speakers in Context

Juan Leon Alcazar, Fabian Caba Heilbron, Long Mai, Federico Perazzi, Joon-Young Lee, Pablo Arbelaez, Bernard Ghanem

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.11724 2020-04-27 cs.MM cs.SD eess.AS eess.IV 62%

Using Cell Phone Pictures of Sheet Music To Retrieve MIDI Passages

TJ Tsai, Daniel Yang, Mengyi Shan, Thitaree Tanprasert, Teerapat Jenrungrot

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.MM、eess.AS

Comments 13 pages, 8 figures, 3 tables. Accepted article in IEEE Transactions on Multimedia. arXiv admin note: text overlap with arXiv:2004.10347

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.10391 2020-04-23 eess.AS cs.MM cs.SD eess.IV 62%

Towards Linking the Lakh and IMSLP Datasets

TJ Tsai

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.MM、eess.AS

Comments 5 pages, 4 figures, 1 table. Accepted paper at the International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.10347 2020-04-23 cs.MM cs.SD eess.AS eess.IV 62%

MIDI Passage Retrieval Using Cell Phone Pictures of Sheet Music

Daniel Yang, Thitaree Tanprasert, Teerapat Jenrungrot, Mengyi Shan, TJ Tsai

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.MM、eess.AS

Comments 8 pages, 8 figures, 1 table. Accepted paper at the International Society for Music Information Retrieval Conference (ISMIR) 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.07208 2020-03-13 cs.HC cs.AI cs.LG eess.AS 62%

MFCC-based Recurrent Neural Network for Automatic Clinical Depression Recognition and Assessment from Speech

Emna Rejaibi, Ali Komaty, Fabrice Meriaudeau, Said Agrebi, Alice Othmani

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI、eess.AS

Comments 14 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.09602 2020-02-17 cs.CL cs.LG cs.SD eess.AS 62%

Learning Hierarchical Discrete Linguistic Units from Visually-Grounded Speech

David Harwath, Wei-Ning Hsu, James Glass

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Camera-ready version for ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.02369 2020-02-07 eess.IV cs.AI cs.CV 62%

Covering the News with (AI) Style

Michele Merler, Cicero Nogueira dos Santos, Mauro Martino, Alfio M. Gliozzo, John R. Smith

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.10458 2019-12-24 cs.SD cs.CL eess.AS 62%

Emotion Recognition from Speech

Kannan Venkataramanan, Haresh Rengaraj Rajamohan

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.06606 2019-12-16 cs.CV cs.LG cs.MM eess.IV 62%

Music-oriented Dance Video Synthesis with Pose Perceptual Loss

Xuanchi Ren, Haoran Li, Zijian Huang, Qifeng Chen

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.11502 2019-11-27 cs.CV cs.LG eess.AS 62%

Hearing Lips: Improving Lip Reading by Distilling Speech Recognizers

Ya Zhao, Rui Xu, Xinchao Wang, Peng Hou, Haihong Tang, Mingli Song

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、eess.AS

Comments AAAI 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.09655 2019-11-22 cs.CL cs.LG cs.SD eess.AS 62%

Temporal Reasoning via Audio Question Answering

Haytham M. Fayek, Justin Johnson

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.05609 2019-11-14 cs.MM cs.CV 62%

Affective Computing for Large-Scale Heterogeneous Multimedia Data: A Survey

Sicheng Zhao, Shangfei Wang, Mohammad Soleymani, Dhiraj Joshi, Qiang Ji

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments Accepted by ACM TOMM

详情

展开后加载摘要…

URL PDF HTML 收藏