arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2104.05752 2021-06-15 cs.CL cs.LG cs.SD eess.AS 62%

Speak or Chat with Me: End-to-End Spoken Language Understanding System with Flexible Inputs

Sujeong Cha, Wangrui Hou, Hyun Jung, My Phung, Michael Picheny, Hong-Kwang Kuo, Samuel Thomas, Edmilson Morais

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS

Comments Accepted to Interspeech 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.03408 2021-06-01 cs.LG cs.CL eess.AS stat.ML 62%

Learning to Detect Bipolar Disorder and Borderline Personality Disorder with Language and Speech in Non-Clinical Interviews

Bo Wang, Yue Wu, Niall Taylor, Terry Lyons, Maria Liakata, Alejo J Nevado-Holgado, Kate E A Saunders

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.02725 2021-05-25 eess.AS cs.CL cs.SD 62%

Any-to-Many Voice Conversion with Location-Relative Sequence-to-Sequence Modeling

Songxiang Liu, Yuewen Cao, Disong Wang, Xixin Wu, Xunying Liu, Helen Meng

专题命中 音频语音多模态 :any-to-any(abstract);分类 cs.CL、eess.AS

Comments Accepted by IEEE/ACM Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.00342 2021-05-12 cs.RO cs.AI cs.LG cs.SD eess.AS 62%

Robust Robotic Pouring using Audition and Haptics

Hongzhuo Liang, Chuangchuang Zhou, Shuang Li, Xiaojian Ma, Norman Hendrich, Timo Gerkmann, Fuchun Sun, Marcus Stoffel, Jianwei Zhang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

Comments accepted by IROS2020

Journal ref 2020 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.08700 2021-05-06 cs.CV eess.AS 62%

A Neural Lip-Sync Framework for Synthesizing Photorealistic Virtual News Anchors

Ruobing Zheng, Zhou Zhu, Bo Song, Changjiang Ji

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、eess.AS

Comments Accepted by ICPR2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.13262 2021-04-06 cs.CV cs.AI 62%

REXUP: I REason, I EXtract, I UPdate with Structured Compositional Reasoning for Visual Question Answering

Siwen Luo, Soyeon Caren Han, Kaiyuan Sun, Josiah Poon

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICONIP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.01264 2021-04-06 cs.CL cs.AI cs.LG 62%

Attention Forcing for Machine Translation

Qingyun Dou, Yiting Lu, Potsawee Manakul, Xixin Wu, Mark J. F. Gales

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments arXiv admin note: text overlap with arXiv:1909.12289

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.10018 2021-03-19 cs.SD cs.MM eess.AS 62%

Audio Description from Image by Modal Translation Network

Hailong Ning, Xiangtao Zheng, Yuan Yuan, Xiaoqiang Lu

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.01894 2021-03-03 cs.SD cs.CL eess.AS 62%

Investigations on Audiovisual Emotion Recognition in Noisy Conditions

Michael Neumann, Ngoc Thang Vu

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Published at the IEEE workshop on Spoken Language Technology (SLT) 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.09281 2021-02-19 cs.LG cs.CV cs.SD eess.AS 62%

DINO: A Conditional Energy-Based GAN for Domain Translation

Konstantinos Vougioukas, Stavros Petridis, Maja Pantic

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、eess.AS

Comments Accepted to ICLR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.08639 2021-02-15 cs.CV cs.SD eess.AS 62%

Detecting Adversarial Attacks On Audiovisual Speech Recognition

Pingchuan Ma, Stavros Petridis, Maja Pantic

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、eess.AS

Comments Accepted to ICASSP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.05894 2021-02-12 cs.SD cs.AI eess.AS 62%

CASA-Based Speaker Identification Using Cascaded GMM-CNN Classifier in Noisy and Emotional Talking Conditions

Ali Bou Nassif, Ismail Shahin, Shibani Hamsa, Nawel Nemmour, Keikichi Hirose

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI、eess.AS

Comments Published in Applied Soft Computing journal

Journal ref Applied Soft Computing, Elsevier, 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.10203 2021-02-12 cs.LG cs.CL cs.SD eess.AS 62%

Replacing Human Audio with Synthetic Audio for On-device Unspoken Punctuation Prediction

Daria Soboleva, Ondrej Skopek, Márius Šajgalík, Victor Cărbune, Felix Weissenberger, Julia Proskurnia, Bogdan Prisacari, Daniel Valcarce, Justin Lu, Rohit Prabhavalkar, Balint Miklos

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

Comments Accepted to IEEE ICASSP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.02028 2021-02-04 cs.SD cs.CV eess.AS 62%

Music source separation conditioned on 3D point clouds

Francesc Lluís, Vasileios Chatziioannou, Alex Hofmann

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.13872 2020-12-29 cs.CL cs.AI cs.CY 62%

My Teacher Thinks The World Is Flat! Interpreting Automatic Essay Scoring Mechanism

Swapnil Parekh, Yaman Kumar Singla, Changyou Chen, Junyi Jessy Li, Rajiv Ratn Shah

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.05158 2020-11-11 cs.SD cs.AI cs.LG eess.AS 62%

GANterpretations

Pablo Samuel Castro

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI、eess.AS

Comments In 4th Workshop on Machine Learning for Creativity and Design at NeurIPS 2020, Vancouver, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.06686 2020-11-04 eess.AS cs.CL cs.LG cs.SD stat.ML 62%

Perception of prosodic variation for speech synthesis using an unsupervised discrete representation of F0

Zack Hodari, Catherine Lai, Simon King

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

Comments Published to the 10th ISCA International Conference on Speech Prosody (SP2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.14565 2020-10-29 cs.SD cs.MM eess.AS 62%

Remixing Music with Visual Conditioning

Li-Chia Yang, Alexander Lerch

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM、eess.AS

Journal ref 2020 IEEE International Symposium on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.13035 2020-10-27 cs.HC cs.MM cs.SD eess.AS 62%

Enactive Mandala: Audio-visualizing Brain Waves

Tomohiro Tokunaga, Michael J. Lyons

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM、eess.AS

Comments 2 pages, 2 figures

Journal ref Proceedings of the International Conference on New Interfaces for Musical Expression, 2013

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.05163 2020-09-24 cs.CL cs.AI cs.LG 62%

ConfNet2Seq: Full Length Answer Generation from Spoken Questions

Vaishali Pal, Manish Shrivastava, Laurent Besacier

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments Accepted at Text, Speech and Dialogue, 2020

Journal ref ConfNet2Seq, Text, Speech, and Dialogue - 23rd International Conference, {TSD}, Brno, Czech Republic, September 8-11, 2020, Proceedings, 12284, 2020, 524-531 (2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.02814 2020-08-06 eess.AS cs.CL cs.LG cs.SD 62%

CSTNet: Contrastive Speech Translation Network for Self-Supervised Speech Representation Learning

Sameer Khurana, Antoine Laurent, James Glass

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.08005 2020-07-17 eess.AS cs.CL cs.LG cs.SD 62%

Xiaomingbot: A Multilingual Robot News Reporter

Runxin Xu, Jun Cao, Mingxuan Wang, Jiaze Chen, Hao Zhou, Ying Zeng, Yuping Wang, Li Chen, Xiang Yin, Xijin Zhang, Songcheng Jiang, Yuxuan Wang, Lei Li

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Accepted to ACL 2020 - system demonstration

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.08449 2020-07-17 cs.CV cs.LG cs.MM 62%

Cross-Task Transfer for Geotagged Audiovisual Aerial Scene Recognition

Di Hu, Xuhong Li, Lichao Mou, Pu Jin, Dong Chen, Liping Jing, Xiaoxiang Zhu, Dejing Dou

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments ECCV 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.10981 2020-06-29 cs.SD cs.CV cs.LG eess.AS 62%

AutoFoley: Artificial Synthesis of Synchronized Sound Tracks for Silent Videos with Deep Learning

Sanchita Ghose, John J. Prevost

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、eess.AS

Comments 14 pages, 14 figures

Journal ref IEEE TRANSACTIONS ON MULTIMEDIA, 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.06175 2020-06-15 cs.CV cs.SD eess.AS 62%

Telling Left from Right: Learning Spatial Correspondence of Sight and Sound

Karren Yang, Bryan Russell, Justin Salamon

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

Comments CVPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.12501 2020-05-27 cs.AI cs.CL cs.HC 62%

History-Aware Question Answering in a Blocks World Dialogue System

Benjamin Kane, Georgiy Platonov, Lenhart K. Schubert

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.09812 2020-05-21 cs.CV cs.SD eess.AS 62%

Active Speakers in Context

Juan Leon Alcazar, Fabian Caba Heilbron, Long Mai, Federico Perazzi, Joon-Young Lee, Pablo Arbelaez, Bernard Ghanem

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.11724 2020-04-27 cs.MM cs.SD eess.AS eess.IV 62%

Using Cell Phone Pictures of Sheet Music To Retrieve MIDI Passages

TJ Tsai, Daniel Yang, Mengyi Shan, Thitaree Tanprasert, Teerapat Jenrungrot

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.MM、eess.AS

Comments 13 pages, 8 figures, 3 tables. Accepted article in IEEE Transactions on Multimedia. arXiv admin note: text overlap with arXiv:2004.10347

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.10391 2020-04-23 eess.AS cs.MM cs.SD eess.IV 62%

Towards Linking the Lakh and IMSLP Datasets

TJ Tsai

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.MM、eess.AS

Comments 5 pages, 4 figures, 1 table. Accepted paper at the International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.10347 2020-04-23 cs.MM cs.SD eess.AS eess.IV 62%

MIDI Passage Retrieval Using Cell Phone Pictures of Sheet Music

Daniel Yang, Thitaree Tanprasert, Teerapat Jenrungrot, Mengyi Shan, TJ Tsai

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.MM、eess.AS

Comments 8 pages, 8 figures, 1 table. Accepted paper at the International Society for Music Information Retrieval Conference (ISMIR) 2019

详情

展开后加载摘要…

URL PDF HTML 收藏