arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

1909.07208 2020-03-13 cs.HC cs.AI cs.LG eess.AS 62%

MFCC-based Recurrent Neural Network for Automatic Clinical Depression Recognition and Assessment from Speech

Emna Rejaibi, Ali Komaty, Fabrice Meriaudeau, Said Agrebi, Alice Othmani

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI、eess.AS

Comments 14 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.09602 2020-02-17 cs.CL cs.LG cs.SD eess.AS 62%

Learning Hierarchical Discrete Linguistic Units from Visually-Grounded Speech

David Harwath, Wei-Ning Hsu, James Glass

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Camera-ready version for ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.02369 2020-02-07 eess.IV cs.AI cs.CV 62%

Covering the News with (AI) Style

Michele Merler, Cicero Nogueira dos Santos, Mauro Martino, Alfio M. Gliozzo, John R. Smith

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.10458 2019-12-24 cs.SD cs.CL eess.AS 62%

Emotion Recognition from Speech

Kannan Venkataramanan, Haresh Rengaraj Rajamohan

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.06606 2019-12-16 cs.CV cs.LG cs.MM eess.IV 62%

Music-oriented Dance Video Synthesis with Pose Perceptual Loss

Xuanchi Ren, Haoran Li, Zijian Huang, Qifeng Chen

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.11502 2019-11-27 cs.CV cs.LG eess.AS 62%

Hearing Lips: Improving Lip Reading by Distilling Speech Recognizers

Ya Zhao, Rui Xu, Xinchao Wang, Peng Hou, Haihong Tang, Mingli Song

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、eess.AS

Comments AAAI 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.09655 2019-11-22 cs.CL cs.LG cs.SD eess.AS 62%

Temporal Reasoning via Audio Question Answering

Haytham M. Fayek, Justin Johnson

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.05609 2019-11-14 cs.MM cs.CV 62%

Affective Computing for Large-Scale Heterogeneous Multimedia Data: A Survey

Sicheng Zhao, Shangfei Wang, Mohammad Soleymani, Dhiraj Joshi, Qiang Ji

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments Accepted by ACM TOMM

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.02524 2019-11-07 cs.AI cs.CL cs.HC 62%

A Spoken Dialogue System for Spatial Question Answering in a Physical Blocks World

Georgiy Platonov, Benjamin Kane, Aaron Gindi, Lenhart K. Schubert

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments 9 pages (with references), 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.12918 2019-10-10 cs.CV cs.HC cs.MM 62%

EmoCo: Visual Analysis of Emotion Coherence in Presentation Videos

Haipeng Zeng, Xingbo Wang, Aoyu Wu, Yong Wang, Quan Li, Alex Endert, Huamin Qu

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments 11 pages, 8 figures. Accepted by IEEE VAST 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.01218 2019-09-15 cs.CV cs.HC cs.LG cs.SD eess.AS 62%

Translating Visual Art into Music

Maximilian Müller-Eberstein, Nanne van Noord

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、eess.AS

Comments Accepted for ICCV 2019 Workshop on Fashion, Art and Design

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.01417 2019-09-05 cs.CV eess.AS 62%

Multi-level Attention network using text, audio and video for Depression Prediction

Anupama Ray, Siddharth Kumar, Rutvik Reddy, Prerana Mukherjee, Ritu Garg

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、eess.AS

Comments in Proceedings of the 9th International Workshop on Audio/Visual Emotion Challenge, AVEC 2019, ACM Multimedia Workshop, Nice, France

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.08065 2019-08-01 eess.AS cs.CL cs.SD 62%

Learning Robust Heterogeneous Signal Features from Parallel Neural Network for Audio Sentiment Analysis

Feiyang Chen, Ziqian Luo

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments 21 pages, PR JOURNAL

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.01195 2019-07-03 cs.SD cs.CV eess.AS 62%

Kite: Automatic speech recognition for unmanned aerial vehicles

Dan Oneata, Horia Cucu

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、eess.AS

Comments 5 pages, accepted at Interspeech 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.10996 2019-06-27 cs.IR cs.CV cs.LG cs.SD eess.AS 62%

Learning Soft-Attention Models for Tempo-invariant Audio-Sheet Music Retrieval

Stefan Balke, Matthias Dorfer, Luis Carvalho, Andreas Arzt, Gerhard Widmer

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、eess.AS

Comments Accepted for publication at ISMIR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.06337 2019-06-18 cs.CV cs.LG eess.AS 62%

Realistic Speech-Driven Facial Animation with GANs

Konstantinos Vougioukas, Stavros Petridis, Maja Pantic

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

Comments arXiv admin note: text overlap with arXiv:1805.09313

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.04160 2019-06-11 cs.CV cs.LG eess.AS 62%

Learning Individual Styles of Conversational Gesture

Shiry Ginosar, Amir Bar, Gefen Kohavi, Caroline Chan, Andrew Owens, Jitendra Malik

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、eess.AS

Comments CVPR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.10604 2019-06-04 cs.SD cs.CV cs.LG eess.AS eess.IV 62%

Reconstructing faces from voices

Yandong Wen, Rita Singh, Bhiksha Raj

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.10500 2019-04-25 cs.CL cs.HC cs.LG cs.SD eess.AS 62%

Natural Language Interactions in Autonomous Vehicles: Intent Detection and Slot Filling from Passenger Utterances

Eda Okur, Shachi H Kumar, Saurav Sahay, Asli Arslan Esme, Lama Nachman

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

Comments Accepted and presented as a full paper at 20th International Conference on Computational Linguistics and Intelligent Text Processing (CICLing 2019), April 7-13, 2019, La Rochelle, France

Journal ref Springer LNCS Proceedings for CICLing 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.05979 2019-04-15 cs.CV cs.SD eess.AS 62%

The Sound of Motions

Hang Zhao, Chuang Gan, Wei-Chiu Ma, Antonio Torralba

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.06031 2019-03-15 cs.CV cs.SD eess.AS 62%

Audiovisual Speaker Tracking using Nonlinear Dynamical Systems with Dynamic Stream Weights

Christopher Schymura, Dorothea Kolossa

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.08890 2019-03-04 cs.LG cs.AI cs.CV stat.ML 62%

Learning from Multiview Correlations in Open-Domain Videos

Nils Holzenberger, Shruti Palaskar, Pranava Madhyastha, Florian Metze, Raman Arora

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.11245 2019-03-01 cs.CL cs.LG cs.SD eess.AS 62%

Incorporating End-to-End Speech Recognition Models for Sentiment Analysis

Egor Lakomkin, Mohammad Ali Zamani, Cornelius Weber, Sven Magg, Stefan Wermter

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Accepted at the 2019 International Conference on Robotics and Automation (ICRA) will be held on May 20-24, 2019 in Montreal, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.07817 2019-02-22 cs.SD cs.CL eess.AS 62%

Audio-Linguistic Embeddings for Spoken Sentences

Albert Haque, Michelle Guo, Prateek Verma, Li Fei-Fei

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

Comments International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.10124 2019-01-30 cs.AI cs.CV cs.CY 62%

Adversarial Adaptation of Scene Graph Models for Understanding Civic Issues

Shanu Kumar, Shubham Atreja, Anjali Singh, Mohit Jain

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted at WWW'19

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.07205 2019-01-01 cs.MM cs.CL 62%

Audiovisual speaker diarization of TV series

Xavier Bost, Georges Linarès, Serigne Gueye

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.MM

Journal ref 2015 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Apr 2015, Brisbane, Australia. IEEE, pp.4799-4803, 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.08592 2018-11-28 cs.CV cs.SD eess.AS 62%

Measuring Depression Symptom Severity from Spoken Language and 3D Facial Expressions

Albert Haque, Michelle Guo, Adam S Miner, Li Fei-Fei

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、eess.AS

Comments Machine Learning for Health (ML4H) Workshop at NeurIPS 2018 arXiv:1811.07216

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.01307 2018-11-06 cs.CL cs.LG cs.SD eess.AS 62%

Towards Unsupervised Speech-to-Text Translation

Yu-An Chung, Wei-Hung Weng, Schrasing Tong, James Glass

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.00046 2018-08-02 cs.CV cs.LG cs.SD eess.AS 62%

Lip-Reading Driven Deep Learning Approach for Speech Enhancement

Ahsan Adeel, Mandar Gogate, Amir Hussain, William M. Whitmer

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

Comments 11 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.06391 2018-07-18 cs.AI cs.LG cs.SD eess.AS 62%

Learning to Listen, Read, and Follow: Score Following as a Reinforcement Learning Game

Matthias Dorfer, Florian Henkel, Gerhard Widmer

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

Comments Published in the Proceedings of the 19th International Society for Music Information Retrieval Conference, Paris, France, 2018

详情

展开后加载摘要…

URL PDF HTML 收藏