arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4597 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2402.01708 2024-05-16 cs.CL cs.AI cs.CY eess.AS 67%

Not My Voice! A Taxonomy of Ethical and Safety Harms of Speech Generators

Wiebke Hutiri, Oresiti Papakyriakopoulos, Alice Xiang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments 17 pages, 4 tables, 4 figures Accepted at the 2024 ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT '24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00384 2024-05-02 cs.CV cs.MM cs.SD eess.AS 67%

Visual and audio scene classification for detecting discrepancies in video: a baseline method and experimental protocol

Konstantinos Apostolidis, Jakob Abesser, Luca Cuccovillo, Vasileios Mezaris

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted for publication, 3rd ACM Int. Workshop on Multimedia AI against Disinformation (MAD'24) at ACM ICMR'24, June 10, 2024, Phuket, Thailand. This is the "accepted version"

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17608 2024-04-30 cs.SD cs.AI cs.CV cs.LG eess.AS 67%

Synthesizing Audio from Silent Video using Sequence to Sequence Modeling

Hugo Garrido-Lestache Belinchon, Helina Mulugeta, Adam Haile

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16055 2024-04-23 cs.CE 67%

Modal-adaptive Knowledge-enhanced Graph-based Financial Prediction from Monetary Policy Conference Calls with LLM

Kun Ouyang, Yi Liu, Shicheng Li, Ruihan Bao, Keiko Harimoto, Xu Sun

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract)

Comments Accepted by LREC Coling 2024 -FinNLP (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05995 2024-04-16 cs.SD cs.AI cs.GR cs.MM eess.AS 67%

Audio is all in one: speech-driven gesture synthetics using WavLM pre-trained model

Fan Zhang, Naye Ji, Fuxing Gao, Siyuan Zhao, Zhaohan Wang, Shunman Li

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

Comments This article needs major revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19002 2024-04-02 cs.MM cs.CV cs.SD eess.AS 67%

Robust Active Speaker Detection in Noisy Environments

Siva Sai Nagender Vasireddy, Chenxu Zhang, Xiaohu Guo, Yapeng Tian

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18843 2024-03-29 cs.CV cs.CL cs.LG cs.SD eess.AS 67%

JEP-KD: Joint-Embedding Predictive Architecture Based Knowledge Distillation for Visual Speech Recognition

Chang Sun, Hong Yang, Bo Qin

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10805 2024-03-19 cs.SD cs.AI cs.CV cs.GR cs.HC eess.AS 67%

Speech-driven Personalized Gesture Synthetics: Harnessing Automatic Fuzzy Feature Inference

Fan Zhang, Zhaohan Wang, Xin Lyu, Siyuan Zhao, Mengjian Li, Weidong Geng, Naye Ji, Hui Du, Fuxing Gao, Hao Wu, Shunman Li

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI、eess.AS

Comments 12 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09407 2024-03-15 cs.SD cs.AI cs.LG cs.MM eess.AS 67%

LM2D: Lyrics- and Music-Driven Dance Synthesis

Wenjie Yin, Xuejiao Zhao, Yi Yu, Hang Yin, Danica Kragic, Mårten Björkman

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08508 2024-02-26 cs.RO 67%

MOSAIC: Learning Unified Multi-Sensory Object Property Representations for Robot Learning via Interactive Perception

Gyan Tatiya, Jonathan Francis, Ho-Hsiang Wu, Yonatan Bisk, Jivko Sinapov

专题命中 音频语音多模态 :multimodal(abstract);multimodal foundation model(abstract)

Comments Accepted to the 2024 IEEE International Conference on Robotics and Automation (ICRA), May 13 to 17, 2024; Yokohama, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08489 2024-02-02 cs.CL cs.AI cs.SD eess.AS 67%

Effectiveness of Text, Acoustic, and Lattice-based representations in Spoken Language Understanding tasks

Esaú Villatoro-Tello, Srikanth Madikeri, Juan Zuluaga-Gomez, Bidisha Sharma, Seyyed Saeed Sarfjoo, Iuliia Nigmatulina, Petr Motlicek, Alexei V. Ivanov, Aravind Ganapathiraju

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments Accepted in ICASSP 2023

Journal ref ICASSP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00789 2024-01-26 cs.CL cs.AI eess.AS eess.SP 67%

Improved Cross-Lingual Transfer Learning For Automatic Speech Translation

Sameer Khurana, Nauman Dawalatabad, Antoine Laurent, Luis Vicente, Pablo Gimeno, Victoria Mingote, James Glass

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05535 2024-01-19 cs.CL cs.AI cs.IR cs.LG cs.SD eess.AS 67%

Detecting Check-Worthy Claims in Political Debates, Speeches, and Interviews Using Audio Data

Petar Ivanov, Ivan Koychev, Momchil Hardalov, Preslav Nakov

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments Check-Worthiness, Fact-Checking, Fake News, Misinformation, Disinformation, Political Debates, Multimodality

Journal ref ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08535 2024-01-15 cs.CV cs.AI eess.AS 67%

Visual Speech Recognition for Languages with Limited Labeled Data using Automatic Labels from Whisper

Jeong Hun Yeo, Minsu Kim, Shinji Watanabe, Yong Man Ro

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、eess.AS

Comments Accepted at ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03937 2024-01-08 cs.SD cs.CV cs.MM eess.AS 67%

Diffusion Models as Masked Audio-Video Learners

Elvis Nunez, Yanzi Jin, Mohammad Rastegari, Sachin Mehta, Maxwell Horton

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Camera-ready version for the Machine Learning for Audio Workshop at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03810 2023-11-08 cs.CL cs.AI cs.SD eess.AS 67%

Rethinking and Improving Multi-task Learning for End-to-end Speech Translation

Yuhao Zhang, Chen Xu, Bei Li, Hao Chen, Tong Xiao, Chunliang Zhang, Jingbo Zhu

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments Accepted to EMNLP2023 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08715 2023-10-16 cs.CL cs.AI cs.SD eess.AS 67%

Toward Joint Language Modeling for Speech Units and Text

Ju-Chieh Chou, Chung-Ming Chien, Wei-Ning Hsu, Karen Livescu, Arun Babu, Alexis Conneau, Alexei Baevski, Michael Auli

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments EMNLP findings 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07403 2023-10-12 cs.CL cs.AI cs.SD eess.AS 67%

DASpeech: Directed Acyclic Transformer for Fast and High-quality Speech-to-Speech Translation

Qingkai Fang, Yan Zhou, Yang Feng

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments NeurIPS 2023. Audio samples are available at https://ictnlp.github.io/daspeech-demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09417 2023-09-15 eess.AS cs.AI cs.CV cs.HC cs.LG 67%

Diff-TTSG: Denoising probabilistic integrated speech and gesture synthesis

Shivam Mehta, Siyang Wang, Simon Alexanderson, Jonas Beskow, Éva Székely, Gustav Eje Henter

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、eess.AS

Comments 7 pages, 2 figures, presented at the ISCA Speech Synthesis Workshop (SSW) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11095 2023-08-17 eess.AS cs.AI cs.CL cs.LG cs.SD 67%

Prompting the Hidden Talent of Web-Scale Speech Models for Zero-Shot Task Generalization

Puyuan Peng, Brian Yan, Shinji Watanabe, David Harwath

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、cs.AI、eess.AS

Comments Interspeech 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06125 2023-08-14 cs.CL cs.AI cs.SD eess.AS 67%

Improving Joint Speech-Text Representations Without Alignment

Cal Peyser, Zhong Meng, Ke Hu, Rohit Prabhavalkar, Andrew Rosenberg, Tara N. Sainath, Michael Picheny, Kyunghyun Cho

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

Journal ref INTERSPEECH 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.03190 2023-08-11 cs.SD cs.CV cs.MM eess.AS 67%

Learning Music-Dance Representations through Explicit-Implicit Rhythm Synchronization

Jiashuo Yu, Junfu Pu, Ying Cheng, Rui Feng, Ying Shan

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted for publication in IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08071 2023-07-18 cs.CV cs.MM cs.SD eess.AS 67%

MAViL: Masked Audio-Video Learners

Po-Yao Huang, Vasu Sharma, Hu Xu, Chaitanya Ryali, Haoqi Fan, Yanghao Li, Shang-Wen Li, Gargi Ghosh, Jitendra Malik, Christoph Feichtenhofer

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.12925 2023-06-23 cs.CL cs.AI cs.SD eess.AS stat.ML 67%

AudioPaLM: A Large Language Model That Can Speak and Listen

Paul K. Rubenstein, Chulayuth Asawaroengchai, Duc Dung Nguyen, Ankur Bapna, Zalán Borsos, Félix de Chaumont Quitry, Peter Chen, Dalia El Badawy, Wei Han, Eugene Kharitonov, Hannah Muckenhirn, Dirk Padfield, James Qin, Danny Rozenberg, Tara Sainath, Johan Schalkwyk, Matt Sharifi, Michelle Tadmor Ramanovich, Marco Tagliasacchi, Alexandru Tudor, Mihajlo Velimirović, Damien Vincent, Jiahui Yu, Yongqiang Wang, Vicky Zayats, Neil Zeghidour, Yu Zhang, Zhishuai Zhang, Lukas Zilka, Christian Frank

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.15329 2023-06-16 cs.CL cs.AI eess.AS 67%

SpeechLM: Enhanced Speech Pre-Training with Unpaired Textual Data

Ziqiang Zhang, Sanyuan Chen, Long Zhou, Yu Wu, Shuo Ren, Shujie Liu, Zhuoyuan Yao, Xun Gong, Lirong Dai, Jinyu Li, Furu Wei

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments We have corrected the errors in the pre-training data for SpeechLM-P Base models, new results are updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02596 2023-06-06 eess.AS cs.CL cs.CV 67%

A Novel Interpretable and Generalizable Re-synchronization Model for Cued Speech based on a Multi-Cuer Corpus

Lufei Gao, Shan Huang, Li Liu

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、eess.AS

Comments 5 pages, 4 figures, Accepted to INTERSPEECH2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17993 2023-05-30 cs.SD cs.AI cs.MM eess.AS 67%

Multi-Scale Attention for Audio Question Answering

Guangyao Li, Yixin Xu, Di Hu

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、cs.MM、eess.AS

Comments Accepted by InterSpeech 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.13003 2023-05-30 cs.CL cs.AI cs.SD eess.AS 67%

Knowledge Transfer from Pre-trained Language Models to Cif-based Speech Recognizers via Hierarchical Distillation

Minglun Han, Feilong Chen, Jing Shi, Shuang Xu, Bo Xu

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments Accepted by INTERSPEECH 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17499 2023-05-30 cs.CL cs.MM eess.AS 67%

CIF-PT: Bridging Speech and Text Representations for Spoken Language Understanding via Continuous Integrate-and-Fire Pre-Training

Linhao Dong, Zhecheng An, Peihao Wu, Jun Zhang, Lu Lu, Zejun Ma

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.MM、eess.AS

Comments Accepted by ACL 2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13738 2023-05-24 cs.CL cs.AI cs.CV 67%

i-Code Studio: A Configurable and Composable Framework for Integrative AI

Yuwei Fang, Mahmoud Khademi, Chenguang Zhu, Ziyi Yang, Reid Pryzant, Yichong Xu, Yao Qian, Takuya Yoshioka, Lu Yuan, Michael Zeng, Xuedong Huang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏