arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2406.03872 2024-06-07 cs.CL cs.SD eess.AS 62%

BLSP-Emo: Towards Empathetic Large Speech-Language Models

Chen Wang, Minpeng Liao, Zhongqiang Huang, Junhong Wu, Chengqing Zong, Jiajun Zhang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07671 2024-06-07 cs.RO cs.AI cs.LG cs.SD eess.AS eess.IV 62%

Reacting like Humans: Incorporating Intrinsic Human Behaviors into NAO through Sound-Based Reactions to Fearful and Shocking Events for Enhanced Sociability

Ali Ghadami, Mohammadreza Taghimohammadi, Mohammad Mohammadzadeh, Mohammad Hosseinipour, Alireza Taheri

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI、eess.AS

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02699 2024-06-05 eess.AS cs.AI 62%

Continual Contrastive Spoken Language Understanding

Umberto Cappellazzo, Enrico Fini, Muqiao Yang, Daniele Falavigna, Alessio Brutti, Bhiksha Raj

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

Comments Accepted to ACL Findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15255 2024-06-03 cs.CL cs.LG cs.SD eess.AS 62%

Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM

Eliya Nachmani, Alon Levkovitch, Roy Hirsch, Julian Salazar, Chulayuth Asawaroengchai, Soroosh Mariooryad, Ehud Rivlin, RJ Skerry-Ryan, Michelle Tadmor Ramanovich

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS

Comments ICLR 2024 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12568 2024-05-17 cs.CV cs.MM 62%

NeRF-AD: Neural Radiance Field with Attention-based Disentanglement for Talking Face Synthesis

Chongke Bi, Xiaoxing Liu, Zhilei Liu

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments Accepted by ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05636 2024-05-10 cs.CV cs.AI 62%

SwapTalk: Audio-Driven Talking Face Generation with One-Shot Customization in Latent Space

Zeren Zhang, Haibo Qin, Jiayu Huang, Yixin Li, Hui Lin, Yitao Duan, Jinwen Ma

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01801 2024-05-08 cs.LG cs.AI cs.CL 62%

Large Language Models for Time Series: A Survey

Xiyuan Zhang, Ranak Roy Chowdhury, Rajesh K. Gupta, Jingbo Shang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments GitHub repository: https://github.com/xiyuanzh/awesome-llm-time-series

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11371 2024-04-19 eess.AS cs.CL 62%

Visually grounded few-shot word learning in low-resource settings

Leanne Nortje, Dan Oneata, Herman Kamper

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Accepted to TASLP. arXiv admin note: substantial text overlap with arXiv:2305.15937

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06753 2024-04-16 cs.CL cs.AI 62%

AudioChatLlama: Towards General-Purpose Speech Abilities for LLMs

Yassir Fathullah, Chunyang Wu, Egor Lakomkin, Ke Li, Junteng Jia, Yuan Shangguan, Jay Mahadeokar, Ozlem Kalinli, Christian Fuegen, Mike Seltzer

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05916 2024-04-11 cs.CV cs.AI 62%

GPT as Psychologist? Preliminary Evaluations for GPT-4V on Visual Affective Computing

Hao Lu, Xuesong Niu, Jiyao Wang, Yin Wang, Qingyong Hu, Jiaqi Tang, Yuting Zhang, Kaishen Yuan, Bin Huang, Zitong Yu, Dengbo He, Shuiguang Deng, Hao Chen, Yingcong Chen, Shiguang Shan

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07092 2024-04-09 cs.CL cs.AI 62%

To Tell The Truth: Language of Deception and Language Models

Sanchaita Hazra, Bodhisattwa Prasad Majumder

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、cs.AI

Comments Accepted as a full paper in NAACL 2024 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16781 2024-04-03 cs.CV cs.CL cs.LG 62%

Kiki or Bouba? Sound Symbolism in Vision-and-Language Models

Morris Alper, Hadar Averbuch-Elor

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted to NeurIPS 2023 (spotlight). Project webpage: https://kiki-bouba.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13667 2024-03-21 cs.CV cs.MM 62%

DanceCamera3D: 3D Camera Movement Synthesis with Music and Dance

Zixuan Wang, Jia Jia, Shikun Sun, Haozhe Wu, Rong Han, Zhenyu Li, Di Tang, Jiaqing Zhou, Jiebo Luo

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments Accept to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15514 2024-02-29 cs.CL cs.AI 62%

Large Scale Generative AI Text Applied to Sports and Music

Aaron Baughman, Stephen Hammer, Rahul Agarwal, Gozde Akay, Eduardo Morales, Tony Johnson, Leonid Karlinsky, Rogerio Feris

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 9 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.15862 2024-02-28 cs.CV cs.AI cs.LG 62%

Snapture -- A Novel Neural Architecture for Combined Static and Dynamic Hand Gesture Recognition

Hassan Ali, Doreen Jirak, Stefan Wermter

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments In Cognitive Computation(Accepted:30/06/2023, Published:17/07/2023),20 pages,20 figures,4 tables;Please find the published version/info to cite: https://doi.org/10.1007/s12559-023-10174-z;Repositories: https://zenodo.org/doi/10.5281/zenodo.10679196, https://zenodo.org/doi/10.5281/zenodo.10693816;This work was co-funded by Horizon Europe project TERAIS under Grant agreement number 101079338

Journal ref Cognitive Computation 15, 2014-2033 (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12445 2024-02-01 cs.SD cs.AI eess.AS 62%

SCRAPS: Speech Contrastive Representations of Acoustic and Phonetic Spaces

Ivan Vallés-Pérez, Grzegorz Beringer, Piotr Bilinski, Gary Cook, Roberto Barra-Chicote

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

Comments In proceedings of the 26th European Conference on Artificial Intelligence ECAI 2023. 8 pages + 1 appendix page

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15316 2024-01-18 cs.CL eess.AS 62%

Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue

Guan-Ting Lin, Prashanth Gurunath Shivakumar, Ankur Gandhe, Chao-Han Huck Yang, Yile Gu, Shalini Ghosh, Andreas Stolcke, Hung-yi Lee, Ivan Bulyko

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Accepted by ICASSP 2024. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04235 2024-01-10 cs.CL cs.SD eess.AS 62%

High-precision Voice Search Query Correction via Retrievable Speech-text Embedings

Christopher Li, Gary Wang, Kyle Kastner, Heng Su, Allen Chen, Andrew Rosenberg, Zhehuai Chen, Zelin Wu, Leonid Velikovich, Pat Rondon, Diamantino Caseiro, Petar Aleksic

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15272 2023-12-27 cs.CL cs.CY cs.LG cs.SD eess.AS 62%

Detecting anxiety from short clips of free-form speech

Prabhat Agarwal, Akshat Jindal, Shreya Singh

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.14136 2023-12-27 cs.SD cs.MM eess.AS 62%

Listen As You Wish: Audio based Event Detection via Text-to-Audio Grounding in Smart Cities

Haoyu Tang, Yunxiao Wang, Jihua Zhu, Shuaike Zhang, Mingzhu Xu, Qinghai Zheng, Yupeng Hu

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.MM、eess.AS

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11503 2023-12-20 cs.CL cs.AI 62%

Speech and Text-Based Emotion Recognizer

Varun Sharma

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments 11 pages 9 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10088 2023-12-20 eess.AS cs.CV cs.LG cs.SD 62%

On Robustness to Missing Video for Audiovisual Speech Recognition

Oscar Chang, Otavio Braga, Hank Liao, Dmitriy Serdyuk, Olivier Siohan

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17796 2023-12-19 cs.CV cs.MM 62%

ControlLLM: Augment Language Models with Tools by Searching on Graphs

Zhaoyang Liu, Zeqiang Lai, Zhangwei Gao, Erfei Cui, Ziheng Li, Xizhou Zhu, Lewei Lu, Qifeng Chen, Yu Qiao, Jifeng Dai, Wenhai Wang

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments 24 pages, 9 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09727 2023-12-18 cs.CV cs.SD eess.AS 62%

LiteVSR: Efficient Visual Speech Recognition by Learning from Speech Representations of Unlabeled Data

Hendrik Laux, Emil Mededovic, Ahmed Hallawa, Lukas Martin, Arne Peine, Anke Schmeink

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

Comments Accepted for publication at ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05187 2023-12-11 cs.CL cs.SD eess.AS 62%

Seamless: Multilingual Expressive and Streaming Speech Translation

Seamless Communication, Loïc Barrault, Yu-An Chung, Mariano Coria Meglioli, David Dale, Ning Dong, Mark Duppenthaler, Paul-Ambroise Duquenne, Brian Ellis, Hady Elsahar, Justin Haaheim, John Hoffman, Min-Jae Hwang, Hirofumi Inaguma, Christopher Klaiber, Ilia Kulikov, Pengwei Li, Daniel Licht, Jean Maillard, Ruslan Mavlyutov, Alice Rakotoarison, Kaushik Ram Sadagopan, Abinesh Ramakrishnan, Tuan Tran, Guillaume Wenzek, Yilin Yang, Ethan Ye, Ivan Evtimov, Pierre Fernandez, Cynthia Gao, Prangthip Hansanti, Elahe Kalbassi, Amanda Kallet, Artyom Kozhevnikov, Gabriel Mejia Gonzalez, Robin San Roman, Christophe Touret, Corinne Wong, Carleigh Wood, Bokai Yu, Pierre Andrews, Can Balioglu, Peng-Jen Chen, Marta R. Costa-jussà, Maha Elbayad, Hongyu Gong, Francisco Guzmán, Kevin Heffernan, Somya Jain, Justine Kao, Ann Lee, Xutai Ma, Alex Mourachko, Benjamin Peloquin, Juan Pino, Sravya Popuri, Christophe Ropers, Safiyyah Saleem, Holger Schwenk, Anna Sun, Paden Tomasello, Changhan Wang, Jeff Wang, Skyler Wang, Mary Williamson

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18168 2023-12-01 cs.CV cs.LG eess.AS 62%

Probabilistic Speech-Driven 3D Facial Motion Synthesis: New Benchmarks, Methods, and Applications

Karren D. Yang, Anurag Ranjan, Jen-Hao Rick Chang, Raviteja Vemulapalli, Oncel Tuzel

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12457 2023-11-22 cs.CV cs.CL 62%

LIP-RTVE: An Audiovisual Database for Continuous Spanish in the Wild

David Gimeno-Gómez, Carlos-D. Martínez-Hinarejos

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted in Proceedings of LREC 2022 ( https://aclanthology.org/2022.lrec-1.294 )

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07014 2023-11-14 cs.CL cs.SD eess.AS 62%

Teach me with a Whisper: Enhancing Large Language Models for Analyzing Spoken Transcripts using Speech Embeddings

Fatema Hasan, Yulong Li, James Foulds, Shimei Pan, Bishwaranjan Bhattacharjee

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06285 2023-11-14 cs.CV cs.LG cs.SD eess.AS 62%

Sounding Bodies: Modeling 3D Spatial Sound of Humans Using Body Pose and Audio

Xudong Xu, Dejan Markovic, Jacob Sandakly, Todd Keebler, Steven Krenn, Alexander Richard

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS

Comments 37th Conference on Neural Information Processing Systems (NeurIPS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04091 2023-11-08 cs.CV cs.IR cs.LG cs.SD eess.AS 62%

Proceedings of the 5th International Workshop on Reading Music Systems

Jorge Calvo-Zaragoza, Alexander Pacha, Elona Shatri

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、eess.AS

Comments Proceedings edited by Jorge Calvo-Zaragoza, Alexander Pacha and Elona Shatri

详情

展开后加载摘要…

URL PDF HTML 收藏