arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4597 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2411.02851 2024-11-06 cs.MM cs.AI cs.CL cs.HC cs.IR 67%

Learning to Unify Audio, Visual and Text for Audio-Enhanced Multilingual Visual Answer Localization

Zhibin Wen, Bin Li

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11190 2024-11-06 eess.AS cs.AI cs.CV cs.LG cs.SD 67%

Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities

Zhifei Xie, Changqiao Wu

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、eess.AS

Comments Technical report, work in progress. Demo and code: https://github.com/gpt-omni/mini-omni2

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20336 2024-10-29 cs.CL cs.AI cs.SD eess.AS 67%

Get Large Language Models Ready to Speak: A Late-fusion Approach for Speech Generation

Maohao Shen, Shun Zhang, Jilong Wu, Zhiping Xiu, Ehab AlBadawy, Yiting Lu, Mike Seltzer, Qing He

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19168 2024-10-28 eess.AS cs.AI cs.CL cs.SD 67%

MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark

S Sakshi, Utkarsh Tyagi, Sonal Kumar, Ashish Seth, Ramaneswaran Selvakumar, Oriol Nieto, Ramani Duraiswami, Sreyan Ghosh, Dinesh Manocha

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments Project Website: https://sakshi113.github.io/mmau_homepage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12957 2024-10-18 cs.SD cs.CV cs.MM eess.AS 67%

MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization

Ruiqi Li, Siqi Zheng, Xize Cheng, Ziang Zhang, Shengpeng Ji, Zhou Zhao

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06388 2024-10-10 cs.HC 67%

Evaluating the Impact of Warning Modalities and False Alarms in Pedestrian Crossing Alert System

Hesham Alyamani, Yucheng Yang, David Noyce, Madhav Chitturi, Kassem Fawaz

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract)

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04534 2024-10-08 cs.SD cs.CV cs.GR cs.LG cs.MM eess.AS 67%

UniMuMo: Unified Text, Music and Motion Generation

Han Yang, Kun Su, Yutong Zhang, Jiaben Chen, Kaizhi Qian, Gaowen Liu, Chuang Gan

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12428 2024-10-04 cs.CL cs.AI cs.LG cs.SD eess.AS 67%

PSLM: Parallel Generation of Text and Speech with LLMs for Low-Latency Spoken Dialogue Systems

Kentaro Mitsui, Koh Mitsuda, Toshiaki Wakatsuki, Yukiya Hono, Kei Sawada

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments 9 pages, 6 figures, 4 tables, accepted for Findings of EMNLP 2024. Demo samples: https://rinnakk.github.io/research/publications/PSLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00656 2024-09-24 cs.CL cs.AI cs.SD eess.AS 67%

WavLLM: Towards Robust and Adaptive Speech Large Language Model

Shujie Hu, Long Zhou, Shujie Liu, Sanyuan Chen, Lingwei Meng, Hongkun Hao, Jing Pan, Xunying Liu, Jinyu Li, Sunit Sivasankaran, Linquan Liu, Furu Wei

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments accepted by EMNLP2024 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07827 2024-09-13 cs.SD cs.CV cs.MM eess.AS 67%

Bridging Paintings and Music -- Exploring Emotion based Music Generation through Paintings

Tanisha Hisariya, Huan Zhang, Jinhua Liang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06135 2024-09-11 cs.SD cs.CV cs.MM eess.AS 67%

Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis

Qi Yang, Binjie Mao, Zili Wang, Xing Nie, Pengfei Gao, Ying Guo, Cheng Zhen, Pengfei Yan, Shiming Xiang

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00971 2024-09-05 cs.CV cs.MM cs.SD eess.AS 67%

Interpretable Convolutional SyncNet

Sungjoon Park, Jaesub Yun, Donggeon Lee, Minsik Park

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments 8+5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14340 2024-09-04 cs.SD cs.AI cs.CL cs.LG eess.AS 67%

Foundation Models for Music: A Survey

Yinghao Ma, Anders Øland, Anton Ragni, Bleiz MacSen Del Sette, Charalampos Saitis, Chris Donahue, Chenghua Lin, Christos Plachouras, Emmanouil Benetos, Elona Shatri, Fabio Morreale, Ge Zhang, György Fazekas, Gus Xia, Huan Zhang, Ilaria Manco, Jiawen Huang, Julien Guinot, Liwei Lin, Luca Marinelli, Max W. Y. Lam, Megha Sharma, Qiuqiang Kong, Roger B. Dannenberg, Ruibin Yuan, Shangda Wu, Shih-Lun Wu, Shuqi Dai, Shun Lei, Shiyin Kang, Simon Dixon, Wenhu Chen, Wenhao Huang, Xingjian Du, Xingwei Qu, Xu Tan, Yizhi Li, Zeyue Tian, Zhiyong Wu, Zhizheng Wu, Ziyang Ma, Ziyu Wang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10589 2024-08-21 cs.RO cs.HC 67%

Bidirectional Intent Communication: A Role for Large Foundation Models

Tim Schreiter, Rishi Hazra, Jens Rüppel, Andrey Rudenko

专题命中 音频语音多模态 :multimodal(abstract);multimodal foundation model(abstract)

Comments 2024 33rd IEEE International Conference on Robot and Human Interactive Communication (RO-MAN), Workshop: Large Language Models in the RoMan Age

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19435 2024-07-30 cs.CV cs.AI cs.CL cs.HC cs.RO 67%

ASI-Seg: Audio-Driven Surgical Instrument Segmentation with Surgeon Intention Understanding

Zhen Chen, Zongming Zhang, Wenwu Guo, Xingjian Luo, Long Bai, Jinlin Wu, Hongliang Ren, Hongbin Liu

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments This work is accepted by IROS 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09956 2024-07-18 cs.SD cs.AI cs.CL eess.AS 67%

Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization

Navonil Majumder, Chia-Yu Hung, Deepanway Ghosal, Wei-Ning Hsu, Rada Mihalcea, Soujanya Poria

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments Accepted at ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10387 2024-07-16 cs.SD cs.AI cs.CV eess.AS 67%

Masked Generative Video-to-Audio Transformers with Enhanced Synchronicity

Santiago Pascual, Chunghsin Yeh, Ioannis Tsiamas, Joan Serrà

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、eess.AS

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03736 2024-07-08 cs.SD cs.CV cs.LG cs.MM eess.AS 67%

Semantic Grouping Network for Audio Source Separation

Shentong Mo, Yapeng Tian

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04673 2024-07-04 cs.SD cs.AI cs.LG cs.MM eess.AS 67%

LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT

Zhihao Du, Jiaming Wang, Qian Chen, Yunfei Chu, Zhifu Gao, Zerui Li, Kai Hu, Xiaohuan Zhou, Jin Xu, Ziyang Ma, Wen Wang, Siqi Zheng, Chang Zhou, Zhijie Yan, Shiliang Zhang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

Comments 10 pages, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.02033 2024-07-02 eess.AS cs.AI cs.MM cs.SD 67%

Towards Generating Diverse Audio Captions via Adversarial Training

Xinhao Mei, Xubo Liu, Jianyuan Sun, Mark D. Plumbley, Wenwu Wang

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、cs.MM、eess.AS

Comments Accepted to TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15111 2024-06-25 cs.AI cs.CL cs.CV 67%

Investigating the impact of 2D gesture representation on co-speech gesture generation

Teo Guichoux, Laure Soulier, Nicolas Obin, Catherine Pelachaud

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 8 pages. Paper accepted at WACAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12707 2024-06-19 cs.CL cs.AI cs.SD eess.AS 67%

Talk With Human-like Agents: Empathetic Dialogue Through Perceptible Acoustic Reception and Reaction

Haoqiu Yan, Yongxin Zhu, Kai Zheng, Bing Liu, Haoyu Cao, Deqiang Jiang, Linli Xu

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments 9 pages, 3 figures, ACL24 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02248 2024-06-17 cs.CL cs.AI eess.AS 67%

COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning

Jing Pan, Jian Wu, Yashesh Gaur, Sunit Sivasankaran, Zhuo Chen, Shujie Liu, Jinyu Li

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05629 2024-06-11 cs.CV cs.CL cs.IR cs.LG cs.SD eess.AS 67%

Separating the "Chirp" from the "Chat": Self-supervised Visual Grounding of Sound and Language

Mark Hamilton, Andrew Zisserman, John R. Hershey, William T. Freeman

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、eess.AS

Comments Computer Vision and Pattern Recognition 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11093 2024-06-10 eess.AS cs.CL cs.MM cs.SD 67%

AudioSetMix: Enhancing Audio-Language Datasets with LLM-Assisted Augmentations

David Xu

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.MM、eess.AS

Comments typos corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04432 2024-06-10 eess.AS cs.AI cs.CL 67%

LipGER: Visually-Conditioned Generative Error Correction for Robust Automatic Speech Recognition

Sreyan Ghosh, Sonal Kumar, Ashish Seth, Purva Chiniya, Utkarsh Tyagi, Ramani Duraiswami, Dinesh Manocha

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments InterSpeech 2024. Code and Data: https://github.com/Sreyan88/LipGER

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01624 2024-06-07 eess.AS cs.AI cs.CL cs.LG cs.SD 67%

Unveiling Hidden Factors: Explainable AI for Feature Boosting in Speech Emotion Recognition

Alaa Nfissi, Wassim Bouachir, Nizar Bouguila, Brian Mishara

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、cs.AI、eess.AS

Comments Published in: Springer Nature International Journal of Applied Intelligence (2024)

Journal ref Applied Intelligence (2024), 1-24

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19103 2024-05-30 cs.CR cs.LG 67%

Voice Jailbreak Attacks Against GPT-4o

Xinyue Shen, Yixin Wu, Michael Backes, Yang Zhang

专题命中 音频语音多模态 :multimodal(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10272 2024-05-17 cs.CV cs.AI cs.SD eess.AS eess.IV 67%

Faces that Speak: Jointly Synthesising Talking Face and Speech from Text

Youngjoon Jang, Ji-Hoon Kim, Junseok Ahn, Doyeop Kwak, Hong-Sun Yang, Yoon-Cheol Ju, Il-Hwan Kim, Byeong-Yeol Kim, Joon Son Chung

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI、eess.AS

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10025 2024-05-17 cs.CL cs.AI cs.LG cs.SD eess.AS 67%

Listen Again and Choose the Right Answer: A New Paradigm for Automatic Speech Recognition with Large Language Models

Yuchen Hu, Chen Chen, Chengwei Qin, Qiushi Zhu, Eng Siong Chng, Ruizhe Li

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments 14 pages, Accepted by ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏