arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2411.11222 2025-01-14 cs.CV cs.MM cs.SD eess.AS 67%

The Sound of Water: Inferring Physical Properties from Pouring Liquids

Piyush Bagad, Makarand Tapaswi, Cees G. M. Snoek, Andrew Zisserman

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Project page at https://bpiyush.github.io/pouring-water-website. Short version accepted to ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05551 2024-12-30 cs.CV cs.MM cs.SD eess.AS 67%

Read, Watch and Scream! Sound Generation from Text and Video

Yujin Jeong, Yunji Kim, Sanghyuk Chun, Jiyoung Lee

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments AAAI2025, Project page: https://naver-ai.github.io/rewas

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08504 2024-12-12 cs.SD cs.AI cs.GR cs.MM eess.AS 67%

PointTalk: Audio-Driven Dynamic Lip Point Cloud for 3D Gaussian-based Talking Head Synthesis

Yifan Xie, Tao Feng, Xin Zhang, Xiangyang Luo, Zixuan Guo, Weijiang Yu, Heng Chang, Fei Ma, Fei Richard Yu

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、cs.MM、eess.AS

Comments 9 pages, accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05037 2024-12-03 eess.AS cs.AI cs.MM cs.SD 67%

Separate Anything You Describe

Xubo Liu, Qiuqiang Kong, Yan Zhao, Haohe Liu, Yi Yuan, Yuzhuo Liu, Rui Xia, Yuxuan Wang, Mark D. Plumbley, Wenwu Wang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

Comments Code, benchmark and pre-trained models: AGI/AudioSep" target="_blank" rel="noopener">https://github.com/Audio-AGI/AudioSep

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18675 2024-12-02 cs.CV cs.AI cs.GR cs.SD eess.AS 67%

GaussianSpeech: Audio-Driven Gaussian Avatars

Shivangi Aneja, Artem Sevastopolsky, Tobias Kirschstein, Justus Thies, Angela Dai, Matthias Nießner

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、eess.AS

Comments Paper Video: https://youtu.be/2VqYoFlYcwQ Project Page: https://shivangi-aneja.github.io/projects/gaussianspeech

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18138 2024-11-28 eess.AS cs.AI cs.CL cs.SD 67%

SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation

Wenyi Yu, Siyin Wang, Xiaoyu Yang, Xianzhao Chen, Xiaohai Tian, Jun Zhang, Guangzhi Sun, Lu Lu, Yuxuan Wang, Chao Zhang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14627 2024-11-25 cs.SD cs.AI cs.LG cs.MM eess.AS 67%

Generative AI for Music and Audio

Hao-Wen Dong

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

Comments PhD Dissertation

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07650 2024-11-13 cs.CV cs.AI cs.LG cs.MM cs.SD eess.IV 67%

Understanding Audiovisual Deepfake Detection: Techniques, Challenges, Human Factors and Perceptual Insights

Ammarah Hashmi, Sahibzada Adil Shahzad, Chia-Wen Lin, Yu Tsao, Hsin-Min Wang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02851 2024-11-06 cs.MM cs.AI cs.CL cs.HC cs.IR 67%

Learning to Unify Audio, Visual and Text for Audio-Enhanced Multilingual Visual Answer Localization

Zhibin Wen, Bin Li

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11190 2024-11-06 eess.AS cs.AI cs.CV cs.LG cs.SD 67%

Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities

Zhifei Xie, Changqiao Wu

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、eess.AS

Comments Technical report, work in progress. Demo and code: https://github.com/gpt-omni/mini-omni2

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20336 2024-10-29 cs.CL cs.AI cs.SD eess.AS 67%

Get Large Language Models Ready to Speak: A Late-fusion Approach for Speech Generation

Maohao Shen, Shun Zhang, Jilong Wu, Zhiping Xiu, Ehab AlBadawy, Yiting Lu, Mike Seltzer, Qing He

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19168 2024-10-28 eess.AS cs.AI cs.CL cs.SD 67%

MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark

S Sakshi, Utkarsh Tyagi, Sonal Kumar, Ashish Seth, Ramaneswaran Selvakumar, Oriol Nieto, Ramani Duraiswami, Sreyan Ghosh, Dinesh Manocha

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments Project Website: https://sakshi113.github.io/mmau_homepage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12957 2024-10-18 cs.SD cs.CV cs.MM eess.AS 67%

MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization

Ruiqi Li, Siqi Zheng, Xize Cheng, Ziang Zhang, Shengpeng Ji, Zhou Zhao

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06388 2024-10-10 cs.HC 67%

Evaluating the Impact of Warning Modalities and False Alarms in Pedestrian Crossing Alert System

Hesham Alyamani, Yucheng Yang, David Noyce, Madhav Chitturi, Kassem Fawaz

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract)

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04534 2024-10-08 cs.SD cs.CV cs.GR cs.LG cs.MM eess.AS 67%

UniMuMo: Unified Text, Music and Motion Generation

Han Yang, Kun Su, Yutong Zhang, Jiaben Chen, Kaizhi Qian, Gaowen Liu, Chuang Gan

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12428 2024-10-04 cs.CL cs.AI cs.LG cs.SD eess.AS 67%

PSLM: Parallel Generation of Text and Speech with LLMs for Low-Latency Spoken Dialogue Systems

Kentaro Mitsui, Koh Mitsuda, Toshiaki Wakatsuki, Yukiya Hono, Kei Sawada

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments 9 pages, 6 figures, 4 tables, accepted for Findings of EMNLP 2024. Demo samples: https://rinnakk.github.io/research/publications/PSLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00656 2024-09-24 cs.CL cs.AI cs.SD eess.AS 67%

WavLLM: Towards Robust and Adaptive Speech Large Language Model

Shujie Hu, Long Zhou, Shujie Liu, Sanyuan Chen, Lingwei Meng, Hongkun Hao, Jing Pan, Xunying Liu, Jinyu Li, Sunit Sivasankaran, Linquan Liu, Furu Wei

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments accepted by EMNLP2024 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07827 2024-09-13 cs.SD cs.CV cs.MM eess.AS 67%

Bridging Paintings and Music -- Exploring Emotion based Music Generation through Paintings

Tanisha Hisariya, Huan Zhang, Jinhua Liang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06135 2024-09-11 cs.SD cs.CV cs.MM eess.AS 67%

Draw an Audio: Leveraging Multi-Instruction for Video-to-Audio Synthesis

Qi Yang, Binjie Mao, Zili Wang, Xing Nie, Pengfei Gao, Ying Guo, Cheng Zhen, Pengfei Yan, Shiming Xiang

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00971 2024-09-05 cs.CV cs.MM cs.SD eess.AS 67%

Interpretable Convolutional SyncNet

Sungjoon Park, Jaesub Yun, Donggeon Lee, Minsik Park

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments 8+5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14340 2024-09-04 cs.SD cs.AI cs.CL cs.LG eess.AS 67%

Foundation Models for Music: A Survey

Yinghao Ma, Anders Øland, Anton Ragni, Bleiz MacSen Del Sette, Charalampos Saitis, Chris Donahue, Chenghua Lin, Christos Plachouras, Emmanouil Benetos, Elona Shatri, Fabio Morreale, Ge Zhang, György Fazekas, Gus Xia, Huan Zhang, Ilaria Manco, Jiawen Huang, Julien Guinot, Liwei Lin, Luca Marinelli, Max W. Y. Lam, Megha Sharma, Qiuqiang Kong, Roger B. Dannenberg, Ruibin Yuan, Shangda Wu, Shih-Lun Wu, Shuqi Dai, Shun Lei, Shiyin Kang, Simon Dixon, Wenhu Chen, Wenhao Huang, Xingjian Du, Xingwei Qu, Xu Tan, Yizhi Li, Zeyue Tian, Zhiyong Wu, Zhizheng Wu, Ziyang Ma, Ziyu Wang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10589 2024-08-21 cs.RO cs.HC 67%

Bidirectional Intent Communication: A Role for Large Foundation Models

Tim Schreiter, Rishi Hazra, Jens Rüppel, Andrey Rudenko

专题命中 音频语音多模态 :multimodal(abstract);multimodal foundation model(abstract)

Comments 2024 33rd IEEE International Conference on Robot and Human Interactive Communication (RO-MAN), Workshop: Large Language Models in the RoMan Age

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19435 2024-07-30 cs.CV cs.AI cs.CL cs.HC cs.RO 67%

ASI-Seg: Audio-Driven Surgical Instrument Segmentation with Surgeon Intention Understanding

Zhen Chen, Zongming Zhang, Wenwu Guo, Xingjian Luo, Long Bai, Jinlin Wu, Hongliang Ren, Hongbin Liu

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments This work is accepted by IROS 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09956 2024-07-18 cs.SD cs.AI cs.CL eess.AS 67%

Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization

Navonil Majumder, Chia-Yu Hung, Deepanway Ghosal, Wei-Ning Hsu, Rada Mihalcea, Soujanya Poria

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments Accepted at ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10387 2024-07-16 cs.SD cs.AI cs.CV eess.AS 67%

Masked Generative Video-to-Audio Transformers with Enhanced Synchronicity

Santiago Pascual, Chunghsin Yeh, Ioannis Tsiamas, Joan Serrà

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、eess.AS

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03736 2024-07-08 cs.SD cs.CV cs.LG cs.MM eess.AS 67%

Semantic Grouping Network for Audio Source Separation

Shentong Mo, Yapeng Tian

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04673 2024-07-04 cs.SD cs.AI cs.LG cs.MM eess.AS 67%

LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT

Zhihao Du, Jiaming Wang, Qian Chen, Yunfei Chu, Zhifu Gao, Zerui Li, Kai Hu, Xiaohuan Zhou, Jin Xu, Ziyang Ma, Wen Wang, Siqi Zheng, Chang Zhou, Zhijie Yan, Shiliang Zhang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

Comments 10 pages, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.02033 2024-07-02 eess.AS cs.AI cs.MM cs.SD 67%

Towards Generating Diverse Audio Captions via Adversarial Training

Xinhao Mei, Xubo Liu, Jianyuan Sun, Mark D. Plumbley, Wenwu Wang

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、cs.MM、eess.AS

Comments Accepted to TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15111 2024-06-25 cs.AI cs.CL cs.CV 67%

Investigating the impact of 2D gesture representation on co-speech gesture generation

Teo Guichoux, Laure Soulier, Nicolas Obin, Catherine Pelachaud

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 8 pages. Paper accepted at WACAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12707 2024-06-19 cs.CL cs.AI cs.SD eess.AS 67%

Talk With Human-like Agents: Empathetic Dialogue Through Perceptible Acoustic Reception and Reaction

Haoqiu Yan, Yongxin Zhu, Kai Zheng, Bing Liu, Haoyu Cao, Deqiang Jiang, Linli Xu

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments 9 pages, 3 figures, ACL24 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏