arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4597 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2503.08540 2025-03-12 cs.SD cs.AI eess.AS 62%

Mellow: a small audio language model for reasoning

Soham Deshmukh, Satvik Dixit, Rita Singh, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

Comments Checkpoint and dataset available at: https://github.com/soham97/mellow

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19924 2025-02-28 cs.SD cs.AI eess.AS 62%

DiffCSS: Diverse and Expressive Conversational Speech Synthesis with Diffusion Models

Weihao wu, Zhiwei Lin, Yixuan Zhou, Jingbei Li, Rui Niu, Qinghua Wu, Songjun Cao, Long Ma, Zhiyong Wu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Chinese University of Hong Kong(香港中文大学) Tencent Youtu Lab(腾讯优图实验室) StepFun(阶跃星辰)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

Comments Accepted by ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00385 2025-02-27 cs.CL cs.AI 62%

The Impact of Persona-based Political Perspectives on Hateful Content Detection

Stefano Civelli, Pietro Bernardelle, Gianluca Demartini

机构 * The University of Queensland(昆士兰大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments Companion Proceedings of the ACM Web Conference 2025 (WWW Companion'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16857 2025-02-25 cs.CL cs.AI 62%

Sarang at DEFACTIFY 4.0: Detecting AI-Generated Text Using Noised Data and an Ensemble of DeBERTa Models

Avinash Trivedi, Sangeetha Sivanesan

机构 * National Institute of Technology, Tiruchirapalli(印度特里奇拉巴利国家理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments AAAI-25 DEFACTIFY 4.0 Workshop AI generated text detection (1st Rank)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16137 2025-02-25 cs.CL cs.AI 62%

Chain-of-Description: What I can understand, I can put into words

Jiaxin Guo, Daimeng Wei, Zongyao Li, Hengchao Shang, Yuanchang Luo, Hao Yang

机构 * Huawei Translation Services Center(华为翻译服务中心)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14892 2025-02-24 cs.CV cs.AI 62%

EgoSpeak: Learning When to Speak for Egocentric Conversational Agents in the Wild

Junhyeok Kim, Min Soo Kim, Jiwan Chung, Jungbin Cho, Jisoo Kim, Sungwoong Kim, Gyeongbo Sim, Youngjae Yu

机构 * Yonsei University(延世大学) NCSOFT Corporation(NCsoft公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments NAACL 2025 Findings. Project page at https://jun297.github.io/EgoSpeak/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13983 2025-02-21 eess.AS cs.AI 62%

Gesture-Aware Zero-Shot Speech Recognition for Patients with Language Disorders

Seungbae Kim, Daeun Lee, Brielle Stark, Jinyoung Han

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03739 2025-02-21 cs.CL cs.AI 62%

Grammar Induction from Visual, Speech and Text

Yu Zhao, Hao Fei, Shengqiong Wu, Meishan Zhang, Min Zhang, Tat-seng Chua

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) National University of Singapore(新加坡国立大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16746 2025-02-18 cs.LG cs.AI cs.CL 62%

The Responsible Foundation Model Development Cheatsheet: A Review of Tools & Resources

Shayne Longpre, Stella Biderman, Alon Albalak, Hailey Schoelkopf, Daniel McDuff, Sayash Kapoor, Kevin Klyman, Kyle Lo, Gabriel Ilharco, Nay San, Maribeth Rauh, Aviya Skowron, Bertie Vidgen, Laura Weidinger, Arvind Narayanan, Victor Sanh, David Adelani, Percy Liang, Rishi Bommasani, Peter Henderson, Sasha Luccioni, Yacine Jernite, Luca Soldaini

机构 * MIT(麻省理工学院) EleutherAI UCSB(加利福尼亚大学圣巴巴拉分校) SynthLabs Princeton University(普林斯顿大学) Stanford University(斯坦福大学) Harvard University(哈佛大学) Allen Institute for AI(艾伦人工智能研究所) Google DeepMind(谷歌DeepMind) ML Commons Contextual AI HuggingFace University College London(伦敦大学学院)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09940 2025-02-17 cs.CL cs.SD eess.AS 62%

A Preliminary Exploration with GPT-4o Voice Mode

Yu-Xiang Lin, Chih-Kai Yang, Wei-Chih Chen, Chen-An Li, Chien-yu Huang, Xuanjun Chen, Hung-yi Lee

机构 * National Taiwan University(台湾大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07538 2025-02-14 cs.MM cs.SD eess.AS 62%

Visual-based spatial audio generation system for multi-speaker environments

Xiaojing Liu, Ogulcan Gurelli, Yan Wang, Joshua Reiss

机构 * Queen Mary University of London(伦敦玛丽女王大学) Xidian University(西安电子科技大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06922 2025-02-12 cs.SD cs.AI cs.CL cs.LG 62%

Synthetic Audio Helps for Cognitive State Tasks

Adil Soubki, John Murzaku, Peter Zeng, Owen Rambow

机构 * Stony Brook University(石溪大学) Department of Computer Science(计算机科学系) Department of Linguistics(语言学系) Institute for Advanced Computational Science(高级计算科学研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments John Murzaku and Adil Soubki contributed equally to this work

Journal ref NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03128 2025-02-06 cs.SD cs.AI cs.LG eess.AS eess.SP 62%

Metis: A Foundation Speech Generation Model with Masked Generative Pre-training

Yuancheng Wang, Jiachen Zheng, Junan Zhang, Xueyao Zhang, Huan Liao, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01046 2025-02-04 cs.SD cs.CV eess.AS 62%

Emotional Face-to-Speech

Jiaxin Ye, Boyuan Cao, Hongming Shan

机构 * Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑智能科学与技术研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18801 2025-02-03 cs.CV cs.AI 62%

Every Image Listens, Every Image Dances: Music-Driven Image Animation

Zhikang Dong, Weituo Hao, Ju-Chiang Wang, Peng Zhang, Pawel Polak

机构 * Stony Brook University(石溪大学) Bytedance(字节跳动) Apple(苹果公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11170 2025-01-22 cs.CL cs.AI cs.LG 62%

AIMA at SemEval-2024 Task 3: Simple Yet Powerful Emotion Cause Pair Analysis

Alireza Ghahramani Kure, Mahshid Dehghani, Mohammad Mahdi Abootorabi, Nona Ghazizadeh, Seyed Arshan Dalili, Ehsaneddin Asgari

机构 * Sharif University of Technology(谢里夫理工大学) Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments Proceedings of the 18th International Workshop on Semantic Evaluation (SemEval-2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10937 2025-01-22 cs.CL cs.SD eess.AS 62%

Leveraging Chain of Thought towards Empathetic Spoken Dialogue without Corresponding Question-Answering Data

Jingran Xie, Shun Lei, Yue Yu, Yang Xiang, Hui Wang, Xixin Wu, Zhiyong Wu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Pengcheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Accepted by ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09104 2025-01-22 cs.SD cs.AI eess.AS 62%

A Non-autoregressive Model for Joint STT and TTS

Vishal Sunder, Brian Kingsbury, George Saon, Samuel Thomas, Slava Shechtman, Hagai Aronowitz, Eric Fosler-Lussier, Luis Lastras

机构 * The Ohio State University(俄亥俄州立大学) IBM Research(IBM研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

Comments 5 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18836 2025-01-20 cs.SD cs.AI eess.AS 62%

MRI2Speech: Speech Synthesis from Articulatory Movements Recorded by Real-time MRI

Neil Shah, Ayan Kashyap, Shirish Karande, Vineet Gandhi

机构 * IIIT Hyderabad(印度国际信息技术学院海得拉巴分校) TCS Research(塔塔咨询服务公司研究院)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI、eess.AS

Comments Accepted at IEEE ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09818 2025-01-17 cs.CL cs.AI 62%

MERaLiON-AudioLLM: Bridging Audio and Language with Large Language Models

Yingxu He, Zhuohan Liu, Shuo Sun, Bin Wang, Wenyu Zhang, Xunlong Zou, Nancy F. Chen, Ai Ti Aw

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments https://huggingface.co/MERaLiON/MERaLiON-AudioLLM-Whisper-SEA-LION

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01020 2025-01-14 cs.CV cs.SD eess.AS 62%

A Critical Assessment of Visual Sound Source Localization Models Including Negative Audio

Xavier Juanola, Gloria Haro, Magdalena Fuentes

机构 * Universitat Pompeu Fabra(庞培法布拉大学) MARL-IDM, New York University(纽约大学MARL-IDM)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

Comments Accepted in ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20619 2024-12-31 cs.LG cs.MM cs.SD eess.AS 62%

Audiopedia: Audio QA with Knowledge

Abhirama Subramanyam Penamakuri, Kiran Chhatre, Akshat Jain

机构 * Indian Institute of Technology, Jodhpur(焦特布尔印度理工学院) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM、eess.AS

Comments Accepted to ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15838 2024-12-31 cs.AI cs.CL 62%

Align Anything: Training All-Modality Models to Follow Instructions with Language Feedback

Jiaming Ji, Jiayi Zhou, Hantao Lou, Boyuan Chen, Donghai Hong, Xuyao Wang, Wenqi Chen, Kaile Wang, Rui Pan, Jiahao Li, Mohan Wang, Josef Dai, Tianyi Qiu, Hua Xu, Dong Li, Weipeng Chen, Jun Song, Bo Zheng, Yaodong Yang

机构 * Institute for AI, Peking University(北京大学人工智能研究院) Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院) Huawei Noah’s Ark LAB(华为诺亚方舟实验室) Baichuan Inc.(百川智能) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团)

专题命中 音频语音多模态 :any-to-any(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18733 2024-12-30 cs.CL cs.SD eess.AS 62%

Intra- and Inter-modal Context Interaction Modeling for Conversational Speech Synthesis

Zhenqi Jia, Rui Liu

机构 * Inner Mongolia University(内蒙古大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Accepted by ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10117 2024-12-30 cs.SD cs.AI cs.LG eess.AS 62%

CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models

Zhihao Du, Yuxuan Wang, Qian Chen, Xian Shi, Xiang Lv, Tianyu Zhao, Zhifu Gao, Yexin Yang, Changfeng Gao, Hui Wang, Fan Yu, Huadai Liu, Zhengyan Sheng, Yue Gu, Chong Deng, Wen Wang, Shiliang Zhang, Zhijie Yan, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI、eess.AS

Comments Tech report, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18061 2024-12-25 cs.SD cs.CL cs.HC eess.AS 62%

Lla-VAP: LSTM Ensemble of Llama and VAP for Turn-Taking Prediction

Hyunbae Jeon, Frederic Guintu, Rayvant Sahni

机构 * Emory University(埃默里大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21315 2024-12-24 cs.CL cs.AI 62%

Beyond Silent Letters: Amplifying LLMs in Emotion Recognition with Vocal Nuances

Zehui Wu, Ziwei Gong, Lin Ai, Pengyuan Shi, Kaan Donbekci, Julia Hirschberg

机构 * Columbia University(哥伦比亚大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13674 2024-12-10 cs.CV cs.LG cs.NE cs.SD eess.AS 62%

FabuLight-ASD: Unveiling Speech Activity via Body Language

Hugo Carneiro, Stefan Wermter

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS

Comments 23 pages, 8 figures, 3 tables, accepted for publication in Neural Computing and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05797 2024-12-10 cs.CL cs.AI 62%

Speech Is Not Enough: Interpreting Nonverbal Indicators of Common Knowledge and Engagement

Derek Palmer, Yifan Zhu, Kenneth Lai, Hannah VanderHoeven, Mariah Bradford, Ibrahim Khebour, Carlos Mabrey, Jack Fitzgerald, Nikhil Krishnaswamy, Martha Palmer, James Pustejovsky

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 3 pages, 2 figures, appearing at AAAI 2025 Demos Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04266 2024-12-06 cs.CL cs.SD eess.AS 62%

Representation Purification for End-to-End Speech Translation

Chengwei Zhang, Yue Zhou, Rui Zhao, Yidong Chen, Xiaodong Shi

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS

Comments Accepted by COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏