arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4587 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4587 篇

1905.03820 2019-05-13 cs.CV 74%

Hierarchical Cross-Modal Talking Face Generationwith Dynamic Pixel-Wise Loss

Lele Chen, Ross K. Maddox, Zhiyao Duan, Chenliang Xu

专题命中 音频语音多模态 :cross-modal(title);分类 cs.CV

Journal ref Published in CVPR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.09107 2019-05-10 cs.CV 74%

Audio-Visual Scene-Aware Dialog

Huda Alamri, Vincent Cartillier, Abhishek Das, Jue Wang, Anoop Cherian, Irfan Essa, Dhruv Batra, Tim K. Marks, Chiori Hori, Peter Anderson, Stefan Lee, Devi Parikh

专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.02334 2019-05-08 cs.SD eess.AS 74%

Multi-modal Blind Source Separation with Microphones and Blinkies

Robin Scheibler, Nobutaka Ono

专题命中 音频语音多模态 :multi-modal(title);分类 eess.AS

Comments Accepted at IEEE ICASSP 2019, Brighton, UK. 5 pages. 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.09765 2019-04-23 cs.SD cs.LG eess.AS stat.ML 74%

hf0: A hybrid pitch extraction method for multimodal voice

Pradeep Rengaswamy, Gurunath Reddy M, Krothapalli Sreenivasa Rao

专题命中 音频语音多模态 :multimodal(title);分类 eess.AS

Comments Pitch Extraction, F0 extraction, harmonic signals, speech, monophonic songs, Convolutional Neural Network, 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.06022 2019-04-15 cs.LG cs.CL stat.ML 74%

Multimodal Speech Emotion Recognition and Ambiguity Resolution

Gaurav Sahu

专题命中 音频语音多模态 :multimodal(title);分类 cs.CL

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.04484 2019-03-13 cs.CL 74%

The Truth and Nothing but the Truth: Multimodal Analysis for Deception Detection

Mimansa Jaiswal, Sairam Tabibu, Rajiv Bajpai

专题命中 音频语音多模态 :multimodal(title);分类 cs.CL

Comments 6pages, ICDMW

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.04000 2018-11-12 cs.CV cs.NE 74%

Identify, locate and separate: Audio-visual object extraction in large video collections using weak supervision

Sanjeel Parekh, Alexey Ozerov, Slim Essid, Ngoc Duong, Patrick Pérez, Gaël Richard

专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.04635 2018-10-11 cs.CL 74%

Multimodal Speech Emotion Recognition Using Audio and Text

Seunghyun Yoon, Seokhyun Byun, Kyomin Jung

专题命中 音频语音多模态 :multimodal(title);分类 cs.CL

Comments 7 pages, Accepted as a conference paper at IEEE SLT 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.10785 2018-09-03 cs.CL 74%

Multimodal Continuous Turn-Taking Prediction Using Multiscale RNNs

Matthew Roddy, Gabriel Skantze, Naomi Harte

专题命中 音频语音多模态 :multimodal(title);分类 cs.CL

Comments Accepted for ICMI18

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.10731 2018-05-29 eess.AS cs.SD 74%

Multimodal Speaker Segmentation and Diarization using Lexical and Acoustic Cues via Sequence to Sequence Neural Networks

Tae Jin Park, Panayiotis Georgiou

专题命中 音频语音多模态 :multimodal(title);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.05091 2018-05-15 cs.CL 74%

The Spot the Difference corpus: a multi-modal corpus of spontaneous task oriented spoken interactions

José Lopes, Nils Hemmingsson, Oliver Åstrand

专题命中 音频语音多模态 :multi-modal(title);分类 cs.CL

Comments Proceedings of the Language Evaluation and Resources Conference (LREC) 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.04798 2018-05-14 cs.HC cs.CL 74%

A Multimodal Corpus of Expert Gaze and Behavior during Phonetic Segmentation Tasks

Arif Khan, Ingmar Steiner, Yusuke Sugano, Andreas Bulling, Ross Macdonald

专题命中 音频语音多模态 :multimodal(title);分类 cs.CL

Journal ref Proc. LREC 11 (2018) 4277-4281

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.05070 2018-03-15 cs.CV cs.LG stat.ML 74%

A Multi-Modal Approach to Infer Image Affect

Ashok Sundaresan, Sugumar Murugesan, Sean Davis, Karthik Kappaganthu, ZhongYi Jin, Divya Jain, Anurag Maunder

专题命中 音频语音多模态 :multi-modal(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.05092 2018-02-15 cs.CL 74%

Linguistic unit discovery from multi-modal inputs in unwritten languages: Summary of the "Speaking Rosetta" JSALT 2017 Workshop

Odette Scharenborg, Laurent Besacier, Alan Black, Mark Hasegawa-Johnson, Florian Metze, Graham Neubig, Sebastian Stueker, Pierre Godard, Markus Mueller, Lucas Ondel, Shruti Palaskar, Philip Arthur, Francesco Ciannella, Mingxing Du, Elin Larsen, Danny Merkx, Rachid Riad, Liming Wang, Emmanuel Dupoux

专题命中 音频语音多模态 :multi-modal(title);分类 cs.CL

Comments Accepted to ICASSP 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.03142 2018-02-12 cs.CL 74%

Augmenting Librispeech with French Translations: A Multimodal Corpus for Direct Speech Translation Evaluation

Ali Can Kocabiyikoglu, Laurent Besacier, Olivier Kraif

专题命中 音频语音多模态 :multimodal(title);分类 cs.CL

Comments LREC 2018, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.02099 2017-08-08 cs.CL cs.IR cs.SI 74%

Multimodal Classification for Analysing Social Media

Chi Thang Duong, Remi Lebret, Karl Aberer

专题命中 音频语音多模态 :multimodal(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
cmp-lg/9611005 2016-08-30 cmp-lg cs.CL 74%

Integrating HMM-Based Speech Recognition With Direct Manipulation In A Multimodal Korean Natural Language Interface

Geunbae Lee, Jong-Hyeok Lee, Sangeok Kim

专题命中 音频语音多模态 :multimodal(title);分类 cs.CL

Comments 6 pages, ps file, presented at icmi96 (Bejing)

详情

展开后加载摘要…

URL PDF HTML 收藏
1601.02220 2016-01-12 cs.CV cs.SD 74%

Joint Object-Material Category Segmentation from Audio-Visual Cues

Anurag Arnab, Michael Sapienza, Stuart Golodetz, Julien Valentin, Ondrej Miksik, Shahram Izadi, Philip Torr

专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV

Comments Published in British Machine Vision Conference (BMVC) 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
cs/0204022 2009-11-30 cs.CL 74%

Annotation Graphs and Servers and Multi-Modal Resources: Infrastructure for Interdisciplinary Education, Research and Development

Christopher Cieri, Steven Bird

专题命中 音频语音多模态 :multi-modal(title);分类 cs.CL

Comments 8 pages, 6 figures

Journal ref Proceedings of ACL Workshop on Sharing Tools and Resources for Research and Education, Toulouse, July 2001, pp 23-30

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12309 2023-12-20 cs.HC 73%

TeamCAD -- A Multimodal Interface for Remote Computer Aided Design

Demircan Tas, Dimitrios Chatzinikolis

专题命中 音频语音多模态 :multimodal(title,comments)

Comments Created for 6.835, Intelligent Multimodal User Interfaces at MIT, Spring 2022. Submitted to CHI 2024. 10 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09765 2026-08-11 cs.CL cs.CV 新提交 73%

REFRAMED: Towards Realistic Audio Description Generation for Movies

REFRAMED:面向电影的真实音频描述生成

Igor Sterner, Mirella Lapata, Alex Lascarides, Frank Keller

专题命中 音频语音多模态 :multimodal(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 本文提出新的音频描述生成范式,构建含206部电影的REFRAMED数据集及评估协议,实验显示现有AD系统和多模态LLMs表现优于简单基线但不及专业人类,为视频理解研究提供新基础。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30256 2026-07-30 cs.CV cs.CL cs.HC 版本更新 73%

VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents

VideoFDB: 评估对话代理中的全双工视觉-语音能力

Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini De Mello

机构 * NVIDIA David AI

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL

AI总结 提出首个全双工视听到视听(AV2AV)对话基准VideoFDB,通过237个真实视频片段、感知与生成行为分类以及基于评分规则的LM评判框架,系统评估代理在非语言对话动态中的表现,发现现有系统存在字幕崩溃和视觉流忽视等缺陷。

Comments Project page: https://research.nvidia.com/labs/amri/projects/video-fdb/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25543 2026-07-29 cs.CV cs.AI 新提交 73%

Less is More: Modality-Decoupling for General AIGC Audio-Video Detection

少即是多:通用AIGC音频-视频检测的模态解耦

Jielun Peng, Yabin Wang, Yaqi Li, Jincheng Liu, Xiaopeng Hong, Athanasios V. Vasilakos

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of Agder(阿格德大学)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 针对通用AIGC音频-视频检测,现有方法假设不总成立,本文提出DAV-Det系统,通过决策级融合独立建模各模态取证证据,视觉和音频检测器分别利用多粒度表示及门控双分支架构,在挑战赛中排名第一。

Comments First place in the General AIGC Audio-Video Detection Challenge at the IJCAI-ECAI 2026 DDL 2.0 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08729 2026-06-30 cs.CV cs.GR cs.MM cs.SD 73%

Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation

Unison:和谐运动、语音和声音以实现以人为中心的音频视频生成

Shihao Cheng, Jiaxu Zhang, Quanyue Song, Shansong Liu, Zhizhi Guo, Xiaolei Zhang, Chi Zhang, Xuelong Li, Zhigang Tu

机构 * DeepMind OpenAI

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 Unison通过显式促进运动、语音和声音模态的协调,解决音频视频生成中模态不一致的问题,提升感知质量和跨模态同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05121 2026-06-30 cs.CL cs.SD eess.AS 73%

The NTNU System at the S&I Challenge 2025 SLA Open Track

NTNU系统在S&I挑战2025 SLA开放赛道中的表现

Hong-Yun Lin, Tien-Hong Lo, Yu-Hsuan Fang, Jhen-Ke Lin, Chung-Chun Wang, Hao-Chien Lu, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学) Department of Computer Science and Information Engineering(计算机科学与信息工程系) Institute of AI Interdisciplinary Applied Technology(人工智能跨学科应用技术研究所)

专题命中 音频语音多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CL、eess.AS

AI总结 本文提出整合W2V与Phi-4多模态大语言模型的系统,通过分数融合策略提升SLA评估性能,在Speak & Improve Challenge 2025中取得第二名,RMSE为0.375。

Comments submitted to the ISCA SLaTE-2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25990 2026-06-25 cs.CL cs.AI cs.SD 新提交 73%

SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models

SpeechEQ: 社交感知语音对话模型的情商基准测试

Liang-Yuan Wu, Zih-Ching Chen, Tongshuang Wu, Chao-Han Huck Yang, Hua Shen

机构 * New York University(纽约大学) NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) NYU Shanghai(上海纽约大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 提出SpeechEQ框架,基于EQ-i 2.0理论构建2265个对话数据集,通过口语情商(SEQ)评分评估语音语言模型在主动多轮对话中的副语言社交线索推理能力,揭示端到端模型存在模态捷径、安全陷阱和上下文遗忘等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21478 2026-06-23 cs.CL cs.LG eess.AS 版本更新 73%

TaigiSpeech: A Low-Resource Real-World Speech Intent Dataset and Preliminary Results with Scalable Data Mining In-the-Wild

TaigiSpeech: 一个低资源真实世界语音意图数据集及基于可扩展野外数据挖掘的初步结果

Kai-Wei Chang, Yi-Cheng Lin, Huang-Cheng Chou, Wenze Ren, Yu-Han Huang, Yun-Shao Tsai, Chien-Cheng Chen, Yu Tsao, Yuan-Fu Liao, Shrikanth Narayanan, James Glass, Hung-yi Lee

机构 * Massachusetts Institute of Technology, USA(麻省理工学院) National Taiwan University, Taipei, Taiwan(国立台湾大学) National Taiwan University Artificial Intelligence Center of Research Excellence, Taipei, Taiwan(国立台湾大学人工智能研究中心) Academia Sinica, Taiwan(台湾“中央”研究院) National Yang Ming Chiao Tung University, Taiwan(阳明交通大学) Signal Analysis and Interpretation Laboratory (SAIL), University of Southern California, USA(信号分析与解释实验室(SAIL),南加州大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CL、eess.AS

AI总结 针对低资源台语,构建包含21位老年人3000条话语的语音意图数据集,并探索关键词匹配与LLM伪标注、音视频框架两种数据挖掘策略,以解决标注数据稀缺问题。

Comments Interspeech 2026 long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07608 2026-06-09 cs.CL cs.AI cs.LG cs.SD 新提交 73%

Subtitle-Aligned Fine-Tuning of Whisper for Swiss German ASR: Benchmark Contamination, Convention Mismatch, and an Honest Baseline at 25.6% WER (13.8% cWER)

针对瑞士德语音识别的Whisper字幕对齐微调:基准污染、惯例不匹配以及25.6% WER(13.8% cWER)的诚实基线

Felix Akeret

机构 * Independent Researcher, Zurich, Switzerland(独立研究员,瑞士苏黎世) ETH Zürich(苏黎世联邦理工学院) University of Bern(伯尔尼大学) FHNW(西北应用科学与艺术大学) CeTIM Leiden/Munich(CeTIM 莱顿/慕尼黑)

专题命中 音频语音多模态 :multimodal(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 通过1,367小时广播语音与标准德语字幕的弱监督,系统微调Whisper large-v3用于瑞士德语音识,发现公开结果因基准污染被高估,并发布两个诚实评估的模型。

Comments 15 pages, 21 tables. Models available at https://huggingface.co/Flix-AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31432 2026-06-01 cs.CL cs.AI cs.SD 73%

DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs

DOA:面向语音大语言模型的长形式同声传译的无训练解码器仅注意力策略

Sara Papi, Luisa Bentivogli

机构 * Fondazione Bruno Kessler(布鲁诺·克塞塞基金会)

专题命中 音频语音多模态 :multimodal(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出DOA策略,利用解码器自注意力导出代理对齐,无需训练即可实现语音大语言模型在长形式同声传译中的流式决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26485 2026-05-27 cs.CV cs.CL 73%

OmniInteract: Benchmarking Real-World Streaming Interaction for Real-Time Omnimodal Assistants

OmniInteract:面向实时全模态助手的流式交互基准测试

Xudong Lu, Xueying Li, Annan Wang, Yang Bo, Jinpeng Chen, Zengliang Li, Nianzu Yang, Rui Liu, Xue Yang, Jingwen Hou, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) SJTU(上海交通大学) NTU(国立新加坡大学) McMaster(麦马斯特大学) CityUHK(香港城市大学) JUFE(吉林大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL

AI总结 提出OmniInteract基准,通过在线推理音视频流评估全模态大模型的实时交互能力,发现现有模型在流式交互中表现薄弱。

详情

展开后加载摘要…

URL PDF HTML 收藏