arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4578 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4578 篇

2608.18401 2026-08-20 cs.HC cs.CL cs.RO 新提交 80%

Multimodal Rapport Estimation in Real-World HRI

现实世界人机交互(HRI)中的多模态融洽度估计

Akihiro Sakuramoto, Takato Hayashi, Ryo Miyoshi, Yuki Okafuji, Shogo Okada

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本研究针对现实世界人机交互的融洽度估计问题,采用日本药店的62个多模态会话,对比零样本LLMs等模型,发现Gemini融合模型表现最优,且性能随互动时长、群体规模变化。

Comments 9 pages, 4 figures, 3 tables. Accepted at the 28th ACM International Conference on Multimodal Interaction (ICMI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00265 2025-08-06 cs.CV 80%

Multimodal Referring Segmentation: A Survey

Henghui Ding, Song Tang, Shuting He, Chang Liu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai University of Finance and Economics(上海财经大学) ByteDance Inc(字节跳动公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

Comments Project Page: https://github.com/henghuiding/Awesome-Multimodal-Referring-Segmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16464 2024-05-28 cs.RO cs.CV 80%

Multi-Modal UAV Detection, Classification and Tracking Algorithm -- Technical Report for CVPR 2024 UG2 Challenge

Tianchen Deng, Yi Zhou, Wenhua Wu, Mingrui Li, Jingwei Huang, Shuhong Liu, Yanzeng Song, Hao Zuo, Yanbo Wang, Yutao Yue, Hesheng Wang, Weidong Chen

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2024 workshop. The 1st winning model in CVPR 2024 UG2+ challenge. The code and configuration of our method are available at https://github.com/dtc111111/Multi-Modal-UAV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.03539 2022-11-08 cs.HC cs.AI 80%

Adaptive User-Centered Multimodal Interaction towards Reliable and Trusted Automotive Interfaces

Amr Gomaa

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

Journal ref In Proceedings of the 2022 International Conference on Multimodal Interaction, pp. 690-695. 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.13206 2022-04-29 cs.SD eess.AS eess.IV 80%

Improving Multimodal Speech Recognition by Data Augmentation and Speech Representations

Dan Oneata, Horia Cucu

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

Comments Accepted at the Multimodal Learning and Applications Workshop (MULA) from CVPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.01353 2021-11-05 cs.CV cs.LG cs.RO 80%

There is More than Meets the Eye: Self-Supervised Multi-Object Detection and Tracking with Sound by Distilling Multimodal Knowledge

Francisco Rivera Valverde, Juana Valeria Hurtado, Abhinav Valada

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

Comments Accepted at CVPR 2021. Dataset, code and models are available at http://rl.uni-freiburg.de/research/multimodal-distill

Journal ref IEEE/ CVF International Conference on Computer Vision and Pattern Recognition (CVPR), pp. 11612-11621, 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.00734 2020-12-02 eess.AS cs.SD eess.IV 80%

Training Strategies to Handle Missing Modalities for Audio-Visual Expression Recognition

Srinivas Parthasarathy, Shiva Sundaram

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS;multimodal(comments)

Comments ICMI 2020 workshop on "MODELING SOCIO-EMOTIONAL AND COGNITIVE PROCESSES FROM MULTIMODAL DATA IN THE WILD"

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.09847 2020-08-25 eess.AS cs.SD eess.SP 80%

Time-Domain Multi-modal Bone/air Conducted Speech Enhancement

Cheng Yu, Kuo-Hsuan Hung, Syu-Siang Wang, Szu-Wei Fu, Yu Tsao, Jeih-weih Hung

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS

Comments multi-modal, bone/air-conducted signals, speech enhancement, fully convolutional network

Journal ref IEEE Signal Processing Letters, vol. 27, pp. 1035-1039, 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.03876 2020-07-09 cs.CL 80%

Audio-Visual Understanding of Passenger Intents for In-Cabin Conversational Agents

Eda Okur, Shachi H Kumar, Saurav Sahay, Lama Nachman

专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract,comments);分类 cs.CL

Comments ACL 2020 - Second Grand-Challenge and Workshop on Multimodal Language (Challenge-HML)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15265 2026-07-17 cs.CV cs.AI cs.MM cs.SD 新提交 80%

SceneBind: Binding What and Where Across Vision, Audio and Language

SceneBind:跨视觉、音频和语言绑定“什么”与“哪里”

Mingfei Chen, Zijun Cui, Ruoke Zhang, Hyeonggon Ryu, Eli Shlizerman

机构 * University of Washington(华盛顿大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Hankuk University of Foreign Studies(韩国外国语大学)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 研究提出SceneBind全模态场景表示,结合全局语义与对象中心语义空间插槽解决空间结构缺失问题,还提出匹配方案。通过构建新数据集及训练协议进行训练评估,兼容预训练编码器,实现先进检索并能零样本转移到下游任务。

Comments Project website: https://scenebind.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18296 2026-05-19 cs.HC 80%

MEEDAV: A Synchronous Web Viewer for EEG, Eye-Tracking and Speech Data

MEEDAV:一种用于EEG、眼动追踪和语音数据同步可视化的Web查看器

Jan Pijálek, Karel Vlk, Ondřej Bojar

专题命中 音频语音多模态 :multi-modal(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract)

AI总结 本文提出MEEDAV,一种用于同步可视化EEG、眼动追踪和语音数据的开源Web应用,支持高密度EEG设置,并提供实时处理和交互式可视化功能,适用于心理语言学研究。

Comments Presented at ACAIN 2025 (Advanced Course & Symposium on Artificial Intelligence & Neuroscience), recipient of the Camillo Golgi Best Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16231 2026-01-26 cs.SD cs.AI cs.CL cs.LG eess.AS 80%

SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models

SoundBreak: 对三模态模型上仅音频对抗攻击的系统研究

Aafiya Hussain, Gaurav Srivastava, Alvi Ishmam, Zaber Hakim, Chris Thomas

机构 * Department of Computer Science, Virginia Tech, USA(计算机科学系,弗吉尼亚理工大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 SoundBreak研究了对三模态模型的仅音频对抗攻击,发现音频扰动可导致严重多模态失败,攻击成功率高达96%,并揭示了多模态系统中被忽视的单模态攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00279 2025-12-01 cs.MM cs.AI cs.CL cs.DC cs.LG cs.SD 80%

LongCat-Flash-Omni Technical Report

LongCat-Flash-Omni 技术报告

Meituan LongCat Team, Bairui Wang, Bayan, Bin Xiao, Bo Zhang, Bolin Rong, Borun Chen, Chang Wan, Chao Zhang, Chen Huang, Chen Chen, Chen Chen, Chengxu Yang, Chengzuo Yang, Cong Han, Dandan Peng, Delian Ruan, Detai Xin, Disong Wang, Dongchao Yang, Fanfan Liu, Fengjiao Chen, Fengyu Yang, Gan Dong, Gang Huang, Gang Xu, Guanglu Wan, Guoqiang Tan, Guoqiao Yu, Haibo Qiu, Hao Lu, Hongbo Liu, Hongyu Xiang, Jiaheng Wu, Jian Yang, Jiaxing Liu, Jing Huang, Jingang Wang, Jinrui Ding, Juchao Jiang, Jun Kuang, Jun Wang, Junhui Mei, Ke Ding, Kefeng Zhang, Lei Chen, Liang Shi, Limeng Qiao, Liming Zheng, Lin Ma, Liuyang Guo, Liya Ma, Luying Sun, Man Gao, Mengshen Zhu, Miao Cao, Minliang Lin, Nuo Xu, Peng Shi, Qi Zhang, Qian Fang, Qian Wang, Qian Yang, Quanxiu Wang, Rongxiang Weng, Rongxin Guo, Ruoxuan Liang, Senbin Yang, Shanbo Xu, Shanglin Lei, Shengze Ye, Shimin Chen, Shuaiqi Chen, Shujie Hu, Shuo Li, Siqi Yang, Siyu Xu, Siyu Ren, Song Li, Songxiang Liu, Tianhao Bai, Tianye Dai, Wei Hong, Wei Wang, Weixiao Zhao, Wengang Cao, Wenlong Zhu, Wenlong He, Xi Su, Xi Nan, Xiaohan Zhao, Xiaohao Wang, Xiaoyu Zhao, Xiaoyu Wang, Xiaoyu Li, Xin Pan, Xin Chen, Xiusong Sun, Xu Xiang, Xudong Xing, Xuezhi Cao, Xunliang Cai, Yang Yang, Yanli Tan, Yao Yao, Yerui Sun, Yi Chen, Yifan Lu, Yin Gong, Yining Zhang, Yitian Chen, Yiyang Gan, Yuchen Tang, Yuchen Xie, Yueqian Wang, Yuewen Zheng, Yufei Zhang, Yufeng Zhong, Yulei Qian, Yuqi Peng, Yuqian Li, Yuwei Jiang, Zeyang Hu, Zheng Zhang, Zhengkun Tian, Zhiqing Hong, Zhixiong Zeng, Zhuqi Mi, Ziran Li, Ziwen Wang, Ziyi Zhao, Ziyuan Zhuang, Zizhe Zhao

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 LongCat-Flash-Omni 是一个具有5600亿参数的开源多模态模型,通过课程启发式训练策略实现高效实时音频视觉交互,具备强大的多模态和单模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16359 2025-05-30 cs.CV cs.AI cs.MM 80%

Audio Visual Segmentation Through Text Embeddings

Kyungbok Lee, You Zhang, Zhiyao Duan

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20693 2024-07-31 cs.CV cs.AI cs.MM 80%

Boosting Audio Visual Question Answering via Key Semantic-Aware Cues

Guangyao Li, Henghui Du, Di Hu

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05206 2024-04-09 cs.CV cs.MM cs.SD eess.AS 80%

SoundingActions: Learning How Actions Sound from Narrated Egocentric Videos

Changan Chen, Kumar Ashutosh, Rohit Girdhar, David Harwath, Kristen Grauman

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted at CVPR 2024. Project page: https://vision.cs.utexas.edu/projects/soundingactions

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.12772 2022-08-16 cs.CV cs.MM cs.SD eess.AS 80%

Exploiting Transformation Invariance and Equivariance for Self-supervised Sound Localisation

Jinxiang Liu, Chen Ju, Weidi Xie, Ya Zhang

专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Camera-ready Version for ACMMM 2022, Project page is https://jinxiang-liu.github.io/SSL-TIE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23484 2026-08-25 cs.AI 新提交 79%

Multi-Modal Semantic Expansion with Constrained LLM Reranking for Conversational Music Recommendation

结合约束大语言模型重排序的多模态语义扩展用于对话式音乐推荐

Naman Garg, Sarika Jain, George Fazekas

机构 * National Institute of Technology Kurukshetra(库鲁克谢特拉国家技术学院) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 该研究针对ACM RecSys 2026挑战赛提出三阶段多模态对话音乐推荐系统,经优化后在Blind B获0.3213综合分,发现约束大语言模型注入的会话数量对Blind A的nDCG有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23383 2026-08-25 cs.CV 新提交 79%

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

面向持续故事与交互世界的长时序视听生成

Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li, Yuming Li, Yijun Liu, Xin Lu, Xiaoxiao Ma, Yanwen Ma, Yaofeng Su, Yilang Sun, Haoyu Wang, Zeyue Xue, Songchun Zhang, Junhao Zhuang

机构 * Joy Future Academy, JD(京东探索研究院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 研究针对长时序视听生成的需求,提出JoyAI-Echo-1.5系统,含长视频与世界模型变体,通过专用技术实现跨镜头一致性等性能,在相关基准上取得领先结果,为生成连贯内容提供基础。

Comments Project page: https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15294 2026-08-25 cs.SD cs.MM 版本更新 79%

MeMo: Attentional Momentum for Real-Time Audio-Visual Target Speaker Extraction Under Impaired Visual Conditions

MeMo: 视觉受损条件下的实时视听目标说话人提取的注意力动量

Junjie Li, Wenxuan Wu, Shuai Wang, Zexu Pan, Kong Aik Lee, Helen Meng, Haizhou Li

机构 * Department of Electrical and Electronic Engineering, Faculty of Engineering, The Hong Kong Polytechnic University(电子工程系,工程学院,香港理工大学) Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong(系统工程与工程管理系,香港中文大学) School of Artificial Intelligence (SAI), The Chinese University of Hong Kong, Shenzhen(人工智能学院(SAI),香港中文大学深圳校区) School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) Tongyi Lab, Alibaba Group, Singapore(通义实验室,阿里巴巴集团,新加坡)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM

AI总结 提出MeMo框架,通过两个自适应记忆库存储注意力信息,在视觉线索缺失时维持注意力动量,实现实时目标说话人提取,SI-SNR提升至少2dB。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00735 2026-08-20 cs.CR cs.AI cs.SE 版本更新 79%

`From Prompt to Perturbation': An Adaptive Framework for Voice-Based Jailbreaks on Audio LLMs

从提示到扰动:针对音频大语言模型的自适应语音越狱框架

Linghan Huang, Bo Li, Huaming Chen, Kim-Kwang Raymond Choo

机构 * School of Electrical and Computer Engineering, The University of Sydney(悉尼大学电气与计算机工程学院) University of Chicago(芝加哥大学) University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 针对现有音频越狱攻击研究仅聚焦单一范式的不足,提出自适应越狱框架,可在统一设置下评估级联流水线和LALM,实验显示其攻击成功率优于现有方法。

Comments Accepted at the IEEE International Conference on Data Mining (ICDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15066 2026-08-18 eess.SP cs.MM eess.IV 新提交 79%

ParaJSCC: A Parameterized Framework for Reusable Multimodal Joint Source-Channel Coding

ParaJSCC:一种用于可复用多模态联合信源信道编码的参数化框架

Kemi Chen, Mingkai Chen, Youjia Chen, Qian Liu, Wei Gao, Tiesong Zhao

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 针对多模态内容重复访问的效率问题,提出ParaJSCC参数化框架,通过离线生成参数包按需传输,降低延迟与传输速率并保持重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16686 2026-08-18 cs.HC cs.CL cs.RO 新提交 79%

Closing the Affective Loop: Multimodal Speaker-Listener Emotion-Dynamics-Aware Empathetic Social Robots

闭合情感循环:具情感动态感知的多模态说话人-听话人共情社交机器人

Zi Haur Pang, Casey Kennington, Tatsuya Kawahara

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本研究提出AffectLoop系统,在Misty II机器人上实现多模态情感动态感知的说话人-听话人共情交互,经试点研究验证可提升共情响应与用户满意度。

Comments This paper has been accepted for presentation at APSIPA ASC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14651 2026-08-18 cs.AI cs.HC 新提交 79%

Evaluating Multimodal LLMs across Text and Audio Modalities for Accessible Disaster Assistance

评估面向无障碍灾害援助的跨文本与音频模态多模态大语言模型

Anuridhi Gupta, Samara Mansoor, Hemant Purohit

专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);分类 cs.AI

AI总结 本文评估了开放权重多模态大语言模型在灾害援助场景下跨文本与音频模态的响应一致性,发现其存在模态依赖的不公平性,为构建公平的灾害沟通AI工具提供了设计建议。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11752 2026-08-14 cs.CV cs.SD 版本更新 79%

UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

UniSwap:用于说话视频的流音频-视觉身份交换

Yuxuan Zhang, Haozhong Xiong, Jiayi Song, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Qwen Applications Business Group of Alibaba(阿里巴巴通义千问应用业务集团)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 UniSwap是首个流音频-视觉身份替换框架,通过多阶段适配技术解决现有方法音视频一致性差等问题,实现高效稳定的说话视频身份替换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17387 2026-08-12 cs.CL 版本更新 79%

Generation-Step-Aware Framework for Cross-Modal Representation and Control in Multilingual Speech-Text Models

跨模态表示与控制的多语言语音-文本模型生成步骤感知框架

Toshiki Nakai, Varsha Suresh, Vera Demberg

机构 * Saarland University(萨尔兰大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL

AI总结 本文提出一个生成步骤感知框架,用于评估多语言语音-文本模型中的跨模态计算,发现跨模态语言对齐在生成初期最强,随后转向模态特定的自回归处理。

Comments 8 pages for the main text, 9 Figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09475 2026-08-11 cs.CV 新提交 79%

Agreement-Based Audio-Visual Segmentation:Champion Report for the MeViS-Audio Track in the 8th LSVOS Challenge

基于一致性的视听分割:第八届LSVOS挑战赛MeViS音频赛道冠军报告

Yiwen Ren, Jianing Liu, Yingxin Wang, Kexin Zhang, Licheng Jiao, Lingling Li, Xu Liu

机构 * National 111 Project Base of Intelligent Information Processing(智能信息处理国家111计划基地)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 本文针对第八届LSVOS挑战赛MeViS音频赛道,提出分阶段视听分割方案,以Qwen3-ASR为基础,通过掩码一致性选择轨迹并修正查询,结合多模态得分判断目标存在性,最终取得赛道第一的成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09288 2026-08-11 cs.SD cs.AI 新提交 79%

DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation

DAVE:用于真实场景语音分离的解耦式视听增强框架

Wei Zhou, Wanyi Ning, Yinshang Guo, Qianxiao Fang, Haitao Qian, Yingpeng Li

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI

AI总结 本文提出用于真实场景语音分离的解耦式视听增强框架DAVE,构建含219411个混合样本的DAVE-Corpus,采用渐进式多目标优化与选择性增强链,在挑战赛中展现出良好鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08510 2026-08-11 cs.CL 新提交 79%

From Speech to Interaction: Analyzing Multimodal Systems in Cocktail-Party Scenarios

从语音到交互:鸡尾酒会场景下多模态系统的分析

Thai-Binh Nguyen, Zhaolin Li, Jan Niehues, Alexander Waibel

专题命中 音频语音多模态 :multimodal(title);audio-visual(abstract);分类 cs.CL

AI总结 本研究分析了CHiME-9 MCoRec任务中不同多模态系统解决鸡尾酒会场景的策略,发现最优系统实现57%相对错误减少,且高语音重叠并非性能差异的主要原因。

Comments Accepted at ICMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03964 2026-08-07 eess.AS 版本更新 79%

Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE

基于QIANGDA与VOXBLINK2-AVSE的身份保真视听目标说话人提取

Peijun Yang, Zhan Jin, Xiaoyi Qin, Ruiyi Gan, Hao Wang, Juan Liu, Ming Li

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

AI总结 本文提出QIANGDA普通话AV-TSE基准与VOXBLINK2-AVSE数据集,采用含AV-HuBERT等的提取器,通过双指标评估,取得了视听目标说话人提取的良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏