arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4597 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2511.02280 2026-02-04 cs.CV cs.CL 62%

SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning

SAIL-RL: 通过双奖励强化学习调优引导MLLM在何时以及如何思考

Fangxun Shu, Yongjie Ye, Yue Liao, Zijian Kang, Weijie Yin, Jiacong Wang, Xiao Liang, Shuicheng Yan, Chao Feng

机构 * National University of Singapore(新加坡国立大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 SAIL-RL通过双奖励强化学习调优,提升多模态大语言模型的推理能力和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02741 2026-02-03 cs.LG cs.AI cs.SD eess.AS 62%

DeepGB-TB: A Risk-Balanced Cross-Attention Gradient-Boosted Convolutional Network for Rapid, Interpretable Tuberculosis Screening

DeepGB-TB: 一种风险平衡的跨注意力梯度提升卷积网络用于快速、可解释的肺结核筛查

Zhixiang Lu, Yulong Li, Feilong Tang, Zhengyong Jiang, Chong Li, Mian Zhou, Tenglong Li, Jionglong Su

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 DeepGB-TB通过结合跨注意力机制和梯度提升决策树,实现快速、可解释的肺结核筛查,具有高准确率和低资源需求。

Comments Accepted by AAAI 2026 (oral)

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10754 2026-02-02 cs.SD cs.AI eess.AS 62%

BNMusic: Blending Environmental Noises into Personalized Music

BNMusic: 将环境噪音融入个性化音乐

Chi Zuo, Martin B. Møller, Pablo Martínez-Nuevo, Huayang Huang, Yu Wu, Ye Zhu

机构 * Wuhan University(武汉大学) Bang & Olufsen A/S(Bang & Olufsen公司) Princeton University(普林斯顿大学) LIX, École Polytechnique(巴黎政治学院LIX研究所)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 BNMusic通过将环境噪音融入个性化音乐生成,减少噪音的明显性,提升听觉体验。

Comments This paper has been accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12142 2026-01-30 eess.AS cs.MM cs.RO 62%

Listen, Look, Drive: Coupling Audio Instructions for User-aware VLA-based Autonomous Driving

Listen, Look, Drive: 通过用户意识的VLA基于自主驾驶的音频指令耦合

Ziang Guo, Feng Yang, Xuefeng Zhang, Jiaqi Guo, Kun Zhao, Yixiao Zhou, Peng Lu, Sifa Zheng, Zufeng Zhang

机构 * SuZhou Automotive Research Institute of Tsinghua University(清华大学苏州汽车研究院) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) Hyundai Motor Advanced Tech. R&D Center School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM、eess.AS

AI总结 EchoVLA通过结合音频指令与视觉信息,提升自动驾驶对用户意图和情绪的感知能力,显著降低误差和碰撞率。

Comments Accepted by IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13244 2026-01-30 cs.SD cs.AI cs.MM 62%

MotionBeat: Motion-Aligned Music Representation via Embodied Contrastive Learning and Bar-Equivariant Contact-Aware Encoding

MotionBeat: 通过具身体验对比学习和小节等价接触感知编码实现运动对齐的音乐表示

Xuanchen Wang, Heng Wang, Weidong Cai

机构 * School of Computer Science, The University of Sydney, Australia(计算机科学学院,悉尼大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI、cs.MM

AI总结 MotionBeat通过具身体验对比学习和小节等价接触感知编码,实现运动对齐的音乐表示学习,提升音乐与舞蹈生成及多任务应用性能。

Comments 5 pages, 1 figure, accepted by ICASSP 2026. demo page: https://motionbeat2025.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17641 2026-01-29 cs.CL cs.AI cs.LG cs.SD 62%

AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?

AuditoryBench++: 语言模型能否在不听觉的情况下理解听觉知识?

Hyunjong Ok, Suho Yoo, Hyeonjun Kim, Jaeho Lee

机构 * Pohang University of Science and Technology(坡山科学技术大学) HJ AILAB Korea Advanced Institute of Science and Technology(韩国高级科学技术研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 AuditoryBench++通过AIR-CoT方法提升语言模型在听觉知识推理中的表现。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16225 2026-01-26 eess.AS cs.AI cs.SD 62%

ES4R: Speech Encoding Based on Prepositive Affective Modeling for Empathetic Response Generation

基于前置情感建模的语音编码用于共情响应生成

Zhuoyue Gao, Xiaohui Wang, Xiaocui Yang, Wen Zhang, Daling Wang, Shi Feng, Yifei Zhang

机构 * Northeastern University, China(东北大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 ES4R通过前置情感建模和双层注意力机制,提升语音对话中的共情响应生成能力,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14620 2026-01-22 eess.AS cs.AI cs.LG cs.SD 62%

Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language Models

缩放歧义:通过音频-语言模型增强语音情感识别中的人工标注

Wenda Zhang, Hongyu Jin, Siyi Wang, Zhiqiang Wei, Ting Dang

机构 * University of Melbourne(墨尔本大学) Xi'an Jiaotong University(西安交通大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文通过音频-语言模型生成合成标注,提升语音情感识别中模糊情感的真实分布可靠性,实验表明合成标注在低歧义区域效果显著,但高歧义情况需进一步优化。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12534 2026-01-22 cs.CV cs.AI 62%

Encoding Emotion Through Self-Supervised Eye Movement Reconstruction

通过自监督眼动重建编码情感

Marcus Ma, Jordan Prescott, Emily Zhou, Tiantian Feng, Kleanthis Avramidis, Gabor Mihaly Toth, Shrikanth Narayanan

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种自监督眼动重建模型,用于从自然主义低分辨率视频中预测情绪表达的多模态标记,通过微调两个下游任务验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02967 2026-01-09 cs.SD cs.AI eess.AS 62%

MoE Adapter for Large Audio Language Models: Sparsity, Disentanglement, and Gradient-Conflict-Free

用于大型音频语言模型的MoE适配器:稀疏性、解耦与梯度无冲突

Yishu Lei, Shuwei He, Jing Hu, Dan Zhang, Xianlong Luo, Danxiang Zhu, Shikun Feng, Rui Liu, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

机构 * ERNIE Team, Baidu(百度ERNIE团队) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出MoE-Adapter,通过稀疏混合专家架构解耦音频信息,缓解梯度冲突,提升音频语义和非语言任务的性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22491 2025-12-30 cs.CL cs.AI 62%

ManchuTTS: Towards High-Quality Manchu Speech Synthesis via Flow Matching and Hierarchical Text Representation

曼juTTS: 通过流匹配和分层文本表示实现高质量曼ju语音合成

Suhua Wang, Zifan Wang, Xiaoxin Sun, D. J. Wang, Zhanbo Liu, Xin Li

机构 * Department of Computer Science, Changchun Humanities and Sciences College(计算机科学系,长春人文科学学院) School of Information Science and Technology, Northeast Normal University(信息科学与技术学院,东北师范大学) College of Optical Science and Engineering, Zhejiang University(光学科学与工程学院,浙江大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 ManchuTTS通过流匹配和分层文本表示,解决曼ju语音合成中的黏着性和数据稀缺问题,实现高质量语音生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21706 2025-12-29 cs.CL cs.AI 62%

Enabling Conversational Behavior Reasoning Capabilities in Full-Duplex Speech

实现全双工语音中对话行为推理能力

Shuchang Pan, Siddharth Banerjee, Dhruv Hebbar, Siddhant Patel, Akshaj Gupta, Kan Jen Cheng, Hanjo Kim, Zeyi Austin Li, Martin Q. Ma, Tingle Li, Gopala Anumanchipalli, Jiachen Lian

机构 * Zhejiang University(浙江大学) University of California, Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于图的思维框架,通过建模对话行为的因果推断,实现全双工语音交互中的行为推理与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18099 2025-12-24 eess.AS cs.CV 62%

SAM Audio: Segment Anything in Audio

SAM Audio:音频中的分段任何事物

Bowen Shi, Andros Tjandra, John Hoffman, Helin Wang, Yi-Chiao Wu, Luya Gao, Julius Richter, Matt Le, Apoorv Vyas, Sanyuan Chen, Christoph Feichtenhofer, Piotr Dollár, Wei-Ning Hsu, Ann Lee

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS

AI总结 SAM Audio提出了一种统一文本、视觉和时间跨度提示的通用音频分离基础模型,实现了在多种音频任务中优于现有系统的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20336 2025-12-16 cs.CV cs.SD eess.AS 62%

RapVerse: Coherent Vocals and Whole-Body Motions Generations from Text

RapVerse: 从文本歌词生成连贯的唱声与全身动作

Jiaben Chen, Xin Yan, Yihang Chen, Siyuan Cen, Zixin Wang, Qinwei Ma, Haoyu Zhen, Kaizhi Qian, Lie Lu, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) Wuhan University(武汉大学) UC San Diego(加州大学圣地亚哥分校) Tsinghua University(清华大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Dolby Laboratories(杜比实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS

AI总结 RapVerse通过统一生成框架,从文本歌词生成连贯唱声与全身动作,实现多模态统一建模,提升生成效果与基准性能。

Comments ICCV 2025, Project website: https://jiabenchen.github.io/RapVerse/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18234 2025-12-15 cs.AI cs.CL cs.LG 62%

The Illusion of Readiness in Health AI

健康AI中的“准备”幻觉

Yu Gu, Jingjing Fu, Xiaodong Liu, Jeya Maria Jose Valanarasu, Noel CF Codella, Reuben Tan, Qianchu Liu, Ying Jin, Sheng Zhang, Jinyu Wang, Rui Wang, Lei Song, Guanghui Qin, Naoto Usuyama, Cliff Wong, Hao Cheng, HoHin Lee, Praneeth Sanapathi, Sarah Hilado, Tristan Naumann, Javier Alvarez-Valle, Jiang Bian, Mu Wei, Khalil Malik, Lidong Zhou, Jianfeng Gao, Eric Horvitz, Matthew P. Lungren, Doug Burger, Eric Topol, Hoifung Poon, Paul Vozila

机构 * Scripps Research Translational Institute(斯克里普斯研究转化研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对抗性压力测试揭示了健康AI在现实应用中的鲁棒性和推理能力不足,强调了对AI系统责任和真实医疗需求的重视。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23856 2025-12-10 cs.CL cs.AI cs.HC cs.LG 62%

OMNIGUARD: An Efficient Approach for AI Safety Moderation Across Languages and Modalities

OMNIGUARD:一种跨语言和模态的高效AI安全审查方法

Sahil Verma, Keegan Hines, Jeff Bilmes, Charlotte Siska, Luke Zettlemoyer, Hila Gonen, Chandan Singh

机构 * University of Washington(华盛顿大学) Microsoft(微软公司)

专题命中 音频语音多模态 :MLLM(abstract);分类 cs.CL、cs.AI

AI总结 Omniguard提出了一种跨语言和模态的高效方法,通过构建语言或模态无关的分类器提升有害提示检测的准确率,并在多语言、图像和音频提示任务中取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21025 2025-12-03 cs.SD cs.AI cs.LG eess.AS 62%

Text-Queried Audio Source Separation via Hierarchical Modeling

通过分层建模实现文本查询的音频源分离

Xinlei Yin, Xiulian Peng, Xue Jiang, Zhiwei Xiong, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) School of Information and Communication Engineering, Communication University of China(中国通信大学信息与通信工程学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出HSM-TSS框架,通过分层建模实现文本查询的音频源分离,结合双阶段语义分离与结构保持重建,提升复杂场景下的分离性能与语义一致性。

Comments Accepted by TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24693 2025-12-01 cs.SD cs.CL eess.AS 62%

STAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligence

STAR-Bench:探测深度时空推理作为音频4D智能

Zihan Liu, Zhikang Niu, Qiuyang Xiao, Zhisheng Zheng, Ruoqi Yuan, Yuhang Zang, Yuhang Cao, Xiaoyi Dong, Jianze Liang, Xie Chen, Leilei Sun, Dahua Lin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院) Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

AI总结 STAR-Bench通过测试音频4D智能,揭示了模型在细粒度感知和推理上的不足,为未来模型发展提供方向。

Comments Homepage: https://internlm.github.io/StarBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15848 2025-11-27 cs.AI cs.CL cs.SD 62%

Step-Audio-R1 Technical Report

Step-Audio-R1 技术报告

Fei Tian, Xiangyu Tony Zhang, Yuxin Zhang, Haoyang Zhang, Yuxin Li, Daijiao Liu, Yayue Deng, Donghang Wu, Jun Chen, Liang Zhao, Chengyuan Yao, Hexin Liu, Eng Siong Chng, Xuerui Yang, Xiangyu Zhang, Daxin Jiang, Gang Yu

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 Step-Audio-R1 是首个实现音频领域推理能力的模型,通过MGRD框架生成基于声音特征的推理链,超越Gemini 2.5 Pro并达到Gemini 3 Pro水平。

Comments 22 pages, 5 figures. Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13219 2025-11-25 cs.SD cs.AI eess.AS 62%

FoleyBench: A Benchmark For Video-to-Audio Models

FoleyBench:视频到音频模型的基准测试

Satvik Dixit, Koichi Saito, Zhi Zhong, Yuki Mitsufuji, Chris Donahue

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI、eess.AS

AI总结 FoleyBench 是首个针对 Foley 风格视频到音频生成的基准测试,包含5000个三元组,用于评估模型在音频质量、对齐和同步方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17553 2025-11-25 cs.LG cs.AI cs.CL 62%

Practical Machine Learning for Aphasic Discourse Analysis

实用语言学在失语症话语分析中的应用

Jason M. Pittman, Anton Phillips, Yesenia Medina-Santos, Brielle C. Stark

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了五个机器学习模型在失语症患者描述图片任务中识别正确信息单位(CIUs)的性能,发现虽然模型能有效区分词与非词,但识别CIUs仍面临挑战。

Comments 14 pages, 4 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11634 2025-11-18 cs.RO cs.CV cs.HC cs.LG cs.MM 62%

Tactile Data Recording System for Clothing with Motion-Controlled Robotic Sliding

Michikuni Eguchi, Takekazu Kitagishi, Yuichi Hiroi, Takefumi Hiraki

机构 * University of Tsukuba(茨口大学) Cluster Metaverse Lab(元宇宙集群实验室) The University of Tokyo(东京大学) ZOZO Research(ZOZO研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments 3 pages, 2 figures, 1 table. Presented at SIGGRAPH Asia 2025 Posters (SA Posters '25), December 15-18, 2025, Hong Kong, Hong Kong

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06606 2025-11-17 eess.AS cs.AI 62%

SPUR: A Plug-and-Play Framework for Integrating Spatial Audio Understanding and Reasoning into Large Audio-Language Models

S Sakshi, Vaibhavi Lokegaonkar, Neil Zhang, Ramani Duraiswami, Sreyan Ghosh, Dinesh Manocha, Lie Lu

机构 * University of Maryland, College Park, USA(马里兰大学 College Park 分校) Dolby Laboratories(杜比实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

Comments Project: https://sakshi113.github.io/spur/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27102 2025-11-17 cs.SD cs.AI eess.AS 62%

Expressive Range Characterization of Open Text-to-Audio Models

Jonathan Morse, Azadeh Naderi, Swen Gaudl, Mark Cartwright, Amy K. Hoover, Mark J. Nelson

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

Comments Accepted at the AAAI Conference on Artificial Intelligence and Interactive Digital Entertainment (AIIDE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04995 2025-11-10 cs.HC cs.AI cs.CL 62%

Enhancing Public Speaking Skills in Engineering Students Through AI

Amol Harsh, Brainerd Prince, Siddharth Siddharth, Deepan Raj Prabakar Muthirayan, Kabir S Bhalla, Esraaj Sarkar Gupta, Siddharth Sahu

机构 * Center for Thinking, Language and Communication(思考、语言与交流中心) Plaksha University(普拉克斯大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15176 2025-11-06 cs.SD cs.CL eess.AS 62%

Unifying Symbolic Music Arrangement: Track-Aware Reconstruction and Structured Tokenization

Longshen Ou, Jingwei Zhao, Ziyu Wang, Gus Xia, Qihao Liang, Torin Hopkins Ye Wang

机构 * Sound and Music Computing Lab, School of Computing, NUS(新加坡国立大学计算机学院声音与音乐计算实验室) Courant Institute of Mathematical Sciences, New York University(纽约大学应用数学科学学院) Music X Lab, MBZUAI(MBZUAI音乐X实验室)

专题命中 音频语音多模态 :any-to-any(abstract);分类 cs.CL、eess.AS

Comments NeurIPS 2025 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01670 2025-11-04 cs.CL cs.AI 62%

SeaLLMs-Audio: Large Audio-Language Models for Southeast Asia

Chaoqun Liu, Mahani Aljunied, Guizhen Chen, Hou Pong Chan, Weiwen Xu, Yu Rong, Wenxuan Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01261 2025-11-04 cs.SD cs.AI eess.AS 62%

Speech-DRAME: A Framework for Human-Aligned Benchmarks in Speech Role-Play

Jiatong Shi, Jionghao Han, Yichen Lu, Santiago Pascual, Pengfei Wu, Chenye Cui, Shinji Watanabe, Chao Weng, Cong Zhou

机构 * Carnegie Mellon University(卡内基梅隆大学) Anuttacon(安纳塔康)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

Comments 67 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21864 2025-10-28 cs.CL cs.AI 62%

DeepOmni: Towards Seamless and Smart Speech Interaction with Adaptive Modality-Specific MoE

Hang Shao, Heting Gao, Yunhang Shen, Jiawei Chen, Zuwei Long, Dong Yang, Ke Li, Xing Sun

机构 * Tencent(腾讯) Fudan University(复旦大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22088 2025-10-27 cs.SD cs.CL eess.AS 62%

Visual Cues Support Robust Turn-taking Prediction in Noise

Sam O'Connor Russell, Naomi Harte

机构 * ADAPT Centre, School of Engineering(ADAPT中心,工程学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Accepted to INTERSPEECH 2025, 10.21437/Interspeech.2025-668

Journal ref Proc. of INTERSPEECH 2025, 1073--1077, 10.21437/Interspeech.2025-668

详情

展开后加载摘要…

URL PDF HTML 收藏