arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2602.14224 2026-02-17 cs.SD cs.CL cs.MM 62%

The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents

Interspeech 2026音频推理挑战:评估音频推理模型和代理的推理过程质量

Ziyang Ma, Ruiyang Xu, Yinghao Ma, Chao-Han Huck Yang, Bohan Li, Jaeyeon Kim, Jin Xu, Jinyu Li, Carlos Busso, Kai Yu, Eng Siong Chng, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Queen Mary University of London(伦敦大学Queen Mary) NVIDIA(NVIDIA公司) Carnegie Mellon University(卡内基梅隆大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) Microsoft Corporation(微软公司)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.MM

AI总结 Interspeech 2026音频推理挑战通过评估推理过程质量,探讨了音频推理模型和代理在事实性和逻辑性方面的表现及改进方向。

Comments The official website of the Audio Reasoning Challenge: https://audio-reasoning-challenge.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13455 2026-02-17 cs.CL cs.AI cs.HC 62%

Using Machine Learning to Enhance the Detection of Obfuscated Abusive Words in Swahili: A Focus on Child Safety

利用机器学习增强斯瓦希里语中隐晦侮辱性词汇的检测:聚焦儿童安全

Phyllis Nabangi, Abdul-Jalil Zakaria, Jema David Ndibwile

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究利用机器学习方法提升斯瓦希里语中隐晦侮辱性词汇的检测能力,旨在提高儿童网络环境的安全性。

Comments Accepted at the Second IJCAI AI for Good Symposium in Africa, hosted by Deep Learning Indaba, 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07969 2026-02-16 eess.AS cs.AI cs.LG cs.SD 62%

Tuberculosis Screening from Cough Audio: Baseline Models, Clinical Variables, and Uncertainty Quantification

咳嗽音频中肺结核筛查:基线模型、临床变量和不确定性量化

George P. Kafentzis, Efstratios Selisios

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出了一种标准化框架,用于通过咳嗽音频和临床数据检测肺结核,通过建立基线模型和量化不确定性,提供公平比较的参考点。

Comments Updated to published version in Sensors; DOI: 10.3390/s26041223

Journal ref Sensors 2026, 26(4), 1223

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12302 2026-02-16 cs.CL cs.CV 62%

Grandes Modelos de Linguagem Multimodais (MLLMs): Da Teoria à Prática

大规模多模态语言模型(MLLMs):从理论到实践

Neemias da Silva, Júlio C. W. Scholz, John Harrison, Marina Borges, Paulo Ávila, Frances A Santos, Myriam Delgado, Rodrigo Minetto, Thiago H Silva

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文介绍了多模态大语言模型(MLLMs)的理论基础和实践方法,探讨了预处理、提示工程及多模态管道构建技术,并提供了补充材料供进一步研究。

Comments in Portuguese language. Accepted book chapter - Webmedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07179 2026-02-10 cs.HC cs.AI cs.CL cs.CY cs.IT math.IT 62%

An Information-Theoretic Framework for Comparing Voice and Text Explainability

一种信息论框架用于比较语音和文本的可解释性

Mona Rajhans, Vishal Khawarey

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种信息论框架,用于比较语音和文本在AI系统可解释性中的效果,发现类比基于的交付在理解效率与信任校准之间取得最佳平衡。

Comments Accepted for publication at the 10th ACM International Conference on Intelligent Systems, Metaheuristics & Swarm Intelligence (ISMSI 2026), April 24-26, Cebu City, Phillipines

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06647 2026-02-09 cs.CL eess.AS 62%

Reading Between the Waves: Robust Topic Segmentation Using Inter-Sentence Audio Features

在波涛间阅读:利用跨句音频特征实现鲁棒性话题分割

Steffen Freisinger, Philipp Seeberger, Tobias Bocklet, Korbinian Riedhammer

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出利用跨句音频特征进行鲁棒性话题分割,通过多模态方法提升分割性能,并在多个数据集上验证了其有效性。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08176 2026-02-06 cs.SD cs.AI cs.LG eess.AS 62%

Leveraging Whisper Embeddings for Audio-based Lyrics Matching

利用Whisper嵌入进行基于音频的歌词匹配

Eleonora Mancini, Joan Serrà, Paolo Torroni, Yuki Mitsufuji

机构 * DISI, University of Bologna(博洛尼亚大学DISI) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出WEALY,利用Whisper嵌入实现基于音频的歌词匹配,通过可重复的流程和多模态扩展,展示了与最先进方法相当的性能,并为音乐信息检索提供了可靠基准。

Comments Accepted at ICASSP 2026 (IEEE International Conference on Acoustics, Speech and Signal Processing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03365 2026-02-05 cs.SD cs.AI cs.CR eess.AS 62%

When Good Sounds Go Adversarial: Jailbreaking Audio-Language Models with Benign Inputs

当良好声音变得对抗性:利用无害输入对音频-语言模型进行劫持

Hiskias Dingeto, Taeyoun Kwon, Dasol Choi, Bodam Kim, DongGeon Lee, Haon Park, JaeHoon Lee, Jongho Shin

机构 * Yonsei University, Seoul, South Korea(延世大学) Seoul National University, Seoul, South Korea(首尔国立大学) Pohang University of Science(坡桑科学大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 WhisperInject通过在无害音频中嵌入细微扰动,利用两阶段对抗性攻击框架劫持音频-语言模型,生成有害内容,展示了音频原生威胁的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02280 2026-02-04 cs.CV cs.CL 62%

SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning

SAIL-RL: 通过双奖励强化学习调优引导MLLM在何时以及如何思考

Fangxun Shu, Yongjie Ye, Yue Liao, Zijian Kang, Weijie Yin, Jiacong Wang, Xiao Liang, Shuicheng Yan, Chao Feng

机构 * National University of Singapore(新加坡国立大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 SAIL-RL通过双奖励强化学习调优,提升多模态大语言模型的推理能力和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02741 2026-02-03 cs.LG cs.AI cs.SD eess.AS 62%

DeepGB-TB: A Risk-Balanced Cross-Attention Gradient-Boosted Convolutional Network for Rapid, Interpretable Tuberculosis Screening

DeepGB-TB: 一种风险平衡的跨注意力梯度提升卷积网络用于快速、可解释的肺结核筛查

Zhixiang Lu, Yulong Li, Feilong Tang, Zhengyong Jiang, Chong Li, Mian Zhou, Tenglong Li, Jionglong Su

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 DeepGB-TB通过结合跨注意力机制和梯度提升决策树,实现快速、可解释的肺结核筛查,具有高准确率和低资源需求。

Comments Accepted by AAAI 2026 (oral)

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10754 2026-02-02 cs.SD cs.AI eess.AS 62%

BNMusic: Blending Environmental Noises into Personalized Music

BNMusic: 将环境噪音融入个性化音乐

Chi Zuo, Martin B. Møller, Pablo Martínez-Nuevo, Huayang Huang, Yu Wu, Ye Zhu

机构 * Wuhan University(武汉大学) Bang & Olufsen A/S(Bang & Olufsen公司) Princeton University(普林斯顿大学) LIX, École Polytechnique(巴黎政治学院LIX研究所)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 BNMusic通过将环境噪音融入个性化音乐生成,减少噪音的明显性,提升听觉体验。

Comments This paper has been accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12142 2026-01-30 eess.AS cs.MM cs.RO 62%

Listen, Look, Drive: Coupling Audio Instructions for User-aware VLA-based Autonomous Driving

Listen, Look, Drive: 通过用户意识的VLA基于自主驾驶的音频指令耦合

Ziang Guo, Feng Yang, Xuefeng Zhang, Jiaqi Guo, Kun Zhao, Yixiao Zhou, Peng Lu, Sifa Zheng, Zufeng Zhang

机构 * SuZhou Automotive Research Institute of Tsinghua University(清华大学苏州汽车研究院) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) Hyundai Motor Advanced Tech. R&D Center School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM、eess.AS

AI总结 EchoVLA通过结合音频指令与视觉信息,提升自动驾驶对用户意图和情绪的感知能力,显著降低误差和碰撞率。

Comments Accepted by IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13244 2026-01-30 cs.SD cs.AI cs.MM 62%

MotionBeat: Motion-Aligned Music Representation via Embodied Contrastive Learning and Bar-Equivariant Contact-Aware Encoding

MotionBeat: 通过具身体验对比学习和小节等价接触感知编码实现运动对齐的音乐表示

Xuanchen Wang, Heng Wang, Weidong Cai

机构 * School of Computer Science, The University of Sydney, Australia(计算机科学学院,悉尼大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI、cs.MM

AI总结 MotionBeat通过具身体验对比学习和小节等价接触感知编码,实现运动对齐的音乐表示学习,提升音乐与舞蹈生成及多任务应用性能。

Comments 5 pages, 1 figure, accepted by ICASSP 2026. demo page: https://motionbeat2025.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17641 2026-01-29 cs.CL cs.AI cs.LG cs.SD 62%

AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?

AuditoryBench++: 语言模型能否在不听觉的情况下理解听觉知识?

Hyunjong Ok, Suho Yoo, Hyeonjun Kim, Jaeho Lee

机构 * Pohang University of Science and Technology(坡山科学技术大学) HJ AILAB Korea Advanced Institute of Science and Technology(韩国高级科学技术研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 AuditoryBench++通过AIR-CoT方法提升语言模型在听觉知识推理中的表现。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16225 2026-01-26 eess.AS cs.AI cs.SD 62%

ES4R: Speech Encoding Based on Prepositive Affective Modeling for Empathetic Response Generation

基于前置情感建模的语音编码用于共情响应生成

Zhuoyue Gao, Xiaohui Wang, Xiaocui Yang, Wen Zhang, Daling Wang, Shi Feng, Yifei Zhang

机构 * Northeastern University, China(东北大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 ES4R通过前置情感建模和双层注意力机制,提升语音对话中的共情响应生成能力,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14620 2026-01-22 eess.AS cs.AI cs.LG cs.SD 62%

Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language Models

缩放歧义:通过音频-语言模型增强语音情感识别中的人工标注

Wenda Zhang, Hongyu Jin, Siyi Wang, Zhiqiang Wei, Ting Dang

机构 * University of Melbourne(墨尔本大学) Xi'an Jiaotong University(西安交通大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文通过音频-语言模型生成合成标注,提升语音情感识别中模糊情感的真实分布可靠性,实验表明合成标注在低歧义区域效果显著,但高歧义情况需进一步优化。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12534 2026-01-22 cs.CV cs.AI 62%

Encoding Emotion Through Self-Supervised Eye Movement Reconstruction

通过自监督眼动重建编码情感

Marcus Ma, Jordan Prescott, Emily Zhou, Tiantian Feng, Kleanthis Avramidis, Gabor Mihaly Toth, Shrikanth Narayanan

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种自监督眼动重建模型,用于从自然主义低分辨率视频中预测情绪表达的多模态标记,通过微调两个下游任务验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02967 2026-01-09 cs.SD cs.AI eess.AS 62%

MoE Adapter for Large Audio Language Models: Sparsity, Disentanglement, and Gradient-Conflict-Free

用于大型音频语言模型的MoE适配器:稀疏性、解耦与梯度无冲突

Yishu Lei, Shuwei He, Jing Hu, Dan Zhang, Xianlong Luo, Danxiang Zhu, Shikun Feng, Rui Liu, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

机构 * ERNIE Team, Baidu(百度ERNIE团队) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出MoE-Adapter,通过稀疏混合专家架构解耦音频信息,缓解梯度冲突,提升音频语义和非语言任务的性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22491 2025-12-30 cs.CL cs.AI 62%

ManchuTTS: Towards High-Quality Manchu Speech Synthesis via Flow Matching and Hierarchical Text Representation

曼juTTS: 通过流匹配和分层文本表示实现高质量曼ju语音合成

Suhua Wang, Zifan Wang, Xiaoxin Sun, D. J. Wang, Zhanbo Liu, Xin Li

机构 * Department of Computer Science, Changchun Humanities and Sciences College(计算机科学系,长春人文科学学院) School of Information Science and Technology, Northeast Normal University(信息科学与技术学院,东北师范大学) College of Optical Science and Engineering, Zhejiang University(光学科学与工程学院,浙江大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 ManchuTTS通过流匹配和分层文本表示,解决曼ju语音合成中的黏着性和数据稀缺问题,实现高质量语音生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21706 2025-12-29 cs.CL cs.AI 62%

Enabling Conversational Behavior Reasoning Capabilities in Full-Duplex Speech

实现全双工语音中对话行为推理能力

Shuchang Pan, Siddharth Banerjee, Dhruv Hebbar, Siddhant Patel, Akshaj Gupta, Kan Jen Cheng, Hanjo Kim, Zeyi Austin Li, Martin Q. Ma, Tingle Li, Gopala Anumanchipalli, Jiachen Lian

机构 * Zhejiang University(浙江大学) University of California, Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于图的思维框架,通过建模对话行为的因果推断,实现全双工语音交互中的行为推理与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18099 2025-12-24 eess.AS cs.CV 62%

SAM Audio: Segment Anything in Audio

SAM Audio:音频中的分段任何事物

Bowen Shi, Andros Tjandra, John Hoffman, Helin Wang, Yi-Chiao Wu, Luya Gao, Julius Richter, Matt Le, Apoorv Vyas, Sanyuan Chen, Christoph Feichtenhofer, Piotr Dollár, Wei-Ning Hsu, Ann Lee

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS

AI总结 SAM Audio提出了一种统一文本、视觉和时间跨度提示的通用音频分离基础模型,实现了在多种音频任务中优于现有系统的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20336 2025-12-16 cs.CV cs.SD eess.AS 62%

RapVerse: Coherent Vocals and Whole-Body Motions Generations from Text

RapVerse: 从文本歌词生成连贯的唱声与全身动作

Jiaben Chen, Xin Yan, Yihang Chen, Siyuan Cen, Zixin Wang, Qinwei Ma, Haoyu Zhen, Kaizhi Qian, Lie Lu, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) Wuhan University(武汉大学) UC San Diego(加州大学圣地亚哥分校) Tsinghua University(清华大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Dolby Laboratories(杜比实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、eess.AS

AI总结 RapVerse通过统一生成框架,从文本歌词生成连贯唱声与全身动作,实现多模态统一建模,提升生成效果与基准性能。

Comments ICCV 2025, Project website: https://jiabenchen.github.io/RapVerse/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18234 2025-12-15 cs.AI cs.CL cs.LG 62%

The Illusion of Readiness in Health AI

健康AI中的“准备”幻觉

Yu Gu, Jingjing Fu, Xiaodong Liu, Jeya Maria Jose Valanarasu, Noel CF Codella, Reuben Tan, Qianchu Liu, Ying Jin, Sheng Zhang, Jinyu Wang, Rui Wang, Lei Song, Guanghui Qin, Naoto Usuyama, Cliff Wong, Hao Cheng, HoHin Lee, Praneeth Sanapathi, Sarah Hilado, Tristan Naumann, Javier Alvarez-Valle, Jiang Bian, Mu Wei, Khalil Malik, Lidong Zhou, Jianfeng Gao, Eric Horvitz, Matthew P. Lungren, Doug Burger, Eric Topol, Hoifung Poon, Paul Vozila

机构 * Scripps Research Translational Institute(斯克里普斯研究转化研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对抗性压力测试揭示了健康AI在现实应用中的鲁棒性和推理能力不足,强调了对AI系统责任和真实医疗需求的重视。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23856 2025-12-10 cs.CL cs.AI cs.HC cs.LG 62%

OMNIGUARD: An Efficient Approach for AI Safety Moderation Across Languages and Modalities

OMNIGUARD:一种跨语言和模态的高效AI安全审查方法

Sahil Verma, Keegan Hines, Jeff Bilmes, Charlotte Siska, Luke Zettlemoyer, Hila Gonen, Chandan Singh

机构 * University of Washington(华盛顿大学) Microsoft(微软公司)

专题命中 音频语音多模态 :MLLM(abstract);分类 cs.CL、cs.AI

AI总结 Omniguard提出了一种跨语言和模态的高效方法,通过构建语言或模态无关的分类器提升有害提示检测的准确率,并在多语言、图像和音频提示任务中取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21025 2025-12-03 cs.SD cs.AI cs.LG eess.AS 62%

Text-Queried Audio Source Separation via Hierarchical Modeling

通过分层建模实现文本查询的音频源分离

Xinlei Yin, Xiulian Peng, Xue Jiang, Zhiwei Xiong, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) School of Information and Communication Engineering, Communication University of China(中国通信大学信息与通信工程学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出HSM-TSS框架,通过分层建模实现文本查询的音频源分离,结合双阶段语义分离与结构保持重建,提升复杂场景下的分离性能与语义一致性。

Comments Accepted by TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24693 2025-12-01 cs.SD cs.CL eess.AS 62%

STAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligence

STAR-Bench:探测深度时空推理作为音频4D智能

Zihan Liu, Zhikang Niu, Qiuyang Xiao, Zhisheng Zheng, Ruoqi Yuan, Yuhang Zang, Yuhang Cao, Xiaoyi Dong, Jianze Liang, Xie Chen, Leilei Sun, Dahua Lin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院) Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

AI总结 STAR-Bench通过测试音频4D智能,揭示了模型在细粒度感知和推理上的不足,为未来模型发展提供方向。

Comments Homepage: https://internlm.github.io/StarBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15848 2025-11-27 cs.AI cs.CL cs.SD 62%

Step-Audio-R1 Technical Report

Step-Audio-R1 技术报告

Fei Tian, Xiangyu Tony Zhang, Yuxin Zhang, Haoyang Zhang, Yuxin Li, Daijiao Liu, Yayue Deng, Donghang Wu, Jun Chen, Liang Zhao, Chengyuan Yao, Hexin Liu, Eng Siong Chng, Xuerui Yang, Xiangyu Zhang, Daxin Jiang, Gang Yu

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 Step-Audio-R1 是首个实现音频领域推理能力的模型,通过MGRD框架生成基于声音特征的推理链,超越Gemini 2.5 Pro并达到Gemini 3 Pro水平。

Comments 22 pages, 5 figures. Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13219 2025-11-25 cs.SD cs.AI eess.AS 62%

FoleyBench: A Benchmark For Video-to-Audio Models

FoleyBench:视频到音频模型的基准测试

Satvik Dixit, Koichi Saito, Zhi Zhong, Yuki Mitsufuji, Chris Donahue

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI、eess.AS

AI总结 FoleyBench 是首个针对 Foley 风格视频到音频生成的基准测试,包含5000个三元组,用于评估模型在音频质量、对齐和同步方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17553 2025-11-25 cs.LG cs.AI cs.CL 62%

Practical Machine Learning for Aphasic Discourse Analysis

实用语言学在失语症话语分析中的应用

Jason M. Pittman, Anton Phillips, Yesenia Medina-Santos, Brielle C. Stark

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了五个机器学习模型在失语症患者描述图片任务中识别正确信息单位(CIUs)的性能,发现虽然模型能有效区分词与非词,但识别CIUs仍面临挑战。

Comments 14 pages, 4 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11634 2025-11-18 cs.RO cs.CV cs.HC cs.LG cs.MM 62%

Tactile Data Recording System for Clothing with Motion-Controlled Robotic Sliding

Michikuni Eguchi, Takekazu Kitagishi, Yuichi Hiroi, Takefumi Hiraki

机构 * University of Tsukuba(茨口大学) Cluster Metaverse Lab(元宇宙集群实验室) The University of Tokyo(东京大学) ZOZO Research(ZOZO研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments 3 pages, 2 figures, 1 table. Presented at SIGGRAPH Asia 2025 Posters (SA Posters '25), December 15-18, 2025, Hong Kong, Hong Kong

详情

展开后加载摘要…

URL PDF HTML 收藏