arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46430 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2511.09282 2026-04-14 cs.SD cs.CL 57%

End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering

端到端对比语言-语音预训练模型用于长形式语音问答

Jiliang Hu, Zuchao Li, Baoyuan Qi, Liu Guoming, Ping Wang

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出CLSR模型,通过将音频特征转换为文本表示,提升长音频问答任务的性能,实验表明其优于现有方法。

Comments 12 pages, 7 figures, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07895 2026-04-10 cs.AI 57%

DialBGM: A Benchmark for Background Music Recommendation from Everyday Multi-Turn Dialogues

DialBGM:从日常多轮对话中推荐背景音乐的基准测试

Joonhyeok Shin, Jaehoon Kang, Yujun Lee, Hannah Lee, Yejin Lee, Yoonji Park, Kyuhong Shim

机构 * Sungkyunkwan University(成均馆大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出DialBGM基准测试,通过1200个日常对话数据,评估模型在无音乐描述的多轮对话中推荐非侵入性背景音乐的能力,发现现有模型在Hit@1指标上远低于人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07467 2026-04-10 cs.CL cs.LG 57%

Lexical Tone is Hard to Quantize: Probing Discrete Speech Units in Mandarin and Yorùbá

词调难以量化:探究 Mandarin 和 Yorùbá 中的离散语音单元

Opeyemi Osakuade, Simon King

机构 * The Centre for Speech Technology Research, University of Edinburgh, UK(英国爱丁堡大学语音技术研究中心)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究发现离散语音单元在编码超段落信息时可靠性较低,尤其在词调方面,提出通过两次聚类方法改进词调编码。

Comments Accepted at Speech Prosody 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00267 2026-04-02 cs.CV 57%

Omni-MMSI: Toward Identity-attributed Social Interaction Understanding

Omni-MMSI:迈向基于身份的社会互动理解

Xinpeng Li, Bolin Lai, Hardy Chen, Shijian Deng, Cihang Xie, Yuyin Zhou, James Matthew Rehg, Yapeng Tian

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Georgia Institute of Technology(佐治亚理工学院) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出Omni-MMSI任务,要求从原始音频、视觉和语音输入中全面理解社会互动,通过身份属性的社会线索识别与推理,提升AI助手对人类互动的感知与响应能力。

Comments Accepted to CVPR 2026. Project page: https://sampson-lee.github.io/omni-mmsi-project-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01448 2026-03-31 cs.LG cs.MM 57%

OpenAVS: Training-Free Open-Vocabulary Audio Visual Segmentation with Foundational Models

OpenAVS: 基于基础模型的无训练开放词汇音频视觉分割

Shengkai Chen, Yifang Yin, Jinming Cao, Shili Xiang, Zhenguang Liu, Roger Zimmermann

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM

AI总结 OpenAVS通过文本作为代理,首次实现音频与视觉模态对齐,利用基础模型直接推断掩码,提升开放词汇音频视觉分割的泛化能力。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10652 2026-03-31 cs.CV cs.CR 57%

TriDF: Evaluating Perception, Detection, and Hallucination for Interpretable DeepFake Detection

TriDF:评估可解释深度伪造检测的感知、检测和幻觉

Jian-Yu Jiang-Lin, Kang-Yang Huang, Ling Zou, Ling Lo, Sheng-Ping Yang, Yu-Wen Tseng, Kun-Hsiang Lin, Chia-Ling Chen, Yu-Ting Ta, Yan-Tsung Wang, Po-Ching Chen, Hongxia Xie, Hong-Han Shuai, Wen-Huang Cheng

机构 * National Taiwan University(国立台湾大学) National Yang Ming Chiao Tung University(国立阳明交通大学) Jilin University(吉林大学) VinUniversity

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 TriDF提出一个全面的可解释深度伪造检测基准,评估模型感知、检测和幻觉能力,揭示三者间的相互作用,为构建可信系统提供基础。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25870 2026-03-30 cs.CV cs.LG 57%

Speech-Synchronized Whiteboard Generation via VLM-Driven Structured Drawing Representations

通过VLM驱动的结构化绘图表示实现语音同步的白板生成

Suraj Prasad, Pinak Mahapatra

机构 * Latent Spaces IITB(印度理工学院孟买分校潜在空间实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出首个包含24对Excalidraw演示与叙述音频的白板数据集,研究基于Qwen2-VL-7B模型通过时间戳条件化实现语音同步的绘图预测,验证了模型在跨学科领域中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20072 2026-03-26 cs.CL 57%

From Text to Talk: Audio-Language Model Needs Non-Autoregressive Joint Training

从文本到谈话:音频-语言模型需要非自回归联合训练

Tianqiao Liu, Xueyi Li, Hao Wang, Haoxuan Li, Zhichao Chen, Weiqi Luo, Zitao Liu

机构 * Guangdong Institute of Smart Education(广东智能教育研究院) TAL Education Group(TAL教育集团) Peking University(北京大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出Text-to-Talk模型,通过整合自回归文本生成与非自回归音频扩散,统一训练目标,提升多模态语音交互系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22728 2026-03-25 cs.SD eess.AS 57%

The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models

2026年国际语音处理大会大型音频语言模型音频编码能力挑战

Heinrich Dinkel, Jiahao Zhou, Guanbo Wang, Yadong Niu, Junbo Zhang, Yufeng Hao, Ying Liu, Ke Li, Wenwu Wang, Zhiyong Wu, Jian Luan

机构 * MiLM Plus, Xiaomi Inc., Beijing, China(小米公司,北京) DataoceanAI Inc., USA(DataoceanAI公司,美国) Centre for Vision Speech and Signal Processing, University of Surrey, Guildford, UK(视觉语音与信号处理中心, Surrey大学, Guildford,英国) Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(深圳国际研究生院,清华大学,深圳,中国)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出Interspeech 2026音频编码能力挑战,旨在评估和提升预训练音频编码器在大型音频语言模型中的性能,通过统一的生成评估框架XARES-LLM,评估编码器在多种下游任务中的表现。

Comments Interspeech 2026 Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21571 2026-03-24 cs.CL 57%

DATASHI: A Parallel English-Tashlhiyt Corpus for Orthography Normalization and Low-Resource Language Processing

DATASHI:一个平行的英语-塔希利耶特语语料库用于正字法规范化和低资源语言处理

Nasser-Eddine Monir, Zakaria Baou

机构 * Université de Lorraine, CNRS, Inria, LORIA(洛林大学、法国国家科学研究中心、法国国家信息与自动化技术研究院、LORIA实验室) ISIMA, Université Clermont Auvergne(克莱蒙特奥弗涅大学ISIMA)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 DATASHI提供了一个包含5000对句子的平行语料库,包含1500个经过专家标准化和非标准用户生成的句子,用于研究正字法多样性及规范化,支持NLP任务并为多模态对齐提供基础。

Comments This paper has been accepted for presentation at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21233 2026-03-24 cs.LG cs.AI 57%

AngelSlim: A more accessible, comprehensive, and efficient toolkit for large model compression

AngelSlim:一个更易用、更全面且更高效的大型模型压缩工具包

Rui Cen, QiangQiang Hu, Hong Huang, Hong Liu, Song Liu, Xin Luo, Lin Niu, Yifan Tan, Decheng Wu, Linchuan Xie, Rubing Yang, Guanghua Yu, Jianchen Zhu

机构 * Hunyuan AI Infra Team(文心一言AI基础设施团队)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 AngelSlim 提供统一流程,整合量化、推测解码等算法,实现从模型压缩到工业部署的高效加速,同时提出训练对齐的推测解码框架和训练无关的稀疏注意力框架,提升吞吐量并优化多模态模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05911 2026-03-24 cs.CL 57%

Pantagruel: Unified Self-Supervised Encoders for French Text and Speech

Pantagruel:面向法语文本和语音的统一自监督编码器

Phuong-Hang Le, Valentin Pelloin, Arnault Chatelain, Maryem Bouziane, Mohammed Ghennai, Qianwen Guan, Kirill Milintsevich, Salima Mdhaffar, Aidan Mannion, Nils Defauw, Shuyue Gu, Alexandre Audibert, Marco Dinarelli, Yannick Estève, Lorraine Goeuriot, Steffen Lalande, Nicolas Hervé, Maximin Coavoux, François Portet, Étienne Ollion, Marie Candito, Maxime Peyrard, Solange Rossato, Benjamin Lecouteux, Aurélie Nardy, Gilles Sérasset, Vincent Segonne, Solène Evain, Diandra Fabre, Didier Schwab

机构 * Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学,CNRS,格勒诺布尔INP,LIG) INA (Institut National de l'Audiovisuel)(国家视听研究院) Avignon Université, LIA(阿维尼翁大学,LIA) CREST (École Polytechnique, ENSAE, CNRS)(CREST(巴黎政治学院、ENSAE、CNRS)) LLF (Université Paris Cité and CNRS)(LLF(巴黎城市大学和CNRS)) Univ. Grenoble Alpes, EFELIA-MIAI, IUT2 Grenoble, LIG(格勒诺布尔阿尔卑斯大学,EFELIA-MIAI,格勒诺布尔IUT2,LIG) Univ. Grenoble Alpes, Lidilem(格勒诺布尔阿尔卑斯大学,Lidilem) Université Bretagne Sud, CNRS, IRISA(布列塔尼南部大学,CNRS,IRISA) Saclay AI(萨克莱AI) IRIT, Université de Toulouse, CNRS, Toulouse INP, UT3(IRIT,图卢兹大学,CNRS,图卢兹INP,UT3)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 Pantagruel通过在特征空间中学习上下文化的目标表示,提升法语文本和语音的多模态理解能力,在多个下游任务中表现优异,优于现有基线模型。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07077 2026-03-24 cs.SD cs.AI 57%

CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models

CALM:用于大音频-语言模型的类条件稀疏注意力向量

Videet Mehta, Liming Wang, Hilde Kuehne, Rogerio Feris, James R. Glass, M. Jehanzeb Mirza

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Tuebingen AI Center(图宾根人工智能中心) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI

AI总结 本文提出CALM,一种用于小样本分类的类条件稀疏注意力向量方法,通过学习类依赖的重要性权重提升音频和音频视觉分类性能,实验显示在多个基准上优于传统投票方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20165 2026-03-23 cs.SD eess.AS 57%

Audio Avatar Fingerprinting: An Approach for Authorized Use of Voice Cloning in the Era of Synthetic Audio

音频人像指纹:在合成音频时代授权使用语音克隆的方法

Candice R. Gerstner

机构 * Research Directorate and AI Security Center(研究部和人工智能安全中心)

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出音频人像指纹技术,用于验证合成语音是否由授权身份生成,通过扩展现有说话人验证模型并引入新数据集解决合成语音授权使用验证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19468 2026-03-23 cs.SD eess.AS 57%

Listen First, Then Answer: Timestamp-Grounded Speech Reasoning

先听再回答:基于时间戳的语音推理

Jihoon Jeong, Pooneh Mousavi, Mirco Ravanelli, Cem Subakan

机构 * Mila-Quebec AI Institute(魁北克AI研究所) Université Laval(拉瓦尔大学) Concordia University(康科迪亚大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出基于强化学习的时间戳接地策略,使语音大模型在推理时更关注音频内容,提升多模态推理的准确性。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19279 2026-03-23 cs.CL 57%

Multilingual Hate Speech Detection and Counterspeech Generation: A Comprehensive Survey and Practical Guide

多语言仇恨言论检测与反仇恨言论生成:全面综述与实用指南

Zahra Safdari Fesaghandis, Suman Kalyan Maity

机构 * Bilkent University(比尔肯特大学) Missouri University of Science and Technology(密苏里科技大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文综述并指导多语言仇恨言论检测与反仇恨言论生成,分析单语言系统在非英语和混合语言环境中的不足,提出三阶段框架,整合最新NLP进展,强调数据稀缺、公平性与多模态解决方案。

Comments 29 pages, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19350 2026-03-23 cs.CL 57%

Modeling Turn-Taking with Semantically Informed Gestures

通过语义引导的手势建模轮流交替

Varsha Suresh, M. Hamza Mughal, Christian Theobalt, Vera Demberg

机构 * Saarland University(萨尔兰大学) Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarland Informatics Campus(萨尔兰信息学校区)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文通过引入DnD Gesture++数据集,结合文本、音频和手势的混合专家框架,研究语义引导的手势在多模态轮流交替建模中的作用。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16874 2026-03-19 cs.HC cs.AI 57%

Disclosure By Design: Identity Transparency as a Behavioural Property of Conversational AI Models

设计中的披露:对话式AI模型的身份透明性作为行为属性

Anna Gausen, Sarenne Wallbridge, Hannah Rose Kirk, Jennifer Williams, Christopher Summerfield

机构 * AI Security Institute(人工智能安全研究所) University of Southampton(萨默塞特大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 研究探讨对话式AI在人类与AI交互日益模糊时如何维持身份透明性,提出通过设计实现披露,以提升系统可靠性并保护用户自主验证能力。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22272 2026-03-19 cs.CL 57%

From Slides to Chatbots: Enhancing Large Language Models with University Course Materials

从幻灯片到聊天机器人:利用大学课程材料增强大语言模型

Tu Anh Dinh, Philipp Nicolas Schumacher, Jan Niehues

机构 * Karlsruhe Institute of Technology, Germany(卡尔斯鲁厄理工学院,德国)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

AI总结 本文研究如何通过整合大学课程材料提升大语言模型在计算机科学课程中的表现,比较了RAG和CPT两种策略,并发现多模态RAG在处理包含图像和公式的幻灯片时更有效。

Comments Accepted to NSLP @ LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16280 2026-03-18 cs.SD eess.AS 57%

CAST-TTS: A Simple Cross-Attention Framework for Unified Timbre Control in TTS

CAST-TTS: 一种用于语音合成中统一音色控制的跨注意力框架

Zihao Zheng, Wen Wu, Chao Zhang, Mengyue Wu, Xuenan Xu

机构 * Shanghai AI Lab(上海人工智能实验室) MoE Key Lab of Artificial Intelligence, X-LANCE Lab, Shanghai Jiao Tong University(人工智能大规模并行计算关键实验室,X-LANCE实验室,上海交通大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 本文提出CAST-TTS框架,通过统一语音和文本提示的音色控制,采用多阶段训练策略和单个跨注意力机制实现高效合成,实验表明其性能接近专用单输入模型。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13824 2026-03-17 cs.SD cs.AI 57%

Evaluating Semantic Fragility in Text-to-Audio Generation Systems Under Controlled Prompt Perturbations

在受控提示扰动下评估文本到音频生成系统中的语义脆弱性

Jiahui Wu

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文评估文本到音频生成系统在受控提示扰动下的语义脆弱性,通过三种扰动方法测试不同模型的鲁棒性,发现大模型在语义一致性上表现更好,但音频和时间分析显示存在持续差异。

Comments 8 pages, 4 figures, Under ICCC'26 review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13262 2026-03-17 cs.SD cs.AI 57%

Evaluation of Audio Language Models for Fairness, Safety, and Security

音频语言模型的公平性、安全性和安全性评估

Ranya Aloufi, Srishti Gupta, Soumya Shaw, Battista Biggio, Lea Schönherr

机构 * Computer Science, Taibah University, Saudi Arabia(塔布大学计算机科学系,沙特阿拉伯) La Sapienza, University of Rome, Rome, Italy(罗马大学拉·萨皮恩扎分校,意大利) CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(信息安全赫尔姆霍茨研究中心,德国萨尔布吕肯) University of Cagliari, Cagliari, Italy(卡利亚里大学,意大利卡利亚里)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种结构化分类方法,评估音频语言模型在公平性、安全性和安全性方面的表现,揭示音频信息整合对语义推理的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07696 2026-03-12 eess.AS 57%

Multi-View Based Audio Visual Target Speaker Extraction

基于多视角的音频视觉目标说话人提取

Peijun Yang, Zhan Jin, Juan Liu, Ming Li

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出多视角张量融合框架,通过多视角学习提升音频视觉目标说话人提取的性能与鲁棒性。

Comments submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03542 2026-03-12 cs.CV 57%

Speech-to-LaTeX: New Models and Datasets for Converting Spoken Equations and Sentences

语音到LaTeX:用于将语音方程和句子转换为LaTeX的新模型和数据集

Dmitrii Korzh, Dmitrii Tarasov, Artyom Iudin, Elvir Karimov, Matvey Skripkin, Nikita Kuzmin, Andrey Kuznetsov, Oleg Y. Rogov, Ivan Oseledets

机构 * AXXX MTUCI(莫斯科国立大学) FusionBrain Lab(FusionBrain实验室) HSE University(俄罗斯高等经济大学) Applied AI Institute(应用人工智能研究所) Innopolis University(Innopolis大学) Moscow State University(莫斯科国立大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出首个开源大规模数据集和模型,用于将语音中的数学方程和句子转换为LaTeX,显著提升了转换精度。

Comments 22 pages, 2 figures, 16 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09627 2026-03-11 eess.AS 57%

Speech-Omni-Lite: Portable Speech Interfaces for Vision-Language Models

Speech-Omni-Lite: 用于视觉-语言模型的便携式语音接口

Dehua Tao, Xuan Luo, Daxin Tan, Kai Chen, Lanqing Hong, Jing Li, Ruifeng Xu, Xiao Chen

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 Speech-Omni-Lite通过轻量模块扩展视觉-语言模型,实现低成本语音理解和生成,同时保持原有性能,实验显示其在少量语音数据下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08312 2026-03-10 cs.CL 57%

Learning Multiple Utterance-Level Attribute Representations with a Unified Speech Encoder

学习多语句层面的属性表示:统一的语音编码器

Maryem Bouziane, Salima Mdhaffar, Yannick Estève

机构 * LIA - Avignon Université, France(阿维尼翁大学LIA中心,法国)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出统一的后训练框架,使语音基础模型能生成多种语句层面的表示,用于多语言语音检索和说话人识别。

Comments Submitted to Interspeech

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07966 2026-03-10 cs.CV 57%

Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time

用眼睛倾听:跨时空的自体视觉共指基准测试

Weijie Zhou, Xuantang Xiong, Zhenlin Hu, Xiaomeng Zhu, Chaoyang Zhao, Honghui Dong, Zhengyou Zhang, Ming Tang, Jinqiao Wang

机构 * Beijing Jiaotong University(北京交通大学) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences (CASIA)(基础模型研究中心、自动化研究所、中国科学院(CASIA)) Tencent Robotics X(腾讯机器人X) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST)(计算机科学与工程系、香港科学与技术大学(HKUST)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EcoG-Bench,通过严格测试语音-手势绑定,揭示多模态接口可能限制时间对齐线索的可观察性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21060 2026-03-10 eess.AS 57%

Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models

测量音频对正确性的影响:面向大音频语言模型的音频贡献意识后训练

Haolin He, Xingjian Du, Renhe Sun, Zheqi Dai, Yujia Xiao, Mingru Yang, Jiayi Zhou, Xiquan Li, Zhengxi Liu, Zining Liang, Chunyat Wu, Qianhua He, Tan Lee, Xie Chen, Wei-Long Zheng, Weiqiang Wang, Mark Plumbley, Jian Liu, Qiuqiang Kong

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出AudioMCQ数据集和Audio-Contribution Filtering方法,通过弱到强和混合到强的后训练范式,提升大音频语言模型的音频贡献意识和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06854 2026-03-10 cs.SD cs.AI 57%

Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering

音频-语言模型在倾听吗?音频专家头用于自适应音频引导

Neta Glazer, Lenny Aharon, Ethan Fetaya

机构 * Bar-Ilan University(巴伊兰大学) Columbia University(哥伦比亚大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文通过识别音频专家注意力头,提出一种方法来增强音频信息在音频-语言模型中的作用,从而提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06542 2026-03-09 cs.SD cs.AI 57%

RAMoEA-QA: Hierarchical Specialization for Robust Respiratory Audio Question Answering

RAMoEA-QA:面向呼吸音频问答的分层专业化

Gaia A. Bertolino, Yuwei Zhang, Tong Xia, Domenico Talia, Cecilia Mascolo

机构 * University of Cambridge(剑桥大学) Tsinghua University(清华大学) University of Calabria(卡拉布里亚大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 RAMoEA-QA通过分层专业化机制,统一处理多种呼吸音频问答任务,提升在不同领域和任务转换下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏