arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4597 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4597 篇

2603.22728 2026-03-25 cs.SD eess.AS 57%

The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models

2026年国际语音处理大会大型音频语言模型音频编码能力挑战

Heinrich Dinkel, Jiahao Zhou, Guanbo Wang, Yadong Niu, Junbo Zhang, Yufeng Hao, Ying Liu, Ke Li, Wenwu Wang, Zhiyong Wu, Jian Luan

机构 * MiLM Plus, Xiaomi Inc., Beijing, China(小米公司,北京) DataoceanAI Inc., USA(DataoceanAI公司,美国) Centre for Vision Speech and Signal Processing, University of Surrey, Guildford, UK(视觉语音与信号处理中心, Surrey大学, Guildford,英国) Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(深圳国际研究生院,清华大学,深圳,中国)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出Interspeech 2026音频编码能力挑战,旨在评估和提升预训练音频编码器在大型音频语言模型中的性能,通过统一的生成评估框架XARES-LLM,评估编码器在多种下游任务中的表现。

Comments Interspeech 2026 Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21571 2026-03-24 cs.CL 57%

DATASHI: A Parallel English-Tashlhiyt Corpus for Orthography Normalization and Low-Resource Language Processing

DATASHI:一个平行的英语-塔希利耶特语语料库用于正字法规范化和低资源语言处理

Nasser-Eddine Monir, Zakaria Baou

机构 * Université de Lorraine, CNRS, Inria, LORIA(洛林大学、法国国家科学研究中心、法国国家信息与自动化技术研究院、LORIA实验室) ISIMA, Université Clermont Auvergne(克莱蒙特奥弗涅大学ISIMA)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 DATASHI提供了一个包含5000对句子的平行语料库,包含1500个经过专家标准化和非标准用户生成的句子,用于研究正字法多样性及规范化,支持NLP任务并为多模态对齐提供基础。

Comments This paper has been accepted for presentation at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21233 2026-03-24 cs.LG cs.AI 57%

AngelSlim: A more accessible, comprehensive, and efficient toolkit for large model compression

AngelSlim:一个更易用、更全面且更高效的大型模型压缩工具包

Rui Cen, QiangQiang Hu, Hong Huang, Hong Liu, Song Liu, Xin Luo, Lin Niu, Yifan Tan, Decheng Wu, Linchuan Xie, Rubing Yang, Guanghua Yu, Jianchen Zhu

机构 * Hunyuan AI Infra Team(文心一言AI基础设施团队)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 AngelSlim 提供统一流程,整合量化、推测解码等算法,实现从模型压缩到工业部署的高效加速,同时提出训练对齐的推测解码框架和训练无关的稀疏注意力框架,提升吞吐量并优化多模态模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05911 2026-03-24 cs.CL 57%

Pantagruel: Unified Self-Supervised Encoders for French Text and Speech

Pantagruel:面向法语文本和语音的统一自监督编码器

Phuong-Hang Le, Valentin Pelloin, Arnault Chatelain, Maryem Bouziane, Mohammed Ghennai, Qianwen Guan, Kirill Milintsevich, Salima Mdhaffar, Aidan Mannion, Nils Defauw, Shuyue Gu, Alexandre Audibert, Marco Dinarelli, Yannick Estève, Lorraine Goeuriot, Steffen Lalande, Nicolas Hervé, Maximin Coavoux, François Portet, Étienne Ollion, Marie Candito, Maxime Peyrard, Solange Rossato, Benjamin Lecouteux, Aurélie Nardy, Gilles Sérasset, Vincent Segonne, Solène Evain, Diandra Fabre, Didier Schwab

机构 * Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学,CNRS,格勒诺布尔INP,LIG) INA (Institut National de l'Audiovisuel)(国家视听研究院) Avignon Université, LIA(阿维尼翁大学,LIA) CREST (École Polytechnique, ENSAE, CNRS)(CREST(巴黎政治学院、ENSAE、CNRS)) LLF (Université Paris Cité and CNRS)(LLF(巴黎城市大学和CNRS)) Univ. Grenoble Alpes, EFELIA-MIAI, IUT2 Grenoble, LIG(格勒诺布尔阿尔卑斯大学,EFELIA-MIAI,格勒诺布尔IUT2,LIG) Univ. Grenoble Alpes, Lidilem(格勒诺布尔阿尔卑斯大学,Lidilem) Université Bretagne Sud, CNRS, IRISA(布列塔尼南部大学,CNRS,IRISA) Saclay AI(萨克莱AI) IRIT, Université de Toulouse, CNRS, Toulouse INP, UT3(IRIT,图卢兹大学,CNRS,图卢兹INP,UT3)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 Pantagruel通过在特征空间中学习上下文化的目标表示,提升法语文本和语音的多模态理解能力,在多个下游任务中表现优异,优于现有基线模型。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07077 2026-03-24 cs.SD cs.AI 57%

CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models

CALM:用于大音频-语言模型的类条件稀疏注意力向量

Videet Mehta, Liming Wang, Hilde Kuehne, Rogerio Feris, James R. Glass, M. Jehanzeb Mirza

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Tuebingen AI Center(图宾根人工智能中心) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.AI

AI总结 本文提出CALM,一种用于小样本分类的类条件稀疏注意力向量方法,通过学习类依赖的重要性权重提升音频和音频视觉分类性能,实验显示在多个基准上优于传统投票方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20165 2026-03-23 cs.SD eess.AS 57%

Audio Avatar Fingerprinting: An Approach for Authorized Use of Voice Cloning in the Era of Synthetic Audio

音频人像指纹:在合成音频时代授权使用语音克隆的方法

Candice R. Gerstner

机构 * Research Directorate and AI Security Center(研究部和人工智能安全中心)

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出音频人像指纹技术,用于验证合成语音是否由授权身份生成,通过扩展现有说话人验证模型并引入新数据集解决合成语音授权使用验证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19468 2026-03-23 cs.SD eess.AS 57%

Listen First, Then Answer: Timestamp-Grounded Speech Reasoning

先听再回答:基于时间戳的语音推理

Jihoon Jeong, Pooneh Mousavi, Mirco Ravanelli, Cem Subakan

机构 * Mila-Quebec AI Institute(魁北克AI研究所) Université Laval(拉瓦尔大学) Concordia University(康科迪亚大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出基于强化学习的时间戳接地策略,使语音大模型在推理时更关注音频内容,提升多模态推理的准确性。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19279 2026-03-23 cs.CL 57%

Multilingual Hate Speech Detection and Counterspeech Generation: A Comprehensive Survey and Practical Guide

多语言仇恨言论检测与反仇恨言论生成:全面综述与实用指南

Zahra Safdari Fesaghandis, Suman Kalyan Maity

机构 * Bilkent University(比尔肯特大学) Missouri University of Science and Technology(密苏里科技大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文综述并指导多语言仇恨言论检测与反仇恨言论生成,分析单语言系统在非英语和混合语言环境中的不足,提出三阶段框架,整合最新NLP进展,强调数据稀缺、公平性与多模态解决方案。

Comments 29 pages, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19350 2026-03-23 cs.CL 57%

Modeling Turn-Taking with Semantically Informed Gestures

通过语义引导的手势建模轮流交替

Varsha Suresh, M. Hamza Mughal, Christian Theobalt, Vera Demberg

机构 * Saarland University(萨尔兰大学) Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarland Informatics Campus(萨尔兰信息学校区)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文通过引入DnD Gesture++数据集,结合文本、音频和手势的混合专家框架,研究语义引导的手势在多模态轮流交替建模中的作用。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16874 2026-03-19 cs.HC cs.AI 57%

Disclosure By Design: Identity Transparency as a Behavioural Property of Conversational AI Models

设计中的披露:对话式AI模型的身份透明性作为行为属性

Anna Gausen, Sarenne Wallbridge, Hannah Rose Kirk, Jennifer Williams, Christopher Summerfield

机构 * AI Security Institute(人工智能安全研究所) University of Southampton(萨默塞特大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 研究探讨对话式AI在人类与AI交互日益模糊时如何维持身份透明性,提出通过设计实现披露,以提升系统可靠性并保护用户自主验证能力。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22272 2026-03-19 cs.CL 57%

From Slides to Chatbots: Enhancing Large Language Models with University Course Materials

从幻灯片到聊天机器人:利用大学课程材料增强大语言模型

Tu Anh Dinh, Philipp Nicolas Schumacher, Jan Niehues

机构 * Karlsruhe Institute of Technology, Germany(卡尔斯鲁厄理工学院,德国)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

AI总结 本文研究如何通过整合大学课程材料提升大语言模型在计算机科学课程中的表现,比较了RAG和CPT两种策略,并发现多模态RAG在处理包含图像和公式的幻灯片时更有效。

Comments Accepted to NSLP @ LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16280 2026-03-18 cs.SD eess.AS 57%

CAST-TTS: A Simple Cross-Attention Framework for Unified Timbre Control in TTS

CAST-TTS: 一种用于语音合成中统一音色控制的跨注意力框架

Zihao Zheng, Wen Wu, Chao Zhang, Mengyue Wu, Xuenan Xu

机构 * Shanghai AI Lab(上海人工智能实验室) MoE Key Lab of Artificial Intelligence, X-LANCE Lab, Shanghai Jiao Tong University(人工智能大规模并行计算关键实验室,X-LANCE实验室,上海交通大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 本文提出CAST-TTS框架,通过统一语音和文本提示的音色控制,采用多阶段训练策略和单个跨注意力机制实现高效合成,实验表明其性能接近专用单输入模型。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13824 2026-03-17 cs.SD cs.AI 57%

Evaluating Semantic Fragility in Text-to-Audio Generation Systems Under Controlled Prompt Perturbations

在受控提示扰动下评估文本到音频生成系统中的语义脆弱性

Jiahui Wu

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文评估文本到音频生成系统在受控提示扰动下的语义脆弱性,通过三种扰动方法测试不同模型的鲁棒性,发现大模型在语义一致性上表现更好,但音频和时间分析显示存在持续差异。

Comments 8 pages, 4 figures, Under ICCC'26 review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13262 2026-03-17 cs.SD cs.AI 57%

Evaluation of Audio Language Models for Fairness, Safety, and Security

音频语言模型的公平性、安全性和安全性评估

Ranya Aloufi, Srishti Gupta, Soumya Shaw, Battista Biggio, Lea Schönherr

机构 * Computer Science, Taibah University, Saudi Arabia(塔布大学计算机科学系,沙特阿拉伯) La Sapienza, University of Rome, Rome, Italy(罗马大学拉·萨皮恩扎分校,意大利) CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(信息安全赫尔姆霍茨研究中心,德国萨尔布吕肯) University of Cagliari, Cagliari, Italy(卡利亚里大学,意大利卡利亚里)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种结构化分类方法,评估音频语言模型在公平性、安全性和安全性方面的表现,揭示音频信息整合对语义推理的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07696 2026-03-12 eess.AS 57%

Multi-View Based Audio Visual Target Speaker Extraction

基于多视角的音频视觉目标说话人提取

Peijun Yang, Zhan Jin, Juan Liu, Ming Li

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出多视角张量融合框架,通过多视角学习提升音频视觉目标说话人提取的性能与鲁棒性。

Comments submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03542 2026-03-12 cs.CV 57%

Speech-to-LaTeX: New Models and Datasets for Converting Spoken Equations and Sentences

语音到LaTeX:用于将语音方程和句子转换为LaTeX的新模型和数据集

Dmitrii Korzh, Dmitrii Tarasov, Artyom Iudin, Elvir Karimov, Matvey Skripkin, Nikita Kuzmin, Andrey Kuznetsov, Oleg Y. Rogov, Ivan Oseledets

机构 * AXXX MTUCI(莫斯科国立大学) FusionBrain Lab(FusionBrain实验室) HSE University(俄罗斯高等经济大学) Applied AI Institute(应用人工智能研究所) Innopolis University(Innopolis大学) Moscow State University(莫斯科国立大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出首个开源大规模数据集和模型,用于将语音中的数学方程和句子转换为LaTeX,显著提升了转换精度。

Comments 22 pages, 2 figures, 16 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09627 2026-03-11 eess.AS 57%

Speech-Omni-Lite: Portable Speech Interfaces for Vision-Language Models

Speech-Omni-Lite: 用于视觉-语言模型的便携式语音接口

Dehua Tao, Xuan Luo, Daxin Tan, Kai Chen, Lanqing Hong, Jing Li, Ruifeng Xu, Xiao Chen

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 Speech-Omni-Lite通过轻量模块扩展视觉-语言模型,实现低成本语音理解和生成,同时保持原有性能,实验显示其在少量语音数据下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08312 2026-03-10 cs.CL 57%

Learning Multiple Utterance-Level Attribute Representations with a Unified Speech Encoder

学习多语句层面的属性表示:统一的语音编码器

Maryem Bouziane, Salima Mdhaffar, Yannick Estève

机构 * LIA - Avignon Université, France(阿维尼翁大学LIA中心,法国)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出统一的后训练框架,使语音基础模型能生成多种语句层面的表示,用于多语言语音检索和说话人识别。

Comments Submitted to Interspeech

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07966 2026-03-10 cs.CV 57%

Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time

用眼睛倾听:跨时空的自体视觉共指基准测试

Weijie Zhou, Xuantang Xiong, Zhenlin Hu, Xiaomeng Zhu, Chaoyang Zhao, Honghui Dong, Zhengyou Zhang, Ming Tang, Jinqiao Wang

机构 * Beijing Jiaotong University(北京交通大学) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences (CASIA)(基础模型研究中心、自动化研究所、中国科学院(CASIA)) Tencent Robotics X(腾讯机器人X) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST)(计算机科学与工程系、香港科学与技术大学(HKUST)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EcoG-Bench,通过严格测试语音-手势绑定,揭示多模态接口可能限制时间对齐线索的可观察性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21060 2026-03-10 eess.AS 57%

Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models

测量音频对正确性的影响:面向大音频语言模型的音频贡献意识后训练

Haolin He, Xingjian Du, Renhe Sun, Zheqi Dai, Yujia Xiao, Mingru Yang, Jiayi Zhou, Xiquan Li, Zhengxi Liu, Zining Liang, Chunyat Wu, Qianhua He, Tan Lee, Xie Chen, Wei-Long Zheng, Weiqiang Wang, Mark Plumbley, Jian Liu, Qiuqiang Kong

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出AudioMCQ数据集和Audio-Contribution Filtering方法,通过弱到强和混合到强的后训练范式,提升大音频语言模型的音频贡献意识和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06854 2026-03-10 cs.SD cs.AI 57%

Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering

音频-语言模型在倾听吗?音频专家头用于自适应音频引导

Neta Glazer, Lenny Aharon, Ethan Fetaya

机构 * Bar-Ilan University(巴伊兰大学) Columbia University(哥伦比亚大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文通过识别音频专家注意力头,提出一种方法来增强音频信息在音频-语言模型中的作用,从而提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06542 2026-03-09 cs.SD cs.AI 57%

RAMoEA-QA: Hierarchical Specialization for Robust Respiratory Audio Question Answering

RAMoEA-QA:面向呼吸音频问答的分层专业化

Gaia A. Bertolino, Yuwei Zhang, Tong Xia, Domenico Talia, Cecilia Mascolo

机构 * University of Cambridge(剑桥大学) Tsinghua University(清华大学) University of Calabria(卡拉布里亚大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 RAMoEA-QA通过分层专业化机制,统一处理多种呼吸音频问答任务,提升在不同领域和任务转换下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06373 2026-03-09 eess.AS 57%

Doctor or Patient? Synergizing Diarization and ASR for Code-Switched Hinglish Medical Conditions Extraction

医生还是病人?协同语音识别与说话人识别用于代码混合希金斯医疗条件提取

Séverin Baroudi, Yanis Labrak, Shashi Kumar, Joonas Kalda, Sergio Burdisso, Pawel Cyrta, Juan Ignacio Alvarez-Trejos, Petr Motlicek, Hervé Bredin, Ricard Marxer

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出了一种端到端神经说话人识别与向量聚类方法,用于代码混合希金斯医疗条件提取,通过领域特定微调和错误校正,实现了较高的转录准确率,并在DISPLACE-M挑战中取得优异成绩。

Comments Submitted for review at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05272 2026-03-09 cs.CL cs.HC 57%

Oral to Web: Digitizing 'Zero Resource'Languages of Bangladesh

口到网:数字化孟加拉国的‘零资源’语言

Mohammad Mamun Or Rashid

机构 * Bangladesh Computer Council(孟加拉国计算机委员会) Jahangirnagar University(贾hangirnagar大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文介绍了多语言云语料库,旨在为孟加拉国的濒危语言提供数字化资源,涵盖42种语言,通过系统田野工作和多模态数据收集,支持低资源NLP和语言保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23649 2026-03-02 cs.SD cs.AI 57%

AudioCapBench: Quick Evaluation on Audio Captioning across Sound, Music, and Speech

AudioCapBench: 音频描述能力的快速评估:涵盖声音、音乐和语音

Jielin Qiu, Jianguo Zhang, Zixiang Chen, Liangwei Yang, Ming Zhu, Juntao Tan, Haolin Chen, Wenting Zhao, Rithesh Murthy, Roshan Ram, Akshara Prabhakar, Shelby Heinecke, Caiming, Xiong, Silvio Savarese, Huan Wang

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 AudioCapBench通过对比不同模型在环境声音、音乐和语音描述任务中的表现,评估了大模型的音频描述能力,揭示Gemini模型在整体质量上优于OpenAI模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23836 2026-03-02 cs.CV 57%

Stereo-Talker: Audio-driven 3D Human Synthesis with Prior-Guided Mixture-of-Experts

立体说话者:基于优先级的混合专家引导的音频驱动3D人类合成

Xiang Deng, Youxin Pang, Xiaochen Zhao, Chao Xu, Lizhen Wang, Hongjiang Xiao, Shi Yan, Hongwen Zhang, Yebin Liu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Bytedance Inc.(字节跳动公司) State Key Laboratory of Media Convergence and Communication, Communication University of China(媒体融合与传播国家重点实验室,中国传媒大学) School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 Stereo-Talker通过优先级引导的混合专家机制实现音频驱动的3D人类合成,生成具有精确唇同步和逼真质量的视频。

Journal ref TPAMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23266 2026-02-27 cs.CL 57%

Discourse-Aware Dual-Track Streaming Response for Low-Latency Spoken Dialogue Systems

面向 discourse 的双轨流式响应用于低延迟语音对话系统

Siyuan Liu, Jiahui Xu, Feng Jiang, Kuang Wang, Zefeng Zhao, Chu-Ren Huang, Jinghang Gu, Changqing Yin, Haizhou Li

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Department of Language Science and Technology, Hong Kong Polytechnic University(香港理工大学语言科学与技术系) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院) School of Data Science, Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) School of Artificial Intelligence, Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 DDTSR 提出了一种低延迟语音对话系统框架,通过双轨流式响应机制实现听中思考和说中思考,显著降低响应延迟并保持 discourse 质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20708 2026-02-25 cs.AI cs.CR 57%

ICON: Indirect Prompt Injection Defense for Agents based on Inference-Time Correction

ICON:基于推理时校正的代理间接提示注入防御

Che Wang, Fuyao Zhang, Jiaming Zhang, Ziqi Zhang, Yinghui Wang, Longtao Huang, Jianbo Gao, Zhong Chen, Wei Yang Bryan Lim

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) Alibaba(阿里巴巴) School of Computer Science, Peking University, China(计算机科学学院,北京大学,中国)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 ICON通过潜在空间轨迹探测和修正器实现对代理间接提示注入攻击的防御,有效提升任务连续性和安全性,同时保持高检测率和任务效用。

Comments 11 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20219 2026-02-25 cs.RO cs.AI 57%

An Approach to Combining Video and Speech with Large Language Models in Human-Robot Interaction

一种结合视频和语音的大型语言模型在人机交互中的应用方法

Guanting Shen, Zi Tian

机构 * Dalian University of Technology(大连理工大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出结合视觉-语言模型、语音处理和模糊逻辑的多模态人机交互框架,通过语音指令实现机械臂的精准操控,实验显示命令执行准确率达75%,为未来人机协作提供灵活的基础。

Comments Preprint currently under revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16334 2026-02-19 cs.SD cs.AI 57%

Spatial Audio Question Answering and Reasoning on Dynamic Source Movements

空间音频问答与动态声源运动推理

Arvind Krishna Sridhar, Yinyi Guo, Erik Visser

机构 * Qualcomm Technologies Inc.(高通技术公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种空间音频问答方法,通过运动推理和多模态微调提升动态声源识别与理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏