LiveServe: Interaction-Aware Serving for Real-Time Omni-Modal LLMs
LiveServe:面向实时全模态大语言模型的交互感知服务系统
专题命中 音频语音多模态 :omni-modal(title,abstract)
AI总结 提出交互感知服务系统LiveServe,通过感知播放进度、语音活动和打断事件,优化调度与KV缓存管理,降低音频延迟并提升吞吐量。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
LiveServe:面向实时全模态大语言模型的交互感知服务系统
专题命中 音频语音多模态 :omni-modal(title,abstract)
AI总结 提出交互感知服务系统LiveServe,通过感知播放进度、语音活动和打断事件,优化调度与KV缓存管理,降低音频延迟并提升吞吐量。
ERM-MinMaxGAP:多语言多模态语音-LLM情感识别中的性别偏见基准测试与缓解
机构 * Kyoto University, Japan(京都大学,日本) ; Agency for Science, Technology, and Research (A*STAR), Singapore(科技研究局(A*STAR),新加坡)
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 针对多语言语音大模型在情感识别中的性别偏见问题,提出基于MELD-ST的多语言多模态基准,并设计ERM-MinMaxGAP训练目标,通过自适应公平权重和MinMaxGAP正则化器,在英日德三种语言上提升性能并缩小性别差距。
Comments This paper has been accepted for presentation at INTERSPEECH 2026 and as non-archival paper at ICML 2026 Workshop on Machine Learning for Audio
基于上下文引导跨模态注意力的多视角语音表示学习用于帕金森病检测
机构 * National Technical University of Athens(雅典国家技术大学)
专题命中 音频语音多模态 :cross-modal(title,abstract)
AI总结 提出多分支深度学习框架,融合Log-Mel谱图、MFCC和HuBERT嵌入三种互补语音模态,通过上下文引导跨模态注意力机制动态加权,在PC-GITA语料库上实现91.51%准确率和95.97% AUC,验证了异质语音建模对帕金森病检测的有效性。
评估针对拆分载荷视听隐写的多模态隐写分析
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 本文研究拆分载荷视听隐写能否逃避单模态和多模态隐写分析,实验表明跨模态拆分载荷可增加检测难度,但多模态检测器的优势主要来自视频流而非真正的音视频联合信号。
基于自由空间光子极端学习机的多模态光学特征提取
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 本文提出一种统一的自由空间光子极端学习机平台,通过相位SLM编码、类傅里叶自由空间传播和相机强度检测,实现对图像、音频、表格和回归任务的多模态光学特征提取,并在多个基准上取得高精度。
多模态语义源的安全联合源信道编码
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 研究在噪声窃听信道上传输多模态语义源的安全联合源信道编码问题,建立了速率-失真-感知权衡的基本界限。
ORACAL: 一种基于因果图增强的鲁棒且可解释的智能合约漏洞检测多模态框架
机构 * Information Security Lab, University of Information Technology(信息安全部,信息科技大学) ; Vietnam National University(越南国家大学) ; School of Computer Science and Information Technology, Adelaide University(计算机科学与信息技术学院,阿德莱德大学)
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 提出ORACAL异构多模态图学习框架,集成控制流图、数据流图和调用图,通过RAG和LLM增强关键子图,并采用因果注意力机制和PGExplainer实现鲁棒且可解释的智能合约漏洞检测。
Comments 21 pages, version 2
GPT-4o mini 是否被自身的安全过滤器蒙蔽?揭示多模态到单模态瓶颈在仇恨言论检测中的作用
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 本文通过 Hateful Memes Challenge 数据集系统分析 GPT-4o mini 在多模态仇恨言论检测中的安全架构,发现并实验验证了“单模态瓶颈”缺陷,即上下文无关的安全过滤器会优先阻断多模态推理,导致误报。
Comments This paper reports preliminary findings from a small-scale study whose sample size is insufficient to support the stated conclusions. The authors are withdrawing it to conduct a more comprehensive evaluation
通过建模内模和跨模态因果注意力来解构偏见以进行多模态情感分析
机构 * School of Computer Science, South China Normal University(华南师范大学计算机学院) ; School of Electronics and Information Technology, Sun Yat-sen University(中山大学电子与信息学院)
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 本文提出了一种多关系多模态因果干预(MMCI)框架,通过因果理论的后门调整来解决多模态情感分析中因统计捷径导致的偏见问题,通过建模多模态输入为多关系图并应用注意力机制分离因果特征和捷径特征,从而提升模型在分布偏移下的稳定性。
Comments Corrected several hyperparameter settings. Updated some experimental results
DFLOP: 一种基于数据的多模态大语言模型训练流水线优化框架
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 本文提出DFLOP框架,通过数据驱动的方法优化多模态大语言模型的训练流水线,提升GPU利用率和训练效率,实验证明其比现有框架快3.6倍。
Comments Accepted to Proceedings of the ACM on Management of Data (SIGMOD 2026)
Journal ref Proc. ACM Manag. Data 4, 3, Article 160 (June 2026), 29 pages
FAM-HRI: 基于基础模型的多模态人机交互框架,结合目光和语音
机构 * University of Tuebingen(图宾根大学) ; Nanyang Technological University(南洋理工大学) ; Mercedes-Benz(梅赛德斯-奔驰)
专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract)
AI总结 本文提出FAM-HRI,一种结合目光和语音的多模态人机交互框架,利用基础模型融合语言和目光输入,以提高任务执行的成功率和交互效率,为肢体障碍者提供实用解决方案。
Comments This work has been accepted for publication in IEEE Transactions on Automation Science and Engineering @ 2026 IEEE
MindMirror: 一种面向数字工作者的本地优先多模态状态感知支持系统
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 MindMirror通过整合面部表情、文本输入和语音交互等多模态数据,为数字工作者提供本地优先的状态感知支持,通过本地大语言模型生成响应,提升工作效率与状态监控能力。
Comments 10 pages, 4 figures, 12 tables. Technical report
我很好,但我的声音不是:面向反思日记的跨模态情感不一致检测
专题命中 音频语音多模态 :cross-modal(title,abstract)
AI总结 本文提出跨模态情感不一致检测(CADD),通过区分掩蔽、应对和一致三种状态,解决数字日记中情感与语音不匹配的问题,并提出CADD-Journal数据集、DACM模型及领域差距量化方法。
对话移动代码本是否能推广到一对一辅导和多模态交互?
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 研究探讨TalkMoves代码本在一对一辅导中的一致性、实用性及可解释性,对比AI-人类混合代码本,发现前者在可靠性上更优,但后者在多模态覆盖和可用性上更胜一筹。
描述符注入的跨模态学习:通过频谱和旋律特征系统探索音频- MIDI对齐
机构 * Asociación Civil AlterMundi(AlterMundi民间协会)
专题命中 音频语音多模态 :cross-modal(title,abstract)
AI总结 本文研究了通过频谱和旋律特征提升音频与MIDI之间跨模态检索性能的方法,通过描述符注入技术提高了模型表现,揭示了音频与MIDI特征对齐的机制。
Comments 26 pages, 11 figures, 20 tables. Companion paper to "Harmonic Information Theory: Foundations" (2026). Code: https://github.com/AlterMundi/Phideus
学习关注抑郁症相关模式:一种自适应跨模态门控网络用于抑郁症检测
机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Key Laboratory of Biomedical Imaging Science and System, Chinese Academy of Sciences(中国科学院生物医学成像科学与系统重点实验室)
专题命中 音频语音多模态 :cross-modal(title,abstract)
AI总结 本文提出自适应跨模态门控网络,通过动态分配帧权重来关注抑郁症相关段落,提升语音信号中抑郁症检测的准确性。
一种结合注意力机制的多模态数据融合模型用于实时估计水下声速
机构 * Faculty of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学部) ; School of Environmental Science and Engineering, Ocean University of China(中国海洋大学环境科学与工程学院)
专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract)
AI总结 本文提出一种结合注意力机制的多模态数据融合卷积神经网络,用于实时估计水下声速剖面,通过提取远程感应海面温度数据与历史声速剖面特征之间的关系,提升估计精度和鲁棒性。
Journal ref IEEE Transactions on Neural Networks and Learning Systems,2026
超越元数据:多模态、政策感知的YouTube诈骗视频检测
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 本文提出多模态、政策感知的YouTube诈骗视频检测方法,通过结合文本、音频和视频信息,提升检测性能和鲁棒性,同时提供可解释的政策依据。
Comments Accepted at AAAI ICWSM 2026
通过多目标优化平衡多模态传感器学习
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) ; IBM Research(IBM研究院) ; Cornell University(康奈尔大学)
专题命中 音频语音多模态 :multi-modal(title,abstract)
AI总结 本文提出MIMO方法,通过多目标优化平衡多模态传感器学习,提升系统可靠性并减少计算开销。
ViDscribe:多模态AI用于定制在线视频的音频描述和问答
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 ViDscribe通过整合AI生成的音频描述和六种用户自定义选项,提升视障和低视力用户在YouTube视频中的交互体验,研究显示定制化描述提高了效果和沉浸感。
Comments CHI EA 2026
二维和三维弯曲管道中的多模非线性声学
专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract)
AI总结 本文提出了一种用于二维和三维弯曲管道中弱非线性声学的模型,通过多模方法和张量卷积提高了数值效率,并展示了多种声学特性及应用潜力。
Comments 55 pages, 17 figures, supplementary material available from https://ejbrambley.warwick.ac.uk/publications.html
Journal ref J. Fluid Mech. 1030 (2026) A19
OmniZip: 一种用于多模态数据的统一且轻量级无损压缩器
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ant Group(蚂蚁集团)
专题命中 音频语音多模态 :multi-modal(title,abstract)
AI总结 OmniZip是一种用于多模态数据的统一且轻量级无损压缩器,通过三种关键组件实现高效压缩,并在多个数据集上实现了更高的压缩效率。
Comments 8 figures, 10 tables
为无障碍异步舞蹈教学设计多模态系统
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 本文通过协同设计研讨会,探讨了如何通过多模态系统为盲人和低视力学习者提供无障碍异步舞蹈教学。
Comments Accepted to CHI 2026
内容与布局共进化:通过多模态交互的TangibleSite用于辅助视障人士网页设计
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 TangibleSite通过多模态交互帮助视障人士共同进化内容与布局,实现独立网页设计。
PISHYAR:一种具有社会智能的智能拐杖,用于室内社交导航和多模态人机交互,以支持视障人士
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 PISHYAR是一款结合社会智能导航与多模态交互的智能拐杖,通过多模态技术提升视障人士的移动辅助与社交互动能力。
Reality Copilot:基于大多模态模型的混合现实中的语音优先人机协作
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 Reality Copilot通过大模型实现混合现实中的语音优先人机协作,支持环境理解、3D生成和实时检索。
通过多模态数据采集减少偶然性和epistemic不确定性
机构 * Université de Lorraine, CentraleSupélec CNRS, LORIA, Metz, France(洛林大学、中央超导电子学学院 CNRS、LORIA、法国梅茨) ; Université de technologie de Compiègne UMR CNRS 7253 Heudiasyc, France(图卢兹理工学院 UMR CNRS 7253 Heudiasyc、法国) ; CNRS, Université de technologie de Compiègne UMR CNRS 7253 Heudiasyc, France(CNRS、图卢兹理工学院 UMR CNRS 7253 Heudiasyc、法国) ; University of Ghent Ghent, Belgium(根特大学、比利时根特)
专题命中 音频语音多模态 :multi-modal(title,abstract)
AI总结 本文提出一种多模态数据采集框架,通过增加模态数量和收集更多观测来减少偶然性和epistemic不确定性。
Scene2Hap: 从场景上下文生成VR场景中的全域触觉反馈
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 Scene2Hap通过多模态大语言模型生成VR场景中的触觉反馈,提升沉浸感与真实感。
Comments Accepted at CHI 2026
FOCA:基于双模态的恶意软件分类方法
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 FOCA通过双曲空间中的交叉注意力机制和双曲投影模块,实现音频和视觉模态的恶意软件分类,展现出优越的分类性能。
Comments Accepted to the International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026
用于呼吸声分析和多模态诊断的Transformer架构
机构 * Ben Gurion University of the Negev(本· Gurion 农业大学)
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 本文提出基于Transformer的AST和VLM模型,用于呼吸声分析和多模态诊断,AST在哮喘检测中达到97%准确率,VLM整合临床信息提升诊断能力。
Comments 7 pages, 4 figures