arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46352 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4587 篇

2603.06121 2026-07-07 cs.RO 版本更新 78%

Glance-Say: Multimodal Human-Robot Collaboration and Intent Recognition via Sticky Glance

Glance-Say:通过粘性注视实现多模态人机协作与意图识别

Yuzhi Lai, Shenghai Yuan, Peizheng Li, Benjamin Kiefer, Andreas Zell

机构 * University of Tuebingen(图宾根大学) Nanyang Technological University(南洋理工大学) Mercedes-Benz(梅赛德斯-奔驰)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 针对运动障碍者,本文提出多模态交互框架,用粘性注视算法稳定基于注视的意图,引入注视-语音交互范式及共享控制方案,实验表明其在目标跟踪、选择精度及任务时长上效果更佳。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11606 2026-07-03 cs.SD cs.LG eess.SP 版本更新 78%

Scaling to Multimodal and Multichannel Heart Sound Classification with Synthetic and Augmented Biosignals

利用合成与增强生物信号实现多模态和多通道心音分类的规模化

Milan Marocchi, Matthew Fynn, Kayapanda Mandana, Yue Rong

机构 * School of Electrical Engineering, Computing, and Mathematical Sciences (EECMS), Faculty of Science and Engineering, Curtin University, Bentley, WA 6102, Australia(电气工程、计算与数学科学学院(EECMS),科学与工程学院, Curtin 大学,Bentley,WA 6102,澳大利亚)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 针对心音分类中同步和多通道数据集有限的问题,提出结合传统信号处理与去噪扩散模型生成增强数据,微调Wav2Vec 2.0分类器,在多个数据集上取得最优性能。

Comments 35 pages, 37 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19127 2026-07-01 cs.LG 版本更新 78%

On Optimizing Multimodal Jailbreaks for Spoken Language Models

关于优化口语语言模型的多模态越狱攻击

Aravind Krishnan, Karolina Stańczak, Dietrich Klakow

机构 * Saarland University(萨尔大学) DFKI GmbH(德国人工智能研究中心) ETH AI Center(ETH人工智能中心)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 提出联合音频文本多模态攻击框架JAMA,通过梯度优化同时扰动语音和文本模态,在四个SLM上实现1.5至20倍于单模态的越狱成功率,并分析其运行机制。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22983 2026-06-23 cs.DC 新提交 78%

LiveServe: Interaction-Aware Serving for Real-Time Omni-Modal LLMs

LiveServe:面向实时全模态大语言模型的交互感知服务系统

Xiangyu Zhi, Peiqi Yin, Sheng Guan, Chenguang Zheng, James Cheng, Xiao Yan

专题命中 音频语音多模态 :omni-modal(title,abstract)

AI总结 提出交互感知服务系统LiveServe,通过感知播放进度、语音活动和打断事件,优化调度与KV缓存管理,降低音频延迟并提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21050 2026-06-23 cs.SD 版本更新 78%

ERM-MinMaxGAP: Benchmarking and Mitigating Gender Bias in Multilingual Multimodal Speech-LLM Emotion Recognition

ERM-MinMaxGAP:多语言多模态语音-LLM情感识别中的性别偏见基准测试与缓解

Zi Haur Pang, Xiaoxue Gao, Tatsuya Kawahara, Nancy F. Chen

机构 * Kyoto University, Japan(京都大学,日本) Agency for Science, Technology, and Research (A*STAR), Singapore(科技研究局(A*STAR),新加坡)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 针对多语言语音大模型在情感识别中的性别偏见问题,提出基于MELD-ST的多语言多模态基准,并设计ERM-MinMaxGAP训练目标,通过自适应公平权重和MinMaxGAP正则化器,在英日德三种语言上提升性能并缩小性别差距。

Comments This paper has been accepted for presentation at INTERSPEECH 2026 and as non-archival paper at ICML 2026 Workshop on Machine Learning for Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09271 2026-06-09 cs.SD cs.LG 新提交 78%

Multi-View Speech Representation Learning for Parkinson's Disease Detection Using Context-guided Cross-modal Attention

基于上下文引导跨模态注意力的多视角语音表示学习用于帕金森病检测

George Theodosiou, Loukas Ilias, Dimitris Askounis

机构 * National Technical University of Athens(雅典国家技术大学)

专题命中 音频语音多模态 :cross-modal(title,abstract)

AI总结 提出多分支深度学习框架,融合Log-Mel谱图、MFCC和HuBERT嵌入三种互补语音模态,通过上下文引导跨模态注意力机制动态加权,在PC-GITA语料库上实现91.51%准确率和95.97% AUC,验证了异质语音建模对帕金森病检测的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08726 2026-06-09 cs.CR 新提交 78%

Evaluating Multimodal Steganalysis for Split-Payload Audiovisual Steganography

评估针对拆分载荷视听隐写的多模态隐写分析

Prateek Paudel, Nitin Jha, Abhishek Parakh

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文研究拆分载荷视听隐写能否逃避单模态和多模态隐写分析,实验表明跨模态拆分载荷可增加检测难度,但多模态检测器的优势主要来自视频流而非真正的音视频联合信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29043 2026-05-29 physics.optics 78%

Multimodal Optical Feature Extraction with a Free-Space Photonic Extreme Learning Machine

基于自由空间光子极端学习机的多模态光学特征提取

Anushka Kumari, Anushree Khisti, Abhinav Choube, Devansh Satra, Srivatsa Murali, Anshuman Kumar

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文提出一种统一的自由空间光子极端学习机平台,通过相位SLM编码、类傅里叶自由空间传播和相机强度检测,实现对图像、音频、表格和回归任务的多模态光学特征提取,并在多个基准上取得高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14334 2026-05-26 cs.IT math.IT 78%

Secure Joint Source-Channel Coding of Multimodal Semantic Sources

多模态语义源的安全联合源信道编码

Denis Kozlov, Mahtab Mirmohseni, Rahim Tafazolli

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 研究在噪声窃听信道上传输多模态语义源的安全联合源信道编码问题,建立了速率-失真-感知权衡的基本界限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28128 2026-05-26 cs.LG cs.CR 78%

ORACAL: A Robust and Explainable Multimodal Framework for Smart Contract Vulnerability Detection with Causal Graph Enrichment

ORACAL: 一种基于因果图增强的鲁棒且可解释的智能合约漏洞检测多模态框架

Tran Duong Minh Dai, Triet Huynh Minh Le, M. Ali Babar, Van-Hau Pham, Phan The Duy

机构 * Information Security Lab, University of Information Technology(信息安全部,信息科技大学) Vietnam National University(越南国家大学) School of Computer Science and Information Technology, Adelaide University(计算机科学与信息技术学院,阿德莱德大学)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 提出ORACAL异构多模态图学习框架,集成控制流图、数据流图和调用图,通过RAG和LLM增强关键子图,并采用因果注意力机制和PGExplainer实现鲁棒且可解释的智能合约漏洞检测。

Comments 21 pages, version 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13608 2026-05-26 cs.LG 78%

Is GPT-4o mini Blinded by its Own Safety Filters? Exposing the Multimodal-to-Unimodal Bottleneck in Hate Speech Detection

GPT-4o mini 是否被自身的安全过滤器蒙蔽?揭示多模态到单模态瓶颈在仇恨言论检测中的作用

Niruthiha Selvanayagam, Ted Kurti

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文通过 Hateful Memes Challenge 数据集系统分析 GPT-4o mini 在多模态仇恨言论检测中的安全架构,发现并实验验证了“单模态瓶颈”缺陷,即上下文无关的安全过滤器会优先阻断多模态推理,导致误报。

Comments This paper reports preliminary findings from a small-scale study whose sample size is insufficient to support the stated conclusions. The authors are withdrawing it to conduct a more comprehensive evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04999 2026-05-21 cs.LG 78%

Disentangling Bias by Modeling Intra- and Inter-modal Causal Attention for Multimodal Sentiment Analysis

通过建模内模和跨模态因果注意力来解构偏见以进行多模态情感分析

Menghua Jiang, Yuxia Lin, Baoliang Chen, Haifeng Hu, Yuncheng Jiang, Sijie Mai

机构 * School of Computer Science, South China Normal University(华南师范大学计算机学院) School of Electronics and Information Technology, Sun Yat-sen University(中山大学电子与信息学院)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文提出了一种多关系多模态因果干预(MMCI)框架,通过因果理论的后门调整来解决多模态情感分析中因统计捷径导致的偏见问题,通过建模多模态输入为多关系图并应用注意力机制分离因果特征和捷径特征,从而提升模型在分布偏移下的稳定性。

Comments Corrected several hyperparameter settings. Updated some experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25120 2026-05-20 cs.DC 78%

DFLOP: A Data-driven Framework for Multimodal LLM Training Pipeline Optimization

DFLOP: 一种基于数据的多模态大语言模型训练流水线优化框架

Hyeonjun An, Sihyun Kim, Chaerim Lim, Hyunjoon Kim, Rathijit Sen, Sangmin Jung, Hyeonsoo Lee, Dongwook Kim, Takki Yu, Jinkyu Jeong, Youngsok Kim, Kwanghyun Park

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文提出DFLOP框架,通过数据驱动的方法优化多模态大语言模型的训练流水线,提升GPU利用率和训练效率,实验证明其比现有框架快3.6倍。

Comments Accepted to Proceedings of the ACM on Management of Data (SIGMOD 2026)

Journal ref Proc. ACM Manag. Data 4, 3, Article 160 (June 2026), 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16492 2026-05-19 cs.HC cs.RO 78%

FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech

FAM-HRI: 基于基础模型的多模态人机交互框架,结合目光和语音

Yuzhi Lai, Shenghai Yuan, Peizheng Li, Boya Zhang, Benjamin Kiefer, Tianchen Deng, Andreas Zell

机构 * University of Tuebingen(图宾根大学) Nanyang Technological University(南洋理工大学) Mercedes-Benz(梅赛德斯-奔驰)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract)

AI总结 本文提出FAM-HRI,一种结合目光和语音的多模态人机交互框架,利用基础模型融合语言和目光输入,以提高任务执行的成功率和交互效率,为肢体障碍者提供实用解决方案。

Comments This work has been accepted for publication in IEEE Transactions on Automation Science and Engineering @ 2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11700 2026-05-13 cs.HC 78%

MindMirror: A Local-First Multimodal State-Aware Support System for Digital Workers

MindMirror: 一种面向数字工作者的本地优先多模态状态感知支持系统

Wenqi Luo, Changbo Wang, Yan Wang

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 MindMirror通过整合面部表情、文本输入和语音交互等多模态数据,为数字工作者提供本地优先的状态感知支持,通过本地大语言模型生成响应,提升工作效率与状态监控能力。

Comments 10 pages, 4 figures, 12 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27517 2026-05-01 cs.HC 78%

I'm Fine, But My Voice Isn't: Cross-Modal Affective Dissonance Detection for Reflective Journaling

我很好,但我的声音不是:面向反思日记的跨模态情感不一致检测

Sumin Lee

专题命中 音频语音多模态 :cross-modal(title,abstract)

AI总结 本文提出跨模态情感不一致检测(CADD),通过区分掩蔽、应对和一致三种状态,解决数字日记中情感与语音不匹配的问题,并提出CADD-Journal数据集、DACM模型及领域差距量化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13380 2026-04-16 cs.HC 78%

Does the TalkMoves Codebook Generalize to One-on-One Tutoring and Multimodal Interaction?

对话移动代码本是否能推广到一对一辅导和多模态交互?

Corina Luca Focsan, Marie Cynthia Abijuru Kamikazi, Tamisha Thompson, Jennifer St. John, Kirk Vanacore, Danielle R. Thomas, Kenneth R. Koedinger, René F. Kizilcec

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 研究探讨TalkMoves代码本在一对一辅导中的一致性、实用性及可解释性,对比AI-人类混合代码本,发现前者在可靠性上更优,但后者在多模态覆盖和可用性上更胜一筹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10283 2026-04-14 cs.SD cs.LG 78%

Descriptor-Injected Cross-Modal Learning: A Systematic Exploration of Audio-MIDI Alignment via Spectral and Melodic Features

描述符注入的跨模态学习:通过频谱和旋律特征系统探索音频- MIDI对齐

Mariano Fernández Méndez

机构 * Asociación Civil AlterMundi(AlterMundi民间协会)

专题命中 音频语音多模态 :cross-modal(title,abstract)

AI总结 本文研究了通过频谱和旋律特征提升音频与MIDI之间跨模态检索性能的方法,通过描述符注入技术提高了模型表现,揭示了音频与MIDI特征对齐的机制。

Comments 26 pages, 11 figures, 20 tables. Companion paper to "Harmonic Information Theory: Foundations" (2026). Code: https://github.com/AlterMundi/Phideus

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10181 2026-04-14 cs.SD 78%

Learning to Attend to Depression-Related Patterns: An Adaptive Cross-Modal Gating Network for Depression Detection

学习关注抑郁症相关模式:一种自适应跨模态门控网络用于抑郁症检测

Hangbin Yu, Yudong Yang, Rongfeng Su, Nan Yan, Lan Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of Biomedical Imaging Science and System, Chinese Academy of Sciences(中国科学院生物医学成像科学与系统重点实验室)

专题命中 音频语音多模态 :cross-modal(title,abstract)

AI总结 本文提出自适应跨模态门控网络,通过动态分配帧权重来关注抑郁症相关段落,提升语音信号中抑郁症检测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12817 2026-04-10 eess.SP cs.SD 78%

An Attention-Assisted Multi-Modal Data Fusion Model for Real-Time Estimation of Underwater Sound Velocity

一种结合注意力机制的多模态数据融合模型用于实时估计水下声速

Pengfei Wu, Wei Huang, Yujie Shi, Hao Zhang

机构 * Faculty of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学部) School of Environmental Science and Engineering, Ocean University of China(中国海洋大学环境科学与工程学院)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract)

AI总结 本文提出一种结合注意力机制的多模态数据融合卷积神经网络,用于实时估计水下声速剖面,通过提取远程感应海面温度数据与历史声速剖面特征之间的关系,提升估计精度和鲁棒性。

Journal ref IEEE Transactions on Neural Networks and Learning Systems,2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23418 2026-04-02 cs.CR 78%

Beyond Metadata: Multimodal, Policy-Aware Detection of YouTube Scam Videos

超越元数据:多模态、政策感知的YouTube诈骗视频检测

Ummay Kulsum, Aafaq Sabir, Abhinaya S. B., Anupam Das

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文提出多模态、政策感知的YouTube诈骗视频检测方法,通过结合文本、音频和视频信息,提升检测性能和鲁棒性,同时提供可解释的政策依据。

Comments Accepted at AAAI ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06686 2026-04-01 cs.LG 78%

Balancing Multi-modal Sensor Learning via Multi-objective Optimization

通过多目标优化平衡多模态传感器学习

Heshan Fernando, Quan Xiao, Parikshit Ram, Yi Zhou, Horst Samulowitz, Nathalie Baracaldo, Tianyi Chen

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM Research(IBM研究院) Cornell University(康奈尔大学)

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 本文提出MIMO方法,通过多目标优化平衡多模态传感器学习,提升系统可靠性并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14662 2026-03-17 cs.HC 78%

ViDscribe: Multimodal AI for Customizing Audio Description and Question Answering in Online Videos

ViDscribe:多模态AI用于定制在线视频的音频描述和问答

Maryam Cheema, Sina Elahimanesh, Pooyan Fazli, Hasti Seifi

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 ViDscribe通过整合AI生成的音频描述和六种用户自定义选项,提升视障和低视力用户在YouTube视频中的交互体验,研究显示定制化描述提高了效果和沉浸感。

Comments CHI EA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11536 2026-03-04 physics.flu-dyn 78%

Multimodal nonlinear acoustics in two- and three-dimensional curved ducts

二维和三维弯曲管道中的多模非线性声学

Freddie Jensen, Edward James Brambley

专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract)

AI总结 本文提出了一种用于二维和三维弯曲管道中弱非线性声学的模型,通过多模方法和张量卷积提高了数值效率,并展示了多种声学特性及应用潜力。

Comments 55 pages, 17 figures, supplementary material available from https://ejbrambley.warwick.ac.uk/publications.html

Journal ref J. Fluid Mech. 1030 (2026) A19

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22286 2026-03-03 cs.LG cs.IT math.IT 78%

OmniZip: Learning a Unified and Lightweight Lossless Compressor for Multi-Modal Data

OmniZip: 一种用于多模态数据的统一且轻量级无损压缩器

Yan Zhao, Zhengxue Cheng, Junxuan Zhang, Dajiang Zhou, Qunshan Gu, Qi Wang, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 OmniZip是一种用于多模态数据的统一且轻量级无损压缩器,通过三种关键组件实现高效压缩,并在多个数据集上实现了更高的压缩效率。

Comments 8 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09658 2026-03-02 cs.HC 78%

Co-Designing Multimodal Systems for Accessible Asynchronous Dance Instruction

为无障碍异步舞蹈教学设计多模态系统

Ujjaini Das, Shreya Kappala, Meng Chen, Mina Huh, Amy Pavel

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文通过协同设计研讨会,探讨了如何通过多模态系统为盲人和低视力学习者提供无障碍异步舞蹈教学。

Comments Accepted to CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19243 2026-02-24 cs.HC 78%

As Content and Layout Co-Evolve: TangibleSite for Scaffolding Blind People's Webpage Design through Multimodal Interaction

内容与布局共进化:通过多模态交互的TangibleSite用于辅助视障人士网页设计

Jiasheng Li, Zining Zhang, Zeyu Yan, Matthew Wong, Arnav Mittal, Ge Gao, Huaishu Peng

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 TangibleSite通过多模态交互帮助视障人士共同进化内容与布局,实现独立网页设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12597 2026-02-16 cs.RO cs.HC 78%

PISHYAR: A Socially Intelligent Smart Cane for Indoor Social Navigation and Multimodal Human-Robot Interaction for Visually Impaired People

PISHYAR:一种具有社会智能的智能拐杖,用于室内社交导航和多模态人机交互,以支持视障人士

Mahdi Haghighat Joo, Maryam Karimi Jafari, Alireza Taheri

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 PISHYAR是一款结合社会智能导航与多模态交互的智能拐杖,通过多模态技术提升视障人士的移动辅助与社交互动能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11025 2026-02-12 cs.HC 78%

Reality Copilot: Voice-First Human-AI Collaboration in Mixed Reality Using Large Multimodal Models

Reality Copilot:基于大多模态模型的混合现实中的语音优先人机协作

Liuchuan Yu, Yongqi Zhang, Lap-Fai Yu

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 Reality Copilot通过大模型实现混合现实中的语音优先人机协作,支持环境理解、3D生成和实时检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18268 2026-02-10 cs.LG 78%

Reducing Aleatoric and Epistemic Uncertainty through Multi-modal Data Acquisition

通过多模态数据采集减少偶然性和epistemic不确定性

Arthur Hoarau, Benjamin Quost, Sébastien Destercke, Willem Waegeman

机构 * Université de Lorraine, CentraleSupélec CNRS, LORIA, Metz, France(洛林大学、中央超导电子学学院 CNRS、LORIA、法国梅茨) Université de technologie de Compiègne UMR CNRS 7253 Heudiasyc, France(图卢兹理工学院 UMR CNRS 7253 Heudiasyc、法国) CNRS, Université de technologie de Compiègne UMR CNRS 7253 Heudiasyc, France(CNRS、图卢兹理工学院 UMR CNRS 7253 Heudiasyc、法国) University of Ghent Ghent, Belgium(根特大学、比利时根特)

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 本文提出一种多模态数据采集框架,通过增加模态数量和收集更多观测来减少偶然性和epistemic不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏