arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 129 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 129 篇

2608.01920 2026-08-05 cs.SD 版本更新 50%

P-MUSE: Prompt-MIDI-Optional Model for Unified Instrumental Music Synthesis and Editing

P-MUSE:用于统一器乐合成与编辑的提示-MIDI可选模型

Chong Jing, Junan Zhang, Jing Yang, Yulun Wu, Fan Fan, Zhizheng Wu

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 P-MUSE是统一器乐合成与编辑的MIDI-to-Music框架,通过多阶段课程学习整合两种生成范式,提出相位感知引导策略与尾端丢弃法,并建立含四类乐器的综合基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19605 2026-07-24 cs.SD 版本更新 50%

RIME: Enabling Large-Scale Agentic Music Post-Production

RIME:实现大规模智能后期制作

Noah Schaffer, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 研究针对音乐后期制作问题,引入RIME框架,利用POEMS工具包生成配对数据,评估多模态语言模型,展示其通过监督微调提升智能体性能,是迈向迭代音乐智能体、变革音乐制作的早期步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04692 2026-07-22 cs.HC 版本更新 50%

Interactive Communication -- cross-disciplinary perspectives from psychology, acoustics, and technology

交互式通信——来自心理学、声学和技术的跨学科视角

Mareike Daeglau, Stephan Getzmann, Moritz Bender, Janina Fels, Rainer Martin, Alexander Raake, Isabel S. Schiller, Sabine J. Schlittmeier, Katrin Schoenenberg, Felix Stärz, Leon O. H. Kroczek

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文从跨学科视角介绍交互式通信,整合心理机制与多方面限制,概述理论框架、总结关键方法,讨论辅助听力技术等应用及伦理考量,强调人类能力与技术系统共同塑造交互式通信,整合相关研究要点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23804 2026-07-10 cs.HC eess.SP 版本更新 50%

Perceptually Lossless Tactile Texture Synthesis with Compact Spectral Envelope Models

基于紧凑频谱包络模型的感知无损触觉纹理合成

Jagan K. Balasubramanian, Yasemin Vardar

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 提出两种紧凑频谱表示(频谱β和频谱斜率)来捕获手指-表面摩擦信号的时间频谱结构,通过感知实验验证其能实现与高保真再现相当的感知真实感,为触觉压缩、通信和合成纹理生成提供高效框架。

Comments 16 pages and 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10547 2026-07-08 cs.SD 版本更新 50%

HeartMuLa: A Family of Open Sourced Music Foundation Models

HeartMuLa:一个开源音乐基础模型家族

Dongchao Yang, Yuxin Xie, Yuguo Yin, Zheyu Wang, Xiaoyu Yi, Gongxi Zhu, Xiaolong Weng, Zihan Xiong, Yingzhe Ma, Dading Cong, Jingliang Liu, Zihang Huang, Jinghan Ru, Rongjie Huang, Haoran Wan, Peixu Wang, Kuoxi Yu, Helin Wang, Liming Liang, Xianwei Zhuang, Yuanyuan Wang, Dingdong Wang, Haohan Guo, Junjie Cao, Zeqian Ju, Songxiang Liu, Yuewen Cao, Heming Weng, Yuexian Zou

机构 * HeartMuLa Teams(HeartMuLa团队)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 介绍开源音乐基础模型家族HeartMuLa,含四个组件及两种特殊模式,能跨任务和模态推动音乐理解与生成,扩展到7B参数时有显著改进,可重现商业级系统,为未来研究提供基线并促进多模态应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14343 2026-06-23 cs.LG 版本更新 50%

Localizing and Editing Knowledge in Large Audio-Language Models

定位与编辑大型音频-语言模型中的知识

Sung Kyun Chung, Jiaheng Dong, Qiuchi Hu, Gongping Huang, Hong Jia, Ting Dang

机构 * The University of Melbourne, Australia(墨尔本大学) University of Auckland, New Zealand(奥克兰大学) Wuhan University, China(武汉大学)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 提出首个音频知识定位与编辑基准,通过语音感知因果追踪定位事实知识存储的层和模块,并应用编辑实现细粒度知识控制。

Comments Paper was accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07676 2026-06-16 cs.NE eess.SP 版本更新 50%

A Primer on Evolutionary Optimization Frameworks for Near-Field Multi-Source Localization

近场多源定位的进化优化框架入门

Seyed Jalaleddin Mousavirad, Parisa Ramezani, Mattias O'Nils, Emil Björnson

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出两种基于进化优化的无网格、无训练连续域搜索框架,用于近场多源定位,克服了MUSIC等网格子空间方法和深度学习的局限,通过差分进化实现高精度定位。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17633 2026-06-15 cs.SD cs.CR 版本更新 50%

SARSteer: Safeguarding Large Audio-Language Models via Safe-Ablated Refusal Steering

SARSteer: 通过安全消融拒绝引导保护大型音频语言模型

Weilin Lin, Jianze Li, Hui Xiong, Li Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出SARSteer,首个针对大型音频语言模型的推理时防御框架,通过文本衍生的拒绝引导和分解安全空间消融,有效提升有害查询拒绝率并减少良性查询的过度拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16835 2026-06-15 cs.CR cs.LG 版本更新 50%

NeST: Neuron Selective Tuning for LLM Safety

NeST: 面向LLM安全的神经元选择性调优

Sasha Behrouzi, Lichao Wu, Mohamadreza Rostami, Ahmad-Reza Sadeghi

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 提出NeST框架,通过激活探测识别安全相关前馈神经元并训练共享簇级更新,仅用普通恶意提示即可泛化防御多种越狱攻击,在14个模型上以极少参数实现接近全微调的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏