arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-25 至 2026-08-25 共收录 17 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 17 篇

2608.23234 2026-08-25 cs.CV 新提交 90%

MLLM-Assisted Audio VOS: A 3rd Place Report for the MeViS-Audio Track, 8th LSVOS Challenge

多模态大语言模型(MLLM)辅助音频引导的视频目标分割:第8届LSVOS挑战赛MeViS音频赛道第3名报告

Liangtao Shi, Jinxia Xie, Xiantao Hu, Ting Liu

机构 * Hefei University of Technology(合肥工业大学) Nanjing University of Science and Technology(南京理工大学) Hunan Police College(湖南警察学院)

专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 该研究提出一种结合MLLM与SAM的无训练音频引导视频分割框架,分解任务至各阶段并选用适配基础模型,在第8届LSVOS挑战赛MeViS音频赛道获第3名,验证了基础模型用于该任务的有效性。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07173 2026-08-25 cs.CL 版本更新 85%

Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models

Omni-SafetyBench:视听大语言模型安全评估基准

Leyi Pan, Zheyu Fu, Yunpeng Zhai, Shuchang Tao, Sheng Guan, Shiyu Huang, Lingzhe Zhang, Zhaoyang Liu, Bolin Ding, Felix Henry, Aiwei Liu, Lijie Wen

机构 * Tsinghua University(清华大学) Tongyi Lab(通义实验室) Peking University(北京大学) OpenRL Lab(OpenRL实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CL

AI总结 研究针对现有OLLM安全基准的不足,构建Omni-SafetyBench基准,提出定制化评估指标,发现多数OLLM存在安全漏洞,为该领域研究提供重要支撑。

Comments ACM MM 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23363 2026-08-25 cs.CV cs.AI cs.LG 新提交 84%

DF-MoE: Generalizable Deepfake Detection via Multimodal Sparse Mixture-of-Experts

DF-MoE:基于多模态稀疏混合专家的通用深度伪造检测方法

Vlad Hondru, Florinel Alin Croitoru, Iuliana Georgescu, A. Sophia Koepke, Radu Tudor Ionescu

机构 * University of Bucharest(布加勒斯特大学) Technical University Munich(慕尼黑工业大学) University of Tübingen(蒂宾根大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对视听深度伪造检测的泛化难题,提出DF-MoE框架,通过多预训练模型提取多模态线索并结合MoE主干网络,在五个基准数据集上实现优于现有方法的检测性能。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22071 2026-08-25 cs.CL cs.AI 新提交 81%

Real-TurnTurk: A Multimodal Turkish Corpus for Turn-Taking Prediction

Real-TurnTurk:用于话轮转换预测的多模态土耳其语语料库

Ahmet Tuğrul Bayrak, Fatma Nur Korkmaz, Bekir Berker Türker, Mustafa Sertaç Türkel, Alper Kaplan

机构 * Data Science and Innovation Ata Technology Platforms(阿塔技术平台数据科学与创新部) Digital Operations and Data(数字运营与数据部)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究构建多模态土耳其语对话数据集,采用遗传算法优化规则,实现话轮转换预测,填补土耳其语相关自然对话语料库的空白。

Comments Accepted to INTCEC 2026. This is the author's pre-print version. The final authenticated version will be available through the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23484 2026-08-25 cs.AI 新提交 79%

Multi-Modal Semantic Expansion with Constrained LLM Reranking for Conversational Music Recommendation

结合约束大语言模型重排序的多模态语义扩展用于对话式音乐推荐

Naman Garg, Sarika Jain, George Fazekas

机构 * National Institute of Technology Kurukshetra(库鲁克谢特拉国家技术学院) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 该研究针对ACM RecSys 2026挑战赛提出三阶段多模态对话音乐推荐系统,经优化后在Blind B获0.3213综合分,发现约束大语言模型注入的会话数量对Blind A的nDCG有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23383 2026-08-25 cs.CV 新提交 79%

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

面向持续故事与交互世界的长时序视听生成

Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li, Yuming Li, Yijun Liu, Xin Lu, Xiaoxiao Ma, Yanwen Ma, Yaofeng Su, Yilang Sun, Haoyu Wang, Zeyue Xue, Songchun Zhang, Junhao Zhuang

机构 * Joy Future Academy, JD(京东探索研究院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 研究针对长时序视听生成的需求,提出JoyAI-Echo-1.5系统,含长视频与世界模型变体,通过专用技术实现跨镜头一致性等性能,在相关基准上取得领先结果,为生成连贯内容提供基础。

Comments Project page: this https URL (https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15294 2026-08-25 cs.SD cs.MM 版本更新 79%

MeMo: Attentional Momentum for Real-Time Audio-Visual Target Speaker Extraction Under Impaired Visual Conditions

MeMo: 视觉受损条件下的实时视听目标说话人提取的注意力动量

Junjie Li, Wenxuan Wu, Shuai Wang, Zexu Pan, Kong Aik Lee, Helen Meng, Haizhou Li

机构 * Department of Electrical and Electronic Engineering, Faculty of Engineering, The Hong Kong Polytechnic University(电子工程系,工程学院,香港理工大学) Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong(系统工程与工程管理系,香港中文大学) School of Artificial Intelligence (SAI), The Chinese University of Hong Kong, Shenzhen(人工智能学院(SAI),香港中文大学深圳校区) School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) Tongyi Lab, Alibaba Group, Singapore(通义实验室,阿里巴巴集团,新加坡)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM

AI总结 提出MeMo框架,通过两个自适应记忆库存储注意力信息,在视觉线索缺失时维持注意力动量,实现实时目标说话人提取,SI-SNR提升至少2dB。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00968 2026-08-25 cs.HC 版本更新 78%

SherpaAI: A Multi-modal Solution for Delivering Personalized and Adaptive Fitness Interventions

FlexAI: 一种多模态解决方案,用于提供个性化和自适应的健身干预

Shivangi Agarwal, Zoya Ghoshal, Bharat Jain, Siddharth

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 FlexAI通过整合计算机视觉、生理传感器和大语言模型,提供实时个性化健身指导,显著提升用户参与度和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21387 2026-08-25 cs.RO eess.SY 新提交 71%

Multimodal-Language-Model-Driven Interaction and Companionship for Service Robots in Elderly-Care Facilities

面向养老机构服务机器人的多模态语言模型驱动的交互与陪伴

Ching-Chieh Liu, Cong-Thanh Vu, Yen-Chen Liu

机构 * National Cheng Kung University (NCKU)(成功大学)

专题命中 音频语音多模态 :multimodal(title)

AI总结 该研究针对养老机构服务机器人缺乏综合陪伴与安全能力的问题,提出整合主动视觉跟人、LLM语音交互及VLM安全监测的智能陪伴机器人系统,实验验证其跟随交互与跌倒检测的有效性。

Comments Accepted to the 2026 IEEE/ASME International Conference on Advanced Intelligent Mechatronics (AIM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20719 2026-08-25 cs.SD cs.AI cs.MM eess.AS 版本更新 67%

ONOTE: Hypergraph-Grounded Omnimodal Reasoning for Computational Music Science

ONOTE:面向专家级音乐智能的多模态记谱处理基准测试

Menghe Ma, Siqing Wei, Yuecheng Xing, Ziyue Zhu, Zhenghong Lin, Yaheng Wang, Fanhong Meng, Peijun Han, Luu Anh Tuan, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文提出ONOTE基准测试,通过确定性流程消除记谱系统偏差,揭示多模态模型在感知准确性和音乐理论理解间的根本分歧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22196 2026-08-25 eess.AS cs.CL 新提交 62%

Mitigating Speaker Leakage in Cascaded Multi-talker ASR with Diarization-based Transcript Correction

基于说话人 diarization 的转录校正缓解级联多说话人自动语音识别中的说话人泄漏

Hermann Yepdjio Nkouanga, Minwei Luo, Maggie Wigness, Suresh Singh

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 该研究针对级联多说话人自动语音识别中的说话人泄漏问题,提出基于剪枝的校正范式,利用预训练说话人 diarization 模型剪枝转录片段,在多语料库上实现 cpW ER 最高相对降低 29%,提升了转录可靠性。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18904 2026-08-25 cs.SD cs.AI cs.CL eess.AS 交叉投稿 62%

MetaSICL: Globalizing Auditory LLMs for Underserved Speakers and Languages via Meta Speech In-Context Learning

MetaSICL: 通过元语音上下文学习适应听觉大语言模型

Haolong Zheng, Siyin Wang, Zengrui Jin, Mark Hasegawa-Johnson

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出MetaSICL方法,利用高资源语音数据通过元学习增强听觉大语言模型的上下文学习能力,在低资源场景下优于直接微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22907 2026-08-25 eess.AS 新提交 57%

Unsupervised Speech Recognition at the Syllable Level

音节级别的无监督语音识别

Liming Wang, Kai-Wei Chang, Kunio Kashino, David Harwath, Mark Hasegawa-Johnson, James R. Glass

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 该研究针对现有无监督语音识别方法依赖G2P且训练不稳定的问题,提出基于掩码语言建模的音节级UASR框架,在LibriSpeech上使CER相对降低40%,并有效推广到低资源语言。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22796 2026-08-25 eess.AS cs.SD 新提交 57%

DiaScriber: A Speech LLM for Joint Diarization and Transcription in Multi-Speaker Scenarios

DiaScriber:面向多说话人场景的联合说话人 diarization(语音分割)与转录的语音大语言模型

Bingshen Mu, Xian Shi, Xiong Wang, Zhifang Guo, Ting He, Xize Cheng, Yu Xi, Jin Xu, Lei Xie

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本研究提出基于Qwen3.5-Omni的端到端多说话人 diarization与转录模型DiaScriber,通过构建多样数据流程与三阶段训练策略,在多说话人场景测试集上性能优于对比方法且泛化能力出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23189 2026-08-25 cs.CV 新提交 57%

EchoWM: Open and Enterable Omnimodal World Models

EchoWM:开放且可进入的全模态世界模型

Songchun Zhang, Yaowei Li, Junhao Zhuang, Weiyang Jin, Haoyu Wang, Xin Lu, Yilang Sun, Shiyi Zhang, Haoran Li, Xiaoxiao Ma, Yuming Li, Yijun Liu, Yaofeng Su, Yanwen Ma, Haoyu Wu, Zihan Su, Yue Ma, Lvmin Zhang, Haoyang Huang, Zeyue Xue, Anyi Rao, Nan Duan

机构 * HKUST(香港科技大学) PKU(北京大学) Joy Future Academy, JD(京东探索研究院) HKU(香港大学) THU(清华大学) USTC(中国科学技术大学) FDU(复旦大学) Beihang University(北京航空航天大学) Stanford University(斯坦福大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 该研究提出EchoWM全模态世界模型,围绕相机意图组织交互,构建互补数据引擎并采用渐进式训练等方法,在公开基准上实现强轨迹跟随与高视觉质量,支持跨视角交互及长序列多模态同步生成。

Comments 42 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23092 2026-08-25 cs.SD 新提交 50%

Reasoning-Oriented Post-Training and Inference-Time LoRA Rescaling for Audio-Dependent Question Answering

面向推理的后训练与推理时LoRA重缩放:针对音频相关问答任务

Weiteng Hu, Yin Cao, Jun Yang

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 该研究针对音频相关问答任务,提出面向推理的LoRA后训练与推理时重缩放方法,在Qwen和MOSS-Audio模型上验证了有效性,提交系统在挑战赛中获总体第三、轻量级系统第二。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15206 2026-08-25 cs.LG 版本更新 50%

Chorus: Harmonizing Context and Sensing Signals for Data-Free Model Customization in IoT

Chorus:谐音上下文和传感信号以实现物联网中的无数据模型定制

Liyu Zhang, Yejia Liu, Kwun Ho Liu, Runxi Huang, Xiaomin Ouyang

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 Chorus通过学习上下文表示,在无需目标域数据的情况下,实现对未知部署条件的模型自适应,实验显示其在多种传感任务中性能优于现有方法,且推理延迟接近传感器部署。

详情

展开后加载摘要…

URL PDF HTML 收藏