arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-26 至 2026-08-26 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 10 篇

2608.24209 2026-08-26 cs.MM 新提交 89%

Task-disentangled Low-Rank Adaptation for Versatile Audio-visual Multi-modal Learning Tasks within a Unified Framework

面向统一框架内多模态视听学习任务的任务解耦低秩适配方法

Hanyu Xuan, Mengqi Zhang, Junjun Mao, Fei Wang, Kun Li, Guanghui Yue, Zhiliang Wu, Hehe Fan

专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出统一框架下的任务解耦低秩适配(LoRA)机制,解决多视听任务联合训练的干扰问题,在多项视听任务上优于现有统一模型及部分任务特定模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23759 2026-08-26 eess.AS cs.SD 新提交 80%

The ISCSLP 2026 Real-World Audio-Visual Speech Enhancement Challenge

ISCSLP 2026 真实场景视听语音增强挑战赛

Challenge Organizers

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

AI总结 该研究介绍ISCSLP 2026真实场景视听语音增强挑战赛,设置含真实混合、合成重混等赛道,公布基线结果与相关资源,以评估视听语音增强在自然场景下的性能。

Comments The First Real-World Audio-Visual Speech Enhancement (AVSE) Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24160 2026-08-26 cs.AI 新提交 79%

OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses

全能评判者还是全能偏差?通过平衡、解耦的视角诊断多模态评判者

Guangzheng Hu, Ziyue Jiang, Weixu Qiao, Lixin Zhang, Jianye Kang, Yuru Wu, Rong Bao, Niantong Li, Wei Wang, Ziyi Cheng, Xinfa Zhu, HangRui Hu, Ting He, Bing Zhao, Lin Qu, Hu Wei, Jin Xu

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究推出平衡解耦的多模态评判者诊断基准D3-Omni,发现全能评判者存在模态相关维度表现差、漏检失败等系统性盲点,为评估多模态模型提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23383 2026-08-26 cs.CV 版本更新 79%

Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds

面向持续故事与交互世界的长时序视听生成

Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li, Yuming Li, Yijun Liu, Xin Lu, Xiaoxiao Ma, Yanwen Ma, Yaofeng Su, Yilang Sun, Haoyu Wang, Zeyue Xue, Songchun Zhang, Junhao Zhuang

机构 * Joy Future Academy, JD(京东探索研究院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 研究针对长时序视听生成的需求,提出JoyAI-Echo-1.5系统,含长视频与世界模型变体,通过专用技术实现跨镜头一致性等性能,在相关基准上取得领先结果,为生成连贯内容提供基础。

Comments Project page: this https URL (https://echo-team-joy-future-academy-jd.github.io/Echo-1.5-Page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24674 2026-08-26 cs.CV 新提交 70%

TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation

TurboT2VA:基于分数正则化一致性蒸馏的快速大规模文本-视频-音频生成

Xiaoda Yang, Yuxiang Liu, Kaiwen Zheng, Yuan Liu, Yibo Lai, Shengpeng Ji, Kai Jiang, Jianfei Chen, Xiaobin Hu, Shuicheng Yan, Jintao Zhang, Jun Zhu, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tianjin University(天津大学) Tsinghua University(清华大学) Qingdao University(青岛大学) National University of Singapore(新加坡国立大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出TurboT2VA框架,通过多模态归一化与渐进式课程方案,在保持音视频生成质量的同时,大幅加速190亿参数联合T2VA模型的推理,在不同分辨率下实现最高54.67倍的生成器加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23758 2026-08-26 cs.SD cs.AI 新提交 70%

EXAM$^2$: $\underline{Ex}tending$ $\underline{A}udio$ $Understanding$ $in$ $\underline{M}ultilingual$ $and$ $\underline{M}ultimodal$ $Analysis$

EXAM²:扩展多语言与多模态分析中的音频理解能力

Jiawen Wang, Xiaoxue Gao, Zi Haur Pang, Nancy F. Chen

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出多语言多模态音频理解基准EXAM²,评估现有模型发现其存在多语言跨模态理解差距,微调的Gemma3n-EXAM²性能显著提升,推动相关研究发展。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06165 2026-08-26 cs.SD cs.AI cs.MM 版本更新 62%

Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset

基于预训练特征、数据增强及新SheetSage-A2S数据集的音频转乐谱转录

Eoin Cummins, Zhongyi Huang, Alexandre D'Hooge, Zhuoru Mo, Yaolong Ju

机构 * University College Dublin(都柏林大学学院) Guangxi Normal University(广西师范大学) Great Bay University(大湾区大学) Shenzhen University(深圳大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 该研究针对流行音乐音频转乐谱研究不足的问题,构建了SheetSage-A2S数据集,结合预训练模型MuQ与数据增强改进A2S方法,在古典与流行音乐基准上均取得优于现有技术的性能。

Comments Accepted at the 34th ACM International Conference on Multimedia (MM '26) 2026-08-25: Edit to drop TeX commands in abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14249 2026-08-26 cs.SD cs.AI eess.AS 版本更新 62%

Do Joint Language-Audio Embeddings Encode Perceptual Timbre Semantics?

联合语言-音频嵌入是否编码感知音色语义?

Qixin Deng, Bryan Pardo, Thrasyvoulos N Pappas

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Computer Science(计算机科学系) Northwestern University(西北大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文评估MS-CLAP等联合语言-音频嵌入模型捕捉感知音色语义的能力,发现LAION-CLAP对齐表现较强但整体有限,混响诱导音色语义的编码一致性优于均衡诱导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24579 2026-08-26 eess.AS 新提交 57%

Visually-Guided Spatial Audio Generation for $360^\circ$ In-the-Wild Speech Scenes

面向野外360°语音场景的视觉引导空间音频生成

Qingyu Luo, Peng Zhang, Wenwu Wang, Philip J. B. Jackson

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 针对野外360°语音场景空间音频采集质量受限问题,本文提出视觉引导的FOA语音空间化方法,构建YT-SPEECH数据集,采用Localizer-Renderer框架实现定向FOA信号重建,提升了音频相关性能。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24707 2026-08-26 cs.CL 新提交 57%

Lost in Speech: Trilingual Spoken Hallucination Detection Across Audio and Transcripts

迷失在语音中:跨音频与文本的三语语音幻觉检测

Meruyert Aristombayeva, Jason S. Lucas, Chaewan Chun, Dongwon Lee

机构 * Satbayev University(萨塔巴耶夫大学) University of Colorado Boulder(科罗拉多大学博尔德分校) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 该研究针对低资源语言语音幻觉检测的空白,构建三语语音幻觉基准,评估多模态检测模型,发现文本检测更优,合成训练检测器在真实数据上迁移性强,还揭示合成基准的混淆因素。

详情

展开后加载摘要…

URL PDF HTML 收藏