arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-04 至 2026-03-04 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2602.21646 2026-03-04 cs.CL 85%

Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion

可扩展的多语言多模态机器翻译与语音-文本融合

Yexing Du, Youcheng Pan, Zekun Wang, Zheng Chu, Yichong Huang, Kaiyuan Liu, Bo Yang, Yang Xiang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CL

AI总结 本文提出一种语音引导的机器翻译框架,通过融合语音和文本提升多语言翻译性能,并在多个基准上取得新突破。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02877 2026-03-04 eess.AS 83%

DBMIF: a deep balanced multimodal iterative fusion framework for air- and bone-conduction speech enhancement

DBMIF:一种用于空气传导和骨传导语音增强的深度平衡多模态迭代融合框架

Yilei Wu, Changyan Zheng, Xingyu Zhang, Yakun Zhang, Chengshi Zheng, Shuang Yang, Ye Yan, Erwei Yin

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 eess.AS

AI总结 DBMIF通过深度平衡多模态迭代融合框架提升空气传导和骨传导语音增强性能,降低字符错误率2.5%以上。

Comments 10 pages, 7 figures, Applied Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03060 2026-03-04 eess.IV eess.AS 79%

DLIOS: An LLM-Augmented Real-Time Multi-Modal Interactive Enhancement Overlay System for Douyin Live Streaming

DLIOS:一种增强现实时间多模态交互增强叠加系统的大型语言模型增强系统,用于抖音直播

Shuide Wen, Sungil Seok, Beier Ku, Richee Li, Yubin He, Bowen Qu, Yang Yang, Ping Su, Can Jiao

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS

AI总结 DLIOS通过LLM增强实时多模态交互增强系统,实现抖音直播中的弹幕、礼物效果和TTS广播的高效处理与优化。

Comments 14 pages, 13 figures, 6 tables, 7 algorithms, 16 references, submitted to ACM/IEEE International Conference on Systems and Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11536 2026-03-04 physics.flu-dyn 78%

Multimodal nonlinear acoustics in two- and three-dimensional curved ducts

二维和三维弯曲管道中的多模非线性声学

Freddie Jensen, Edward James Brambley

专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract)

AI总结 本文提出了一种用于二维和三维弯曲管道中弱非线性声学的模型,通过多模方法和张量卷积提高了数值效率,并展示了多种声学特性及应用潜力。

Comments 55 pages, 17 figures, supplementary material available from https://ejbrambley.warwick.ac.uk/publications.html

Journal ref J. Fluid Mech. 1030 (2026) A19

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12386 2026-03-04 cs.HC 50%

Hey Dashboard!: Supporting Voice, Text, and Pointing Modalities in Dashboard Onboarding

Hey Dashboard!:在仪表盘引导中支持语音、文本和指向模态

Vaishali Dhanoa, Gabriela Molina León, Eve Hoggan, Eduard Gröller, Marc Streit, Niklas Elmqvist

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 DIANA通过语音、文本和指向等多种模态,为仪表盘引导提供自助导航和分析支持,提升用户在复杂仪表盘中的使用效率。

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏