arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-09 至 2026-02-09 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2602.06139 2026-02-09 cs.CV 87%

EgoAVU: Egocentric Audio-Visual Understanding

EgoAVU:第一人称音频视觉理解

Ashish Seth, Xinhao Mei, Changsheng Zhao, Varun Nagaraja, Ernie Chang, Gregory P. Meyer, Gael Le Lan, Yunyang Xiong, Vikas Chandra, Yangyang Shi, Dinesh Manocha, Zhipeng Cai

机构 * Meta University of Maryland, College Park(马里兰大学College Park分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);multi-modal(abstract);cross-modal(abstract)

AI总结 EgoAVU通过生成第一人称音频视觉叙述和问题,提升多模态大语言模型在第一人称视频理解中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06647 2026-02-09 cs.CL eess.AS 62%

Reading Between the Waves: Robust Topic Segmentation Using Inter-Sentence Audio Features

在波涛间阅读:利用跨句音频特征实现鲁棒性话题分割

Steffen Freisinger, Philipp Seeberger, Tobias Bocklet, Korbinian Riedhammer

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出利用跨句音频特征进行鲁棒性话题分割,通过多模态方法提升分割性能,并在多个数据集上验证了其有效性。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06270 2026-02-09 cs.CL 57%

VowelPrompt: Hearing Speech Emotions from Text via Vowel-level Prosodic Augmentation

VowelPrompt:通过元音层面的语调增强从文本中听出语音情感

Yancheng Wang, Osama Hanna, Ruiming Xie, Xianfeng Rui, Maohao Shen, Xuedong Zhang, Christian Fuegen, Jilong Wu, Debjyoti Paul, Arthur Guo, Zhihong Lei, Ozlem Kalinli, Qing He, Yingzhen Yang

机构 * Meta Superintelligence Labs(Meta超智能实验室) Arizona State University(亚利桑那州立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 VowelPrompt通过元音层面的语调增强,提升LLM在语音情感识别中的表现并生成可解释的解释。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06047 2026-02-09 cs.HC cs.AI 57%

Git for Sketches: An Intelligent Tracking System for Capturing Design Evolution

Git for Sketches: 一种智能追踪系统用于捕捉设计演变

Sankar B, Amogh A S, Sandhya Baranwal, Dibakar Sen

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 DIMES系统通过智能版本控制捕捉设计演变,利用sGIT和生成式AI提升概念探索和知识传递效率。

Comments 49 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏