EgoAVU: Egocentric Audio-Visual Understanding
EgoAVU:第一人称音频视觉理解
机构 * Meta ; University of Maryland, College Park(马里兰大学College Park分校)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);multi-modal(abstract);cross-modal(abstract)
AI总结 EgoAVU通过生成第一人称音频视觉叙述和问题,提升多模态大语言模型在第一人称视频理解中的性能。