MLLM-Assisted Audio VOS: A 3rd Place Report for the MeViS-Audio Track, 8th LSVOS Challenge
多模态大语言模型(MLLM)辅助音频引导的视频目标分割:第8届LSVOS挑战赛MeViS音频赛道第3名报告
机构 * Hefei University of Technology(合肥工业大学) ; Nanjing University of Science and Technology(南京理工大学) ; Hunan Police College(湖南警察学院)
专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV
AI总结 该研究提出一种结合MLLM与SAM的无训练音频引导视频分割框架,分解任务至各阶段并选用适配基础模型,在第8届LSVOS挑战赛MeViS音频赛道获第3名,验证了基础模型用于该任务的有效性。
Comments 5 pages