Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation
机构 * Fudan University, China(复旦大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);MLLM(abstract);分类 cs.CV
Comments ICCV 2025, Project Page: https://henghuiding.com/OmniAVS/