JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments
JAEGER:模拟物理环境中的联合3D音频-视觉定位与推理
机构 * Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学) ; Tencent AI Lab(腾讯AI实验室)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI
AI总结 提出JAEGER框架,通过集成RGB-D观测和多通道一阶环境声学,将音频-视觉大语言模型扩展到3D空间,实现联合空间定位与推理,并引入神经强度向量(Neural IV)提升声源方向估计的鲁棒性。
Comments Accepted to ICML 2026