arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

机器人学会“听声辨位”:北大阿里清华推出首个具身空间声学大模型

作者:arXivDaily编辑部 arXiv 2609.23407 cs · cs.AI · cs.SD

论文导读

具身智能机器人以往高度依赖前向摄像头视觉,在暗光视线受阻或转角盲区场景下极易丧失对目标的追踪定位。北京大学联合阿里巴巴与清华大学等机构联合推出了首个具身空间声学大模型OmniEcho。该模型赋予智能体感知三维声场与实时双耳声源定位的能力,在197个复杂室内场景中实现了端到端声学自主导航。

核心背景与具身听觉痛点

在嘈杂且障碍交错的真实家庭与工作场所中,人类常常在视线未及之前就通过门后的脚步声或厨房的报警声迅速锁定目标方向。相比之下,现代自主移动机器人却长期处于视力发达但双耳失聪的失衡状态,极度脆弱地依赖正向摄像头的狭窄视场。为了给机器人补齐关键的空间听觉感知拼图,北京大学、阿里巴巴与清华大学的研究团队联合推出了首个通用具身空间声学大模型OmniEcho。

传统声源定位算法只能输出单一的角度坐标,且在遇到强混响室内墙壁与家具多重反射时误差极大,完全无法支持动态移动与路径规避。OmniEcho采用双塔多模态融合架构,将原生音频单声道波形与高精度的四阶一阶双耳声场分量同步编码,在底层网络中实现声波时延差与三维几何环境的深度对齐。

图:原生音频与一阶双耳声场信号联合编码的多模态具身决策架构

真实室内声学数据与环境采集

为了系统性训练并验证机器人的听觉具身能力,研究团队历时数月在真实住宅与写字楼等197个多样化房间内进行了详尽的实测数据采集。数据集涵盖了近3000组高保真空间音频问答与主动搜寻轨迹,包含了手机铃声、玻璃破碎、婴儿啼哭以及机械报警等数十种日常生活关键声响。采集过程中,移动机器人搭载全向麦克风阵列在动态声源场景下连续记录空间冲激响应,构建了涵盖不同反射混响强度的多模态物理声学基准。

图:在复杂遮挡办公室内机器人依靠微弱警报声避障穿行的运动轨迹

关键突破与盲区声源定位

在实机自主导航测试中,搭载OmniEcho的轮式机器人在完全处于视线遮挡的隔壁房间依然能准确判定声源方位并规划绕障路径。实验表明,智能体在水平方位角测算上的平均误差低于5度,即使在仅依赖微弱声音指引的极端暗光场景中,导航到达目标的综合成功率也直逼传统视觉系统。

图:声源水平方位角与俯仰距离测算及后续动作决策的精确输出

未来应用与落地展望

这项成果标志着具身智能正式迈入了视听一体全感知时代。未来该技术将广泛赋能室内家庭陪伴管家、全天候安防巡检与消防搜救机器人,使其能在黑夜浓烟或遮蔽转角等极限环境中准确听声救人与敏捷避险。

参考资料

https://arxiv.org/abs/2609.23407

https://omniecho-embodied.github.io