给机器人一张目标房间的俯视布局,它需要从第一视角找到家具、抓起、搬运并摆到正确位置。北京理工大学提出具身场景重排规划ESRP,并构建ESRP-Bench,包含超过5400组初始—目标场景和8200个物体。
与可以读取全局坐标的传统重排任务不同,ESRP不向智能体开放全局状态或真值定位。家具互相遮挡,机器人只能根据眼前画面和历史动作推断当前布局,任务从移动一件物体逐步增加到移动四至六件物体。
目标图是全局的,机器人看到的却是局部
智能体收到一张自上而下的目标布局,但行动时只有第一人称相机。它必须把俯视图中的家具与眼前物体对应起来,估计相对位置,再规划移动、抓取和放置。任何一次识别或定位误差都会影响后面的长动作链。
数据覆盖卧室、书房、客厅等常见室内空间,以及椅子、桌子、植物和柜子等多种家具。简单任务只移动一件,困难任务移动四至六件,并增加遮挡和路径冲突。
图1:每组上排为初始布局、下排为目标布局,难度随需移动家具数量增加。
三类指标不只检查最终位置
ESRP定义多层指标,分别观察物体是否接近目标、整体场景匹配程度以及任务执行效率。只把一件家具推近目标不能等同于完成;位置、朝向和多物体关系都要纳入判断。
任务环境建立在OmniGibson上,物体具有碰撞和可操作属性。机器人不能穿过墙体或直接修改坐标,抓取、移动和放置都要通过动作执行。
图2:智能体依据目标俯视图,在无全局状态和真值定位条件下重排家具。
四类基线从规划器到视觉语言模型
论文提供分层任务—运动规划方法、视觉语言模型智能体、模仿学习和强化学习四类基线。规划器利用更强的全局信息作为能力上界,学习方法从交互或专家轨迹中获得策略,视觉语言模型则在ReAct循环中观察和行动。
基准还提供数据集、环境和模型结构。强化学习基线用卷积网络处理视觉输入,以LSTM保存历史,并显式编码抓取状态;长序列记忆由此成为方法设计的一部分。
图3:基准比较模仿学习、强化学习、视觉语言模型和分层规划四类方法。
当前方法能成功,但效率随物体数迅速下降
成功案例中,红线表示机器人轨迹,蓝线表示物体移动轨迹。智能体需要多次往返,把不同家具送到目标位置。物体数量增加后,较早摆好的家具可能挡住后续路径,错误放置也会放大整个计划的成本。
图4:机器人和物体轨迹显示多次抓取、搬运与放置如何共同完成目标布局。
实验结论是现有方法仍难高效完成任务。所有成绩来自OmniGibson仿真,不代表实体机器人已能在家庭中稳定搬运家具;现实中的抓取摩擦、物体重量和人员安全会进一步提高门槛。
从仿真基准走向家庭机器人部署
项目页、代码和数据集已开放,后续可以加入可变物体尺寸、可开合家具和多人活动,让规划更接近真实家庭。另一条路线是将语义地图和失败恢复接入视觉语言模型,减少每次遮挡后从头定位。
实体部署应先从轻量、低风险物体开始,并记录碰撞、抓取失败和人类接管次数。只有在不同房型和未知家具上保持稳定,ESRP里的长程规划能力才可能转成可用的家务功能。
数据层也可加入语言约束,例如保留通道、不要遮挡插座或把常用物品放在可达高度。目标布局若只追求几何一致,可能生成不方便居住的房间;把功能和安全规则写入评分,才能衡量机器人是否真正理解重排目的。
同一目标若存在多种合理布局,评分也应允许等价解,而非只认一张标准图。
参考资料
https://bit-pie.github.io/ESRP/
https://arxiv.org/abs/2608.27371