北京大学、北京航空航天大学和京东科技联合提出AppliancePlan,让机器人结合说明书、当前画面和操作状态规划家电任务。团队构建覆盖22类家电的数据集;论文报告,7B模型在RealAppliance-Bench开放规划上超过最佳基线10倍以上,并在6种真实家电上测试仿真到现实迁移。
操作家电不是识别一个按钮就结束。制作饮品可能包含开盖、加料、关盖、选择模式和启动,门被物体挡住或按钮状态变化后还要调整顺序。通用大模型通常缺少家电零件、说明书步骤和异常恢复相互对应的训练数据。
从说明书自动合成三类训练任务
团队设计MAGE数据合成流水线,先把说明书整理成分层家电图,将整机、部件、可操作区域和状态变化连接起来,再生成零件定位、长流程规划与闭环恢复样本。相比纯人工标注,这种结构可快速扩展到不同型号。
MAGE从家电说明书和结构信息生成定位、规划与恢复数据。
最终的UseAppliance数据集包含22类家电、超过8.9万个部件标注、5.3万项操作任务和3.3万条闭环调整步骤。数据不只告诉模型正常情况下怎么做,还加入门受阻、目标状态不符等变化,让策略学习重新观察并修改计划。
7B模型同时处理零件、顺序和异常恢复
AppliancePlan输入说明书、图像和任务,将零件定位与序列规划放进一套端到端模型。它需要把文字中的“控制面板”“水箱”对应到当前家电画面,再结合已有状态决定下一步,而不是输出一段无法落地的通用操作建议。
AppliancePlan统一处理说明书理解、部件定位和长流程动作规划。
RealAppliance-Bench分别检查开放规划、部件定位、顺序规划和闭环调整。论文称7B版本在开放规划指标上超过最佳基线10倍,并在各任务上取得更高结果。10倍只对应论文基准中的开放规划,不代表真实家庭总体成功率提高10倍。
真机测试覆盖6种家电与人为干扰
团队把策略部署到6种真实家电,展示触控面板、咖啡机和烹饪设备等操作。案例中,机器人遇到门体干涉或按钮状态变化后重新规划,而不是继续机械执行原始序列。
真实机器人在家电操作中处理面板、门体和按钮干扰。
这些实验确认模型可以把说明书知识迁移到真实视觉和机械臂动作,但环境仍经过布置,家电数量也远少于数据集覆盖的22类。透明部件、狭小空间、触觉反馈和不同品牌的交互差异,都会给开放家庭部署增加难度。
UseAppliance的价值不只在样本数量,还在三类任务之间存在共同结构。零件定位告诉模型“操作谁”,顺序规划决定“先做什么”,闭环调整则处理“环境变化后怎么办”。如果三部分分别训练,定位误差很容易传到后续而无人修正;统一建模至少让模型有机会在新观察出现后更新步骤。
说明书本身也不是绝对可靠的现实状态描述。用户可能已经拆下托盘、放入不同容器,老旧设备的按钮标识也会磨损。论文通过视觉输入和干扰案例检验重新规划,但尚未覆盖儿童、宠物或多人同时进入操作区等安全情形。真正部署时,制造商说明书、实时传感器和硬件安全联锁必须共同约束模型。
“超过最佳基线10倍”尤其需要放回指标语境:它反映开放规划任务上原有方法得分较低,而AppliancePlan取得显著提升,不意味着每台家电都能十倍更快或十倍更安全。消费者场景最终还要看整条任务成功率、误操作率、恢复次数和跨品牌泛化。
家电案例展示模型根据当前状态修改后续步骤。
先从可验证的半结构化场景落地
家电说明书天然提供操作边界和状态条件,适合构建可检查的机器人任务。餐饮后厨、实验室设备和标准化工位都具有类似特点:设备种类有限、流程较长,但每一步可以通过传感器或界面状态确认。
下一步需要把计划与低层动作控制更紧密连接,并增加错误检测、安全联锁和人工接管。若系统只能生成正确步骤,却不能确认旋钮是否真的转到位,长流程仍会在物理执行端累积误差。