复旦大学、北京智源人工智能研究院、清华大学和中国人民大学提出SLIM,一个只有0.47B参数的机器人操作策略。它不用大型多模态骨干每个控制步都重做开放域理解,而是学习与动作和状态变化紧密相关的紧凑潜表示。
在单张H100、BF16和PyTorch eager设置下,SLIM每个动作块推理延迟60.6毫秒,峰值增量显存4.26GiB,计算490.73 GFLOPs。Fast-WAM的延迟为360.6毫秒,显存13.63GiB。
不预测所有像素,只保留对操作有用的变化
大型VLA模型把视觉、语言和动作统一在大骨干中,但连续操作时,大量开放世界语义并不会在每个控制周期改变。像素世界模型又需要生成背景纹理、光照等与控制无关的细节。
SLIM的自监督目标同时做两件事:根据动作预测未来潜状态,以及根据观察变化重建造成它的动作。模型因此必须记住物体、夹爪和二者的交互,而不是把容量花在完整画面重建上。
SLIM以紧凑潜交互模型完成多类桌面操作,不额外使用具身预训练。
观测Token和动作Token在两条流中交互
架构使用Mixture-of-Transformers,观测潜变量与动作Token由不同路径处理,再在关键层交换信息。第一阶段做遮盖轨迹预测,让表示同时具有反向动力学和前向动力学信息;第二阶段用流匹配学习语言条件下的动作生成。
SLIM把观测潜变量和动作Token分流建模,再通过交互层对齐。
注意力可视化显示,SLIM在操作进程中更稳定地追踪目标物、夹爪和接触区域;去掉第一阶段的策略更容易把注意力分散到背景。
0.47B模型在LIBERO拿到97.5%总成功率
原始LIBERO比较中,SLIM总成功率为97.5%,与7B的RIPT-VLA持平,接近6B Fast-WAM的97.6%。CALVIN长序列任务中,SLIM平均完成长度4.556,高于表中多个VLA和世界动作模型。
SLIM在实机任务中连续估计操作进度,并输出动作块。
团队还设置相机、机器人、语言、光照、背景噪声和布局变化。SLIM在这组测试的总成功率为77.45%,展示了紧凑表示的外推能力;其中对机器人外观变化的表现相对较弱,说明轻量策略仍需要更广泛的实机验证。
分项结果能看出紧凑表示的优势与边界。SLIM在相机变化下得分70.73%,光照变化下92.01%,背景噪声下86.07%,布局变化下83.21%;机器人形态变化下为36.90%。这符合其训练目标:模型对观测与动作的局部对齐很敏感,但换了机器人本体后,原有动作与画面变化的对应关系也会改变。
在CALVIN长序列中,评测不只看单个任务是否完成,还统计连续完成1到5个任务的比例。SLIM完成第一项的比例为99.3%,连续完成五项仍为80.2%,平均长度4.556。这类连续任务会累积早期操作误差,因此比单次抓取更能检查策略是否在多步交互中保持状态。
效率表的三个指标也应分开理解。60.6毫秒是模型生成一个动作块的平均延迟,4.26GiB是相对测量基线增加的峰值显存,490.73 GFLOPs则是每个动作块的理论计算量。三者同时下降,才说明轻量化没有只把开销从一个环节转移到另一个环节。
下一步走向低延迟边缘部署
实机闭环还需要检查动作块长度与反应速度的取舍:一次输出更多动作可以减少模型调用,但环境如果在中途发生变化,策略也要更晚才能重新观察并纠正。
小参数、4.26GiB峰值增量显存和60.6毫秒模型延迟,使SLIM比多个大型VLA更接近机器人本地闭环控制的资源预算。这些数字仍是单张H100上的受控测量,端到端控制还包括感知输入、动作下发和机器人本体延迟。
实机OOD测试改变光照、背景、干扰物和机器人条件。
后续如果能在嵌入式GPU、不同机械臂和更长任务中保持成功率,这种不重建无关像素的思路可以成为轻量通用操作策略的一条实用路线。