Recurrent-Depth VLA: Implicit Test-Time Compute Scaling of Vision-Language-Action Models via Latent Iterative Reasoning
递归深度VLA:通过潜在迭代推理实现视觉-语言-动作模型的隐式测试时计算扩展
机构 * Stanford University(斯坦福大学) ; Technical University of Munich(慕尼黑技术大学) ; University of Washington(华盛顿大学) ; Allen Institute for Artificial Intelligence(人工智能研究院)
专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);分类 cs.RO
AI总结 RD-VLA通过潜在迭代推理实现视觉-语言-动作模型的隐式测试时计算扩展,提供恒定内存使用和高达80倍的推理加速。
Comments 11 Pages, Project page:https://rd-vla.github.io/