RotVLA: Rotational Latent Action for Vision-Language-Action Model
RotVLA: 旋转的潜在动作用于视觉-语言-动作模型
机构 * Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学) ; Xiaomi Robotics(小米机器人) ; CASIA
AI总结 RotVLA提出基于连续旋转潜在动作表示的VLA框架,通过三元组帧学习和流匹配头实现高效动作建模,实现98.2%的LIBERO和89.6%/88.5%的RoboTwin2.0性能。