dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models
dVLA-RL:基于去噪轨迹的强化学习用于离散扩散视觉-语言-动作模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Baidu AI Cloud D-Robotics Shanghai AI Laboratory(百度AI云D-机器人上海人工智能实验室)
AI总结 提出dVLA-RL方法,将离散扩散VLA模型的强化学习目标从边缘动作概率转移到采样生成路径的联合概率,通过将去噪过程建模为马尔可夫决策过程,实现变步长调度,在LIBERO上达到99.7%成功率,在RoboTwin 2.0上相比SFT提升30.6%。