What to Ignore, What to React: Visually Robust RL Fine-Tuning of VLA Models
忽略什么,反应什么:视觉鲁棒的VLA模型强化学习微调
机构 * Hong Kong University of Science and Technology(香港理工大学) ; Microsoft Research Asia(微软亚洲研究院) ; Zhejiang University(浙江大学)
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO
AI总结 本文提出PAIR-VLA框架,通过在PPO优化中加入两个辅助目标,提升VLA模型在视觉变化下的鲁棒性,实验表明其在不同视觉扰动下均优于标准PPO。