$π_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models
$π_\ exttt{RL}$: 流基于视觉-语言-动作模型的在线强化学习微调
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Carnegie Mellon University(卡内基梅隆大学) ; Infinigence AI ; Zhongguancun Academy(中关村学院)
AI总结 本文提出$π_\ exttt{RL}$方法,通过流噪声和流SDE技术,解决大规模流基于VLA模型中强化学习微调的挑战,提升模型在分布内和分布外任务中的性能。