Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)
专题命中 安全训练 :alignment(abstract);分类 cs.LG