OPDSearch+: On-Policy Distillation with RL Refinement for Search-Augmented Reasoning
OPDSearch+:用于搜索增强推理的带RL优化的在线策略蒸馏
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Macau(澳门大学) ; Wuhan University(武汉大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Northwestern Polytechnical University(西北工业大学) ; University of Hong Kong(香港大学)
AI总结 OPDSearch+是无需教师微调的搜索增强推理蒸馏范式,利用冻结的现成指令模型分两阶段优化3B模型,在7个QA基准上优于所有3B RL基线,HotpotQA和2WikiMultihopQA分别提升13.1%、8.5%。
Comments 9 pages, 4 figures