Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration
Search-R2: 通过演员-细化协作提升搜索集成推理
机构 * The Chinese University of Hong Kong(香港中文大学) ; LLM Department, Tencent(腾讯语言模型部门) ; Mohamed bin Zayed University of Artificial Intelligence(马尔代夫人工智能大学) ; McGill University(麦吉尔大学) ; City University of Hong Kong(香港城市大学) ; The University of Edinburgh(爱丁堡大学)
AI总结 Search-R2通过演员-细化协作框架提升搜索集成推理,通过针对性干预和混合奖励设计,在多种QA数据集上超越强基线,实现更优的推理准确性。