AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
你的强化学习奖励函数是你的最佳搜索PRM:统一强化学习与基于搜索的文本生成
机构 * Rutgers University(新泽西州立大学) ; Nanyang Technological University(南洋理工大学) ; University of Connecticut(康涅狄格大学) ; Fudan University(复旦大学) ; NVIDIA Research(NVIDIA研究) ; Red Hat AI Innovation(红帽AI创新) ; MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 本文提出AIRL-S,通过强化学习与搜索技术的统一,利用奖励函数直接学习动态PRM,提升推理链扩展和跨任务泛化能力,实验显示性能提升9%并优于基线PRM。