Update-Free On-Policy Steering via Verifiers
基于验证器的免更新在线策略引导
机构 * University of Toronto(多伦多大学) ; Google DeepMind(谷歌DeepMind) ; University of Alberta(阿尔伯塔大学) ; UTAustin(得克萨斯大学奥斯汀分校) ; Harvard University(哈佛大学)
AI总结 提出UF-OPS方法,利用策略评估中的验证器函数引导基础策略选择高成功概率动作,无需更新参数即可提升黑箱扩散策略性能,在5个真实任务中平均成功率提升49%。
Comments 11 pages, 5 figures