Efficient Exploration at Scale
大规模高效探索
机构 * Google(谷歌) ; DeepMind(深度思维)
AI总结 本文提出一种在线学习算法,通过增量更新奖励和语言模型提升强化学习从人类反馈中的数据效率,采用小幅度正向激励、信念神经网络和信息导向探索等机制,实验表明在少于20k标签下达到200k标签的性能,预计1M标签可匹配1B标签的性能。
大厂专区
大规模高效探索
机构 * Google(谷歌) ; DeepMind(深度思维)
AI总结 本文提出一种在线学习算法,通过增量更新奖励和语言模型提升强化学习从人类反馈中的数据效率,采用小幅度正向激励、信念神经网络和信息导向探索等机制,实验表明在少于20k标签下达到200k标签的性能,预计1M标签可匹配1B标签的性能。
基于验证器的免更新在线策略引导
机构 * University of Toronto(多伦多大学) ; Google DeepMind(谷歌DeepMind) ; University of Alberta(阿尔伯塔大学) ; UTAustin(得克萨斯大学奥斯汀分校) ; Harvard University(哈佛大学)
AI总结 提出UF-OPS方法,利用策略评估中的验证器函数引导基础策略选择高成功概率动作,无需更新参数即可提升黑箱扩散策略性能,在5个真实任务中平均成功率提升49%。
Comments 11 pages, 5 figures