arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Google(谷歌)

2026-08-24 至 2026-08-24 共收录 2
2603.17378 2026-08-24 cs.LG cs.AI 版本更新

Efficient Exploration at Scale

大规模高效探索

Seyed Mohammad Asghari, Chris Chute, Vikranth Dwaracherla, Xiuyuan Lu, Mehdi Jafarnia, Victor Minden, Zheng Wen, Benjamin Van Roy

机构 * Google(谷歌) DeepMind(深度思维)

AI总结 本文提出一种在线学习算法,通过增量更新奖励和语言模型提升强化学习从人类反馈中的数据效率,采用小幅度正向激励、信念神经网络和信息导向探索等机制,实验表明在少于20k标签下达到200k标签的性能,预计1M标签可匹配1B标签的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10282 2026-08-24 cs.RO 版本更新

Update-Free On-Policy Steering via Verifiers

基于验证器的免更新在线策略引导

Maria Attarian, Ian Vyse, Jasper Gerigk, Evgenii Opryshko, Yifan Ruan, Anas Almasri, Sumeet Singh, Yilun Du, Igor Gilitschenski, Claas Voelcker

机构 * University of Toronto(多伦多大学) Google DeepMind(谷歌DeepMind) University of Alberta(阿尔伯塔大学) UTAustin(得克萨斯大学奥斯汀分校) Harvard University(哈佛大学)

AI总结 提出UF-OPS方法,利用策略评估中的验证器函数引导基础策略选择高成功概率动作,无需更新参数即可提升黑箱扩散策略性能,在5个真实任务中平均成功率提升49%。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏