arXivDaily arXiv每日学术速递 周一至周五更新

作者

Graham Neubig

Natural Language Processing

2026-06-23 至 2026-06-23 共收录 1
2606.21795 2026-06-23 cs.LG 新提交

Discretizing Reward Models

离散化奖励模型

Vijay Viswanathan, Shiqi Wang, Devamanyu Hazarika, Chirag Nagpal, Tongshuang Wu, Graham Neubig, Yuning Mao

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta Superintelligence Labs(Meta超级智能实验室)

AI总结 针对奖励模型过度敏感导致策略不佳的问题,提出一种基于蒙特卡洛dropout的无训练离散化算法,在保持判别能力的同时降低过度敏感性,减少奖励黑客行为并提升策略效果。

详情

展开后加载摘要…

URL PDF HTML 收藏