Benchmarking Reward Hack Detection in Code Environments via Contrastive Analysis
通过对比分析在代码环境中基准测试奖励黑客检测
专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 本文通过对比分析提出了一种涵盖54类的奖励利用分类法,并引入TRACE基准测试,展示模型在对比设置中对奖励黑客的检测效果优于孤立分类设置。
Comments Dataset: https://huggingface.co/datasets/PatronusAI/trace-dataset