Post-hoc Reward Calibration: A Case Study on Length Bias
机构 * University of Edinburgh(爱丁堡大学) ; Alibaba Group(阿里巴巴集团) ; INF Technology(INF技术) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)
Comments ICLR 2025