PROF: An LLM-based Reward Code Preference Optimization Framework for Offline Imitation Learning
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)
专题命中 后训练与偏好优化 :LLM(title);preference optimization(title);large language model(abstract);language model(abstract)