Shaping Explanations: Semantic Reward Modeling with Encoder-Only Transformers for GRPO
机构 * AI Sparks(AI火花) ; University of Graz(格拉茨大学) ; Foyer Group(Foyer集团) ; Onepix Academy(Onepix学院)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)