A Survey on Rubric-Guided Reinforcement Learning for Language Models
面向语言模型的准则引导强化学习综述
机构 * WeChat, Tencent(腾讯微信)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 该综述针对传统RLHF的缺陷,提出贝叶斯框架并沿先验-后验轴分类准则引导强化学习,分析语言学相关对齐问题,明确未来研究方向。
Comments Accepted to Findings of EMNLP 2026