From Refuse to Richness: Rubric Rewards for Long-Form Hallucination Reinforcement Learning
从拒答到丰富:用于长文本幻觉强化学习的评分规则奖励
机构 * Peking University(北京大学) ; Xiaomi(小米)
AI总结 该研究针对长文本幻觉强化学习的「拒答-丰富度」权衡,提出用关键要点评分规则定义奖励,发现软组合依据、评分规则覆盖率与相关性的奖励能实现最佳平衡,提升了依据性与分布外迁移能力。