SR-GRPO: Stable Rank as an Intrinsic Geometric Reward for Large Language Model Alignment
SR-GRPO:稳定秩作为大语言模型对齐的内在几何奖励
机构 * The Hong Kong University of Science and Technology(香港理工大学)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 SR-GRPO通过稳定秩作为内在几何奖励信号,无需外部监督提升大语言模型对齐性能。