Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning
可检测边界处的后训练:一种用于微调的博弈论方法
机构 * University of California, Berkeley(加州大学伯克利分校) ; Inria(法国国家信息与自动化研究所) ; École Normale Supérieure(巴黎高等师范学院)
AI总结 该研究提出博弈论框架解决RL微调中KL正则化系数设置问题,将均衡系数归约为KL正则化RL目标,在Qwen3-8B等模型实验中实现良好奖励-保留权衡,可用于审计开源模型API提供商。