VAM: Verbalized Action Masking for Controllable Exploration in RL Post-Training -- A Chess Case Study
VAM:在RL后训练中可控探索的可言行动屏蔽——国际象棋案例研究
机构 * Carnegie Mellon University(卡内基梅隆大学) ; King's College London(国王学院伦敦)
专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 VAM通过可言化动作屏蔽提升LLM后训练强化学习的探索效率,在国际象棋中验证了其有效性。