Instruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned Policy
基于非对称强化学习与自蒸馏的指令条件探索
机构 * University of Southampton(南安普顿大学)
AI总结 该研究针对LLM强化学习中的探索挑战,提出指令条件探索(ICE)方法,结合非对称RL/SD训练目标,使Qwen3-1.7B数学推理性能提升5.0%且长上下文下仍有效。
Comments Submitted to ACL Rolling Review (ARR) May 2026 cycle. OpenReview submission record at https://openreview.net/forum?id=PV945lekMa