Why Pass@k Optimization Can Degrade Pass@1: Prompt Interference in LLM Post-training
为何Pass@k优化会损害Pass@1:LLM微调中的提示干扰
机构 * Singapore University of Technology and Design(新加坡科技设计大学) ; University of Maryland, College Park(马里兰大学学院公园分校) ; University of Central Florida(佛罗里达中央大学)
AI总结 该研究揭示了在LLM微调中,pass@k优化可能损害pass@1的原因,通过梯度冲突和提示干扰机制,提出了理论解释并验证了实验结果。
Comments updated related work discussion