Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination
推理还是记忆?由于数据污染导致强化学习不可靠的结果
专题命中 隐私与版权 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文发现Qwen2.5系列模型易受数据污染影响,通过生成清洁算术问题验证了准确奖励信号对数学推理性能的提升作用
Comments 28 pages, AAAI 2026