Robust Code RL via Faulty-Code-Driven Test case Synthesis and Dense Reward Shaping
基于故障代码驱动的测试用例合成与密集奖励塑造的鲁棒代码强化学习
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团)
专题命中 测试生成 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 该研究提出RobustTests框架,通过故障代码驱动的测试用例合成与密集奖励塑造,实现RL微调的Qwen3-32B在LiveCodeBench上较基线方法获绝对3%性能提升,增强了LLM代码生成能力。
Comments Accepted by EMNLP 2026