Learn from Your Mistakes: Tree-like Self-Play for Secure Code LLMs
从错误中学习:面向安全代码LLM的树状自博弈
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 提出树状自博弈(TSP)框架,将安全代码生成建模为细粒度序列决策过程,通过构建决策树探索安全与脆弱路径,使模型在关键决策节点自我纠正,显著提升代码安全性并实现跨语言泛化。
Comments 18 pages, 3 figures, Accepted by ICML 2026