Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models
通过在线自我博弈强化学习追踪移动目标以实现更安全的语言模型
AI总结 研究传统大语言模型安全对齐问题,引入Self-RedTeam算法,通过在线自我博弈多智能体强化学习持续共同进化攻防策略,有理论安全保障,实证效果好,推动从被动修补到主动协同进化转变。
Comments ICML 2026 Poster
作者
Natural Language Processing
通过在线自我博弈强化学习追踪移动目标以实现更安全的语言模型
AI总结 研究传统大语言模型安全对齐问题,引入Self-RedTeam算法,通过在线自我博弈多智能体强化学习持续共同进化攻防策略,有理论安全保障,实证效果好,推动从被动修补到主动协同进化转变。
Comments ICML 2026 Poster