Training Alignment Auditors via Reinforcement Learning
通过强化学习训练对齐审计员
机构 * Anthropic
AI总结 本研究用强化学习训练LLM审计员,通过成对奖励等优化提升审计质量与真实性,误报率低于1%,且审计能力可跨框架泛化。
Comments 82 pages, 15 figures. Code, prompts, and evaluation data are available at this https URL (https://github.com/paulrosu11/training-auditing-agents-public)