arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Anthropic

2026-08-27 至 2026-08-27 共收录 1
2608.25460 2026-08-27 cs.AI cs.LG 新提交

Training Alignment Auditors via Reinforcement Learning

通过强化学习训练对齐审计员

Paul Rosu, Rowan Wang

机构 * Anthropic

AI总结 本研究用强化学习训练LLM审计员,通过成对奖励等优化提升审计质量与真实性,误报率低于1%,且审计能力可跨框架泛化。

Comments 82 pages, 15 figures. Code, prompts, and evaluation data are available at this https URL (https://github.com/paulrosu11/training-auditing-agents-public)

详情

展开后加载摘要…

URL PDF HTML 收藏