How does information access affect LLM monitors' ability to detect sabotage?
信息访问如何影响大语言模型监视器检测破坏行为的能力?
机构 * Aether Research(Aether研究机构) ; Vector Institute(Vector研究所) ; Trajectory Labs(Trajectory实验室) ; University of Toronto(多伦多大学) ; Imperial College London(伦敦帝国学院)
AI总结 本文研究了信息访问对大语言模型监视器检测破坏行为的影响,提出了一种新的分层监控方法EaE,通过提取和评估被监视代理的轨迹片段来提升检测效果。
Comments 54 pages, 34 figures, 7 tables