Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL
机构 * UC Berkeley(伯克利大学) ; University of Oxford(牛津大学) ; University of Washington(华盛顿大学) ; UK AI Security Institute(英国人工智能安全研究所) ; Google DeepMind(谷歌DeepMind)
作者
Robotics / Reinforcement Learning
机构 * UC Berkeley(伯克利大学) ; University of Oxford(牛津大学) ; University of Washington(华盛顿大学) ; UK AI Security Institute(英国人工智能安全研究所) ; Google DeepMind(谷歌DeepMind)