Language Models Are Capable of Metacognitive Monitoring and Control of Their Internal Activations
机构 * Neurosciences Graduate Program University of California San Diego(加州大学圣地亚哥分校神经科学研究生项目) ; School of Psychology Georgia Tech(佐治亚理工学院心理学系) ; Department of Psychology New York University(纽约大学心理学系) ; Department of Neurobiology University of California San Diego(加州大学圣地亚哥分校神经生物学系)
专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI