Can We Predict Alignment Before Models Finish Thinking? Towards Monitoring Misaligned Reasoning Models
机构 * Brown University(布朗大学)
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Brown University(布朗大学)
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * University of Pisa(比萨大学) ; Huawei RAMS Lab(华为RAMS实验室) ; Technical University of Munich(慕尼黑技术大学) ; Technical University of Berlin(柏林技术大学) ; University of Manchester(曼彻斯特大学) ; University of Modena and Reggio Emilia(莫德纳和雷吉奥艾米利亚大学)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
机构 * Google Cloud AI Research(谷歌云人工智能研究) ; Google DeepMind(谷歌DeepMind)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
Comments 22 pages
机构 * OpenAI
专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
机构 * King Abdullah University of Science and Technology(卡布斯大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments preprint - under review
机构 * Université de Montréal(蒙特利尔大学) ; Mila(Mila研究所) ; Technical University of Munich(慕尼黑技术大学) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 安全训练 :safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 15 pages, 6 figures
专题命中 安全训练 :alignment(abstract);trustworthy(abstract)
机构 * Purdue University(普渡大学) ; Columbia University(哥伦比亚大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI