A Granular Study of Safety Pretraining under Model Abliteration
机构 * Data and Web Science Group, University of Mannheim(曼海姆大学数据与网络科学组) ; Vision and AI Lab, Indian Institute of Science(印度科学院视觉与人工智能实验室) ; Carnegie Mellon University(卡内基梅隆大学) ; Max-Planck-Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息校园)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.LG;LLM(comments)
Comments Accepted at NeurIPS 2025 bWorkshop Lock-LLM. *Equal Contribution