Model Tampering Attacks Enable More Rigorous Evaluations of LLM Capabilities
机构 * University of Maryland(马里兰大学) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; UK AI Security Institute(英国人工智能安全研究所) ; University of Toronto(多伦多大学) ; Northeastern University(东北大学) ; Haize Labs(Haize实验室) ; Dalhousie University(达尔豪斯大学) ; University of Waterloo(滑铁卢大学) ; University of Oxford(牛津大学) ; MIT(麻省理工学院)
Comments Accepted to TMLR