Active Slice Discovery in Large Language Models
大语言模型中的主动切片发现
机构 * University of Waterloo(多伦多大学) ; New York University(纽约大学)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出主动切片发现方法,通过主动学习算法有效识别大语言模型中的错误切片,提升毒性分类的准确性。
Comments Accepted for presentation at NeurIPS 2025 - Reliable ML Workshop