T-FIX: Text-Based Explanations with Features Interpretable to eXperts
T-FIX:基于文本的可解释性方法,具备可解释的专家特征
机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) ; Department of Computer Science, University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) ; Department of Physics and Astronomy, University of Pennsylvania(宾夕法尼亚大学物理与天文学系) ; Flatiron Institute(Flatiron研究所) ; Department of Surgery, Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院外科系) ; Division of Pulmonary, Allergy, and Critical Care, Perelman School of Medicine, University of Pennsylvania(宾夕菲亚大学佩雷尔曼医学院呼吸、过敏与危重医学科) ; Division of Cardiovascular Medicine, Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院心血管医学科) ; Department of Surgery, University of Toronto(多伦多大学外科系) ; University Health Network(大学健康网络)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出T-FIX框架,用于评估LLM生成的解释是否符合专家的推理方式,通过七个科学任务和三个领域进行验证,实现了自动且可定制的专家对齐评估。