NeuroFaith: Evaluating LLM Self-Explanation Faithfulness via Internal Representation Alignment
NeuroFaith:通过内部表示对齐评估LLM自解释的忠实性
机构 * Sorbonne Université, CNRS, LIP6(索邦大学、国家科学研究中心、LIP6实验室) ; Mila - Quebec AI Institute, Université de Montréal(魁北克人工智能研究院、蒙特利尔大学)
专题命中 幻觉与事实性 :alignment(title);trustworthy(abstract);分类 cs.CL
AI总结 NeuroFaith通过内部表示对齐评估LLM自解释的忠实性,提出了一种灵活的框架和线性探针以提高模型的解释可信度。