When Do Supervised UQ Ensembles Improve LLM Hallucination Detection? A Robustness Study
当监督式不确定性量化集成能提升大语言模型幻觉检测性能?一项鲁棒性研究
机构 * CVS Health(CVS健康公司)
专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究监督式UQ集成对LLM幻觉检测的鲁棒性,在多模型、多数据集、多生成范式下分析其性能,发现其多数场景优于单个评分器,采样黑盒集成效果接近全集成。