Liars' Bench: Evaluating Lie Detectors for Language Models
说谎的检验台:评估语言模型的说谎检测器
机构 * Cadenza Labs(Cadenza实验室) ; FZI(弗劳恩霍夫研究所) ; University of Cambridge(剑桥大学)
AI总结 本文提出LIARS' BENCH,通过多个数据集和模型生成72,863个谎言和诚实响应,评估三种谎言检测技术,揭示现有方法在识别特定类型谎言上的局限性。
Comments *Kieron Kretschmar and Walter Laurito contributed equally to this work. 10 pages, 2 figures; plus appendix. Code at https://github.com/Cadenza-Labs/liars-bench and datasets at https://huggingface.co/datasets/Cadenza-Labs/liars-bench Subjects: Computation and Language (cs.CL); Artificial Intelligence (cs.AI)