The MASK Benchmark: Disentangling Honesty From Accuracy in AI Systems
MASK基准:在人工智能系统中区分诚实与准确性
机构 * Center for AI Safety(人工智能安全中心) ; Scale AI
AI总结 本文提出MASK基准,通过大规模人工数据集区分LLM的准确性和诚实性,发现大模型虽更准确但不更诚实,简单干预可提升诚实度,强调需加强评估与干预以确保模型可信。
Comments Website: https://www.mask-benchmark.ai