AR-BENCH: Benchmarking Legal Reasoning with Judgment Error Detection, Classification and Correction
AR-BENCH:通过判决错误检测、分类和纠正进行法律推理基准测试
机构 * SKLCCSE Beihang University(北京航空航天大学软件学院) ; SCCE University of Science and Technology Beijing(北京科技大学计算机学院) ; Sino-French Engineer School Beihang University(北京航空航天大学中法工程师学院) ; People’s Procuratorate of Beijing Municipality(北京市人民检察院)
AI总结 AR-BENCH通过构建基准数据集和评估14个大语言模型,揭示现有模型在法律判决错误识别上的局限性,旨在提升法律推理的诊断能力和可靠性。