JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation
JudgeBoard: 对小语言模型进行推理评估的基准测试与增强
专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)
AI总结 JudgeBoard通过多代理框架提升小语言模型的推理判断能力,展示其在数学和常识推理任务中与大模型相当的性能。
Comments 23 pages, 4 figures