MixRea: Benchmarking Explicit-Implicit Reasoning in Large Language Models
MixRea: 在大型语言模型中评估显式-隐式推理的基准测试
机构 * DeepMind ; DeepSeek-AI ; Anthropic ; Qwen ; Touvron ; Team
AI总结 本文提出MixRea基准测试,用于评估大型语言模型在显式和隐式推理任务中的表现,发现即使最佳模型也存在注意力不足的问题,并提出PRCP方法来改进推理能力。
Comments 12 pages, 6 figures, 4 tables