TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
TReB:评估大语言模型表格推理能力的综合基准
机构 * JIUTIAN Research(天研机构)
AI总结 针对大语言模型处理表格数据推理能力评估基准缺失的问题,提出TReB基准,用分类法涵盖26个子任务,经数据处理构建高质量数据集,设计含三种推理模式的评估框架,揭示现有模型在表格任务上有改进空间,且数据和框架均公开。
Comments published by SIGIR 2026
Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval, 2026, 3267-3275