EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving
EngiBench:用于评估大型语言模型在工程问题解决上的基准
机构 * Nanyang Technological University(南洋理工大学) ; The University of Sydney(悉尼大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院) ; The University of Hong Kong(香港大学) ; Hong Kong Polytechnic University(香港理工大学) ; AIRS
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI
AI总结 EngiBench是一个分层基准,用于评估大型语言模型在解决工程问题上的能力,涵盖基础知识检索、情境推理和开放性建模三个层次,揭示当前LLM在现实工程中仍缺乏高级推理能力。
Comments Accepted at ACL 2026 Findings