Measuring Taiwanese Mandarin Language Understanding
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
Comments Preprint. Under review
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
Comments Preprint. Under review
专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI
专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL
Comments Accepted at LREC-COLING 2024
专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL
专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL
Comments Accepted by LREC-COLING 2024
专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL
专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments 31 pages, 17 figures
专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL
专题命中 推理评测 :chain-of-thought(abstract);planning(abstract);分类 cs.CL
Comments In EACL 2024
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL
Comments Project: https://open-compass.github.io/T-Eval
专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments Technical report. 13 pages. Demo: https://speechtranslation.github.io/llm-st/
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
Comments Accepted by NeurIPS 2023 Track on Datasets and Benchmarks
专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL
Comments Work in progress
专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.LG
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL
Comments 6 pages, 4 figures. The video and code of LoHoRavens are available at https://cisnlp.github.io/lohoravens-webpage/
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
Comments Findings of EMNLP 2023
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
Comments Accepted by NeurIPS2023. The code and data are available at https://github.com/Leezekun/Directional-Stimulus-Prompting
专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments EMNLP 2023 findings (short paper). Code: https://github.com/d223302/A-Closer-Look-To-LLM-Evaluation/
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
Comments 10 pages, 3 figures
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
Comments To appear in the Proceedings of the 14th International Conference on Computational Creativity (ICCC)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL
Comments ACL 2022
专题命中 推理评测 :reasoning(abstract,comments);分类 cs.CL、cs.AI、cs.LG
Comments 15 pages, 5 tables, 4 figures; full research paper currently under review for the Workshop on Information Technologies and Systems (WITS) 2025. The paper presents a comprehensive evaluation of large language models (LLMs) for business process model analysis and optimization, including error detection, reasoning, and scenario-based redesign
机构 * University of Washington(华盛顿大学) ; Stanford University(斯坦福大学)
专题命中 推理评测 :reasoning(abstract,comments);分类 cs.CL、cs.AI;planning(comments)
Comments Published in the XLLM-Reason-Plan Workshop on the Application of LLM Explainability to Reasoning and Planning at COLM 2025
Journal ref Proceedings of the XLLM-Reason-Plan Workshop, Conference on Language Modeling (COLM) 2025