Large Language Models in the Clinic: A Comprehensive Benchmark
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
Comments Accepted at EMNLP 2024 Main Conference
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
Comments Accepted at EMNLP 2024 Main Conference
专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments 13 pages, 6 figures
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
Comments Presented at NeLaMKRR@KR, 2024 (arXiv:2410.05339)
专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG
Comments SPAICE Conference 2024 (7 pages)
Journal ref Proceedings of SPAICE 2024, pp. 430-436
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
Journal ref Proceedings of the 33rd ACM International Conference on Information and Knowledge Management (CIKM '24), October 21--25, 2024, Boise, ID, USA
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
Comments EMNLP 2024 Findings
专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI
Comments EMNLP 2024
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
Comments Accepted by EMNLP 2024 Main
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
Comments 32 pages, 5 figures
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
Comments Accepted by NeurIPS 2024
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
Comments Accepted to NeurIPS 2024 (Benchmark Track, Spotlight)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
Comments EMNLP Findings 2024
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
Journal ref ICML Humans, Algorithmic Decision-Making and Society: Modeling Interactions and Impact Workshop 2024
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
Comments EMNLP 2024 Main. We release our code and data publicly at https://github.com/MozerWang/Loong
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
Comments preprint - 39 pages
Journal ref 1st Conference on Language Modeling (COLM 2024)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
Comments AI Trustworthiness and Risk Assessment for Challenged Contexts (ATRACC) AAAI 2024 Fall Symposium
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
Journal ref LLMs4MI 2024 @FLLM 2024, IEEE, Nov 2024, Dubai, United Arab Emirates
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments EMNLP 2024: Camera-ready version
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
Comments ICML 2024 Workshop on Large Language Models and Cognition
专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI
Comments 25 pages,4 figures
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
Comments Accepted at EMNLP 2024 Main. The dataset and code are available at https://github.com/chen-zichen/XplainLLM_dataset.git
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
Comments EMNLP 2024 Main
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG