Efficient Performance Tracking: Leveraging Large Language Models for Automated Construction of Scientific Leaderboards
专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL
专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI
Comments ACL 2024
专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL
Comments arXiv admin note: text overlap with arXiv:2408.03062
专题命中 评测与基准 :language model(title,abstract);small language model(title);分类 cs.LG
专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL
Comments 36 pages, 6 figures, 13 tables (ACL 2024 Findings)
专题命中 评测与基准 :large language model(title);language model(title);prompting(abstract);分类 cs.CL
Comments NAACL 2024 Main track long paper
专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL
Comments LREC-COLING 2024
专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL
Comments Accepted by ACL 2024
专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL
Comments 40 pages, 35 figures and 34 tables
专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI
Comments 1 figure
专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL
Comments NAACL 2024 (Findings)
专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI
Comments 10 pages
专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL
专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI
Comments Pre-print of the paper submitted to the Call for Papers for the Special Focus Issue on ChatGPT and Large Language Models (LLMs) in Biomedicine and Health at the Journal of the American Medical Informatics Association: https://academic.oup.com/jamia/pages/call-for-papers-for-special-focus-issue
专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI
专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL
Comments Work in progress
专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL
Comments 13 pages
专题命中 评测与基准 :large language model(title);language model(title);prompting(abstract);分类 cs.CL
Comments NLPCC 2023
专题命中 评测与基准 :foundation model(title,abstract);prompting(title);分类 cs.AI
Comments 12 pages, 3 figures, Accepted in ICIAP2023, AI4DH workshop
专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL
专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL
Comments ACL 2023 camera ready, final title change
专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL
专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL
Comments Accepted to EMNLP 2022
专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL
Comments 29 pages, EMNLP 2022 camera ready
专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.LG
Comments corrected typos, added references, added authors, added acknowledgements
专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,comments)
Comments Presented at Human-LLM Interaction Workshop at HRI 2024
固定合成日语咨询对话中的结构化提示与自动评估
机构 * Japan National Institute of Occupational Safety and Health(日本国立职业安全卫生研究所) ; Kaze To Taiyo(凯泽・太阳) ; Saga Occupational Health Association(Saga职业健康协会) ; Department of Pharmacy, Zikei Hospital/Zikei Institute of Psychiatry(药剂科,Zikei医院/Zikei精神医学研究所) ; Department of Medical Welfare, Suzuka University of Medical Science(医疗福祉科, Suzuka医科大学) ; Graduate School of Human Sciences, Ritsumeikan University(人类科学研究生院,立命馆大学) ; Faculty of Nursing, National Defense Medical College(护理学部,国家防卫医疗大学) ; Support Center for Students with Disabilities, Aoyama Gakuin University(残疾学生支持中心,上智大学)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究通过人工智能生成的18份固定日语咨询对话记录,对比GPT - minimal、GPT - SMDP和Claude - SMDP三种情况,咨询专家与新的语言模型分别评级,发现SMDP对话在多方面获更高专家评级,语言模型评级可重复但偏宽松。
Comments 55 pages, 2 figures, 31 tables; supplemental material included; data and code at https://doi.org/10.5281/zenodo.22106028; preregistration and amendments at https://doi.org/10.17605/OSF.IO/VU286
风格取胜,实质落败:对作为创意生成评判者的大语言模型(LLM)的诊断
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 本研究针对大语言模型作为创意评判者的风格偏差问题,提出SciStyleBench基准及配套的SciStyleExtractor模块,实验验证该模块可有效降低风格偏差、提升实质区分度,为科学创意评估提供了系统性解决方案。
Comments First three authors are co-first authors
语言模型中的评估感知:表示、语言化与控制
专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 该研究系统探测了6个语言模型的评估感知,发现其可线性解码、与语言化部分对齐,且在Olmo模型中随微调放大,需评估时考虑模型内部表示与语言化的脱节。
Comments The first two authors contributed equally