Orchestrating LLM Agents for Scientific Research: A Pilot Study of Multiple Choice Question (MCQ) Generation and Evaluation
协调大型语言模型代理进行科学研究:多选题生成与评估的试点研究
机构 * College of Computing and Informatics(计算与信息学院)
专题命中 Agent评测 :workflow(abstract);分类 cs.AI
AI总结 本文研究了通过协调多个LLM代理生成和评估多选题,发现生成的题目在质量上存在与专家审核题目不完全可比的问题,同时揭示了科学研究中劳动力向AI研究操作技能转变的趋势。