Mind the Gap: Can Frontier LLMs Pass a Standardized Office Proficiency Exam?
注意差距:前沿大语言模型能否通过标准化办公能力考试?
机构 * Microsoft Research(微软研究院)
AI总结 基于中国计算机等级考试(NCRE)的200个综合操作任务,评估7个前沿LLM在Word、Excel和PowerPoint自动化中的表现,发现单轮模型最高得分率36.6%,带执行反馈的智能体系统达68.8%,仍低于95.5%的社区参考分,表明可靠细粒度办公自动化仍是重大挑战。
Comments 21 pages, 5 figures