OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models
OMGEval: 一种开放的多语言生成评估基准用于大型语言模型
Yang Liu, Meng Xu, Shuo Wang, Liner Yang, Haoyu Wang, Zhenghao Liu, Cunliang Kong, Yun Chen, Yang Liu, Maosong Sun, Erhong Yang
机构
*
Beijing Language and Culture University(北京语言大学)
;
Tsinghua University(清华大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Northeastern University(东北大学)
;
Shanghai University of Finance and Economics(上海金融学院)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.CL
Comments10 pages, 8 figures. This paper has been peer-reviewed and published in IEEE Access. The arXiv version corresponds to the accepted author manuscript (AAM)
Journal refIEEE Access, vol. 14, 2026, Article ID 3658575
Specialists or Generalists? Multi-Agent and Single-Agent LLMs for Essay Grading
专家还是通才?多智能体与单智能体LLM用于作文评分
Jamiu Adekunle Idowu, Ahmed Almasoud
机构
*
Sahel AI, Sahel Group Inc.(Sahel AI,Sahel Group Inc.)
;
University College London (UCL)(University College London(UCL))
;
Prince Sultan University
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
PaperArena: An Evaluation Benchmark for Tool-Augmented Agentic Reasoning on Scientific Literature
PaperArena: 一个用于科学文献上工具增强代理推理的评估基准
Daoyu Wang, Mingyue Cheng, Shuo Yu, Zirui Liu, Ze Guo, Xin Li, Qi Liu
机构
*
State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
;
Artificial Intelligence Research Institute, iFLYTEK Co., Ltd(人工智能研究院,iFLYTEK有限公司)
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
WiFiPenTester: Advancing Wireless Ethical Hacking with Governed GenAI
WiFiPenTester: 通过受控生成式AI推进无线道德黑客技术
Haitham S. Al-Sinani, Chris J. Mitchell
机构
*
Diwan of Royal Court, Muscat, Oman.(阿曼穆斯cat王室法庭)
;
Royal Holloway, University of London, Egham, UK.(伦敦皇家霍洛威大学)
;
German University of Technology in Oman, Muscat, Oman.(阿曼技术大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI
CommentsThis is an updated review of our previous paper (see https://doi.org/10.1007/s10462-021-10039-7), and has been accepted by Artificial Intelligence Review journal