LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark
LongBench Pro: 一个更现实且全面的双语长上下文评估基准
机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 LongBench Pro通过人机协作构建,提供1500个双语长上下文样本,评估46个模型发现长上下文优化比参数扩展更有效,有效上下文长度较短且存在跨语言偏差,混合思考设计具有潜在优势。