FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models
FIN-bench-v2:一个用于评估芬兰大型语言模型的统一且稳健的基准测试集
专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI
AI总结 FIN-bench-v2通过整合芬兰语言任务和评估方法,提供统一且稳健的基准测试集,用于评估芬兰大型语言模型的性能。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
FIN-bench-v2:一个用于评估芬兰大型语言模型的统一且稳健的基准测试集
专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI
AI总结 FIN-bench-v2通过整合芬兰语言任务和评估方法,提供统一且稳健的基准测试集,用于评估芬兰大型语言模型的性能。
GPT-OSS好吗?对OpenAI最新开源模型的综合评估
机构 * AI Agent Lab, Vokram Group(AI代理实验室,Vokram集团) ; Purdue University(普渡大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Minnesota(明尼苏达大学) ; Emory University(埃默里大学) ; Imperial College London(伦敦帝国学院)
专题命中 代码评测 :code generation(abstract);分类 cs.CL
AI总结 GPT-OSS在代码生成方面表现优异,但在多语言任务上存在不足,研究发现稀疏架构扩展未必能带来性能提升。
DoNOF 2.0:一种现代的开源电子结构程序用于自然轨道功能
专题命中 代码评测 :repository(abstract)
AI总结 DoNOF 2.0是一款开源电子结构程序,提供改进的优化算法、激发态计算和非线性光学响应评估功能。
Comments 11 pages, 4 figures, 3 tables
用于KTP晶体连续波高斯二次谐波生成的热模型工具包
专题命中 代码评测 :repository(abstract)
AI总结 该工具包提供了一种用于计算KTP晶体连续波高斯二次谐波生成中温度场的开源有限差分方法,支持多种热传导模型和参数化情景扫描。
泛化与专门化:评估Segment Anything Model(SAM3)零样本分割对精细调优的YOLO检测器
机构 * Cornell University, Department of Biological and Environmental Engineering(康奈尔大学生物与环境工程系) ; University of the Peloponnese, Department of Informatics and Telecommunications(希腊皮埃里亚大学信息与电信系)
专题命中 代码评测 :repository(abstract)
AI总结 本文评估了SAM3在零样本分割中的性能,与微调的YOLO检测器相比,展示了SAM3在遮罩精度上的优势。