arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2025-12-16 至 2025-12-16 共收录 5 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 5 篇

2512.13330 2025-12-16 cs.CL cs.AI 62%

FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models

FIN-bench-v2:一个用于评估芬兰大型语言模型的统一且稳健的基准测试集

Joona Kytöniemi, Jousia Piha, Akseli Reunamo, Fedor Vitiugin, Farrokh Mehryary, Sampo Pyysalo

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 FIN-bench-v2通过整合芬兰语言任务和评估方法,提供统一且稳健的基准测试集,用于评估芬兰大型语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12461 2025-12-16 cs.CL 57%

Is GPT-OSS Good? A Comprehensive Evaluation of OpenAI's Latest Open Source Models

GPT-OSS好吗?对OpenAI最新开源模型的综合评估

Ziqian Bi, Keyu Chen, Chiung-Yi Tseng, Danyang Zhang, Tianyang Wang, Hongying Luo, Lu Chen, Junming Huang, Jibin Guan, Junfeng Hao, Xinyuan Song, Junhao Song

机构 * AI Agent Lab, Vokram Group(AI代理实验室,Vokram集团) Purdue University(普渡大学) Georgia Institute of Technology(佐治亚理工学院) University of Minnesota(明尼苏达大学) Emory University(埃默里大学) Imperial College London(伦敦帝国学院)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 GPT-OSS在代码生成方面表现优异,但在多语言任务上存在不足,研究发现稀疏架构扩展未必能带来性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13550 2025-12-16 physics.chem-ph cond-mat.str-el physics.comp-ph 50%

DoNOF 2.0: A modern Open-Source Electronic Structure Program for Natural Orbital Functionals

DoNOF 2.0:一种现代的开源电子结构程序用于自然轨道功能

Juan Felipe Huan Lew-Yee, Ion Mitxelena, Jorge M. del Campo, and Mario Piris

专题命中 代码评测 :repository(abstract)

AI总结 DoNOF 2.0是一款开源电子结构程序,提供改进的优化算法、激发态计算和非线性光学响应评估功能。

Comments 11 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12145 2025-12-16 physics.optics 50%

A Thermal Modeling Toolkit for Continuous-Wave Gaussian Second-Harmonic Generation in KTP Crystal

用于KTP晶体连续波高斯二次谐波生成的热模型工具包

Mostafa M. Rezaee, Mohammad Sabaeian, Alireza Motazedian, Fatemeh Sedaghat Jalil-Abadi, Mohammad Ghadri

专题命中 代码评测 :repository(abstract)

AI总结 该工具包提供了一种用于计算KTP晶体连续波高斯二次谐波生成中温度场的开源有限差分方法,支持多种热传导模型和参数化情景扫描。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11884 2025-12-16 cs.CV 50%

Generalization vs. Specialization: Evaluating Segment Anything Model (SAM3) Zero-Shot Segmentation Against Fine-Tuned YOLO Detectors

泛化与专门化:评估Segment Anything Model(SAM3)零样本分割对精细调优的YOLO检测器

Ranjan Sapkota, Konstantinos I. Roumeliotis, Manoj Karkee, Nikolaos D. Tselikas

机构 * Cornell University, Department of Biological and Environmental Engineering(康奈尔大学生物与环境工程系) University of the Peloponnese, Department of Informatics and Telecommunications(希腊皮埃里亚大学信息与电信系)

专题命中 代码评测 :repository(abstract)

AI总结 本文评估了SAM3在零样本分割中的性能,与微调的YOLO检测器相比,展示了SAM3在遮罩精度上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏