arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-01-07 至 2026-01-07 共收录 3 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 3 篇

2601.02404 2026-01-07 cs.CL cs.AI 62%

PCEval: A Benchmark for Evaluating Physical Computing Capabilities of Large Language Models

PCEval: 一个评估大型语言模型物理计算能力的基准

Inpyo Song, Eunji Jeon, Jangwon Lee

机构 * Department of Immersive Media Engineering(沉浸媒体工程系) Sungkyunkwan University(成均馆大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 PCEval是一个评估大型语言模型物理计算能力的基准,通过自动评估电路生成和硬件交互能力,揭示LLMs在物理布局设计中的不足。

Comments Code and Dataset available at https://github.com/Null99-Dog/PCEval-Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22334 2026-01-07 cs.AI cs.CL 62%

SciEvalKit: An Open-source Evaluation Toolkit for Scientific General Intelligence

SciEvalKit: 一个用于科学通用智能的开源评估工具包

Yiheng Wang, Yixin Chen, Shuo Li, Yifan Zhou, Bo Liu, Hengjian Gao, Jiakang Yuan, Jia Bu, Wanghan Xu, Yuhao Zhou, Xiangyu Zhao, Zhiwang Zhou, Fengxiang Wang, Haodong Duan, Songyang Zhang, Jun Yao, Han Deng, Yizhou Wang, Jiabei Xiao, Jiaqi Liu, Encheng Su, Yujie Liu, Weida Wang, Junchi Yao, Shenghe Zheng, Haoran Sun, Runmin Ma, Xiangchao Yan, Bo Zhang, Dongzhan Zhou, Shufei Zhang, Peng Ye, Xiaosong Wang, Shixiang Tang, Wenlong Zhang, Lei Bai

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 SciEvalKit是一个开源工具包,用于评估科学通用智能,涵盖科学多模态感知、推理、理解等核心能力,并提供灵活的评估流程和可定制的基准测试环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02569 2026-01-07 cs.CL 57%

LoRA-Drop: Temporal LoRA Decoding for Efficient LLM Inference

LoRA-Drop:用于高效LLM推理的时序LoRA解码

Hossein Rajabzadeh, Maryam Dialameh, Chul B. Park, Il-Min Kim, Hyock Ju Kwon

机构 * University of Waterloo(滑铁卢大学) University of Toronto(多伦多大学) Queen’s University(皇后大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 LoRA-Drop通过时序计算计划和低秩LoRA校正,实现高效LLM推理,提升解码速度2.6倍并减少45-55%的KV缓存占用。

详情

展开后加载摘要…

URL PDF HTML 收藏