arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-01-26 至 2026-01-26 共收录 4 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 4 篇

2601.16520 2026-01-26 cs.CV cs.AI cs.CL 62%

TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning

TangramPuzzle: 通过组合空间推理评估多模态大语言模型

Daixian Liu, Jiayi Kuang, Yinghui Li, Yangning Li, Di Yin, Haoyu Cao, Xing Sun, Ying Shen, Hai-Tao Zheng, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun-Yat Sen University(孙逸人大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 TangramPuzzle通过几何基准测试评估多模态大语言模型的组合空间推理能力,发现模型在匹配轮廓时忽视几何约束,导致碎片变形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15728 2026-01-26 cs.AI cs.SE 62%

Benchmarking Text-to-Python against Text-to-SQL: The Impact of Explicit Logic and Ambiguity

对文本到Python与文本到SQL的基准测试:显式逻辑和歧义的影响

Hangle Hu, Chenyu Hou, Bin Cao, Ruizhe Li

机构 * Zhejiang University of Technology(浙江工业大学) University of Aberdeen(阿伯丁大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出BIRD-Python基准测试,通过逻辑完成框架解决文本到Python与SQL的性能差异问题,证明Python在分析代理中的可行性。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16354 2026-01-26 cs.CR cs.AI 57%

NOIR: Privacy-Preserving Generation of Code with Open-Source LLMs

NOIR:基于开源LLM的隐私保护代码生成

Khoa Nguyen, Khiem Ton, NhatHai Phan, Issa Khalil, Khang Tran, Cristian Borcea, Ruoming Jin, Abdallah Khreishah, My T. Thai

机构 * New Jersey Institute of Technology(新泽西理工学院) Hamad Bin Khalifa University(哈利法大学) Kent State University(肯特州立大学) University of Florida(佛罗里达大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 NOIR通过客户端本地处理和隐私保护机制,实现对开源LLM生成代码的隐私保护,显著提升代码生成性能和安全性。

Comments To appear at Usenix Security Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14122 2026-01-26 cs.CL cs.CY cs.ET 57%

Benchmarking LLMs for Political Science: A United Nations Perspective

对政治科学的LLM进行基准测试:一个联合国视角

Yueqing Liang, Liangwei Yang, Chen Wang, Congying Xia, Rui Meng, Xiongxiao Xu, Haoran Wang, Ali Payani, Kai Shu

机构 * Google Cloud AI Research(谷歌云人工智能研究)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文提出联合国基准(UNBench),用于评估LLMs在政治科学中的能力,涵盖联合国决策过程的三个阶段。

Comments This paper has been accepted at AAAI 2026 as an oral paper

详情

展开后加载摘要…

URL PDF HTML 收藏