arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-01-19 至 2026-01-19 共收录 4 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 4 篇

2601.11077 2026-01-19 cs.SE cs.AI cs.CL 75%

ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development

ABC-Bench: 评估现实世界开发中自主后端编码的基准测试

Jie Yang, Honglin Guo, Li Ji, Jiazheng Zhou, Rui Zheng, Zhikai Lei, Shuo Zhang, Zhiheng Xi, Shichun Liu, Yuxin Wang, Bo Wang, Yining Zheng, Tao Gui, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Qiji Zhifeng Co., Ltd.(上海启济智风有限公司) Shanghai Innovation Institute(上海创新研究院)

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 ABC-Bench是一个评估自主后端编码在真实可执行工作流中性能的基准测试,通过224个实际任务揭示了当前模型在复杂后端工程任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10820 2026-01-19 cs.LG cs.AI cs.CL cs.MA 75%

Towards Reliable ML Feature Engineering via Planning in Constrained-Topology of LLM Agents

通过LLM代理的受限拓扑规划实现可靠的机器学习特征工程

Himanshu Thakur, Anusha Kamath, Anurag Muthyala, Dhwani Sanmukhani, Smruthi Mukund, Jay Katukuri

机构 * Meta Menlo Park, CA(Meta 洛杉矶公园分校) JPMorgan Chase & Co.(摩根大通公司)

专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于LLM代理的受限拓扑规划框架,通过多步骤生成代码提升特征工程的可靠性与效率,实验显示在数据集和实际应用中均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18488 2026-01-19 cs.SE cs.AI 62%

Evaluating perturbation robustness of generative systems that use COBOL code inputs

评估使用COBOL代码输入的生成系统对扰动的鲁棒性

Samuel Ackerman, Wesam Ibraheem, Orna Raz, Marcel Zalmanovici

机构 * IBM Research(IBM研究院)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出评估使用COBOL代码输入的生成系统鲁棒性的框架,通过扰动方法和可视化工具提升系统对输入变化的鲁棒性。

Comments 16 pages (8 main, 8 appendix). Accepted to AI-SQE (ICSE, 2026): The 1st International Workshop on AI for Software Quality Evaluation: Judgment, Metrics, Benchmarks, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10904 2026-01-19 cs.AI 57%

ARC Prize 2025: Technical Report

ARC 2025奖项:技术报告

François Chollet, Mike Knoop, Gregory Kamradt, Bryan Landers

专题命中 代码评测 :program synthesis(abstract);分类 cs.AI

AI总结 本文探讨了ARC-AGI-2基准竞赛中精炼循环对AGI进展的作用,分析了当前AI推理的局限性,并预览了ARC-AGI-3的交互推理挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏