arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 12194 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1744 篇

2602.11103 2026-07-02 cs.AI cs.CL cs.SE 版本更新 67%

GameDevBench: Evaluating Agentic Capabilities Through Game Development

GameDevBench: 通过游戏开发评估智能体能力

Wayne Chi, Yixiong Fang, Arnav Yayavaram, Siddharth Yayavaram, Seth Karten, Qiuhong Anna Wei, Runkun Chen, Alexander Wang, Valerie Chen, Ameet Talwalkar, Chris Donahue

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 提出GameDevBench基准,包含333个游戏开发任务,评估智能体在多模态软件开发中的能力,发现最佳智能体仅解决53.8%任务,并引入视觉反馈机制提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03824 2026-06-17 cs.AI cs.CL cs.LG cs.MA 版本更新 67%

In-Context Environments Induce Evaluation-Awareness in Language Models

上下文环境诱导语言模型中的评估意识

Maheep Chaudhary

机构 * Independent(独立)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出黑盒对抗优化框架,通过优化上下文提示诱导语言模型产生评估意识并策略性低表现(沙袋效应),实验显示优化提示可使算术任务准确率下降高达94个百分点,且沙袋效应主要由评估意识推理驱动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13735 2026-06-15 cs.AR cs.AI cs.LG cs.PL 新提交 67%

VHDLSuite: Unified Pipeline for LLM VHDL Generation with Data Synthesis and Evaluation

VHDLSuite:面向LLM VHDL生成的统一流水线,包含数据合成与评估

Yijun Shen, Minghao Shao, Yichen Zhao, Zhuoyan Yu, Boyuan Chen, Yik-Cheung Tam, Muhammad Shafique

机构 * Center for Data Science, NYU Shanghai, China(纽约市立大学上海分校数据科学中心) NYU Tandon School of Engineering, USA(纽约大学Tandon工程学院) NYU Abu Dhabi, UAE(纽约大学阿布扎比分校)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG、cs.PL

AI总结 提出VHDLSuite基础设施,通过自动基准合成、可执行验证和多模型诊断分析,解决LLM在VHDL生成评估中的不足,并构建含200+问题的VHDLBench基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22025 2026-06-11 cs.CL cs.AI cs.IR cs.SE 版本更新 67%

When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications

当通用提示改进有害:LLM应用的评估驱动迭代

Daniel Commey

机构 * Daniel Commey

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 提出最小可行评估套件(MVES),通过结构化评估框架和本地复现实验,发现通用提示添加并非单调改进,强调评估驱动的提示迭代。

Comments Technical report. 42 pages, 3 figures. Code, test suites, and result logs: https://github.com/dcommey/llm-eval-benchmarking

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04261 2026-06-04 cs.AI cs.CL cs.CV cs.ET cs.LG 67%

Can Generalist Agents Automate Data Curation?

通用智能体能否自动化数据筛选?

Feiyang Kang, Hanze Li, Adam Nguyen, Mahavir Dabas, Jiaqi W. Ma, Frederic Sala, Dawn Song, Ruoxi Jia

机构 * Virginia Tech(弗吉尼亚理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 代码评测 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Curation-Bench基准,通过通用编码智能体自动化数据筛选循环,实验表明现成智能体可达到强基线,但存在执行-研究差距,而结构化方法引导的智能体能在十分之一数据预算下自主组合出优于强基线的数据选择策略。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04205 2026-06-04 cs.MM cs.AI cs.CL cs.CV cs.LG cs.SD 67%

DetectZoo: A Unified Toolkit for AI-Generated Content Detection Across Text, Audio, and Image Modalities

DetectZoo:一个用于跨文本、音频和图像模态的AI生成内容检测的统一工具包

Sajad Ebrahimi, Nima Jamali, Bardia Shirsalimian, Kelly McConvey, Wentao Zhang, Jalehsadat Mahdavimoghaddam, Maksym Taranukhin, Maura Grossman, Vered Shwartz, Yuntian Deng, Ebrahim Bagheri

机构 * University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) Toronto Metropolitan University(多伦多 Metropolitan 大学) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DetectZoo,一个首个统一的多模态AI生成内容检测工具包,通过标准化数据预处理、评估流程和集成61个检测器与22个基准数据集,实现公平可重复的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22480 2026-06-03 cs.AI cs.CL cs.LG 67%

VeRO: A Harness for Agents to Optimize Agents

VeRO: 用于优化智能体的智能体框架

Varun Ursekar, Apaar Shanker, Veronica Chatrath, Yuan Xue, Samuel Marc Denton

专题命中 代码评测 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出 VeRO 框架和 VeRO-Bench 基准,通过版本化快照、预算控制评估和结构化执行轨迹来优化智能体代码,并实验比较不同优化器对目标智能体的改进效果。

Comments Accepted to the Forty-Third International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00308 2026-06-02 cs.SE cs.AI cs.LG 67%

How Generation Architecture Shapes Code Complexity in Multi-Agent LLM Systems: A Paired Study on HumanEval

生成架构如何塑造多智能体LLM系统中的代码复杂度:基于HumanEval的配对研究

Nazmus Ashrafi

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 通过配对实验比较六种多智能体架构在HumanEval上的代码复杂度,发现架构复杂度与功能正确性无正相关,最简架构在准确率上持平或超越复杂架构。

Comments 16 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28773 2026-05-28 cs.CL cs.AI cs.LG cs.MA cs.MM 67%

Rethinking Memory as Continuously Evolving Connectivity

重新思考记忆作为持续演化的连接性

Jizhan Fang, Buqiang Xu, Zhixian Wang, Haoliang Cao, Xinle Deng, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu, Ying Wei, Guozhou Zheng, Feiyu Xiong, Haofen Wang, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) MemTensor Tongji University(同济大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出 FluxMem 框架,将记忆建模为异构图并通过三个阶段(初始连接形成、反馈驱动优化、长期巩固)动态演化拓扑结构,以解决现有记忆增强型 LLM 代理在动态环境中的脆弱性问题。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17046 2026-05-20 cs.LG cs.AI cs.CL 67%

1GC-7RC: One Graphic Card -- Seven Research Challenges! How Good Are AI Agents at Doing Your Job?

1GC-7RC:一张图形卡——七个研究挑战!AI代理在做你的工作方面有多好?

Robin-Nico Kampa, Fabian Deuser, Anna Bößendörfer, Konrad Habel, Norbert Oswald

专题命中 代码评测 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出1GC-7RC基准测试,通过七个跨领域机器学习任务评估AI代理在从头设计、实现和训练模型的能力,揭示了不同代理在隐式机器学习知识、规划能力和时间预算管理方面的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02262 2026-05-19 cs.SE cs.AI cs.CL 67%

OmniCode: A Benchmark for Evaluating Software Engineering Agents

OmniCode: 一个评估软件工程代理的基准

Atharv Sonwane, Eng-Shen Tu, Wei-Chung Lu, Claas Beger, Carter Larsen, Debjit Dhar, Simon Alford, Rachel Chen, Ronit Pattanayak, Tuan Anh Dang, Guohao Chen, Gloria Geng, Kevin Ellis, Saikat Dutta

机构 * Cornell University(康奈尔大学) Independent contributor(独立贡献者) UC Santa Barbara(加州大学圣巴巴拉分校) Jadavpur University(贾瓦伊普尔大学) New York University(纽约大学)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出OmniCode,一个涵盖更广泛任务类别的软件工程基准,旨在评估软件代理在不同软件开发方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16819 2026-05-19 cs.CL cs.AI cs.LG 67%

AgentKernelArena: Generalization-Aware Benchmarking of GPU Kernel Optimization Agents

AgentKernelArena: GPU核优化代理的通用化意识基准测试

Sharareh Younesian, Wenwen Ouyang, Sina Rafati, Mehdi Rezagholizadeh, Sharon Zhou, Ji Liu, Yue Liu, Yuchen Yang, Hao Li, Ziqiong Liu, Dong Li, Vikram Appia, Zhenyu Gu, Emad Barsoum

机构 * AMD

专题命中 代码评测 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AgentKernelArena,一个用于评估GPU核优化代理的开源基准,通过隔离工作区和统一评分机制,测试代理在不同任务和硬件目标上的性能和通用化能力,发现大多数任务在正确性和编译效率上表现优异,但在PyTorch到HIP的转换任务中存在显著的正确性下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04601 2026-05-15 cs.SE cs.AI cs.CL 67%

Vibe Code Bench: Evaluating AI Models on End-to-End Web Application Development

Vibe Code Bench:评估AI模型在端到端Web应用开发中的表现

Hung Tran, Langston Nashold, Rayan Krishnan, Antoine Bigeard, Alex Gu

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出Vibe Code Bench,通过100个Web应用规格和964个浏览器工作流评估AI模型在端到端应用开发中的性能,揭示了可靠开发仍为前沿挑战,并提出评估协议和人类对齐研究。

Comments 23 pages, 8 figures. Accepted to ACM CAIS 2026. Live leaderboard: https://www.vals.ai/benchmarks/vibe-code. Benchmark first released Nov 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09678 2026-05-13 cs.AI cs.LG cs.SE 67%

EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages

EsoLang-Bench: 通过奇特编程语言评估大语言模型的真实推理能力

Aman Sharma, Paras Chopra

机构 * Lossfunk

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 EsoLang-Bench通过五种奇特编程语言评估大语言模型在分布外编程语言上的推理能力,发现前沿模型在处理陌生语言时存在显著能力差距。

Comments 45 pages, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08658 2026-05-12 cs.LG cs.AI cs.SE 67%

Sketch-and-Verify: Structured Inference-Time Scaling via Program Sketching

Sketch-and-Verify: 通过程序草图实现推理时间扩展

Shan Jiang, Zijian Yi, Chenguang Zhu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 代码评测 :code model(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出SKETCHVERIFY方法,通过程序草图生成多样化候选方案,验证后选择最优,提升模型性能,同时探讨K与M的权衡关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07342 2026-05-11 cs.LG cs.AI cs.SE 67%

Mage: Multi-Axis Evaluation of LLM-Generated Executable Game Scenes Beyond Compile-Pass Rate

Mage:多轴评估LLM生成的可执行游戏场景超越编译通过率

Hugh Xuechen Liu, Kıvanç Tatar

机构 * Chalmers University of Technology and University of Gothenburg(楚尔姆斯理工大学和哥德堡大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出Mage多轴评估框架,通过编译通过率、运行通过率、结构保真度和机制符合度四个维度评估LLM生成的游戏场景,发现编译通过率与功能正确性反相关,证明多轴评估对检测领域差异的必要性。

Comments Main Content: 10 pages, 1 figure. In total 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23361 2026-04-28 cs.SE cs.AI cs.LG 67%

An Empirical Evaluation of Locally Deployed LLMs for Bug Detection in Python Code

对本地部署LLM在Python代码中检测bug的实证评估

Jelena Ilić Vulićević

机构 * Independent Researcher Master of Electrical(独立研究者 电气工程硕士)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文评估了本地部署的LLaMA 3.2和Mistral在Python bug检测中的性能,发现其准确率在43%-45%之间,但难以精确定位修复。

Comments 8 pages, 5 figures. Code available at https://github.com/insajder/llm-bug-detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05863 2026-04-21 cs.CL cs.LG cs.SE 67%

ReflexiCoder: Teaching Large Language Models to Self-Reflect on Generated Code and Self-Correct It via Reinforcement Learning

ReflexiCoder:通过强化学习教大语言模型自我反思和自我纠正生成的代码

Juyong Jiang, Jiasi Shen, Sunghun Kim, Kang Min Yoo, Jeonghoon Kim, Sungju Kim

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Amazon AGI(亚马逊人工智慧实验室) NAVER Cloud(NAVER云)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 本文提出ReflexiCoder,一种基于强化学习的框架,使大语言模型在推理过程中自我反思和纠正代码,通过细粒度奖励函数优化整个反思-纠正过程,实现无需外部反馈的自我调试能力,实验表明其在多个基准测试中表现优异,且在推理效率上更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16320 2026-04-21 cs.SE cs.AI cs.LG 67%

How Robustly do LLMs Understand Execution Semantics?

大语言模型如何理解执行语义的鲁棒性?

Claudio Spiess, Prem Devanbu, Earl T. Barr

机构 * University College London(伦敦大学学院)

专题命中 代码评测 :code model(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 研究通过代码输出预测任务评估大语言模型对代码理解的鲁棒性,发现开源模型在代码变换和输入扰动下表现稳定,而前沿模型GPT-5.2表现出显著的脆弱性,且异常处理能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06296 2026-04-17 cs.LG cs.AI cs.MA cs.SE 67%

AgentOpt v0.1 Technical Report: Client-Side Optimization for LLM-Based Agent

AgentOpt v0.1 技术报告:基于LLM的代理的客户端优化

Wenyue Hua, Sripad Karne, Qian Xie, Armaan Agrawal, Nikos Pagonas, Kostis Kaffes, Tianyi Peng

机构 * Microsoft Research, AI Frontiers(微软研究院,人工智能前沿) Cornell University(康奈尔大学) Columbia University(哥伦比亚大学)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出AgentOpt框架,用于解决LLM代理客户端资源分配问题,通过多种搜索算法优化模型选择和资源分配,提升效率与效果。

Comments 24 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06433 2026-04-16 cs.CL cs.AI cs.LG cs.MA 67%

Memp: Exploring Agent Procedural Memory

Memp:探索代理程序记忆

Runnan Fang, Yuan Liang, Xiaobin Wang, Jialong Wu, Shuofei Qiao, Pengjun Xie, Fei Huang, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) State Key Lab. for Novel Software Technology(新型软件技术国家重点实验室) Nanjing University(南京大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Memp,一种可学习、可更新且终身的程序记忆系统,通过提炼历史轨迹生成细粒度指令和高层脚本抽象,提升代理在TravelPlanner和ALFWorld任务中的成功率和效率。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09791 2026-04-14 cs.AI cs.CL cs.LG cs.MA 67%

Pioneer Agent: Continual Improvement of Small Language Models in Production

先驱代理:生产环境中小语言模型的持续改进

Dhruv Atreja, Julia White, Nikhil Nayak, Kelton Zhang, Henrijs Princis, George Hurn-Maloney, Ash Lewis, Urchade Zaratiana

机构 * Fastino Labs

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Pioneer Agent,通过闭环系统自动化小语言模型的持续改进,通过冷启动和生产模式提升模型性能,发现有效训练策略。

Comments 43 pages, 10 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07494 2026-04-10 cs.SE cs.AI cs.LG 67%

Triage: Routing Software Engineering Tasks to Cost-Effective LLM Tiers via Code Quality Signals

Triage: 通过代码质量信号将软件工程任务路由到成本效益高的LLM层级

Lech Madeyski

机构 * Wroclaw University of Science and Technology(弗罗茨瓦夫理工大学)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 Triage利用代码健康度指标作为路由信号,将任务分配到最便宜的模型层级,通过分析代码质量与模型层级成本的关系,提升任务处理效率。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01128 2026-04-02 cs.CL cs.AI cs.LG 67%

Paper Reconstruction Evaluation: Evaluating Presentation and Hallucination in AI-written Papers

论文重构评估:评估AI论文中的表现和幻觉

Atsuyuki Miyai, Mashiro Toyooka, Zaiying Zhao, Kenta Watanabe, Toshihiko Yamasaki, Kiyoharu Aizawa

机构 * The University of Tokyo(东京大学)

专题命中 代码评测 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出首个系统评估框架,用于量化现代编码代理生成论文的质量与风险。通过重构现有论文并生成完整论文进行比较,将评估分为表现和幻觉两个维度,基于PaperWrite-Bench基准测试,揭示ClaudeCode和Codex在表现与幻觉间的权衡。

Comments Project Page: https://agent4science-utokyo.github.io/PaperRecon_HP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20660 2026-03-30 cs.LG cs.AI cs.SE 67%

The Dual-State Architecture for Reliable LLM Agents

双状态架构用于可靠的LLM代理

Matthew Thompson

机构 * Independent Researcher(独立研究者)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出双状态动作对DSAP,通过结合随机生成与确定性后置条件验证,提升LLM代理在软件工程中的可靠性,实验表明在1.2-2.1倍基准成本下可靠性提升达66个百分点。

Comments 18 pages, 2 figures, 5 tables. V2 extends and supersedes V1, introducing tri-state guard semantics, a three-level recovery hierarchy, and SWE-Bench boundary analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09978 2026-03-12 cs.SE cs.AI cs.LG 67%

One Model, Many Skills: Parameter-Efficient Fine-Tuning for Multitask Code Analysis

一个模型,多种技能:用于多任务代码分析的参数高效微调

Amal Akli, Maxime Cordy, Mike Papadakis, Yves Le Traon

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出多任务PEFT方法,通过共享模块在代码分析中实现性能与效率的平衡,验证了其在多任务场景下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01646 2026-03-09 cs.CL cs.AI cs.LG 67%

ESGenius: Benchmarking LLMs on Environmental, Social, and Governance (ESG) and Sustainability Knowledge

ESGenius:对环境、社会和治理(ESG)及可持续性知识的LLM基准测试

Chaoyue He, Xin Zhou, Yi Wu, Xinjia Yu, Yan Zhang, Lei Zhang, Di Wang, Shengfei Lyu, Hong Xu, Xiaoqiao Wang, Wei Liu, Chunyan Miao

机构 * Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-NTU全球可持续性公司实验室) Alibaba Group(阿里巴巴集团)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ESGenius是首个针对LLM在ESG及可持续性知识评估的综合问答基准,通过RAG方法显著提升模型性能。

Comments EMNLP'25 Main Oral (42 pages, 10 figures, 11 tables), Nominations for Resource Award & Theme Paper Award

Journal ref In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), pages 14612-14653

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21251 2026-02-26 cs.SE cs.AI cs.MA cs.PL 67%

AgenticTyper: Automated Typing of Legacy Software Projects Using Agentic AI

AgenticTyper: 使用代理AI自动类型化遗留软件项目

Clemens Pohle

机构 * Darmstadt University of Applied Sciences(达姆斯塔德应用技术大学) MaibornWolff GmbH(马本沃尔夫公司)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI、cs.PL

AI总结 AgenticTyper利用代理AI自动类型化遗留软件项目,通过迭代错误纠正和行为保留技术,高效解决类型错误问题。

Comments Accepted at ICSE 2026 Student Research Competition (SRC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02554 2026-02-04 cs.LG cs.AI cs.SE 67%

BatCoder: Self-Supervised Bidirectional Code-Documentation Learning via Back-Translation

BatCoder: 通过回译实现的双向代码-文档自监督学习

Jingwen Xu, Yiyang Lu, Zisu Huang, Changze Lv, Xiaohua Wang, Shizheng Li, Zhibo Xu, Zhengkang Guo, Zhengyuan Wang, Muzhao Tian, Xuanjing Huang, Xiaoqing Zheng

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(计算机科学与人工智能学院,复旦大学,上海,中国)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 BatCoder通过回译策略实现代码与文档的双向自监督学习,提升模型在代码生成和文档生成任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20103 2026-01-29 cs.SE cs.AI cs.LG 67%

Benchmarking Reward Hack Detection in Code Environments via Contrastive Analysis

通过对比分析在代码环境中基准测试奖励黑客检测

Darshan Deshpande, Anand Kannappan, Rebecca Qian

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文通过对比分析提出了一种涵盖54类的奖励利用分类法,并引入TRACE基准测试,展示模型在对比设置中对奖励黑客的检测效果优于孤立分类设置。

Comments Dataset: https://huggingface.co/datasets/PatronusAI/trace-dataset

详情

展开后加载摘要…

URL PDF HTML 收藏