Measuring Coding Challenge Competence With APPS
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.LG
Comments NeurIPS 2021. Code and the APPS dataset is available at https://github.com/hendrycks/apps
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.LG
Comments NeurIPS 2021. Code and the APPS dataset is available at https://github.com/hendrycks/apps
专题命中 代码生成 :program synthesis(abstract);分类 cs.SE、cs.LG、cs.PL
Comments Published in ICML 2021
专题命中 代码生成 :program synthesis(abstract);分类 cs.AI、cs.LG、cs.PL
Comments ICLR 2021
专题命中 代码生成 :program synthesis(abstract);分类 cs.AI、cs.LG、cs.PL
Comments Published in Advances in Neural Information Processing Systems (NeurIPS) 2019
专题命中 代码生成 :code model(abstract);分类 cs.SE、cs.LG、cs.PL
专题命中 代码生成 :program synthesis(abstract);分类 cs.AI、cs.LG、cs.PL
Comments AAAI 2019
专题命中 代码生成 :program synthesis(abstract);分类 cs.AI、cs.LG、cs.PL
Comments Published as a conference paper at ICLR 2018
专题命中 代码生成 :program synthesis(abstract);分类 cs.CL、cs.AI、cs.PL
Comments 9 pages, 3 figures, ICLR workshop
在大规模文档集合中导航:MuDABench用于多文档分析问答
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Wenlan School of Business, Zhongnan University of Economics and Law(中南财经政法大学文澜商学院)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI;repository(comments)
AI总结 本文提出在大规模半结构化文档集合上进行分析问答的任务,介绍了MuDABench多文档分析问答基准,要求跨多个文档提取和综合信息以进行定量分析,实验发现标准RAG系统表现不佳,提出多代理工作流以提升性能。
Comments Findings of ACL 2026. The camera-ready version corrects some labeling errors. The accompanying repository is continuously updated based on community feedback; for the most up-to-date implementation and results, please refer to the repository
机构 * Microsoft(微软公司) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Peking University(北京大学)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI;repository(comments)
Comments The collection of papers reviewed in this survey will be hosted and regularly updated on the GitHub repository: https://github.com/vyokky/LLM-Brained-GUI-Agents-Survey Additionally, a searchable webpage is available at https://aka.ms/gui-agent for easier access and exploration
面向预算受限的智能体搜索:更充分利用,更智能探索
机构 * Amazon AGI(亚马逊AGI)
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 针对预算受限的智能体搜索场景,提出ExTS树搜索策略,结合三种机制优化树搜索,在多项任务上实现性能提升,还提供了问题结构差异的诊断方法。
云模拟器的自动化合成
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 针对DevOps程序测试中云模拟器构建难的问题,提出基于神经符号代码合成的CloudEmu方法,其在AWS、GCP服务上的覆盖率与准确性优于手动开发的LocalStack。
Comments 12 pages, 8 figures, 5 tables, Under review
评估针对大语言模型生成代码中包幻觉的推理时防御措施
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 本文针对LLM生成代码的包幻觉问题,修正了评估方法,评估了七种推理时防御措施,提出包效用指标,发现对抗提示下RAG与Self-Refine表现更优,明确防御需匹配威胁模型与效用。
Comments Accepted ASE 2026
SLICE:规约级别的契约执行隔离
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.PL
AI总结 SLICE是一个分阶段的代码生成框架,通过规约结构化、函数体生成、契约断言生成三个阶段,在ContractEval数据集上使代码满足功能需求与输入契约的性能平均提升6.58%。
Comments 17 pages, 6 figures, 3 tables
MOSAIC:结构化智能体智能与组合的模块化编排
机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) ; University College London(伦敦大学学院) ; University of Edinburgh(爱丁堡大学) ; Data & Analytics, Digital X(Digital X 数据与分析部) ; Alan Turing Institute(艾伦·图灵研究所)
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 提出MOSAIC框架,通过结构化智能体编排、记忆驱动的模型选择和蓝图构建,将自动化数据科学转化为可验证、可复用的模型选择问题,在金融时间序列任务中优于AutoML和智能体基线。
EditPPT:基于结构化工具使用多智能体与双模态验证器的忠实长文档幻灯片编辑
机构 * KAIST AI(韩国科学技术院人工智能学院)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI
AI总结 本文提出EditPPT多智能体框架,通过PowerPoint COM接口执行局部操作并结合双模态验证,在DeckEdit-Bench基准上实现高执行率等指标,解决长文档幻灯片编辑的级联错误问题。
Comments 30 pages, 7 figures, 17 tables, EMNLP 2026 submitted, under review
提示工程之外:提示词词汇敏感性及其对质量影响的系统性分析
机构 * Shenzhen Technology University(深圳技术大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Zhejiang Lab(之江实验室) ; The Chinese University of Hong Kong(香港中文大学) ; HKUST (Guangzhou)(香港科技大学(广州))
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对大型语言模型的提示词词汇敏感性开展大规模机制分析,揭示提示词性能稳定性缩放定律,提出自动化提示词优化智能体,可降低代码生成任务性能方差40.7%,为鲁棒提示工程提供可解释框架。
LLM生成代码中的库幻觉:基于开发者查询的风险分析
机构 * King’s College London(伦敦国王学院) ; University College London(伦敦大学学院)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL
AI总结 本文研究了LLM生成代码中库幻觉的风险,通过分析用户提示变化对库幻觉的影响,揭示了系统性漏洞,并提出了LibHalluBench基准测试以评估这些幻觉。
Comments 28 pages, 1 figure, 13 tables. Accepted to Proceedings of EMNLP 2026
你的强化学习奖励函数是你的最佳搜索PRM:统一强化学习与基于搜索的文本生成
机构 * Rutgers University(新泽西州立大学) ; Nanyang Technological University(南洋理工大学) ; University of Connecticut(康涅狄格大学) ; Fudan University(复旦大学) ; NVIDIA Research(NVIDIA研究) ; Red Hat AI Innovation(红帽AI创新) ; MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出AIRL-S,通过强化学习与搜索技术的统一,利用奖励函数直接学习动态PRM,提升推理链扩展和跨任务泛化能力,实验显示性能提升9%并优于基线PRM。
专题命中 代码生成 :program synthesis(abstract);分类 cs.SE、cs.LG
Journal ref Proceedings of Machine Learning and Systems, Vol. 5, pp. 442-456, 2023
探测预填充:通过潜在激活检测代码漏洞
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 该研究从四个LLM提取预填充标记激活训练MLP探测器,在四个代码漏洞基准上实现平均F1值41.7%,证明LLM自身代码表示含漏洞信息,为轻量原生筛查提供方向。
不确定信号是否有用?对带有回滚机制的不确定感知解码的系统研究
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 本文通过系统研究带有回滚机制的不确定感知解码,发现其可提升代码LLM的生成性能,其中token熵等信息论不确定信号效果最优,反馈引导的回滚是主要改进来源。
Aletheia: 什么使得代码验证器的RLVR有效?
机构 * INSAIT, Sofia University "St. Kliment Ohridski", Bulgaria(保加利亚索菲亚大学INSAIT实验室) ; Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, Technical University of Darmstadt and National Research Center for Applied Cybersecurity(德累斯顿技术大学计算机科学系及应用网络安全国家研究中心通用知识处理实验室) ; ATHENE, Germany(德国ATHENE研究院)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 通过消融实验研究RLVR训练代码验证器时,中间思考轨迹、负样本学习和策略内训练三个因素在不同规模下的性能-成本权衡,发现最优配方依赖于模型规模。
通过激活引导剪枝实现跨模型规模的无训练知识迁移
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出激活剪枝融合框架APM,通过激活引导选择源模型的显著组件并注入目标模型,无需训练和显式语义对齐,在16个基准上将3B目标模型平均准确率从55.5%提升至60.6%。
Comments 9 pages, 3 figures, and 7 tables
KBSpec:基于演化领域知识库的LLM驱动形式化规约生成
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.PL
AI总结 提出KBSpec方法,利用外部官方文档和内部验证器反馈的双源知识增强LLM,通过自演化知识库持续更新成功轨迹,无需调参或标注数据,在JML规约生成上验证通过率提升10-25%。
隐式在线策略自蒸馏
机构 * Shanghai Jiao Tong University(上海交通大学) ; National University of Singapore(新加坡国立大学)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出隐式在线策略自蒸馏(LOPD),将教师的特权上下文改为端到端可学习,在智能体工具使用和代码生成任务上,以远低于对比方法的rollout预算实现了更优性能。
GCPO:针对大语言模型的rollout强化学习中子空间几何的诊断与约束
机构 * Shanghai AI Lab(上海人工智能实验室)
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 GCPO通过几何约束策略优化方法,诊断rollout强化学习的子空间几何问题,在大语言模型后训练中提升了多任务性能并解决了训练不稳定等问题
Comments 15 pages, 10 figures
这是你的最终答案吗?跨上下文一致性作为大语言模型可信度的度量
机构 * University of Chicago(芝加哥大学)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出用跨上下文一致性(C3)度量大语言模型可信度,通过对比26个模型在6个基准上的原始与扰动提示生成结果,发现C3可作为互补评估维度与基准有用性诊断工具。
在大型语言模型中自我改进的极限:没有符号模型合成,奇点并不临近
机构 * Algorithmic Dynamics Lab(算法动力实验室) ; Department of Biomedical Computing(生物医学计算系) ; School of Biomedical Engineering and Imaging Sciences(生物医学工程与成像科学学院) ; King’s Institute for AI(国王人工智能研究所) ; King’s College London(伦敦国王学院) ; Oxford Immune Algorithmics(牛津免疫算法公司) ; Oxford University Innovation(牛津大学创新中心) ; London Institute for Healthcare Engineering(伦敦医疗工程研究所)
专题命中 代码生成 :program synthesis(abstract);分类 cs.AI、cs.LG
AI总结 研究指出大型语言模型在缺乏外部信号时自我改进会退化,提出神经符号整合方法以突破这一限制。
Comments 31 pages. Update: DPI and Levin's non-growth is not violated explanation when it comes to finite learners
无验证器的测试时扩展的一致性方法
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG
AI总结 本文针对现有基于置信度的无验证器测试时扩展(VF-TTS)方法在复杂任务上失效的问题,提出一致性(consilience)框架,通过评估置信度时间不对称性提升LLM推理性能,在数学和代码生成任务上优于基线。