arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-24 至 2026-08-24 共收录 14 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 6 篇

2601.00894 2026-08-24 cs.LG cs.CL 版本更新 76%

When to Ponder: Adaptive Compute Allocation for Code Generation via Test-Time Training

何时思考:通过测试时间训练实现的自适应计算分配

Gihyeon Sim

机构 * Dongpae High School, Paju, Gyeonggi-do, Republic of Korea(京畿道帕久郡东垈高中)

专题命中 代码生成 :code generation(title);分类 cs.CL、cs.LG

AI总结 通过测试时间训练实现自适应计算分配,利用自监督重建损失选择性更新,提升代码语言建模性能

Comments 14 pages, 1 figure, 14 tables, code available at this https URL (https://github.com/deveworld/ponderTTT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22202 2026-08-24 cs.SE cs.CL 版本更新 62%

Library Hallucinations in LLM-Generated Code: A Risk Analysis Grounded in Developer Queries

LLM生成代码中的库幻觉:基于开发者查询的风险分析

Lukas Twist, Mark Harman, Helen Yannakoudakis, Jie M. Zhang

机构 * King’s College London(伦敦国王学院) University College London(伦敦大学学院)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL

AI总结 本文研究了LLM生成代码中库幻觉的风险,通过分析用户提示变化对库幻觉的影响,揭示了系统性漏洞,并提出了LibHalluBench基准测试以评估这些幻觉。

Comments 28 pages, 1 figure, 13 tables. Accepted to Proceedings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14313 2026-08-24 cs.LG cs.AI 版本更新 62%

AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning

你的强化学习奖励函数是你的最佳搜索PRM:统一强化学习与基于搜索的文本生成

Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che, Dimitris N. Metaxas

机构 * Rutgers University(新泽西州立大学) Nanyang Technological University(南洋理工大学) University of Connecticut(康涅狄格大学) Fudan University(复旦大学) NVIDIA Research(NVIDIA研究) Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AIRL-S,通过强化学习与搜索技术的统一,利用奖励函数直接学习动态PRM,提升推理链扩展和跨任务泛化能力,实验显示性能提升9%并优于基线PRM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02710 2026-08-24 cs.LG 版本更新 57%

Maximum Likelihood Reinforcement Learning

最大似然强化学习

Fahim Tajwar, Guanning Zeng, Yueer Zhou, Yuda Song, Daman Arora, Yiding Jiang, Jeff Schneider, Ruslan Salakhutdinov, Haiwen Feng, Andrea Zanette

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 MaxRL是一种基于采样的强化学习框架,通过最大似然估计提升模型训练效率,实验显示其在多个任务中表现优于现有方法。

Comments ICML 2026. Project website: this https URL (https://zanette-labs.github.io/MaxRL/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20476 2026-08-24 cs.CL 版本更新 57%

When Looks Do Not Lie: Discourse Structure Guided In-Context Learning for Faithful Diagram Generation

用上下文示例能改进教育图表生成吗?如果幻觉破坏了整体效果就不能

Evanfiya Logacheva, Arto Hellas, Tsvetomila Mihaylova, Juha Sorva, Ava Heinonen, Juho Leinonen

机构 * Aalto University(阿尔托大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 本研究通过基于RST的上下文示例方法改进教育图表生成,发现高复杂度上下文增加幻觉风险,LLMs难以检测错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19100 2026-08-24 cs.SE 版本更新 57%

Reward Engineering for Software Tasks: A Survey of Reinforcement Learning Approaches

软件任务中强化学习的奖励工程

Md Rayhanul Masud, Azmine Toushik Wasi, Salman Rahman, Md Rizwan Parvez

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文系统综述了强化学习在软件任务中奖励工程的方法与挑战,旨在整合现有奖励设计方法并提供全面的指导。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 4 篇

2608.01347 2026-08-24 cs.CL 版本更新 74%

Prompt-Induced Waste in Coding Agents: Reasoning, Effort, Harness Design, and End-to-End Cost

提示词诱导的大推理模型浪费:一项预注册的双框架编码智能体基准测试

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 软件智能体 :coding agent(title);分类 cs.CL

AI总结 该研究通过预注册基准测试发现,提示词措辞和智能体框架会大幅影响大推理编码智能体的成本,部分提示指令可成倍增加推理成本却不提升任务成功率,框架选择的成本差异更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12764 2026-08-24 cs.LG cs.CL cs.CR 版本更新 62%

Detecting Functional Memorization in Code Language Models

检测代码语言模型中的功能记忆

Matthieu Meeus, Anil Ramakrishna, Shengyuan Hu, Matthew Grange, Zheng Xu, Luca Melis

机构 * Meta Imperial College London(伦敦帝国学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.LG

AI总结 研究代码语言模型的功能记忆现象,通过反事实设置对比暴露目标代码的模型与未暴露的参考模型,使用文本和功能相似性度量,发现功能记忆超出文本重叠的检测范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03262 2026-08-24 cs.SE cs.CL 版本更新 62%

Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks

Vibe 编程是否安全?在现实任务中对代理生成代码的漏洞基准测试

Songwen Zhao, Danqing Wang, Kexun Zhang, Jiaxuan Luo, Zhuo Li, Lei Li

机构 * Carnegie Mellon University Language Technologies Institute(卡内基梅隆大学语言技术研究所) Columbia University(哥伦比亚大学) Johns Hopkins University(约翰霍普金斯大学) HydroX AI

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL

AI总结 本文通过基准测试发现,Vibe 编程在现实任务中生成的代码安全性不足,尽管功能正确但存在安全漏洞,警示其在安全敏感领域应用的风险。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19816 2026-08-24 cs.CY 版本更新 50%

Understanding as an Explicit and Assessable Component of Frontier AI Safety Decisions

将理解作为前沿AI安全决策的明确且可评估的组成部分

Stephen Barrett, Robin Bloomfield, Alexandra Chirilă, Mamoon Masud, David Meredith Hardy, Phillip Mulvana

专题命中 软件智能体 :coding agent(abstract)

AI总结 该研究提出一种基于Assurance 2.0框架的临时方法,用于明确且可评估前沿AI安全决策中的理解,经两种场景测试,该方法可应用且能驱动工程工作。

Comments Changed first line of abstract

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 1 篇

2607.08164 2026-08-24 cs.CV 版本更新 50%

Continual Test-Time Adaptation in Computer Vision: Methods, Benchmarks, and Future Directions

计算机视觉中的持续测试时间适应:方法、基准和未来方向

Sarthak Kumar Maharana, Shambhavi Mishra, Yunbei Zhang, Shuaicheng Niu, Taki Hasan Rafi, Jihun Hamm, Marco Pedersoli, Jose Dolz, Yunhui Guo

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) LIVIA ETS Montreal, ILLS International Laboratory on Learning Systems (ILLS)(蒙特利尔LIVIA ETS,学习系统国际实验室(ILLS)) Tulane University(路易斯安那州立大学) Nanyang Technological University(南洋理工大学) Hanyang University(翰阳大学)

专题命中 代码评测 :repository(abstract)

AI总结 本文针对计算机视觉中训练与测试数据分布不同的问题,定义CTTA问题,分析持续域转移模式,提出分层分类法将现有方法分为三类,回顾代表性方法并展示实验结果,讨论局限性与新兴方向,为持续测试时间适应研究提供路线图。

Comments TMLR 2026 (July edition)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 3 篇

2607.18970 2026-08-24 cs.SE cs.AI 版本更新 62%

Skillware: A Software Ontology and Engineering Lifecycle for Persistent Behavioral Artifacts

Skillware:用于持久行为工件的软件本体与工程生命周期

Haodi Fan, Zucong Lan

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究针对智能体技能成为持久行为工件却缺乏相关软件本体的问题,引入Skillware,通过Skill Artifact和Skillware Unit管理工件,阐述相关条件与证据,为智能体能力提供可识别、可组合、可维护及可演化的软件本体与工程生命周期。

Comments 26 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03486 2026-08-24 cs.CR eess.SP eess.SY 版本更新 50%

DKD-KAN: A Lightweight knowledge-distilled KAN intrusion detection framework, based on MLP and KAN

DKD-KAN:一种轻量级的知识蒸馏KAN入侵检测框架,基于MLP和KAN

Mohammad Alikhani

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出了一种基于MLP和KAN的轻量级入侵检测框架,利用DKD方法实现知识蒸馏,有效减少模型参数规模并保持高检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11186 2026-08-24 eess.SP 版本更新 50%

KAN-HAR: A Human activity recognition based on Kolmogorov-Arnold Network

KAN-HAR:基于Kolmogorov-Arnold网络的人体活动识别

Mohammad Alikhani

专题命中 仓库级理解 :repository(abstract)

AI总结 该研究提出基于Kolmogorov-Arnold网络(KAN)的人体活动识别(HAR)方法,利用三轴加速度计与MotionSense数据集验证,KAN在分类性能相当或更优的同时参数更少,为HAR提供高效可解释方案。

详情

展开后加载摘要…

URL PDF HTML 收藏