arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-01-05 至 2026-01-05 共收录 7 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 1 篇

2505.07167 2026-01-05 cs.CR cs.CL 57%

One Trigger Token Is Enough: A Defense Strategy for Balancing Safety and Usability in Large Language Models

一个触发标记就足够:一种在大型语言模型中平衡安全性和可用性的防御策略

Haoran Gu, Handing Wang, Yi Mei, Mengjie Zhang, Yaochu Jin

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 本研究提出D-STT算法,通过识别和解码安全触发标记,有效提升大型语言模型的安全性,同时保持其可用性与响应效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 2 篇

2601.00477 2026-01-05 cs.CR cs.SE 57%

Security in the Age of AI Teammates: An Empirical Study of Agentic Pull Requests on GitHub

AI队友时代的安全:对GitHub上代理拉取请求的实证研究

Mohammed Latif Siddiq, Xinye Zhao, Vinicius Carvalho Lopes, Beatrice Casey, Joanna C. S. Santos

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 研究分析了GitHub上代理撰写的PR在安全方面的贡献,发现其主要进行支持性的安全加固活动,且PR被拒绝与复杂性和冗长性相关。

Comments Submitted to Information and Software Technology Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24656 2026-01-05 cs.SE 57%

Characterizing Bugs and Quality Attributes in Quantum Software: A Large-Scale Empirical Study

量子软件中缺陷和质量属性的特征化:一项大规模经验研究

Mir Mohammad Yousuf, Shabir Ahmad Sofi

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 本研究通过大规模分析量子软件缺陷,揭示了全栈库和编译器的高缺陷率及自动化测试对减少缺陷的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 2 篇

2601.00481 2026-01-05 cs.NI cs.AI 57%

MAESTRO: Multi-Agent Evaluation Suite for Testing, Reliability, and Observability

MAESTRO:多智能体评估套件用于测试、可靠性与可观测性

Tie Ma, Yixi Chen, Vaastav Anand, Alessandro Cornacchia, Amândio R. Faustino, Guanheng Liu, Shan Zhang, Hongbin Luo, Suhaib A. Fahmy, Zafar A. Qazi, Marco Canini

机构 * Beihang University(北航大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 MAESTRO通过统一接口评估多智能体系统的测试、可靠性和可观测性,揭示架构对资源配置和性能权衡的核心影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00213 2026-01-05 cs.CR cs.CL 57%

Overlooked Safety Vulnerability in LLMs: Malicious Intelligent Optimization Algorithm Request and its Jailbreak

LLMs中被忽视的安全漏洞:恶意智能优化算法请求及其突破

Haoran Gu, Handing Wang, Yi Mei, Mengjie Zhang, Yaochu Jin

机构 * Xidian University(西安电子科技大学) Victoria University of Wellington(威灵顿维多利亚大学) Westlake University(西湖大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 本研究揭示了LLMs在恶意智能优化算法请求中的安全漏洞,提出MOBjailbreak方法并评估了其对主流模型的攻击效果,强调了对齐技术在防范滥用中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 1 篇

2505.16587 2026-01-05 cs.SE 57%

A Survey on the Application of Large Language Models in Scenario-Based Testing of Automated Driving Systems

面向自动驾驶系统场景化测试的大型语言模型应用综述

Yongqi Zhao, Ji Zhou, Dong Bi, Tomislav Mihalj, Jia Hu, Arno Eichberger

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文综述了大型语言模型在自动驾驶系统场景化测试中的应用,系统分类了其在不同测试阶段的角色,并总结了关键特性与使用策略,同时指出了五个开放挑战和研究方向。

Comments 24 pages, 11 figures

Journal ref IEEE Transactions on Intelligent Transportation Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 程序分析与验证 1 篇

2601.00509 2026-01-05 cs.CR cs.LG 74%

Improving LLM-Assisted Secure Code Generation through Retrieval-Augmented-Generation and Multi-Tool Feedback

通过检索增强生成和多工具反馈改进LLM辅助的安全代码生成

Vidyut Sriram, Sawan Pandita, Achintya Lakshmanan, Aneesh Shamraj, Suman Saha

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 程序分析与验证 :code generation(title);分类 cs.LG

AI总结 通过检索增强生成和多工具反馈,改进LLM辅助的安全代码生成,显著减少安全漏洞和缺陷率。

详情

展开后加载摘要…

URL PDF HTML 收藏