arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

安全优先的Text-to-Terraform评估:针对安全基础设施即代码生成的大语言模型(LLMs)与小型语言模型(SLMs)基准测试

Security-First Evaluation of Text-to-Terraform: Benchmarking LLMs and SLMs for Secure IaC Generation

Francis Luis Santos Vargas, Rodrigo Brandão Mansilha, Diego Kreutz

arXiv 2608.02672首次发表:更新:

发表机构

AI Horizon Labs; Universidade Federal do Pampa (UNIPAMPA)(AI地平线实验室; 潘帕联邦大学)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

该研究针对7款LLMs与SLMs开展Terraform生成基准测试,发现IaC的语法有效性与安全合规性正交,仅靠提示工程不足,自动化多工具扫描是必要补充。

AI 中文摘要

云配置错误仍是安全事件的主要诱因,但大语言模型(LLMs)与小型语言模型(SLMs)能否生成符合安全要求的基础设施即代码(IaC)仍是悬而未决的问题。我们在17种场景下对7款模型进行AWS Terraform生成基准测试,其中包含3款闭源LLMs(Claude Opus 4、GPT-5.4、Gemini 2.5 Pro)和4款开源SLMs(Qwen2.5-Coder-14B、WizardCoder-33B、CodeLlama-13B、Magicoder-S-CL-7B),将Checkov与Trivy扫描工具集成至GitLab CI/CD流水线,在3个安全级别下评估2种提示策略(pass@5)。LLM生成的IaC中,语法有效性与安全合规性基本为正交属性:能可靠生成格式良好Terraform的模型未必能生成安全的Terraform,例如WizardCoder-33B的验证率达77.8%,但Checkov合规率为0;而Claude Opus 4在详细安全提示下达到23.1%的Checkov合规率与92.5%的Trivy通过率。因此,仅靠提示工程是不够的:无论模型家族或提示策略如何,自动化多工具扫描仍是LLM辅助IaC生成的必要补充。所有成果均公开可用。

英文摘要

Cloud misconfiguration remains a leading cause of security incidents, yet whether LLMs and SLMs can generate security-compliant Infrastructure-as-Code is an open question. We benchmark seven models, three closed LLMs (Claude Opus 4, GPT-5.4, Gemini 2.5 Pro) and four open SLMs (Qwen2.5-Coder-14B, WizardCoder-33B, CodeLlama-13B, Magicoder-S-CL-7B), on AWS Terraform generation across 17 scenarios, integrating Checkov and Trivy scanners into a GitLab CI/CD pipeline and evaluating two prompt strategies at three security levels (pass@5). Syntactic validity and security compliance are largely orthogonal properties in LLM-generated IaC, a model that reliably produces well-formed Terraform does not necessarily produce secure Terraform: WizardCoder-33B achieves 77.8% validate rate yet zero Checkov compliance, while Claude Opus 4 reaches 23.1% Checkov and 92.5% Trivy pass rates under detailed security prompting. Consequently, prompt engineering alone is insufficient: automated multi-tool scanning remains a necessary complement to LLM-assisted IaC generation regardless of model family or prompt strategy. All artifacts are publicly available.

Comments10 pages, 1 figure, and 9 tables. The benchmark artifacts and CI/CD pipeline are publicly available at https://gitlab.com/repo-anon-iac/repo-anon-9ac. Accepted for publication at SBSeg 2026

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑