arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2606.21861 2026-06-23 cs.CV 新提交 78%

Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization

零样本视觉语言模型用于课堂投入度识别:提示敏感性与跨数据集泛化的基准研究

Aman Goyal, Kshama Nitin Shah, Kemmannu Vineet Venkatesh Rao

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Magna International(麦格纳国际)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本研究系统评估五种视觉语言模型在零样本条件下识别课堂投入度的表现,发现三个主要失败模式:个体学生识别近乎随机、类别崩溃和极端提示敏感性,但场景级分类效果较好。

Comments 11 pages, 6 figures, including supplementary material. Presented as a non-archival paper at the CV4Edu Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21787 2026-06-23 cs.SE 新提交 78%

Towards Imputation of Pre-Trained Language Model Metadata using Semantic Fingerprinting

基于语义指纹的预训练语言模型元数据插补方法

Adekunle Ajibode, Oussama Ben Sghaier, Keheliya Gallaba, Bram Adams, Ahmed E. Hassan

专题命中 评测与基准 :language model(title,abstract)

AI总结 提出语义指纹(SemFin)方法,利用Hugging Face配置文件和仓库标签自动插补缺失的PTLM元数据并重建模型谱系,在317,133个模型上相比基线提升预测准确率最高31.4%,并成功处理16.6%的孤立模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19062 2026-06-18 cs.CV 新提交 78%

DREAM: Extending Vision-Language Models with Dual-Objective Encoding for Cross-Modal Retrieval

DREAM: 通过双目标编码扩展视觉-语言模型用于跨模态检索

Kaleem Ullah, Altaf Hussain, Muhammad Munsif, Sung Wook Baik

机构 * Sejong University(世宗大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) Ulsan National Institute of Science and Technology(乌山国立科学研究院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 提出DREAM模型,通过双路径表示增强与对齐,结合层级视觉编码器和混合语言建模,在视频检索任务中实现新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19053 2026-06-18 cs.CV 新提交 78%

Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: From Evaluation to Diagnosis

大规模视觉-语言模型在细粒度图像任务上的基准测试:从评估到诊断

Hong-Tao Yu, Chen-Wei Xie, Yuxin Peng, Serge Belongie, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院,中国) Alibaba Group(阿里巴巴集团) School of Computer Science and Engineering, School of Intelligence Science and Engineering, and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, China(东南大学计算机科学与工程学院、智能科学与工程学院以及新一代人工智能技术及其交叉应用关键实验室,中国) Wangxuan Institute of Computer Technology, National Key Laboratory for Multimedia Information Processing, Peking University, China(北京大学王轩计算机技术研究所、多媒体信息处理国家重点实验室,中国) University of Copenhagen, Denmark(丹麦哥本哈根大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 提出FG-BMK基准,含101万问题和28万图像,通过人机双范式评估LVLM的细粒度语义识别与视觉判别能力,诊断失败原因,发现视觉表示、语义对齐等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17423 2026-06-17 q-fin.CP stat.ML 新提交 78%

Martingale Doppelgänger-Eval: An Identification Framework for Auditing Candlestick Understanding in Vision-Language Models

鞅双生评估:审计视觉语言模型对K线图理解的识别框架

Ziyao Wang

专题命中 评测与基准 :language model(title,abstract)

AI总结 提出Martingale Doppelgänger-Eval基准,通过受控实验识别VLM是否基于K线证据而非趋势外推进行判断,发现模型忽略或反向利用K线语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15663 2026-06-16 cs.CV 新提交 78%

OneFocus: Enabling Real-World X-ray Security Screening with a Unified Vision-Language Model

OneFocus: 实现基于统一视觉语言模型的真实世界X光安检

Jiali Wen, Hongxia Gao, Litao Li, Yixin Chen, Kaijie Zhang, Qianyun Liu, Xiaoqin Wen

专题命中 评测与基准 :language model(title,abstract)

AI总结 针对X光违禁品检测中新型违禁品适应难和视觉理解不足的问题,提出MMXray数据集和统一视觉语言模型OneFocus,支持问答、定位、分类和图像理解四项核心任务,达到最先进性能。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14114 2026-06-16 eess.SP 新提交 78%

Digital Twin-Based Channel Generation Toolchain and Foundation Model for Low-Altitude XL-MIMO

基于数字孪生的低空XL-MIMO信道生成工具链与基础模型

Mengyuan Li, Yu Han, Jiachen Tian, Chao-Kai Wen, Shi Jin

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 针对低空经济中XL-MIMO系统因3D移动性和近场传播导致的高保真无线数据集获取困难,提出基于数字孪生的工具链LAETwin-XL和条件去噪扩散隐式模型(CDDIM)基础模型,实现从部分信道观测中生成完整信道表示,并支持零样本外推和高效迁移学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11568 2026-06-11 cs.CV 新提交 78%

4DP-QA: Scalable QA for 4D Perception in Vision Language Models

4DP-QA:面向视觉语言模型中4D感知的可扩展问答

Seokju Cho, Abhishek Badki, Hang Su, Jindong Jiang, Ziyao Zeng, Seungryong Kim, Sifei Liu, Orazio Gallo

机构 * NVIDIA(英伟达) Yale University(耶鲁大学) KAIST AI(韩国科学技术院人工智能学院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 针对视觉语言模型难以理解动态场景的问题,提出一种关注运动场景理解的问答生成流水线,通过真运动追踪解耦物体与相机运动,生成大规模数据集4DP-QA和基准4DP-QA-Bench,训练现有模型在外部基准上取得性能提升。

Comments Project page: https://research.nvidia.com/labs/lpr/4dpqa

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07779 2026-06-09 astro-ph.IM astro-ph.GA 新提交 78%

Do Vision-Language Models See Dwarf Galaxies the Way We Do?

视觉语言模型是否像我们一样看待矮星系?

Dimitrios Tanoglidis, Chin Yi Tan, Kate Overdeck, Alex Drlica-Wagner

专题命中 评测与基准 :language model(title,abstract)

AI总结 评估视觉语言模型在识别超暗矮星系候选体任务中的表现,发现零样本模型能复现人类整体校准,但在个体层面存在显著差异,且不确定性估计不可靠。

Comments 8 pages, 4 figures; Accepted at the Conference on Physics and AI at Stanford University (PAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07775 2026-06-09 cs.CV 新提交 78%

DALE-CT: Depth-Aware Foundation Models for Computed Tomography

DALE-CT: 用于计算机断层扫描的深度感知基础模型

Evan W. Damron, Mahmut S. Gokmen, Mitchell A. Klusty, Caroline N. Leach, Emily B. Collier, V. K. Cody Bumgardner

机构 * University of Kentucky(肯塔基大学)

专题命中 评测与基准 :foundation model(title);language model(abstract)

AI总结 提出DALE-CT,一种基于LeJEPA的2D切片模型,通过3D深度感知预训练(利用解剖掩膜和异常标注)提升表示质量,在CT多异常检测中达到与3D视觉语言模型近似的性能。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07641 2026-06-09 cs.CV 新提交 78%

Readable Yet Unpredictable: Rotated-Outcome Prediction in Vision-Language Models

可读但不可预测:视觉语言模型中的旋转结果预测

Lexin Wang, Shenghua Liu, Yiwei Wang, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of California, Merced(加州大学默塞德分校)

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究视觉语言模型能否仅从原图预测180°旋转后的内容,引入RotOutBench基准,发现模型能识别但无法预测旋转结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19515 2026-08-21 cs.CL 新提交 77%

Hear2Act: Benchmarking When Prosody Should Change What an Assistant Does

Hear2Act:对韵律应何时改变助手行为的基准测试

Xinyi Liu, Hooshang Nayyeri, Dilek Hakkani-Tur, Emine Yilmaz, JK Kim, Yifei Zhang, Charith Peris, Hari Thadakamalla

机构 * Amazon(亚马逊公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 该研究推出 Hear2Act 基准,评估发现词汇证据不足时韵律对助手决策很重要,具备音频能力的 LLM 能从语音恢复信息但需显式中间表示才能可靠转化为行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19011 2026-08-20 cs.CR cs.AI 新提交 77%

From Threat Intelligence to Detection: Knowledge-driven Enrichment and Template-based Rule Grounding for Automated Sigma Rule Generation

从威胁情报到检测:知识驱动的丰富化与基于模板的规则落地用于自动化Sigma规则生成

Sepehr Ghaffarzadegan, Boubakr Nour, Makan Pourzandi, Mourad Debbabi, Chadi Assi

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本研究设计了AUTOSIGMA,结合知识驱动丰富化等技术,将非结构化CTI报告自动生成Sigma规则,其在多项指标上优于其他方案。

Comments Submitted for publication and currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18296 2026-08-20 cs.CY cs.AI 新提交 77%

FairGlucose: A CGM Fairness Benchmark Reveals Subgroup Disparities Hidden in Population-Level Validation

FairGlucose:揭示人群水平验证中隐藏亚组差异的CGM公平性基准

Junjie Luo, Xuzhe Zhi, Rui Han, Abhimanyu Kumbara, Anand K. Iyer, Mansur E. Shomali, Ritu Agarwal, Guodong Gordon Gao

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 研究构建FairGlucose基准,发现CGM预测模型人群水平验证掩盖亚组差异,T1D患者误差更高,前沿LLM表现逊于专业神经模型,推动数字健康AI采用亚组分层公平评估标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17827 2026-08-19 cs.CL 新提交 77%

From Global Benchmarks to Local Evaluations: Benchmarking LLMs for the German Public Sector

从全球基准到本地评估:面向德国公共部门的大语言模型基准测试

Camilla Dalerci, Thilo Michael, Robin Schaefer, Daniel Weinland

机构 * Bundesdruckerei GmbH(德国联邦印刷公司)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 该研究针对德国公共部门构建MÖVE评估框架,发现现有LLM基准不适用于本地场景,不同模型在能耗、提供商透明度、德国政党立场认知维度存在显著权衡,公共机构选LLM需结合治理要求而非仅性能排名。

Comments Accepted as non-archival paper at Eval4SD (co-located with KONVENS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17694 2026-08-19 cs.SE cs.AI 新提交 77%

GADR: Gathering Architecture Decision Records from Meeting Transcriptions

GADR:从会议转录文本中收集架构决策记录

Lucas Daniel Costa da Silva, Kiev Gama

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 本文提出多智能体自校正工作流GADR,从原始会议转录文本提取架构决策并生成Nygard格式ADR,经评估其效果优于零样本、少样本基线,还探讨了RAG丰富化的权衡及自动架构文档可追溯性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17671 2026-08-19 cs.SE cs.AI cs.CR 新提交 77%

Benchmarking Automated Security Patch Backporting: How Far Are We?

自动化安全补丁回移植基准测试:我们还差多远?

Jincheng Yang, Yulong Fu, Chengwei Liu, Lyuye Zhang, Fangyuan Zhang, Bingyang Ren, Yang Liu, Hui Li

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 该研究推出涵盖多场景的Porting Benchmark基准,评估五类安全补丁回移植工具,发现工具泛化能力差、复杂补丁性能骤降,明确根本原因并指出优化方向。

Comments 13 pages, 3 figures. Accepted at ASE 2026. Artifact: https://doi.org/10.5281/zenodo.21785770

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16318 2026-08-18 cs.SE cs.AI cs.PF 新提交 77%

Revisiting the Performance of Generative Artificial Intelligence on Introductory Object-Oriented Programming Assessments: Insights from 2026

重新审视生成式人工智能在面向对象编程入门评估中的表现:来自2026年的见解

Marina Lepp, Joosep Kaimre

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究评估ChatGPT-5.2等5种GenAI系统在OOP入门课程评估中的表现,发现其得分高于平均学生,在部分任务有优势但仍存在编译、高级OOP概念等问题,且较前一年有明显改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15932 2026-08-18 cs.AI 新提交 77%

Augmenting Text to Increase Translation Difficulty

通过增强文本提升翻译难度

William Kalikman, Šimon Sukup, Michal Tešnar, Vilém Zouhar

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 针对机器翻译模型评估的饱和问题,提出对抗翻译优化(ATO)方法增强基准文本以提升翻译难度,生成了两个各含350篇英文文本的数据集,验证了其可有效降低翻译质量且无需额外成本。

Comments 18 pages, 8 figures, 10 tables. William Kalikman and Šimon Sukup contributed equally. Published in EAMT 2026. Code: https://github.com/BreakingMT/ATO. Data: https://huggingface.co/datasets/wskal/ATO-datasets

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14683 2026-08-18 cs.LG 新提交 77%

One Score, Two Decisions: Selective Prediction on the Rare-Disease Tail

一个分数,两个决策:针对罕见疾病尾部的选择性预测

Zhaoyang Jiang, Zhizhong Fu, Yunsoo Kim, Zicheng Li, Xuanqi Peng, Fei Teng, Jiacong Mi, Honghan Wu

机构 * School of Health & Wellbeing, University of Glasgow(格拉斯哥大学健康与福祉学院) Shanghai Sixth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第六人民医院) School of Life Science and Technology, University of Electronic Science and Technology of China(电子科技大学生命科学与技术学院)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.LG

AI总结 针对罕见疾病尾部的选择性预测,研究发现现有小型开放权重LLM在超罕见疾病上表现受限,前两位边际可提升部分病例选择性准确率,且仅未标记分数无法确定边际切换是否有益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12905 2026-08-14 cs.CL 新提交 77%

Prompts in the Wild: A Large Analyzed Collection of Transactional Prompts in Code

野外提示:代码中事务性提示的大型分析集合

Victoria Basmov, Yoav Goldberg, Reut Tsarfaty

机构 * Bar-Ilan University(巴伊兰大学) Allen Institute for Artificial Intelligence(艾伦人工智能研究所)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文从GitHub收集57500个代码事务性提示样本,构建结构化本体将其结构化,分析得使用模式呈齐普夫分布,经错误分析验证标注可靠性,发布数据集及浏览界面。

Journal ref Proc. of the 20th Linguistic Annotation Workshop (LAW XX), pp. 257-308, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11332 2026-08-13 cs.CL cs.CV 新提交 77%

Gloss-Free Representation Learning for Cross-Dataset Sign Spotting

无 gloss( gloss 指手语 gloss,即手语的书面转写)的跨数据集手语定位表征学习

Oğuz Akif Tüfekcioğlu, Ezgi Ekin, Mustafa Kaan Çevik, Hacer Yalim Keles

机构 * Hacettepe University(哈杰泰佩大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL

AI总结 本研究针对资源受限语言的手语研究,用土耳其广播语料库 TSL-News 基于转录文本的伪 gloss 标签预训练手语编码器,在跨数据集手语定位任务中显著提升性能,证明松散对齐的广播数据可提供有效弱监督学习手语表征。

Comments Accepted at the 4th LIMIT Workshop (Representation Learning with Very Limited Resources), ECCV 2026. The abstract was shortened to comply with arXiv's 1,920-character limit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11327 2026-08-13 cs.LG q-fin.CP 新提交 77%

Long-Horizon Forecasting of Complete Financial Statements with Forma

使用Forma进行完整财务报表的长周期预测

Travis L. Johnson, Jiannan Jiang, Soumyabrata Chaudhuri, Yihao Chen, Lauren Falvey, Donal O'Cofaigh

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 该研究发布了ProForma-20Q基准,提出Transformer模型Forma,在1至20个季度的完整财务报表预测任务中,击败各类对比模型,优势随期限扩大,且能支持无需重训的情景分析。

Comments 46 pages, 2 figures, 3 tables. Benchmark: https://github.com/forma-lab-mccombs/proforma-20q. Model and weights: https://github.com/forma-lab-mccombs/forma-release

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11146 2026-08-12 cs.CL 新提交 77%

The Illusion of Cross-Lingual Safety in Low-Resource Languages

低资源语言中跨语言安全的错觉

Abigail Oppong, P Sam Sahil, Tadesse Destaw Belay, Maryam Ibrahim Mukhtar, Esmael Ahmed Abdu, Tassallah Abdullahi, Jessica Oparebea, Saminu Mohammad Aliyu, Idris Abdulmumin, Abubakar Juma Chilala, Nicholaus Dismas Ladislaus, Alfred Malengo Kondoro, Lemofouet Valdini Douglace, Shamsuddeen Hassan Muhammad, Seid Muhie Yimam

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现大型语言模型的跨语言安全迁移在四种非洲低资源语言中极为有限,现有多语言安全对齐仅停留在表面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08869 2026-08-11 cs.CL 新提交 77%

Position Bias in Ordinal Classification: A Systematic Evaluation

序数分类中的位置偏差:系统评估

Yu Wang, Jeffrey Zhou, Menglin Liu, Ge Shi

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究系统评估了序数分类中大型语言模型的位置偏差,发现其普遍存在且现有校正方法效果有限,提出需结合预测性能与稳定性选择序数分类系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06672 2026-08-10 cs.CL 新提交 77%

TA-RAG: Tone Awareness as a Design Imperative for Retrieval-Augmented Generation

TA-RAG:将语气感知作为检索增强生成的设计要务

Yong-Bin Kang, Anthony McCosker

机构 * Swinburne University of Technology(斯威本科技大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对标准RAG系统存在的语境脱耦问题,提出TA-RAG框架,将交流对齐与事实准确性并列为核心设计目标,明确语气感知是高风险语境下RAG系统的设计要务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04682 2026-08-06 cs.SE cs.AI 新提交 77%

Active-SWE: Benchmarking Coding Agents for Proactive Bug Fixing without Issue Reports

Active-SWE:针对无问题报告的主动漏洞修复任务的编码智能体基准测试

Haobin Li, Ping Deng, Weizhong Qian, Liang Jiang, Zhenyu Huang, Mouxing Yang, Xi Peng

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Active-SWE是首个针对无问题报告的主动多漏洞修复任务的编码智能体基准,实验显示现有顶尖编码智能体在该任务上性能有限。

Comments 24 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03720 2026-08-05 cs.CL 新提交 77%

Detecting Hallucinations and Recovering Verified Answers in Arabic Islamic Question Answering

阿拉伯语伊斯兰问答中幻觉检测与可信答案恢复

Khaled Ziani

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对阿拉伯语伊斯兰问答场景,基于微调后的google/gemma-4-12B-it模型构建系统,实现了幻觉检测与可信答案选择的两步任务,在公开数据集上取得了优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03018 2026-08-05 cs.AI 新提交 77%

UrbanAgent: A Tool-Augmented Agent for Cross-System Urban Tasks

UrbanAgent:面向跨系统城市任务的工具增强型智能体

Jiayu Cao, Xingyuan Zeng, feiyu Li, Zhijing Huang, Xujie Yuan, Rongxiang Chen, Shimin Di, Libin Zheng, Jian Yin

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 针对城市数字服务碎片化问题,提出工具增强型智能体UrbanAgent,结合大语言模型与多类工具,引入基准Urban-Eval评估,在多模型上任务成功率达71%,领先基线10个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02672 2026-08-05 cs.CR cs.AI cs.ET cs.SE 新提交 77%

Security-First Evaluation of Text-to-Terraform: Benchmarking LLMs and SLMs for Secure IaC Generation

安全优先的Text-to-Terraform评估:针对安全基础设施即代码生成的大语言模型(LLMs)与小型语言模型(SLMs)基准测试

Francis Luis Santos Vargas, Rodrigo Brandão Mansilha, Diego Kreutz

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 该研究针对7款LLMs与SLMs开展Terraform生成基准测试,发现IaC的语法有效性与安全合规性正交,仅靠提示工程不足,自动化多工具扫描是必要补充。

Comments 10 pages, 1 figure, and 9 tables. The benchmark artifacts and CI/CD pipeline are publicly available at https://gitlab.com/repo-anon-iac/repo-anon-9ac. Accepted for publication at SBSeg 2026

详情

展开后加载摘要…

URL PDF HTML 收藏