arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1448 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1448 篇

2512.18542 2026-07-08 cs.CR cs.AI cs.CL cs.LG 版本更新 80%

SecureCode: A Production-Grade Multi-Turn Dataset for Training Security-Aware Code Generation Models

SecureCode:用于训练安全意识代码生成模型的生产级多轮数据集

Scott Thornton

专题命中 评测与基准 :LLM(abstract,abstract_cn);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对AI编码助手生成漏洞代码问题,提出SecureCode数据集,涵盖网络应用安全和AI/ML安全领域,有特定对话结构,经质量保证,发布统一数据集、开源模型及评估框架,是首个提供相关覆盖的公共数据集。

Comments 30 pages, 12 figures, 10 tables. Dataset available at https://huggingface.co/datasets/scthornton/securecode. Code and validation tools at https://github.com/scthornton/securecode

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17360 2026-07-03 cs.CV 版本更新 80%

Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction

Omni-DuplexEval: 评估实时双工全模交互

Chaoqun He, Mingyang Xiang, Yingjing Xu, Bokai Xu, Junbo Cui, Jie Zhou, Yuan Yao, Lijie Wen

机构 * Tsinghua University(清华大学) Tongji University(同济大学) ModelBest Inc.(ModelBest公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Omni-DuplexEval基准,用于系统评估实时双工交互能力,通过两个互补场景评估模型生成连续响应和主动提醒的能力,并揭示现有模型在平衡响应及时性和内容连贯性方面的局限性。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22659 2026-07-03 cs.SE 版本更新 80%

RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices

RealBench: 一个与真实世界软件开发实践对齐的仓库级代码生成基准测试

Jia Li, Hongyi Deng, Yiran Zhang, Kechi Zhang, Tianqi Shao, Tiankuo Zhao, Weinan Wang, Zhi Jin, Ge Li, Yang Liu, Yingtao Fang, Yihong Dong

专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 RealBench通过结合自然语言需求和UML图,评估LLM在结构化设计下的代码生成能力,揭示了LLM在仓库级代码生成中的性能差距和优化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01148 2026-07-03 cs.SE 版本更新 80%

Automatically Enhancing the Quality of Android App Bug Reports

为Android应用程序自动生成高质量的缺陷报告

Antu Saha, Atish Kumar Dipongkor, Sam Bennett, Kevin Moran, Andrian Marcus, Oscar Chaparro

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文提出通过提供具体应用相关信息帮助LLM自动生成清晰详细的缺陷报告,提出BugScribe方法,通过评估显示其生成的报告质量更高且更准确。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22872 2026-07-03 cs.CV 版本更新 80%

ForeSea: AI Forensic Search with Multi-modal Queries for Video Surveillance

ForeSea:面向视频监控的多模态查询AI取证搜索

Hyojin Park, Yi Li, Janghoon Cho, Sungha Choi, Jungsoo Lee, Taotao Jing, Shuai Zhang, Munawar Hayat, Dashan Gao, Ning Bi, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 针对监控视频中多模态查询与时间定位难题,提出ForeSea系统,采用三阶段即插即用流程,结合跟踪、多模态嵌入和视频LLM,在ForeSeaQA基准上准确率提升3.1%,时间IoU提升10.1%。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28517 2026-07-02 cs.HC 版本更新 80%

Drag, Infer, Reproject: Grounding LLMs through Spatial Interaction for Image Clustering

拖拽、推断、重投影:通过空间交互为图像聚类的LLM基础

Yang Liu, Xuxin Tang, Jiahao Xu, Chris North

专题命中 评测与基准 :LLM(title_cn);large language model(abstract);language model(abstract)

AI总结 提出CriterionSI方法,利用大语言模型从用户拖拽交互中推断聚类标准,并引导重投影,实现渐进式标准对齐的图像聚类布局。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04080 2026-06-30 cs.IR 版本更新 80%

Caption Injection for Optimization in Generative Search Engine

生成搜索引擎中的标题注入用于优化

Xiaolu Chen, Jie Bao, Haojie Wu, Zhen Chen, Yong Liao

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Caption Injection,一种多模态G-SEO方法,通过提取图像标题并注入文本内容,提升生成搜索中的主观可见性,实验表明其在G-EVAL指标下优于文本-only基线。

Comments 24 pages, 4 figures, ECML PKDD 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13890 2026-06-29 cs.HC 版本更新 80%

Workshop Paper: An empirical study to understand how students use ChatGPT for writing essays and how it affects their ownership

研讨会论文:一项关于学生如何使用ChatGPT撰写论文及其如何影响论文所有权的实证研究

Andrew Jelson, Sang Won Lee

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 通过用户研究记录学生与ChatGPT的交互过程,分析查询与回复,探讨AI辅助写作对写作教育和评估的影响。

Comments 5 pages, 2 figures, submitted and accepted to ACM CHI Workshop In2Writing in 2024, Please see full paper at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19652 2026-06-29 cs.CR 版本更新 80%

A Plug-and-Play Method for Improving Imperceptibility and Capacity in Practical Generative Text Steganography

一种提高实用生成式文本隐写术不可感知性和容量的即插即用方法

Kaiyi Pang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出FreStega方法,通过重构语言模型概率分布,在自回归生成隐写文本时动态调整token概率,同时提升不可感知性和容量(容量提升15.41%),无需牺牲文本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14837 2026-06-23 cs.CV 版本更新 80%

DamageArbiter: A Multimodal Arbitration Framework for Disaster Damage Assessment from Street-View Imagery

DamageArbiter:一种基于街景图像进行灾害损伤评估的多模态仲裁框架

Yifan Yang, Lei Zou, Wenjing Gong, Kani Fu, Zongrong Li, Siqin Wang, Bing Zhou, Heng Cai, Hao Tian

机构 * organization= Department of Geography, Texas A\&M University , city= College Station , country= USA organization= Department of Landscape Architecture \& Urban Planning, Texas A\&M University , city= College Station , country= USA organization= Department of Industrial Systems Engineering, University of Florida , city= Gainesville , country= USA organization= Spatial Sciences Institute, University of Southern California , city= Los Angeles , country= USA organization= Department of Geography Sustainability, University of Tennessee , city= Knoxville , country= USA

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出DamageArbiter多模态仲裁框架,通过轻量级逻辑回归元分类器仲裁单模态与多模态模型预测分歧,在2556张街景图像上将准确率提升至75.85%,MCC达0.6188,并将过度自信误差从70.58%降至16.45%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22222 2026-06-18 cs.IR cs.MA 版本更新 80%

TWICE: Modeling the Temporal Evolution of Personalized User Behavior via Event-Driven Agents

TWICE:通过事件驱动代理建模个性化用户行为的时间演化

Bingrui Jin, Kunyao Lan, Baihan LI, Mengyue Wu

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出TWICE框架,结合结构化用户画像、事件驱动记忆模块和两阶段工作流,利用LLM模拟用户行为的时间演化,在Twitter数据集上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04799 2026-06-09 cs.CR 版本更新 80%

Maris: A Formally Verifiable Privacy Policy Enforcement Paradigm for Multi-Agent Collaboration Systems

Maris:一种用于多智能体协作系统的形式化可验证隐私策略执行范式

Jian Cui, Zichuan Li, Chi Wang, Luyi Xing, Xiaojing Liao

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对多智能体协作系统(MACS)中敏感数据泄露风险,提出一种基于引用监视器的隐私增强开发范式Maris,通过嵌入消息流控制机制实现细粒度数据保护,并在AutoGen和LangChain框架中实现,实验表明其能有效缓解数据泄露威胁且保持高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11012 2026-06-09 cs.SE 版本更新 80%

Beyond Accuracy: Behavioral Dynamics of Agentic Multi-Hunk Repair

超越准确率:智能体多块修复的行为动力学

Noor Nashid, Daniel Ding, Keheliya Gallaba, Ahmed E. Hassan, Ali Mesbah

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 研究LLM驱动的编码智能体在多块缺陷修复中的行为,通过404个多块bug的1616条修复轨迹分析定位、修复准确率、回归行为及操作动力学,发现修复准确率随bug分散度和复杂度下降,且失败修复消耗更多资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10196 2026-06-09 cs.LG cs.AI 版本更新 80%

Large Models for Time Series and Spatio-Temporal Data: A Survey and Outlook

时间序列与时空数据的大模型:综述与展望

Ming Jin, Yaxuan Kong, Yuxuan Liang, Chaoli Zhang, Siqiao Xue, Xue Wang, James Zhang, Yi Wang, Haifeng Chen, Xiaoli Li, Vincent S. Tseng, Yu Zheng, Lei Chen, Hui Xiong, Shirui Pan, Qingsong Wen

机构 * Griffith University(格里菲斯大学) University of Oxford(牛津大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Zhejiang Normal University(浙江师范大学) Ant Group(蚂蚁集团) Alibaba Group(阿里巴巴集团) Deloitte Service LLP(德勤服务有限责任公司) The University of Hong Kong(香港大学) NEC Laboratories America(NEC美国实验室) A*STAR National Yang Ming Chiao Tung University(阳明交通大学) JD Technology(京东科技) Squirrel Ai Learning

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 综述了面向时间序列和时空数据的大模型,按数据类型、模型类别、范围和应用领域分类,总结了通用与领域专用模型,并整理了相关资源与开放问题。

Comments Accepted by ACM Computing Surveys; 35 Pages; Github Repo: https://github.com/qingsongedu/Awesome-TimeSeries-SpatioTemporal-LM-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27984 2026-08-24 cs.AI 版本更新 79%

Share the Judge, Learn the Deferral: Where Specialization Helps LLM Evaluation

共享评判,学习弃权:专业化在大语言模型评估中的作用

Ye Chen, Weining Zhang

机构 * Cheung Kong Graduate School of Business(长江商学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 该研究探讨大语言模型评估中领域专业化的架构设计,发现将专业化置于弃权而非评判环节,通过共享学习与级联路由可提升评估准确率并降低计算量。

Comments 18 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25497 2026-08-24 cs.CV cs.AI 版本更新 79%

A Distributional Robustness Margin For Pathology Foundation Models

超越计数:病理学基础模型的分布稳健性余量

Clément Grisi, Jeroen van der Laak, Geert Litjens

机构 * Radboud University Medical Center(拉德堡德大学医学中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 研究病理学基础模型受非生物学变异影响的问题,提出交叉混杂稳健性余量(CRoMa),通过直接比较距离评估模型稳健性,将其重塑为队列范围的余量分布,为模型选择和稳健性评估提供原则基础。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07382 2026-08-21 cs.LG astro-ph.HE astro-ph.IM 版本更新 79%

Generalist Vision-Language Models for Fast Radio Burst detection: a zero-shot benchmark against a specialized detector

用于快速射电暴检测的通用视觉语言模型:针对专用探测器的零样本基准测试

Raiff H. Santos, Amilcar R. Queiroz, Tharcisyo S. S. Duarte, K. E. L. de Farias, Rafael A. Batista

机构 * Universidade Federal de Campina Grande(坎皮纳格兰德联邦大学) Instituto de Formação de Educadores, Universidade Federal do Cariri(卡里里联邦大学教育工作者培训学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 研究通用视觉语言模型在零样本下检测快速射电暴,从模拟动态频谱中抽取样本作基准,比较其与专用探测器,发现Gemma 4 2B准确率与SwinYNet相近,在结构化RFI上误报率低,重写提示可用于三类分类,准确率较高。

Comments 31 pages, 7 figures. Section added with analysis for real data. New figures and tables added. Other minor changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15565 2026-08-20 cs.AI 版本更新 79%

Admission Without Answers: Label-Free Certification and Experience Learning for LLM-Based Optimization Modeling

无答案准入:基于大语言模型的优化建模的无标注认证与经验学习

Junbo Jacob Lian, Huiling Chen, Hanzhang Qin, Chung-Piaw Teo

机构 * Institute of Operations Research and Analytics(运营研究与分析研究所) National University of Singapore(新加坡国立大学) Wenzhou Buyi Pharmacy(温州布衣药房) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Wenzhou University(温州大学)

专题命中 评测与基准 :LLM(title);prompting(abstract);分类 cs.AI

AI总结 本文提出AdmitOR这一无标注准入机制,通过跨家族团校准阈值实现模型接纳,在优化建模任务中显著提升接纳精度并减少污染接纳,为无标注场景下的模型准入提供了新方案。

Comments Code and data are available at https://github.com/junbolian/AdmitOR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10302 2026-08-19 cs.LG q-bio.QM 版本更新 79%

How to make the most of your masked language model for protein engineering

如何充分利用你的掩码语言模型进行蛋白质工程

Calvin McCarter, Nick Bhattacharya, Sebastian W. Ober, Hunter Elliott

机构 * BigHat Biosciences(BigHat生物科学公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文提出一种灵活有效的掩码语言模型采样方法,通过系统评估模型和方法在抗体工程中的实际应用,揭示采样方法对生物性质优化的重要性。

Comments Accepted into the GEM Workshop, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08913 2026-08-19 cs.LG cs.CR q-bio.GN 版本更新 79%

Quantifying Memorization and Privacy Risks in Genomic Language Models

量化基因组语言模型中的记忆化与隐私风险

Alexander Nemecek, Wenbiao Li, Xiaoqian Jiang, Jaideep Vaidya, Erman Ayday

机构 * Case Western Reserve University(凯斯西储大学) UTHealth(UT健康) Rutgers University(罗格斯大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文提出多向量隐私评估框架,量化基因组语言模型的记忆风险与隐私威胁,揭示不同架构和训练制度下的记忆差异。

Comments Accepted at ACM BCB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11891 2026-08-18 cs.CY cs.AI cs.HC 版本更新 79%

Benchmark-Based Comparative Assessment of Publicly Benchmarked Indian Foundation Models: A Capability and Evaluation-Maturity Framework

基于基准的公开基准印度基础模型对比评估:能力与评估成熟度框架

Avinash Agarwal, Vridhi Jain

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出能力与评估成熟度框架,对公开基准的印度基础模型与全球同类模型对比评估,发现其在传统基准表现尚可但参与新评估不足,还提出基准成熟度指数,指出能力差距或源于评估生态问题。

Comments 19 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00801 2026-08-18 cs.AI cs.IR 版本更新 79%

The Synthetic Web: Adversarially-Curated Mini-Internets for Diagnosing Epistemic Weaknesses of Language Agents

合成网络:用于诊断语言代理知识弱点的对抗性定制迷你互联网

Shrey Shah, Levent Ozgur

机构 * Microsoft(微软)

专题命中 评测与基准 :language agent(title,abstract);分类 cs.AI

AI总结 本研究提出合成网络基准测试,通过对抗性内容测试揭示语言代理在处理冲突信息时的弱点,为高风险领域中的可靠代理开发提供评估框架。

Comments This version includes a revised manuscript presentation and formatting, expanded methodological and experimental details, enhanced reproducibility documentation, and improved benchmark framing and evaluation descriptions

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18094 2026-08-18 cs.CV cs.AI cs.DB 版本更新 79%

OODBench: Out-of-Distribution Benchmark for Large Vision-Language Models

OODBench: 用于大型视觉-语言模型的分布外基准

Ling Lin, Yang Bai, Heng Su, Congcong Zhu, Yaoxing Wang, Yang Zhou, Huazhu Fu, Jingrun Chen

机构 * University of Science and Technology of China Suzhou Institute for Advanced Research, USTC Key Laboratory of the Ministry of Education for Mathematical Foundations Unmanned System Research Institute, Northwestern Polytechnical University

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 OODBench提出了一种自动化方法,用于构建评估大型视觉-语言模型处理分布外数据能力的基准,并展示了当前模型在面对此类数据时的性能下降。

Comments 54 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01856 2026-08-17 cs.AI 版本更新 79%

EchoChange: A Diffusion Language Model with Dual Pass Remasking for Factual Remote Sensing Disaster Change Captioning

EchoChange:用于事实性遥感灾害变化描述的双遍重掩蔽扩散语言模型

Dongwei Sun, Bowen Yao, Yujie Zhang, Pei Liu, Jing Yao, Xiangyong Cao

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 针对现有遥感灾害变化描述方法的级联事实错误问题,提出EchoChange扩散语言模型,经实验在RSCC基准上优于各类基线

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11941 2026-08-14 cs.AI 版本更新 79%

OEIS Open: How many conjectures can language models turn into theorems?

OEIS Open:语言模型能将多少个猜想转化为定理?

Tom Adamczewski

机构 * Epoch AI

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本研究构建OEIS Open基准,发现配备最少工具的语言模型在适中预算下可自主解决部分OEIS未解决数学猜想,访问大量数学文献或复杂智能体循环未提升其性能。

Comments 26 pages, 6 figures. Code: https://github.com/epoch-research/LeanOpenProblems, results: https://github.com/epoch-research/LeanOpenProblems-results

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06718 2026-08-14 cs.CL 版本更新 79%

Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation

音频语言模型是否使用副语言证据?用于响应评估的反事实审计

Kevin Miller, Arjun Chandra, Venkatesh Saligrama

机构 * Boston University(波士顿大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 该研究针对用作语音转语音系统评判者的音频语言模型,提出反事实审计方法,发现其评判可靠性常被对比成功高估,需结合行为审计而非仅准确率评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06200 2026-08-14 astro-ph.SR astro-ph.IM cs.AI 版本更新 79%

StarEmbed: Benchmarking Time Series Foundation Models on Astronomical Observations of Variable Stars

StarEmbed:在变星天文观测上对时间序列基础模型进行基准测试

Weijian Li, Hong-Yu Chen, Nabeel Rehemtulla, Ved G. Shah, Dongho Kim, Dennis Wu, Qinjie Lin, Adam A. Miller, Han Liu

机构 * Department of Computer Science, Northwestern University(计算机科学系,西北大学) Center for Foundation Models and Generative AI, Northwestern University(基础模型与生成AI中心,西北大学) NSF – Simons AI Institute for the Sky (SkAI)(国家科学基金会-斯隆人工智能天文研究所(SkAI)) Department of Physics and Astronomy, Northwestern University(物理与天文学系,西北大学) Center for Interdisciplinary Exploration and Research in Astrophysics (CIERA)(天文学跨学科探索与研究中心(CIERA)) Department of Statistics and Data Science, Northwestern University(统计与数据科学系,西北大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 StarEmbed首次在变星天文观测上对时间序列基础模型进行基准测试,展示了TSFMs在天文任务中的优越性能和泛化能力。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11729 2026-08-14 cs.CV cs.LG 版本更新 79%

SpaRRTa: A Synthetic Benchmark for Evaluating Spatial Intelligence in Visual Foundation Models

SpaRRTa:用于评估视觉基础模型空间智能的合成基准

Turhan Can Kargin, Wojciech Jasiński, Adam Pardyl, Bartosz Zieliński, Marcin Przewięźlikowski

机构 * AGH University of Krakow(克拉科夫AGH大学) IDEAS NCBR

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 SpaRRTa通过评估视觉基础模型的空间推理能力,揭示其在不同空间任务中的表现差异,旨在推动更高效的空间意识视觉模型发展。

Comments Project page is available at https://sparrta.gmum.net/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02587 2026-08-11 cs.SE cs.LG 版本更新 79%

The Moving Target: A Longitudinal Audit of Trust-Benchmark Score Drift Across Open-Source Chat LLM Release Lines

移动目标:对开源聊天语言模型十二个检查点的可信度漂移进行纵向审计

Zhichao Fan, Yanhang Li, Zexin Zhuang, Xian Sun, Yingshuo Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南方 Methodist 大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

AI总结 通过对四个开源版本系列在多提示模板下的信任基准测试,发现相邻版本间存在显著漂移,结论是发布线的信任分数应重新测量,而非沿用,应作为检查点相关的日期化工件报告。

Comments 6 pages, 1 figure; accepted at IEEE ICMLA 2026; title, presentation, and formatting revised from v1; empirical results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13138 2026-08-06 cs.SE cs.CR cs.LG 版本更新 79%

A Comprehensive Evaluation of Code Language Models for Security Patch Detection

以代码为中心的漏洞修复提交检测:一个统一的基准和实证研究

Nils Loose, Joseph Bienhüls, Kristoffer Hempel, Felix Mächtle, Thomas Eisenbarth

机构 * University of Lübeck(吕贝克大学) University of Lübeck Institute for IT Security(吕贝克大学信息安全部)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文通过统一框架评估了基于代码语言模型的漏洞修复提交检测,发现仅依赖代码变更无法让模型获得可转移的安全相关代码理解,且在去除提交信息后,增加内过程语义上下文也无法使模型关注代码变更,性能受数据分布和时间分割影响显著。

Comments Accepted at ASE26

详情

展开后加载摘要…

URL PDF HTML 收藏