arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-31 至 2026-08-31 共收录 75 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 75 篇

2608.27465 2026-08-31 cs.CL cs.AI cs.CY cs.HC 新提交 92%

The Effect of Emotional Context on Large Language Models' Endorsement of Premature Decisions: Comparing Emotional Vulnerability Across Six Commercial Models

情绪语境对大语言模型支持仓促决策的影响:六种商业模型的情绪脆弱性比较

Cheolho Shin, Yoojin Han, Donghun Shin, Kunho Lee

机构 * Yonsei University(延世大学) Fudan University(复旦大学) St. Johnsbury Academy Jeju(济州圣约翰斯伯里学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究探究情绪语境对LLM支持仓促决策的影响,测试六种商业模型后发现情绪会显著提升模型的支持度,且脆弱性因单个模型而异,仅Claude Opus无显著情绪效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27746 2026-08-31 cs.IR 新提交 92%

NormasTCU --- A Brazilian Portuguese IR Dataset and an Evaluation of LLM-as-a-Judge for Relevance Assessment

NormasTCU——巴西葡萄牙语信息检索数据集及LLM作为相关性评估评判的评估

Leandro Carísio Fernandes, Marcus Vinícius Borela de Castro, Leandro dos Santos Ribeiro, Leonardo Augusto da Silva Pacheco, Edans Flávius de Oliveira Sandes

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对巴西葡萄牙语IR领域缺乏公开数据集的问题,该研究构建了NormasTCU数据集,评估了LLM作为相关性评估评判的效果,发现其在排名感知指标上与人类评判的系统排名相关性较强,可用于该场景的可扩展相关性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26159 2026-08-31 cs.CL cs.AI 版本更新 92%

Self-Generated Text Recognition: Quality Heuristics, Cross-Task Transfer, and Downstream Bias in LLM Evaluation

自生成文本识别:LLM评估中的质量启发式、跨任务迁移与下游偏差

Jesse St. Amand, Callum Canavan, Sohaib Imran, Joseph Hewson, Aaron Lutz, Shi Feng, Puria Radmard, Lennie Wells

机构 * George Washington University(乔治·华盛顿大学) Geodesic Research(吉奥戴斯克研究机构) University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title,title_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究聚焦LLM的自生成文本识别(SGTR)能力,明确了导致过往研究结论分歧的实验设计因素,发现SGTR性能可跨任务迁移,且训练SGTR会引发下游偏差,强调需监控SGTR以保障AI安全。

Comments 31 pages, 9 figures (3 main body, 6 appendix), 18 tables (1 main body, 17 appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05281 2026-08-31 cs.HC 版本更新 92%

Algorithmic Fairness Perceptions in the Global South: Evidence from Bangladesh on Ride-Sharing, Beauty Filters, and Large Language Models

全球南方的算法公平感知:来自孟加拉国关于网约车、美颜滤镜和大型语言模型的证据

Ahmed Abdal Shafi Rasel, Ahmed Mustafa Amlan, Tasmim Shajahan Mim

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 该研究通过对孟加拉国199名民众的双语调查,揭示了情境影响算法公平感知、对算法保护需求普遍、美颜滤镜损害自我形象、识别与阐明LLM文化偏见存在差异等四个关键模式,指出仅结果导向的公平指标存在局限。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28490 2026-08-31 cs.CR cs.AI 新提交 92%

LLM-Based Agents for Software and Systems Security: Approaches, Applications, and Assessment

基于大语言模型(LLM)的软件与系统安全智能体:方法、应用与评估

Jingjing Nie, Jiawei Guo, Krishna Meda, Haipeng Cai

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过系统综述2023-2026年的同行评审文献,梳理基于LLM的软件与系统安全智能体的技术方法、应用及评估,指出当前智能体权限未受限、行为不可审计的局限,并展望未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01629 2026-08-31 cs.CL 版本更新 92%

Benchmarking LLM-as-a-Judge for Long-Form Output Evaluation

基准测试LLM作为裁判在长文本输出评估中的应用

Junjie Chen, Yuxi Dong, Haitao Li, Weihang Su, Yujia Zhou, Min Zhang, Yiqun Liu, Qingyao Ai

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) University of Science and Technology Beijing(北京科技大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LongJudgeBench基准,系统评估LLM裁判在长文本输出评估中的可靠性,发现当前模型存在显著可靠性差距。

Comments EMNLP 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27703 2026-08-31 cs.SE 新提交 91%

Operationalizing Regulations into Code: A Model to Enhance Governance and Compliance in LLM Selection for Software Engineering

将法规转化为代码:一种用于增强软件工程中大型语言模型(LLM)选择的治理与合规性的模型

Jonysberg Quintino, Hermano Moura, Filipe Calegário

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于设计科学研究的三层模型,将法规转化为可操作的LLM选择标准,试点评估显示该模型可识别合规风险,为软件工程LLM治理提供可行方案。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12066 2026-08-31 cs.LG cs.AI cs.CL 版本更新 90%

The Instability of Safety: How Random Seeds and Temperature Expose Inconsistent LLM Refusal Behavior

安全性的不稳定性:随机种子和温度如何暴露LLM拒绝行为的一致性问题

Erik Larsen

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现LLM在随机种子和温度变化下安全拒绝行为不稳定,提出安全性稳定性指数并推荐多样本评估以提高可靠性。

Comments 17 pages, 7 figures, 9 tables. Code and data available at this https URL (https://github.com/erikl2/safety-refusal-stability). v3: corrects dataset attribution (AdvBench+HarmBench, not BeaverTails), fixes label-derived statistics and CIs, revises the judge-noise analysis to a sensitivity framing; conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27470 2026-08-31 cs.CL cs.AI cs.DB 新提交 90%

Select, Don't Train: The Benefits of Modular Entity Disambiguation with LLM-Based Selection

选择,而非训练:基于大语言模型(LLM)选择的模块化实体消歧的优势

Fina Polat, Daniel Daza, Pengyu Zhang, Klim Zaporojets, Paul Groth

机构 * University of Amsterdam(阿姆斯特丹大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Aarhus University(奥胡斯大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 该研究提出将实体消歧的检索与选择解耦,基于LLM选择器对比不同检索策略,发现无需训练的BM25搭配LLM选择器在ZELDA基准上达到先进性能,还支持检测到检索失败时弃权,提升了实体消歧效果。

Comments Accepted at the 25th International Semantic Web Conference (ISWC 2026), Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27990 2026-08-31 cs.CR cs.AI 新提交 90%

CAITLYN: Can LLM Agents Autonomously Synthesize Defenses against Emerging Injection Attacks?

CAITLYN:大语言模型智能体能否自主合成针对新型注入攻击的防御措施?

Zi Liang, Xiaoyu Xu, Yanyun Wang, Minxin Du, Qingqing Ye, Haibo Hu

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM智能体注入攻击防御的三难困境,提出智能体无关防御中间件CAITLYN,其含即时防御与自主合成新防御的双系统,在标准基准与新基准Emerging上均表现优异,可降低攻击成功率。

Comments Source code: this https URL (https://github.com/liangzid/caitlyn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27817 2026-08-31 cs.SD cs.CL eess.AS 新提交 90%

Auditing Generative Audio Calls for Known-Task Audio-LLM Evaluation

针对已知任务音频-LLM评估的生成式音频调用审计

Mengzhe Geng

机构 * National Research Council Canada(加拿大国家研究委员会)

专题命中 评测与基准 :LLM(title,title_cn);pretraining(abstract);分类 cs.CL

AI总结 本研究将生成式音频调用评估设为受控决策问题,通过VocalSound数据集实验发现,带生成式调用的选择器准确率达0.925,优于无调用对照,明确了生成式调用在音频-LLM已知任务评估中的边际价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12451 2026-08-31 cs.AI cs.IR cs.LG 版本更新 90%

ToolSense: A Diagnostic Framework for Auditing Parametric Tool Knowledge in LLMs

ToolSense: 审计LLM中参数化工具知识的诊断框架

Ashutosh Hathidara, Sai Shruthi Sistla, Sebastian Schreiber, Sahil Bansal

机构 * SAP Labs(SAP实验室)

专题命中 评测与基准 :LLM(title_cn,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出ToolSense诊断框架,自动生成三类基准测试,揭示参数化工具检索中知识-检索分离现象,发现模型在模糊查询下性能显著下降。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27734 2026-08-31 q-fin.ST 新提交 89%

What survives honest evaluation? Leakage-safe, search-aware assessment of LLM-driven trading strategy discovery

经得住诚实评估的是什么?针对大语言模型驱动的交易策略发现的防泄漏、感知搜索的评估方法

Eray Gençay

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对LLM发现交易策略时的前瞻偏差与搜索强度未校正问题,提出防泄漏的结构防护及基于试验次数的性能调整系统,经实证验证其可诚实评估策略并量化可信验证所需样本量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12474 2026-08-31 cs.CL cs.AI 版本更新 88%

Evaluating the Performance of Large Language Models on GAOKAO Benchmark

评估大型语言模型在高考基准测试上的性能

Xiaotian Zhang, Chunyang Li, Yi Zong, Zhengyu Ying, Liang He, Xipeng Qiu, Tianxiang Sun, Peng Li, Shiqiao Meng, Yanjun Zheng, Jun Zhan, Zhangyue Yin, Xiannian Hu, Guofeng Quan, Qixiang Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究推出基于中国高考试题的GAOKAO-Bench基准测试,采用零样本设置评估LLMs,发现其高考成绩有竞争力但科目间差异大,模型主观题评分与人类评分中度一致,为LLMs评估提供了可靠基准。

Comments Updated the author metadata to match the manuscript and added Qixiang Wang in recognition of his contribution to data collection and curation. Results and conclusions are unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28053 2026-08-31 cs.CL 新提交 88%

CNeo-Bench: Diagnosing Large Language Models on Chinese Neologisms

CNeo-Bench:针对中文新词汇的大语言模型诊断基准

Kaiyan Zhao, Zhongtao Miao, Zheyong Xie, Shaosheng Cao, Yoshimasa Tsuruoka

机构 * The University of Tokyo(东京大学) Xiaohongshu Inc.(小红书公司) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract_cn);prompting(abstract)

AI总结 本研究构建了含4759个中文新词汇的基准CNeo-Bench,搭配两层评估框架评估18个大语言模型,发现模型在定义生成上表现差,存在识别-操作差距,少样本提示仍无法解决部分难题。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06869 2026-08-31 cs.AI 版本更新 88%

Evidence-Based Intelligent Diagnostic and Therapeutic Visualization System with Large Language Models: Multi-Turn Interaction and Multimodal Treatment Plan Generation

基于证据的智能诊断与治疗可视化系统与大语言模型:多轮交互与多模态治疗方案生成

Yunhan Wang, Yuda Wang, Zhiying Tu, Mingqiang Song, Li Song, Kun Li, Dianhui Chu, Bolin Zhang

机构 * Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院) Shandong Key Laboratory of Digital Service Computing Technology and Systems(山东省数字服务计算技术与系统重点实验室) Weihai Municipal Hospital(威海市人民医院) Shanghai Taizhu Technology Co., Ltd(上海泰山技术有限公司) Tianjin Zhifu Qihuang Medical Technology Co., Ltd(天津中孚启黄医疗技术有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出知识增强的可视化诊断系统,通过知识图谱约束、信息增益驱动提问和多模态治疗呈现,提升中医辨证透明度和治疗可解释性。

Comments 29 pages, 9 figures, 5 tables, including supporting information

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00292 2026-08-31 cs.NI cs.AI cs.CL 版本更新 88%

An LLM-Based Framework for Intent-Driven Network Topology Design

基于LLM的意图驱动网络拓扑设计框架

Kholoud El-Habbouli, Fen Zhou, Stephane Huet

机构 * CERI-LIA, University of Avignon(阿维尼翁大学CERI-LIA实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一个结合分层建模和系统验证的约束驱动流水线,利用大语言模型从自然语言需求生成结构有效且符合约束的网络拓扑,并通过多模型对比评估其正确性和弹性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27463 2026-08-31 cs.AI 新提交 87%

Rating the Raters: Rasch Measurement Theory for LLM Evaluation

评估评估者:用于大语言模型评估的拉施测量理论

Pratik S. Sachdeva, Nathan Boudol

机构 * D-Lab, University of California, Berkeley(加州大学伯克利分校D-Lab) Grenoble INP(格勒诺布尔国立综合理工学院)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究将拉施测量理论应用于LLM评估,通过多维度拉施模型分析发现LLM与人类评估者存在系统性差异,提出RMT适用于各类LLM评估范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28241 2026-08-31 cs.AI 新提交 86%

Beyond Task-Only Matching: Personalized Skill Routing with Counterfactual Evaluation

超越仅任务匹配:基于反事实评估的个性化技能路由

Tianle Wang, Yanghe Zou, Xiang Liu, Ziyao Huang, Chenchen Fu, Weiwei Wu

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) College of Software Engineering, Southeast University(东南大学软件学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学系) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有LLM智能体技能路由仅匹配任务的缺陷,提出SkillFeed渐进式检索-重排序框架,在自主构建的反事实基准上大幅提升了满足用户约束的技能检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27984 2026-08-31 cs.AI 新提交 86%

When Evidence Shapes Collaboration: Knowledge-Conditioned Topology Generation for Multi-Agent Systems

当证据塑造协作:面向多智能体系统的知识条件拓扑生成

Yangxiao Jiang, Jiarun Fan, Mingcong Xu, Yanxi Guo, Jiwen Feng, Shanqing Xu, Mengchen Qian, Wei Chen, Xiaojin Zhang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对多智能体系统拓扑生成的结构-知识错位问题,提出K-GAT框架,在GPQA数据集上较LLM-Debate基线准确率提升15.7%且计算开销更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03162 2026-08-31 cs.AI cs.HC 版本更新 86%

APeB: Benchmarking Personalization Ability of Large Language Model Agents

APeB:大型语言模型智能体个性化能力基准测试

Garry Yang, Zizhe Chen, Xinru Chen, Yongqiang Chen, Jianxiang Wang, Deyu Zou, Linyi Ding, Jialiang Wu, Yunzhong He, Yu Gong, James Cheng, Huaixiao Tou

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 研究大型语言模型智能体在处理原始、未明确查询时的个性化问题,通过引入个性化产品搜索测试平台构建基准测试,评估发现模型处理明确查询较好,但早期查询有困难,简单方法能提升性能。

Comments NA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05122 2026-08-31 cs.CL 版本更新 86%

Self-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data

自我评估已然存在:用最少数据激发基础LLM中的潜在评判校准

XiuYu Zhang, Yi Shan, Junfeng Fang, Zhenkai Liang

机构 * National University of Singapore(新加坡国立大学) Beijing University of Technology(北京理工大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出自我评估激发(SEE)方法,通过少量数据(160个示例)结合校准耦合强化学习和掩码蒸馏,激发基础LLM中已有的预测外部评判者评分能力,在保持答案质量的同时显著提升校准性能。

Comments Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01017 2026-08-31 cs.CL 版本更新 86%

Psychologically Potent, Computationally Invisible: LLMs Generate Social-Comparison-Eliciting Posts They Fail to Detect

心理上有效,计算上不可见:LLM 生成引发社会比较的帖子但无法检测

Hua Zhao, Jiapei Gu, Michelle Mingyue Gu

机构 * Department of English Language Education(英语语言教育系) Analytics/Assessment Research Centre(分析/评估研究中心)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 本研究通过构建小红书社会比较读者诱发基准(XHS-SCoRE),发现 LLM 在生成引发社会比较的帖子时存在生成-检测不匹配,即该信号在领域内可学习但无法通过提示分类稳健访问。

Comments Accepted at the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026). 20 pages; 1 figure and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28042 2026-08-31 cs.CL cs.AI 新提交 86%

SimpCue: Cue-Based Prompting for Multilingual Text Simplification

SimpCue:面向多语言文本简化的基于提示的线索方法

Mehrzad Tareh, Horacio Saggion, Stefan Bott

机构 * Universitat Pompeu Fabra (UPF)(庞培法布拉大学)

专题命中 评测与基准 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对加泰罗尼亚语、西班牙语、意大利语的多语言易读性文本简化任务,以Qwen3-8B为模型,对比不同提示方式的效果,发现预测线索提示表现最优但提升有限。

Comments Accepted at CLEAR-TEXT 2026: Readability and text simplification workshop at the International Conference Computational Linguistics in Bulgaria (CLIB 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26192 2026-08-31 cs.CL cs.AI 版本更新 85%

Comparing Chunking and Embedding Strategies for Turkish RAG Systems

土耳其检索增强生成(RAG)系统的分块与嵌入策略比较

Mustafa Sertaç Türkel, Fatma Nur Korkmaz, Ahmet Tuğrul Bayrak

机构 * Data Science and Innovation Ata Technology Platforms(阿塔技术平台数据科学与创新部门)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对土耳其语RAG系统,对比三种分块策略、五种嵌入模型和两种生成器LLM,发现布局感知分块可压缩嵌入模型差异,最优配置依内容类型而定,最佳单个组件无法组合出最优整体配置,准确率达87.0%。

Comments Accepted to INTCEC 2026. This is the author's pre-print version. The final authenticated version will be available through the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27661 2026-08-31 cs.CL cs.AI 新提交 84%

Knowing Before Answering: Decoding Language Models for Reliable RAG

先知后答:为可靠检索增强生成(RAG)解码语言模型

Syed Mahbubul Huq, Christopher Child, Tillman Weyde, Pranava Madhyastha

机构 * City St George’s, University of London(伦敦城市圣乔治大学) The Alan Turing Institute(阿兰·图灵研究所)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对RAG中检索信息不足或冲突的问题,构建标注数据集,利用语言模型的隐藏激活等特征训练线性分类器,实现可靠的RAG分类,性能优于基线及专用RAG模型。

Comments Accepted at the Third Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20607 2026-08-31 cs.CL cs.AI cs.LG 版本更新 83%

JuryProbe: An Empirical Consensus-Risk Diagnostic for Routing Reference-Free Factuality Judge Panels to Grounded Verification

JuryProbe:用于将无参考事实性评判小组路由至基于事实的验证的经验共识风险诊断方法

Tianxin Zhou, Ruixi Lin

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对无参考事实性LLM评判小组的共识风险诊断方法JuryProbe,通过校准路由策略减少假阴性盲区导致的错误,在FEVER数据上验证了其有效性,可降低假接受并减少参考获取。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 08/2026. 21 pages, 1 figure, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28021 2026-08-31 cs.CR cs.AI cs.MA cs.SE 新提交 83%

Compared to What? A Human-Anchored Security Benchmark for LLM-Generated Infrastructure-as-Code

与什么相比?面向大语言模型生成基础设施即代码的人类锚定安全基准

Animesh Shaw

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究推出GenIaC-SecBench基准,对比大语言模型与人类生成IaC的漏洞密度,发现模型漏洞密度为人类的3.21-3.87倍,供应商扩展思维表现优于提示思维链,还得出可部署性与漏洞无关联等结论,相关代码数据已公开。

Comments 12 pages, 11 figures, 9 tables. Code: this https URL (https://github.com/AnimeshShaw/GenIaC-SecBench) Data: this https URL (https://huggingface.co/datasets/AnimeshShaw/GenIaC-SecBench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27831 2026-08-31 cs.AI cs.LG 新提交 82%

RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests

RealSWE:面向真实用户请求的编码智能体组合式评估

Gyuhyeong Kim, Hyojung Gwon, Jeonghyeon Kim, Kyuhong Shim, Sunjae Lee

机构 * Sungkyunkwan University(成均馆大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对编码智能体评估基准与真实用户请求的差异,构建了新基准sys并评估7种LLM,发现真实输入降低解决率且改变模型排名,明确陈述期望行为和动机可提升LLM软件工程性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28394 2026-08-31 cs.CR cs.CL 新提交 81%

BEACON: Behavior-Anchored Cross-Source Knowledge Graph Construction for Cyber Threat Intelligence

BEACON:面向网络威胁情报的行为锚定跨源知识图谱构建

Changze Li, Yutong Cheng, Tsania Camila Finnisa, Qian Cui, Wei Ding, Peng Gao

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 该研究提出BEACON框架,基于LLM结合MITRE ATT&CK实现跨源CTI知识图谱构建,构建了两个标注数据集,性能优于基线方法至少9%至23%。

详情

展开后加载摘要…

URL PDF HTML 收藏