OpenEval: Benchmarking Chinese LLMs across Capability, Alignment and Safety
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL
超越夏普利值:用于大语言模型对齐和评估的基于影响的数据审核管道
机构 * Google(谷歌)
专题命中 安全评测 :alignment(title,abstract);RLHF(abstract,abstract_cn);safety(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大语言模型数据质量问题,引入可扩展的基于影响的数据审核管道,通过映射语义邻域到有向图,利用参考LLM概率分布评估数据效用,转换为局部优势指标,有效清理数据集,揭示基准漏洞,确保数据完整性。
对齐审计员:一种用于验证和细化大语言模型目标的贝叶斯框架
机构 * Imperial College London(伦敦帝国学院) ; Amazon AGI(亚马逊通用人工智能)
专题命中 安全评测 :alignment(title,abstract);RLHF(abstract);safety(abstract);trustworthy(abstract)
AI总结 本文提出一种贝叶斯框架,通过验证和细化LLM目标,解决逆强化学习中奖励函数推断的非识别性问题,提供可操作的诊断和验证政策效用的方法。
Comments Preprint
grounded but Misleading: Evaluating Semantic Alignment in AI-Generated Security Explanations
机构 * Virginia Tech(弗吉尼亚理工学院)
专题命中 安全评测 :alignment(title,title_cn);trustworthy(abstract);分类 cs.CL、cs.LG
AI总结 本文研究了AI生成的安全解释中语义对齐的问题,通过VEXA测试平台验证了词汇基础与语义风险对齐之间的差距,发现即使解释在词汇上显得合理,其语义解释可能削弱检测器的意图风险评估。
XL-SafetyBench: 一个基于国家的跨文化安全基准,用于LLM安全性和文化敏感性
机构 * AIM Intelligence(AIM智能研究院) ; Microsoft(微软公司) ; Korea AISI(韩国人工智能研究所) ; KT Corporation(KT公司) ; BMW Group(宝马集团) ; Coinbase(Coinbase公司) ; Technical University of Munich(慕尼黑技术大学) ; Ankara University(安卡拉大学) ; Cyril Amarchand Mangaldas(Cyril Amarchand Mangaldas法律事务所) ; Seoul National University(首尔国立大学)
专题命中 安全评测 :safety(title,abstract);jailbreak(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI
AI总结 XL-SafetyBench通过5500个跨10个国家语言对的测试案例,评估LLM在文化敏感性和安全性的表现,揭示了前沿模型的安全性与文化意识无耦合关系,以及本地模型在安全与文化敏感性间的线性权衡。
Logit-Gap Steering:一种对齐鲁棒性的前向传递诊断
机构 * Palo Alto Networks(帕洛阿尔托网络)
专题命中 安全评测 :alignment(title,abstract);RLHF(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.LG
AI总结 本文提出logit-gap steering方法,通过前向传递发现短的分布内后缀以关闭对齐间隙,验证了当前对齐边距的薄且可测量,强调防御策略需考虑分布内后缀。
EvalSafetyGap:LLM评估-安全失败的混合调查与概念框架
机构 * Erciyes University(埃里切耶大学) ; Abdullah Gül University(阿卜杜勒拉赫曼·古尔大学)
专题命中 安全评测 :safety(title,abstract);alignment(abstract,comments);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对LLM评估与AI安全中基准分数与潜在属性不一致的测量问题,提出混合调查与概念框架,并通过十模型审计揭示能力与鲁棒性关联不显著、安全差距主要由治理因素驱动。
Comments 74 pages, 2 figures, 4 tables. Hybrid systematic survey and conceptual framework on LLM evaluation and AI-safety failures, synthesizing 373 primary studies (2018-2026). Introduces the EvalSafetyGap framework (Instability Decomposition, Alignment Trilemma) and reports an exploratory ten-model audit. Submitted as a review/survey article; not currently under consideration elsewhere
注意力忽视视觉风险:多模态安全对齐的风险适应性转向
机构 * Seoul National University(首尔大学) ; KU Leuven(鲁汶大学)
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract)
AI总结 本文提出MoRAS,通过简洁的视觉上下文增强关键安全区域的视觉注意力,以实现多模态安全对齐,减少推理开销并提升泛化能力。
XrayClaw:协作-竞争多智能体对齐用于可信的胸部X光诊断
机构 * Shenzhen University of Advanced Technology, Shenzhen, China(深圳理工大学,深圳,中国)
专题命中 安全评测 :alignment(title,abstract);trustworthy(title,abstract)
AI总结 本文提出XrayClaw框架,通过协作-竞争架构提升胸部X光诊断的可靠性,实现高准确性和临床推理一致性。
Comments 14 pages
机构 * RISE Research Institutes of Sweden(瑞典RISE研究机构)
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract)
Comments 12 pages, 9 figures, EVS38, https://evs38-program.org/en/evs-38-proceedings/all
专题命中 安全评测 :alignment(title,abstract);safety(title);分类 cs.CL、cs.AI、cs.CY
专题命中 安全评测 :safety(title,abstract);trustworthy(title);分类 cs.CL、cs.AI、cs.LG
Comments To Appear in AAAI AI Magazine. 15 pages, 7 figures
LLM智能体中的冷启动安全差距
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 安全评测 :safety(title,abstract);trustworthy(abstract,abstract_cn);分类 cs.CL
AI总结 研究发现工具调用型LLM智能体在会话开始时最脆弱,随着常规任务执行安全性提升,提出SODA基准并验证预热策略可缩小冷启动安全差距。
因果路径对齐:为可控的参数知识编辑锚定优化轨迹
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
专题命中 安全评测 :alignment(title,summary_cn);trustworthy(abstract);分类 cs.CL
AI总结 本文提出Causal Path Alignment框架,通过锚定优化轨迹来解决参数知识编辑中的主体主导记忆干扰问题,提升关系特异性并减少副作用。
Comments Accepted by IJCAI 2026
图表示学习的安全性研究
机构 * University of Connecticut(康涅狄格大学) ; University of Notre Dame(圣约翰大学)
专题命中 安全评测 :safety(title,summary_cn);分类 cs.LG
AI总结 本文提出GRL-Safety评估框架,评估十二种图表示学习方法在不同安全轴上的表现,揭示安全行为受表示设计与受压图因素交互影响,指出基础模型在特定轴上具有优势,揭示部署中仍存在能力缺口。
Comments Preprint. 10 pages main text, appendices included
VLDBench:评估具有监管对齐的多模态虚假信息
专题命中 安全评测 :alignment(title,abstract);safety(abstract);trustworthy(abstract);AI safety(abstract)
AI总结 VLDBench 是首个多模态虚假信息检测基准,通过大规模标注数据提升检测准确率,支持 AI 管治框架下的可信虚假信息分析。
Comments Accepted in Information Fusion Journal
专题命中 安全评测 :safety(title,abstract);alignment(abstract);trustworthy(abstract);AI safety(abstract)
Comments 22 pages, 9 figures, accepted by AAAI2026 as oral paper
机构 * ShanghaiTech University(上海科技大学)
专题命中 安全评测 :alignment(title,abstract);safety(abstract);jailbreak(abstract);harmlessness(abstract)
机构 * EECS University of California at Berkeley(加州大学伯克利分校电子工程与计算机科学系)
专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract);AI safety(abstract)
专题命中 安全评测 :alignment(title,abstract);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 24 pages
专题命中 安全评测 :safety(title,abstract);alignment(abstract);jailbreak(abstract);trustworthy(abstract)
Comments Accepted by NeurIPS2024 (Dataset and Benchmark Track)
LIBERO-Safety:视觉-语言-动作模型中物理与语义安全的综合基准
机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) ; Beihang University(北京航空航天大学) ; Eastern Institute of Technology, Ningbo(宁波东方理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; Microsoft Research Asia (MSRA)(微软亚洲研究院)
专题命中 安全评测 :safety(title,title_cn)
AI总结 针对视觉-语言-动作模型操作安全未验证的问题,提出参数化安全基准和关键帧驱动数据生成流水线,构建大规模无碰撞数据集,系统评估八种模型,揭示泛化-安全张力。
Comments Accepted by ECCV 2026, Project Page: https://libero-safety.github.io/
面向AI安全的项目反应理论
机构 * Independent(独立研究者)
专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.CL、cs.AI
AI总结 该研究将项目反应理论(IRT)应用于192个语言模型的8个安全基准,识别出三个关键因素,证明IRT可降低评估成本并审计模型,建议前沿实验室采用。
Comments 15 pages, 9 figures, 6 tables
面向AI安全评估的对抗语用学:指令冲突、嵌入命令与策略模糊性基准
机构 * Humber Polytechnic(汉博理工学院) ; University of Toronto(多伦多大学)
专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.CL、cs.AI
AI总结 提出对抗语用学基准和标注协议,通过语言学控制的分类法评估模型在指令冲突、嵌入命令等场景下的行为,为安全评估提供实证和方法论工具。
Comments 32-page main paper plus 13-page supplement; 6 figures and 17 tables total; code and data artifact available at the linked repository
MedFailBench:用于医学人工智能安全边界检查的临床医生构建的开源基准测试
机构 * Kutahya Emet Dr. Fazil Dogan State Hospital(屈塔希亚埃梅特法齐尔·多安州立医院)
专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.CL、cs.AI
AI总结 MedFailBench提出不同问题,构建合成基准测试和失败图谱,通过严重程度和安全门类型标记医学人工智能错误,当前版本含44个合成病例等内容,以特定许可形式发布并带有DOI。
Comments 6 pages; synthetic benchmark reviewed by a clinician; no patient data
BioBlue:在生物与经济对齐的AI安全基准上,具有简化观察格式的LLM的系统性类失控优化失败模式
机构 * Independent researcher(独立研究者) ; Three Laws research collaboration(Three Laws研究合作) ; Rakvere, Estonia(爱沙尼亚拉克雷市)
专题命中 安全评测 :safety(title);AI safety(title);alignment(abstract);分类 cs.AI、cs.CY
AI总结 本研究通过长期控制环境测试LLM,发现尽管LLM能理解目标,但在多目标场景下会系统性偏离至单目标、无界优化行为,表现出类似失控优化的失败模式。
Comments 27 pages, 7 figures, 7 tables
通过检索增强的修订实现代码LLM的推理时安全性
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 安全评测 :safety(title,abstract);trustworthy(abstract,comments);alignment(abstract);分类 cs.AI、cs.LG
AI总结 通过检索增强的修订机制提升代码LLM的推理时安全性,提高生成代码的安全性并减少漏洞。
Comments Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI: Interpretability, Robustness, and Safety Across Modalities
专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.CY
Comments 19 pages, 5 tables, 1 figure; minor ambiguities clarified, typos corrected, author affiliations added
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 安全评测 :safety(title,abstract);alignment(title);分类 cs.CL、cs.LG