Logic-Based Explainability: Past, Present & Future
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
Comments 43 pages, 5 figures
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL
专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL
Comments 9+6 pages, Submitted to ACL 2024
专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.LG
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL
Comments 19 pages, 14 figures
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
Comments 14 pages, 8 figures
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI
Comments 13 Pages, 1 Figure, 8 Tables
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG
Comments Accepted AAAI 2024
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CY
Comments Accepted at Socially Responsible Language Modelling Research (SoLaR) workshop, NeurIPS 2023 (https://openreview.net/forum?id=8iXdNXW34d). Based on previous manuscript version: doi:10.2139/ssrn.4446991
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI
Comments 18 pages, 9 figures, under review
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
Journal ref IEEE 27th International Conference on Emerging Technologies and Factory Automation (ETFA), Stuttgart, Germany, 2022
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG
Comments 14 pages, 12 figures
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG
Comments 18 pages, 6 figures. Preprint submitted to NeurIPS 2023
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL
Comments EMNLP 2023 Findings
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CY
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CY
Comments In the 16th International Symposium on Distributed Autonomous Robotic Systems 2022, November 28-30, 2022, Montbeliard, France
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG
Journal ref Proceedings of the 18th International Joint Conference on Computer Vision, Imaging and Computer Graphics Theory and Applications - Volume 5: VISAPP, 878-887, 2023
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG
Comments 11 pages, 2 figures, 8 tables
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CY
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG
Comments 10 pages, 10 figures, submitted to IEEE BigData 2022 conference
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 36 pages, 2 figures, see https://haidecisionmaking.github.io for website
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 23 pages, 6 figures, published in Findings of EMNLP 2021
用于特征发现与控制的多模态模型差异分析
机构 * University of Oxford(牛津大学) ; Microsoft(微软公司)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG;trustworthy(comments)
AI总结 本研究提出MMDiff多模态模型差异分析框架,训练多模态SAEs以识别多模态训练改变的特征,实现特征隔离、检测与控制,在空间、OCR任务及多模态安全攻击评估中展现出良好效果。
Comments Preprint. Accepted at ICML 2026 Trustworthy AI for Good Workshop
Hearsay:无需图像的视觉-语言医学诊断
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Amazon Web Services AI Native(亚马逊网络服务AI原生部门)
专题命中 安全评测 :trustworthy(abstract,comments);分类 cs.CL、cs.AI、cs.CY
AI总结 该研究发现前沿视觉-语言模型在无图像时会基于人口统计学特征编造医学诊断,存在不同失败模式,提出需直接审计其结构化输出通道并将探针词敏感性作为核心评估维度。
Comments Peer-reviewed and presented at the 1st Workshop on Toward Trustworthy Vision-Language Models in the Wild (TrustVLM), co-located with ACM ICMR 2026, Amsterdam. Non-archival workshop. Reviews public on OpenReview. 5 pages, 2 figures
首先,不伤害:打破媒体推荐中的自杀性回音室
机构 * E.T.S.I. Sistemas Informáticos (Universidad Politécnica de Madrid)(马德里理工大学信息系统工程系)
专题命中 安全评测 :safety(abstract,comments);分类 cs.AI、cs.CY、cs.LG
AI总结 针对推荐系统在心理健康场景中可能加剧用户自杀倾向的问题,提出RankAid重排序方法,通过惩罚有害内容并提升治疗性内容,在保持推荐准确性的同时确保临床安全。
Comments 10 pages, 5 figures. Research on safety-aware recommender systems and algorithmic ethics