Quantifying Logical Consistency in Transformers via Query-Key Alignment
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.LG
专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI
Comments AAAI-AISI 2025
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
Comments Submitted to IJCAI 2025
专题命中 安全评测 :safety(abstract,comments);AI safety(abstract,comments);分类 cs.AI、cs.CY
Comments Presented at UK AI Safety Institute (AISI) Conference on Frontier AI Safety Frameworks (FAISC 24), Berkeley CA, November 2024
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI
Comments 11 pages
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI
Comments 12 pages, 12 figures
专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI
Comments Accepted at EMNLP 2024 Findings
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
Comments PhD thesis
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.CY
Comments 5 pages, 2 figures
Journal ref ACM Conversational User Interfaces 2024 (CUI '24), July 8--10, 2024, Luxembourg, Luxembourg
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI
Comments Published at NAACL 2024. Code: https://seaeval.github.io/
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
Comments Accepted at NeurIPS 2023 Workshop on Tackling Climate Change with Machine Learning: Blending New and Existing Knowledge Systems
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI
Comments Fix typos in Table 1
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
Comments 9 pages, 8 figures
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
Comments UNSURE2023 (Uncertainty for Safe Utilization of Machine Learning in Medical Imaging) at MICCAI2023; Spotlight
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI
Comments Try BayLing's online demo at http://nlp.ict.ac.cn/bayling/demo
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
Comments 27 pages, 5 figures
专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.LG
Comments International Journal of Artificial Intelligence in Education (Accepted)
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
Journal ref Proceedings of the Genetic and Evolutionary Computation Conference Companion GECCO 21 (2021)
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI
专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI
Comments Accepted in SmartComp 2020 (SmartSys)
Journal ref IEEE INTERNATIONAL CONFERENCE ON SMART COMPUTING (SMARTCOMP 2020)
专题命中 安全评测 :trustworthy(title,journal_ref);分类 cs.LG
Journal ref AAAI workshop on Trustworthy AI for Healthcare, 2022
专题命中 安全评测 :safety(title,comments);分类 cs.LG
Comments Safety and Robustness in Decision Making Workshop at NeurIPS 2019
缺失的层次:人工智能监督的规范基础设施
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract)
AI总结 研究指出人工智能安全监督存在协调差距,提出两轴分类法。针对规范层缺乏成熟学科标志的问题,给出六项设计原则,以CARMA为例展示如何让规范可组合,助独立团队构建缺失部分实现有效监督。
通过跨调查转移进行硅采样
机构 * National Sun Yat-sen University(国立中山大学) ; National Chung Hsing University(中国台湾国立中兴大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究提出跨调查转移评估框架,用大语言模型根据部分问题答案预测同调查中其他不同问题答案。利用2024年台湾选举与民主化研究数据等,发现零样本大语言模型精度及不同结构可预测性层级等,明确硅采样前景与局限。