Where Did It Go Wrong? Attributing Undesirable LLM Behaviors via Representation Gradient Tracing
机构 * Singapore Management University(新加坡管理大学)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 16 pages, 4 figures
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Singapore Management University(新加坡管理大学)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 16 pages, 4 figures
机构 * School of Information, Computer, and Communication Technology(信息、计算机与通信技术学院) ; Sirindhorn International Institute of Technology, Thammasat University(泰国朱拉安吞国际技术学院,泰国 Thammasat 大学)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
Comments 6 pages, 8 figures, 7 equations, 1 algorithm
机构 * Virginia Tech(维吉尼亚理工大学)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY
机构 * TRUSTIFAI GMBH(TRUSTIFAI公司) ; TÜV AUSTRIA HOLDING AG(TÜV奥地利控股公司) ; Software Competence Center Hagenberg(哈根贝格软件竞争力中心) ; Johannes Kepler University Linz - Institute for Machine Learning(林茨约瑟夫·约瑟夫斯大学-机器学习研究所)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
Comments 63 pages, 27 figures
机构 * Dept. of Information Engineering University of Pisa, Italy Pisa, Italy(信息工程系 乌迪内大学 乌迪内,意大利)
专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)
机构 * Aix Marseille Univ, CNRS, LIS(阿维尼翁-马赛大学、国家科学研究中心、LIS)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
Comments SIGIR 2025
Journal ref Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval. 2025
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG
机构 * Kempelen Institute of Intelligent Technologies(凯普勒智能技术研究所) ; University of Copenhagen(哥本哈根大学) ; Comenius University in Bratislava(布拉迪斯拉瓦科เมนius大学)
专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY
Comments ACL 2025 main
Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025 Volume 1: Long Papers)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments Minor improvements over previous version
机构 * Queen Mary University of London United Kingdom ; Queen Mary University of London \& Jo z ef Stefan Institute United Kingdom \& Slovenia ; Queen Mary University of London ; Queen Mary University of London \& Jo z ef Stefan Institute
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 59 pages; updated to ICML version
机构 * Trustwise AI ; New York University(纽约大学) ; The Alan Turing Institute(艾伦·图灵研究所)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)信息中心) ; School of Psychology, South China Normal University(华南师范大学心理学学院) ; College of Computer and Cyber Security, Fujian Normal University(福建师范大学计算机与网络安全学院) ; College of Cyber Security, Jinan University(济南大学网络安全学院)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.CY、cs.LG
Comments 26 pages,7 figures
专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at ICLR 2025
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG
Comments 79 pages
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 40 pages, 49 figures
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Submitted to ICLR 2025. 17 pages, 13 figures
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG
Comments Journal article for Philosophical Studies
专题命中 安全评测 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments SpLU-RoboNLP workshop at ACL 2024
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 11 page main body, 98 page appendix, 58 figures
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY、cs.LG
Comments Updated version with major additions (new experiments, evaluation, and attacks)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Arabic-centric, foundation model, large-language model, LLM, generative model, instruction-tuned, Jais, Jais-chat
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
Comments Proceedings for AAAI 2019 Fall Symposium Series - Human-centered AI: Trustworthiness of AI Models & Data
自适应对手:用于大语言模型智能体安全的多轮、多大语言模型基准测试
机构 * Lambda
专题命中 安全评测 :safety(abstract,comments);prompt injection(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出针对无记忆大语言模型防御者的自适应多轮攻击的21场景基准测试,通过观察防御者响应灵活调整攻击。介绍了不同攻击轮次成功率,汇集多个前沿攻击者大语言模型的情况,还指出不同防御者弱点差异及场景排名不一致性,并发布了相关基准测试及数据集。
Comments Second Workshop on Agents in the Wild: Safety, Security, and Beyond
LieCraft:一种用于评估语言模型欺骗能力的多智能体框架
机构 * Intel Labs(英特尔实验室)
专题命中 安全评测 :alignment(abstract,comments);safety(abstract);分类 cs.CL、cs.AI
AI总结 LieCraft通过多智能体隐藏角色游戏评估语言模型的欺骗能力,揭示所有模型在面对高风险领域时均倾向于不道德行为。
Comments AAAI 2026 Alignment track. Authors 1 and 2 contributed equally, 3 and 4 contributed equally, 6 and 7 and 8 contributed equally (ordered by last name)
预测认证无法替代解释认证:复合压力下可信人工智能的能力边界
专题命中 安全评测 :trustworthy(title);分类 cs.AI
AI总结 研究表明仅预测侧认证无法确保AI可信,提出结合预测与解释认证的能力边界框架,可捕捉预测侧认证遗漏的失效模式,为可信AI认证提供新方法。
ConspirED:一个用于研究阴谋论认知特质与大语言模型安全性的数据集
专题命中 安全评测 :safety(title);分类 cs.CL
AI总结 该研究推出首个标注阴谋内容通用认知特质的CONSPIRED数据集,利用其开发识别阴谋特质的计算模型,并发现大语言模型易被阴谋框架误导而复制其修辞模式。
Comments Accepted at TACL