Unified Threat Detection and Mitigation Framework (UTDMF): Combating Prompt Injection, Deception, and Bias in Enterprise-Scale Transformers
机构 * Microsoft Corporation(微软公司)
专题命中 AI治理与伦理 :prompt injection(title,abstract);分类 cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Microsoft Corporation(微软公司)
专题命中 AI治理与伦理 :prompt injection(title,abstract);分类 cs.AI
机构 * Microsoft Corporation(微软公司)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI
Comments 11 pages Includes simulations with over 4 million steps
机构 * Department of Computer Science University of Chicago(计算机科学系芝加哥大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 21 pages, 15 figures, 14 tables. Accepted as a conference paper at COLM 2025. Camera-ready
机构 * HKUST(香港科技大学) ; Microsoft Research Asia(微软亚洲研究院) ; Duke University(杜克大学) ; Northwestern University(西北大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Microsoft(微软)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Research Institute of Big Data(深圳大数据研究院)
专题命中 AI治理与伦理 :alignment(abstract,comments);分类 cs.CL、cs.AI
Comments Cultural Analysis, Cultural Alignment, Word Association Test, Large Language Models. Accepted by EMNLP 2025 (Oral)
机构 * Department of Information Systems, W.P. Carey School of Business, Arizona State University, Tempe, AZ, USA(亚利桑那州立大学信息系统系,W.P. Carey商学院,Tempe分校) ; Department of Computer Science, Cornell University, Ithaca, NY, USA(康奈尔大学计算机科学系) ; Graduate School of Management, University of California Davis, Davis, CA, USA(加州大学戴维斯分校管理研究生院)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI
Comments Accepted at PNAS Nexus
Journal ref PNAS Nexus 2025
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Alibaba Group(阿里巴巴集团)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG
Comments Accepted to EMNLP 2025
专题命中 AI治理与伦理 :safety(abstract)