AURA: Affordance-Understanding and Risk-aware Alignment Technique for Large Language Models
专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL
机构 * University of Exeter(埃克塞特大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
机构 * Department of Electronic Engineering, Sogang University(电子工程系,首尔大学) ; Robotics Institute, Carnegie Mellon University(机器人研究所,卡内基梅隆大学)
专题命中 安全评测 :safety(title,abstract)
Comments 16 pages, 6 figures
机构 * Department of Computational Intelligence, Faculty of Engineering and Technology, SRM Institute of Science and Technology(计算智能系,工程与技术学院,SRM科学与技术学院)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at ACL 2025 (Main)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments arXiv admin note: This paper has been withdrawn by arXiv due to disputed and unverifiable authorship
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments arXiv admin note: This paper has been withdrawn by arXiv due to disputed and unverifiable authorship
专题命中 安全评测 :alignment(abstract);分类 cs.CL
机构 * Shandong University of Finance and Economics(山东财经大学) ; University of Toronto(多伦多大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
专题命中 安全评测 :alignment(abstract);分类 cs.CL
Comments arXiv admin note: This paper has been withdrawn by arXiv due to disputed and unverifiable authorship
机构 * Gradient Institute Ltd.(梯度研究所有限公司)
专题命中 安全评测 :red teaming(abstract);分类 cs.AI
机构 * Peking University(北京大学) ; LinkSure ; University of Glasgow(格拉斯哥大学) ; Boston University(波士顿大学)
专题命中 安全评测 :alignment(abstract)
Comments 17 pages,8 figures