Annotation-Efficient Language Model Alignment via Diverse and Representative Response Texts
机构 * CyberAgent / Tokyo, Japan(CyberAgent)
专题命中 偏好对齐 :alignment(title);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP Findings, 2025
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * CyberAgent / Tokyo, Japan(CyberAgent)
专题命中 偏好对齐 :alignment(title);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP Findings, 2025
专题命中 偏好对齐 :alignment(abstract);DPO(abstract)
机构 * Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院) ; Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
Comments 19pages, 13 figures, 11 tables
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
Comments 38 pages, 31 figures
机构 * Department of Computer Science, University of Warwick, UK(沃里克大学计算机科学系) ; School of Computer Science, University of Sheffield, UK(谢菲尔德大学计算机科学学院) ; Department of Psychology, University of Warwick, UK(沃里克大学心理学系)
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL
Comments EMNLP 2025 Findings camera-ready, 9+7 pages
机构 * University of Michigan(密歇根大学) ; SaferDrive AI ; The University of Hong Kong(香港大学) ; Tsinghua University(清华大学) ; NVIDIA(英伟达)
专题命中 安全训练 :safety(title,abstract)
Comments 8 pages, 6 figures
机构 * Korea University(韩国大学)
专题命中 安全训练 :alignment(abstract);safety(abstract)
机构 * Machine Learning Department(机器学习部门) ; Heinz College of Public Policy(公共政策学院) ; Carnegie Mellon University(卡内基梅隆大学) ; Center for Data Science and Public Policy(数据科学与公共政策中心) ; University of Chicago(芝加哥大学)
专题命中 安全训练 :safety(abstract);分类 cs.CY、cs.LG
机构 * University of Kent(肯特大学)
专题命中 越狱攻击 :safety(title,abstract);prompt injection(abstract);分类 cs.AI
专题命中 越狱攻击 :alignment(abstract)
机构 * University of Kent(肯特大学)
专题命中 红队测试 :safety(title,abstract);alignment(abstract);red teaming(abstract);prompt injection(abstract)
专题命中 红队测试 :prompt injection(abstract);分类 cs.AI
Comments 17 pages, 6 figures, 2 Tables
机构 * School of Computer Engineering(计算机工程学院) ; Key Laboratory of Multimedia Trusted Perception(多媒体可信感知关键实验室) ; Efficient Computing, Xiamen University(高效计算,厦门大学) ; Tencent Youtu Lab(腾讯优图实验室)
专题命中 幻觉与事实性 :alignment(title,abstract)
Comments Accepted by ICML 2025
机构 * School of Computing and Technology(计算机学院) ; China University of Petroleum(中国石油大学) ; Qingdao(青岛)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI
机构 * Algoverse AI Research(Algoverse AI研究院)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG
机构 * Honda Research Institute (HRI)(本田研究院) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 幻觉与事实性 :safety(abstract)
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI
Journal ref Proceedings of the 42nd International Conference on Machine Learning, Vancouver, Canada. 2025
机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) ; Language and Machine Intelligence Department, Ant Group(蚂蚁集团语言与机器智能部门)
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :trustworthy(title);alignment(abstract);分类 cs.AI、cs.LG
机构 * INESC-ID ; Instituto Superior Técnico - University of Lisbon(理工学院 - 里斯本大学) ; Department of Technology, Operations, and Statistics, New York University(技术、运营与统计系,纽约大学) ; Speech Technology and Machine Learning Group - Universidad Politécnica de Madrid(语音技术与机器学习小组 - 马德里理工大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL
Comments DSTC12 Track 1 Overview Paper. https://chateval.org/dstc12
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
Comments EMNLP 2025 camera-ready; Code: https://github.com/esteng/ambiguous-loophole-exploitation
机构 * Virginia Tech(维吉尼亚理工大学)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 安全评测 :trustworthy(title);分类 cs.AI
Comments 9 pages, 1 figure, 4 tables
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Bloomberg(彭博)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP 2025 main conference
机构 * King’s College Hospital(国王学院医院) ; Nuraxi AI Dev and Doc: AI for Healthcare(Nuraxi AI 人工智能医疗) ; Sage Bionetworks(Sage 生物网络) ; University College London(伦敦大学学院) ; King’s College London(国王学院伦敦)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
机构 * Singapore Management University(新加坡国立大学) ; Capital Normal University(首都师范大学) ; Nanyang Technological University(南洋理工大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.CY
专题命中 安全评测 :alignment(abstract);分类 cs.AI
Comments 14 pages, 3 figs
专题命中 安全评测 :alignment(abstract);分类 cs.AI
机构 * Department of Computer Science, Aarhus University, Denmark(计算机科学系,奥胡斯大学) ; Department of Computer Science, University of Copenhagen, Denmark(计算机科学系,哥本哈根大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
Comments Accepted at EMNLP Findings 2025