Pareto Multi-Objective Alignment for Language Models
机构 * Ruhr University Bochum(鲁尔大学波恩)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at ECML/PKDD 2025
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Ruhr University Bochum(鲁尔大学波恩)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at ECML/PKDD 2025
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 12 pages, 5 figures, 7 tables
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL
Comments Presented at ACL 2025 SRW
机构 * Arizona State University(亚利桑那州立大学)
专题命中 偏好对齐 :alignment(abstract);DPO(abstract)
Comments COLM 2025
专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG
机构 * Computer Science, Virginia Tech, Blacksburg, Virginia, USA(计算机科学,弗吉尼亚理工学院,弗吉尼亚州黑斯堡,美国;弗吉尼亚理工学院黑斯堡弗吉尼亚美国) ; Virginia Tech Blacksburg Virginia USA
专题命中 偏好对齐 :safety(abstract);分类 cs.AI
Comments Submitted to International Journal of Human-Computer Studies. Bond and Choe: Drafting, Review, Editing, Validation, Software, Methodology, Investigation, Data Analysis, Conceptualization, Experiment training. Hasan and Siddiqui: Experimental and Data Analysis Support. Jeon: Supervision, Review, Resources, Project Admin, Methodology, Conceptualization. Total 34 pages
机构 * University of Washington(华盛顿大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Allen Institute for AI(人工智能研究院) ; Lavita AI(Lavita人工智能) ; Dartmouth Medicine(达特茅斯医学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
Comments 29 pages, 8 figures, 12 tables
专题命中 安全训练 :jailbreak(title,abstract);分类 cs.AI、cs.CY
Comments Homepage: https://poex-jailbreak.github.io/
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY
Comments 42 pages, 6 figures
Journal ref Information 2025, 16(8), 651
专题命中 安全训练 :safety(title)
机构 * Nankai University(南开大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.CY
Comments Accepted to COLM 2025
机构 * Stanley Ngugi(独立研究者)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
Comments 9 pages, 2 visual aids
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
机构 * McGill University(麦吉尔大学) ; Mila (Quebec AI Institute)(蒙特利尔AI研究所) ; Google Deepmind(谷歌DeepMind)
专题命中 安全训练 :safety(abstract);分类 cs.AI
Comments [20250810]: ICML 2025 Camera Ready, https://github.com/mila-iqia/delusions
专题命中 安全训练 :alignment(abstract);分类 cs.AI
专题命中 安全训练 :safety(abstract);分类 cs.AI
Comments 10 pages, 3 figures
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 安全训练 :alignment(abstract)
机构 * Department of Computer Science at University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校计算机科学系) ; College of Transportation and Key Laboratory of Road and Traffic Engineering, Ministry of Education, Tongji University(同济大学交通学院及交通工程教育部重点实验室) ; Department of Mechanical Engineering at the University of California, Berkeley(加州大学伯克利分校机械工程系)
专题命中 安全训练 :safety(abstract)
专题命中 越狱攻击 :jailbreak(title,abstract);prompt injection(abstract);分类 cs.AI
Journal ref IEEE Access, vol. 13, pp. 134976-134988, Jul. 2025
机构 * Imperial College London(伦敦帝国学院) ; California Institute of Technology(加州理工学院)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);AI safety(abstract);分类 cs.LG
Comments 25 pages, 15 figures. Accepted at COLM 2025 SoLaR Workshop
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
机构 * CMU(卡内基梅隆大学)
专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.AI
Comments 10 pages, 1 figure
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
专题命中 隐私与版权 :alignment(abstract)
专题命中 隐私与版权 :trustworthy(abstract)
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
Comments Accepted at IEEE VIS 2025. Urbanite is available at https://urbantk.org/urbanite
机构 * The University of Akron(阿克隆大学) ; University of Tennessee at Chattanooga(田纳西大学查塔努加分校) ; Texas State University(德克萨斯州立大学)
专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI
机构 * School of Computer Science, University of Nottingham Ningbo China(诺丁汉大学宁波校区计算机科学学院)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG
Comments Preprint for an essay to be published in The Importance of Being Learnable (Enhancing the Learnability and Reliability of Machine Learning Algorithms) Essays Dedicated to Alexander Gammerman on His 80th Birthday, LNCS Springer Nature Switzerland AG ed. Nguyen K.A. and Luo Z
机构 * State Key Laboratory of Robotics and System(机器人系统国家重点实验室) ; Harbin Institute of Technology(哈尔滨工业大学) ; State Key Laboratory of Intelligent Green Vehicle and Mobility(智能绿色车辆与移动性国家重点实验室) ; Tsinghua University(清华大学) ; the School of Mechanical and Aerospace Engineering(机械与航空航天工程学院) ; Nanyang Technological University(南洋理工大学) ; Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室) ; Beijing Jiaotong University(北京交通大学) ; the Institute for Infocomm Research(信息通信研究所) ; A*STAR ; the Engineering Cluster(工程集群) ; the Singapore Institute of Technology(新加坡理工学院)
专题命中 安全评测 :safety(title,abstract)