SPA: Achieving Consensus in LLM Alignment via Self-Priority Optimization
机构 * University of Notre Dame(诺特大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);harmlessness(abstract);trustworthy(abstract)
Comments Accepted by AAAI 2026 (Oral)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * University of Notre Dame(诺特大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);harmlessness(abstract);trustworthy(abstract)
Comments Accepted by AAAI 2026 (Oral)
机构 * Mila–Quebec AI Institute(魁北克AI研究所)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract);分类 cs.AI
Comments ICML 2025
机构 * Rensselaer Polytechnic Institute(罗切斯特理工学院) ; IBM Research(IBM研究院) ; Cornell University(康奈尔大学)
专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
Comments 13 pages, 1 figure
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.LG
机构 * Alibaba.com US E-Commerce(阿里巴巴美国电子商务) ; Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY
机构 * University of California(加州大学) ; California Institute of Technology(加州理工学院) ; Abiomed(阿比omed)
专题命中 安全训练 :safety(abstract);分类 cs.LG
机构 * University of Bath(巴斯大学)
专题命中 安全训练 :safety(abstract);分类 cs.LG
Comments Camera-ready version. Published at the Conference on Neural Information Processing Systems (NeurIPS 2025)
Journal ref Proceedings of the Conference on Neural Information Processing Systems (NeurIPS 2025)
机构 * University of Science and Technology of China(科学技术大学)
专题命中 安全训练 :safety(abstract);分类 cs.CL
机构 * University of California, Berkeley(加州大学伯克利分校) ; Columbia University(哥伦比亚大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 安全训练 :alignment(comments,journal_ref);分类 cs.AI、cs.LG
Comments Accepted by ICML 2025 Workshop on Models of Human Feedback for AI Alignment
Journal ref ICML 2025 Workshop on Models of Human Feedback for AI Alignment
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.LG
Comments Accepted to AAAI 2026
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Brown University(布朗大学) ; University of Michigan Ann Arbor(密歇根大学安娜堡分校) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Boise State University(博伊西州立大学)
专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.LG
Comments 45 pages
机构 * Department of Computer Science(计算机科学系) ; Tennessee Tech University(田纳西科技大学) ; School of Interdisciplinary Informatics(跨学科信息学学院) ; University of Nebraska Omaha(内布拉斯加大学奥马哈分校)
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI
专题命中 越狱攻击 :jailbreak(abstract)
机构 * University of California, Santa Barbara(加州大学圣巴bara分校)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI
Comments At IEEE S&P 2026
机构 * KAIST(韩国科学技术院)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI
Comments Accepted to IJCNLP-AACL 2025 Findings
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
Comments 5 pages, 3 tables, 4 figrues
机构 * Imperial College London, UK(伦敦帝国学院) ; Singapore Management University(新加坡管理大学)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
Comments Accepted by NeurIPS 2025
机构 * Devoteam
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
Comments Preprint under review (2025). 9 pages, 2 figures. Code and scripts: to be released
机构 * Technical University of Munich (TUM)(慕尼黑技术大学) ; TUM University Hospital(慕尼黑技术大学医院) ; German Heart Center TUM University Hospital(慕尼黑技术大学医院德国心脏中心) ; Department of Radiology(放射科) ; Klinikum rechts der Isar TUM University Hospital(慕尼黑技术大学医院右岸诊所) ; Uniklinik RWTH Aachen(亚琛工业大学医院) ; HOPPR IL USA(HOPPR美国) ; University of Oxford(牛津大学) ; Imperial College London(伦敦帝国学院)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
Comments Accepted to ML4H 2025 Proceedings
机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工大学计算机工程系)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
Comments Accepted at GenProCC NeurIPS 2025 Workshop
专题命中 幻觉与事实性 :safety(abstract)
Comments Accepted at AAAI-26 (AAAI 2026), Main Track
机构 * Korea University(韩国大学) ; Kyung Hee University(庆熙大学)
专题命中 幻觉与事实性 :trustworthy(abstract)
Comments 18 pages, 9 figures. Preprint
机构 * Peking University, Shenzhen Graduate School(北京大学深圳研究生院) ; International Digital Economy Academy (IDEA)(国际数字经济学院)
专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI
Comments Accepted by Empirical Methods in Natural Language Processing 2025 (EMNLP 2025) Main Conference
机构 * Virginia Tech(弗吉尼亚理工大学) ; Cisco Research(思科研究)
专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI
Comments The 2025 Conference on Empirical Methods in Natural Language Processing
专题命中 隐私与版权 :alignment(abstract)
专题命中 安全评测 :safety(title,abstract);alignment(abstract);trustworthy(abstract);AI safety(abstract)
Comments 22 pages, 9 figures, accepted by AAAI2026 as oral paper
机构 * department of Aeronautics and Astronautics, Stanford University(航空与宇航系,斯坦福大学) ; School of Vehicle and Mobility at Tsinghua University(清华大学车辆与移动系统学院)
专题命中 安全评测 :safety(title,abstract);trustworthy(abstract)
机构 * NVIDIA(英伟达)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.LG