The Sign Estimator: LLM Alignment in the Face of Choice Heterogeneity
机构 * MIT(麻省理工学院)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * MIT(麻省理工学院)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG
机构 * Department of Statistics(统计系) ; LSE London, UK(伦敦大学学院) ; Department of Mathematics(数学系) ; Tsinghua University(清华大学) ; School of Design LCC, UAL London, UK(伦敦艺术大学设计学院) ; Department of Engineering Science(工程科学系) ; University of Oxford(牛津大学)
专题命中 偏好对齐 :alignment(title);RLHF(abstract);分类 cs.AI、cs.LG
Comments Accepted to NeurIPS 2025
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);safety(abstract);分类 cs.CL
Comments 18 pages, 6 figures, accepted to Findings of the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Independent Researcher(独立研究者)
专题命中 偏好对齐 :alignment(title);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
机构 * Tsinghua University(清华大学) ; Shanghai Qi Zhi Institute(上海启智研究院) ; Harbin Institute of Technology(哈尔滨工业大学) ; Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) ; Peng Cheng Laboratory(鹏城实验室) ; National University of Singapore(新加坡国立大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL;RLHF(comments)
Comments Project Website: https://github.com/RLHF-V/RLAIF-V
机构 * PKU Alignment Team, Peking University(北京大学对齐团队) ; LLM Safety Centre, Beijing Academy of Artificial Intelligence(北京人工智能研究院大语言模型安全中心)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI
机构 * School of Computing, Macquarie University, Australia(计算机学院,麦考瑞大学,澳大利亚)
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI
机构 * Fondazione Bruno Kessler(布罗诺·凯塞勒基金会) ; University of Trento(特伦托大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.CY
Comments Code and data at https://github.com/drusso98/face-the-facts - Accepted for publication at INLG 2025
机构 * EPFL(苏黎世联邦理工学院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 安全评测 :safety(title,abstract);prompt injection(abstract);分类 cs.LG
Comments NeurIPS 2025 Datasets & Benchmarks Track (Spotlight)
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
机构 * The Hong Kong Polytechnic University(香港理工大学)
专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.CL
专题命中 安全评测 :alignment(abstract);safety(abstract)
机构 * Manipal University Jaipur(马普尔大学斋普尔)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at NeurIPS 2025, ER Workshop
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
机构 * Yale University(耶鲁大学)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
Comments NeurIPS 2025
机构 * German Research Center for Artificial Intelligence (DFKI GmbH)(德国人工智能研究中心(DFKI GmbH)) ; Saarland Informatics Campus(萨尔兰州信息技术校区) ; Barcelona Supercomputing Center (BSC-CNS)(巴塞罗那超级计算中心(BSC-CNS))
专题命中 安全评测 :alignment(abstract);分类 cs.CL
Comments Accepted by RANLP 2025
机构 * University of California, San Diego(加州大学圣迭戈分校) ; Wuhan University of Technology(武汉科技大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
Comments Ph.D. dissertation, Heidelberg University, October 2025
机构 * International Digital Economy Academy (IDEA)(国际数字经济学院) ; School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) ; Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
Comments Accepted by EMNLP 2025
专题命中 安全评测 :alignment(abstract);分类 cs.AI
专题命中 安全评测 :safety(abstract)
机构 * INESC-ID ; Instituto Superior Técnico(理工学院) ; Universidade de Lisboa(里斯本大学) ; Breast Cancer Research Program(乳腺癌研究计划) ; Champalimaud Foundation(恰帕拉马德基金会) ; Faculdade de Medicina de Lisboa(里斯本医学院)
专题命中 安全评测 :alignment(abstract)
专题命中 AI治理与伦理 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 65 pages
机构 * University of the Basque Country(巴斯克大学) ; Lebanese International University (LIU)(黎巴嫩国际大学) ; The International University of Beirut(贝鲁特国际大学) ; IKERBASQUE
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
机构 * Northeastern University(东北大学) ; Stanford University(斯坦福大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI
Comments In Submission
机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院 aerospace information research institute) ; School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) ; School of Information Network Security, People’s Public Security University of China(中国人民公安大学信息网络安全学院)
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
机构 * Forward College(前进学院) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Nebraska, Lincoln(内布拉斯加大学林肯分校) ; Technische Universität Berlin(柏林技术大学) ; Humboldt Institute for Internet and Society(洪堡互联网与社会研究所) ; Stony Brook University(石溪大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
Comments Accepted to the Conference on Neural Information Processing Systems (NeurIPS 2025)
机构 * Case Western Reserve University(凯斯西储大学) ; Hangzhou Dianzi University(杭州电子科技大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG