Why DPO is a Misspecified Estimator and How to Fix It
机构 * IISc Bangalore(班加罗尔IISc) ; IIT Kanpur(坎purIIT) ; HP AI Research(HP人工智能研究)
专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * IISc Bangalore(班加罗尔IISc) ; IIT Kanpur(坎purIIT) ; HP AI Research(HP人工智能研究)
专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.LG
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; University of Florida(佛罗里达大学)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL
Comments Published at EMNLP 2025 Main Conference
机构 * Department of Chemistry Stanford University(化学系 斯坦福大学)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI、cs.LG
机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen(清华大学深圳国际研究生院) ; Tencent AI Lab(腾讯AI实验室) ; Wuhan University(武汉大学) ; The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳)) ; X-LANCE Lab, Shanghai Jiao Tong University, Shanghai(上海交通大学X-LANCE实验室) ; School of Intelligence Science and Technology, Nanjing University, Suzhou, China(南京大学智能科学与技术学院)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI
Comments Accepted by NeurIPS 2025
机构 * Northwestern University(西北大学)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG
Comments 21 pages
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Amazon(亚马逊)
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG
Comments NeurIPS 2025, 18 pages
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
Comments Preprint. The model report is available at https://arxiv.org/abs/2505.11336v1
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
专题命中 偏好对齐 :alignment(abstract)
专题命中 偏好对齐 :alignment(abstract)
Comments 10 pages, 5 figures
机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) ; Department of Computer Science and Engineering, Yonsei University(计算机科学与工程系,延世大学)
专题命中 安全训练 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
Comments Accepted at NeurIPS 2025. Code and models are available at https://ai-isl.github.io/safepath
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG
Comments 15 pages, 4 figures
机构 * Siebel School of Computing and Data Science(计算机与数据科学学院)
专题命中 安全训练 :trustworthy(abstract);分类 cs.CL
Comments EMNLP 2025 (Oral)
机构 * LMU Munich(慕尼黑大学) ; Siemens(西门子) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Technical University of Berlin(柏林技术大学) ; Konrad Zuse School of Excellence in Reliable AI (relAI)(Konrad Zuse可靠性人工智能卓越学院) ; DFKI ; AWS AI(AWS人工智能) ; University of Oxford(牛津大学)
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL
Comments OpenAI Red-teaming Challenge Winner and Oral Presentation
机构 * LMU Munich(慕尼黑大学) ; Siemens(西门子) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Technical University of Munich (TUM)(慕尼黑技术大学) ; AWS AI(亚马逊AI) ; Konrad Zuse School of Excellence in Reliable AI (relAI)(Konrad Zuse卓越可靠AI学校) ; University of Hong Kong (HKU)(香港大学) ; University of Oxford(牛津大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL
Comments Accepted to Reliable ML from Unreliable Data Workshop @ NeurIPS 2025
专题命中 越狱攻击 :alignment(abstract);safety(abstract);AI safety(abstract)
机构 * Knight Foundation School of Computing and Information Sciences (KFSCIS)(骑士基金会计算与信息科学学院) ; Florida International University(佛罗里达国际大学) ; Sustainability, Optimization, and Learning for InterDependent networks laboratory (solid lab)(可持续性、优化与互依赖网络学习实验室)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)
机构 * Siebel School of Computing and Data Science(计算机与数据科学学院)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL
Comments EMNLP 2025
机构 * Oxford Internet Institute(牛津互联网研究所) ; University of Oxford(牛津大学) ; Amazon(亚马逊) ; Department of Computer Science(计算机科学系) ; University of Wisconsin - Eau Claire(威斯康星大学欧克莱尔分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Harvard University(哈佛大学)
专题命中 红队测试 :red teaming(title,abstract);分类 cs.AI、cs.CY
机构 * Isaac Wu Research Fellow(Isaac Wu 研究员) ; Non-Trivial Ventures(非平凡企业)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI
Comments 11 pages, 7 figures
机构 * Gauge Freedom, Inc. (Public Benefit Corporation)(Gauge Freedom公司)
专题命中 提示注入 :safety(abstract);分类 cs.AI
专题命中 提示注入 :prompt injection(abstract)
机构 * Department of Computer Science and Technology, BNRist(计算机科学与技术系,BNRist) ; Shenzhen International Graduate School(深圳国际研究生院) ; KIRC, Institute for Artificial Intelligence, Tsinghua University(人工智能研究院,清华大学)
专题命中 幻觉与事实性 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments NeurIPS 2025
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG
Comments Accepted and presented in International Conference on Advancing Science and Technologies in Health Science
机构 * AI-WEINBERG, AI Experts(AI-WEINBERG人工智能专家)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; University of Science and Technology of China(中国科学技术大学) ; GigaAI ; School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :safety(title,abstract);分类 cs.CL
Comments EMNLP 2025 Findings
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
Comments Under Review
专题命中 安全评测 :harmlessness(abstract);trustworthy(abstract);分类 cs.AI
机构 * Independent Researcher(独立研究者)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG