arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3252 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3252 篇

2405.17956 2025-05-27 cs.AI 85%

Unified Preference Optimization: Language Model Alignment Beyond the Preference Frontier

Anirudhan Badrinath, Prabhat Agarwal, Jiajing Xu

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI

Comments Accepted at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11926 2025-05-20 cs.CV cs.AI 85%

SafeVid: Toward Safety Aligned Video Large Multimodal Models

Yixu Wang, Jiaxin Song, Yifeng Gao, Xin Wang, Yang Yao, Yan Teng, Xingjun Ma, Yingchun Wang, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17112 2025-04-01 cs.LG 85%

Decoding Human Preferences in Alignment: An Improved Approach to Inverse Constitutional AI

Carl-Leander Henneking, Claas Beger

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.LG

Comments 9 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13967 2025-03-04 cs.CL 85%

Model Editing as a Robust and Denoised variant of DPO: A Case Study on Toxicity

Rheeya Uppaal, Apratim Dey, Yiting He, Yiqiao Zhong, Junjie Hu

专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16681 2025-02-19 cs.CL 85%

Triple Preference Optimization: Achieving Better Alignment using a Single Step Optimization

Amir Saeidi, Shivanshu Verma, Aswin RRV, Kashif Rasul, Chitta Baral

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06874 2024-12-03 cs.AI cs.HC cs.RO 85%

Learning Reward and Policy Jointly from Demonstration and Preference Improves Alignment

Chenliang Li, Siliang Zeng, Zeyi Liao, Jiaxiang Li, Dongyeop Kang, Alfredo Garcia, Mingyi Hong

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04127 2024-11-08 cs.AI 85%

Combining Theory of Mind and Kindness for Self-Supervised Human-AI Alignment

Joshua T. S. Hewson

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18853 2024-10-29 cs.LG 85%

Decoding-Time Language Model Alignment with Multiple Objectives

Ruizhe Shi, Yifang Chen, Yushi Hu, Alisa Liu, Hannaneh Hajishirzi, Noah A. Smith, Simon S. Du

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract);分类 cs.LG

Comments NeurIPS accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04834 2024-10-28 cs.CL 85%

As Simple as Fine-tuning: LLM Alignment via Bidirectional Negative Feedback Loss

Xin Mao, Feng-Lin Li, Huimin Xu, Wei Zhang, Wang Chen, Anh Tuan Luu

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09834 2024-09-02 cs.AI 85%

Minor DPO reject penalty to increase training robustness

Shiming Xie, Hong Chen, Fred Yu, Zeye Sun, Xiuyu Wu, Yingfan Hu

专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.AI

Comments 8 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11907 2024-08-16 cs.CL 85%

Direct Large Language Model Alignment Through Self-Rewarding Contrastive Prompt Distillation

Aiwei Liu, Haoping Bai, Zhiyun Lu, Xiang Kong, Simon Wang, Jiulong Shan, Meng Cao, Lijie Wen

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL

Comments 24 pages, 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17092 2024-06-26 cs.CR cs.AI 85%

BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models

Yi Zeng, Weiyu Sun, Tran Ngoc Huynh, Dawn Song, Bo Li, Ruoxi Jia

专题命中 偏好对齐 :safety(title,abstract);RLHF(abstract);AI safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04879 2024-06-10 cs.CL 85%

A Deep Dive into the Trade-Offs of Parameter-Efficient Preference Alignment Techniques

Megh Thakkar, Quentin Fournier, Matthew D Riemer, Pin-Yu Chen, Amal Zouaq, Payel Das, Sarath Chandar

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL

Comments Accepted to ACL (Main) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06390 2024-04-16 cs.CL 85%

Latent Distance Guided Alignment Training for Large Language Models

Haotian Luo

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03047 2023-12-05 cs.LG cs.AI cs.CL cs.CY 85%

Principle-Driven Self-Alignment of Language Models from Scratch with Minimal Human Supervision

Zhiqing Sun, Yikang Shen, Qinhong Zhou, Hongxin Zhang, Zhenfang Chen, David Cox, Yiming Yang, Chuang Gan

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Accepted at NeurIPS 2023 (Spotlight). Project page: https://github.com/IBM/Dromedary

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00819 2023-10-03 cs.CL 85%

Parameter-Efficient Tuning Helps Language Model Alignment

Tianci Xue, Ziqi Wang, Heng Ji

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL

Comments 21 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18252 2025-04-29 cs.LG cs.AI cs.CL 85%

Asynchronous RLHF: Faster and More Efficient Off-Policy RL for Language Models

Michael Noukhovitch, Shengyi Huang, Sophie Xhonneux, Arian Hosseini, Rishabh Agarwal, Aaron Courville

机构 * Mila Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) Allen Institute for AI(人工智能研究院) Google Deepmind(谷歌DeepMind) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 偏好对齐 :RLHF(title,abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments accepted at ICLR 2025, code at https://github.com/mnoukhov/async_rlhf, integrated into the open-instruct library https://github.com/allenai/open-instruct

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02144 2023-09-06 cs.CL cs.AI cs.LG 85%

Making Large Language Models Better Reasoners with Alignment

Peiyi Wang, Lei Li, Liang Chen, Feifan Song, Binghuai Lin, Yunbo Cao, Tianyu Liu, Zhifang Sui

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Large Language Models; Reasoning; Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08022 2026-08-21 cs.CL cs.AI 版本更新 85%

DiverValue-Bench: A Benchmark and Fine-Tuning Framework for Aligning Large Language Models with Diverse Human Values

DiverValue-Bench:用于使大语言模型与多元人类价值观对齐的基准及微调框架

Yao Liang, Dongcheng Zhao, Feifei Zhao, Guobin Shen, Yuwei Wang, Dongqi Liang, Yi Zeng

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究推出覆盖74个国家/地区的人群感知基准DiverValue-Bench,发现现有LLMs存在地理与人口统计学价值观对齐差异,结合LoRA与DPO的轻量微调可提升对齐效果,为全球公平AI开发提供实用基础。

Comments 11 pages, 5 figures. Accepted to IJCAI-ECAI 2026 (Human-Centred AI Special Track). v2: Updated to the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00042 2026-08-04 cs.CL cs.AI 新提交 85%

Trustworthiness Costs of Domain Adaptation in Small Language Models:A Cross-Architecture Empirical Study

小语言模型领域适应的可信性代价:一项跨架构实证研究

Ramesh B. Paramkusham

专题命中 偏好对齐 :DPO(abstract,abstract_cn);safety(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对三类SLM架构、三个领域、两类训练数据及四种微调策略的216组实验,量化了领域适应的可信性代价,发现对抗扰动训练数据可提升适应质量且不降低可信性,部分安全策略反而增加对抗伤害易感性。

Comments 13 pages, 7 tables, 2 appendices (Reproducibility Checklist; Software and Data Availability). Code, model checkpoints, and datasets publicly available at https://github.com/rbpdlf/slm-trw

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17946 2026-07-21 cs.LG cs.AI 新提交 85%

A Geometric Perspective on Stabilizing Value Conflict Resolution

稳定价值冲突解决的几何视角

Saket Reddy, Andy Liu

机构 * University of Illinois - Urbana-Champaign(伊利诺伊大学厄巴纳 - 香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型在RLHF训练中应对价值冲突的问题,核心方法是利用思维链推理,通过几何视角分析其作用,创建新的以价值冲突为重点的CoT设计,提升了道德推理性能,为改进模型处理复杂价值冲突请求的性能提供新途径。

Comments Accepted to ICML Workshop on High-Dimensional Learning Dynamics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04539 2026-07-20 cs.CL cs.AI 版本更新 85%

RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization

RLearner-LLM: 通过混合直接偏好优化平衡大语言模型中的逻辑性与流畅性

Qiming Bao, Juho Leinonen, Paul Denny, Michael J. Witbrock

机构 * University of Auckland(奥克兰大学) Aalto University(阿alto大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RLearner-LLM,通过融合DeBERTa-v3 NLI信号与验证器LLM评分,解决直接偏好优化在知识密集型生成中的逻辑对齐问题,实现NLI指标显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10569 2026-06-10 cs.CL cs.AI 新提交 85%

Hidden Consensus:Preference-Validity Compression in Human Feedback

隐藏共识:人类反馈中的偏好有效性压缩

Dorcas Chia Ern Chua, Karen Myn Hui Lee, Jia Yue Tan, Zhen Xue Gue, Norzalena Abdul Hamid, Azima Binti Azmi, Keat Mei Yeong, Aizat Izyani binti Mujab, Hafsah Noor Azam, Chee Guo Khoo, Han Ying Lim, Chee Seng Chan

机构 * YTL AI Labs Universiti Malaya(马来亚大学) Monash University Malaysia(莫纳什大学马来西亚校区) Universiti Malaysia Sarawak(马来西亚沙捞越大学)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出偏好有效性压缩问题,即RLHF将多元有效反馈压缩为单一奖励目标,导致对齐测量偏差。通过马来西亚语料分析,79%的提示存在多个多数支持响应,表明多数聚合测量的是argmax可接受性而非多元对齐。

Comments 28 pages. When AI learns from human feedback, it forces a single "correct" answer, but sometimes multiple answers are all genuinely valid, and that nuance gets thrown away

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06674 2026-06-08 cs.CL cs.CY 新提交 85%

What Do People Actually Want From AI? Mapping Preference Plurality

人们真正希望从AI中得到什么?偏好多元性映射

Julia Sepúlveda Coelho, Scott A. Hale

机构 * Oxford Internet Institute, University of Oxford(牛津大学互联网研究所) Meedan

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.CY

AI总结 通过分析75个国家1500份开放式回答,发现不同人对AI的期望各异,多数价值观仅被少数人要求,且同一词语(如“真实性”)含义分歧,某些能力存在争议,揭示当前RLHF偏好聚合方法的根本缺陷。

Comments Accepted at the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09084 2026-05-26 cs.LG cs.AI 85%

PageLLM: A Multi-Grained Reward Framework for Whole-Page Optimization with Large Language Models

PageLLM:面向整页优化的大语言模型多粒度奖励框架

Xinyuan Wang, Liang Wu, Dongjie Wang, Yanjie Fu

机构 * Arizona State University(亚利桑那州立大学) Nokia(诺基亚) University of Kansas(堪萨斯大学)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 针对整页优化中人工标注成本高和页面级连贯性与项目级放置粒度不匹配的问题,提出PageLLM框架,通过将隐式反馈解耦为粗粒度页面级奖励和细粒度项目级奖励,结合PPO的RLHF进行微调,显著提升排序性能并在线上部署中取得收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13878 2026-05-26 cs.LG cs.CL 85%

InfiFPO: Implicit Model Fusion via Preference Optimization in Large Language Models

InfiFPO:通过偏好优化实现大型语言模型的隐式模型融合

Yanggan Gu, Yuanyi Wang, Zhaoyi Yan, Yiming Zhang, Qi Zhou, Fei Wu, Hongxia Yang

机构 * The Hong Kong Polytechnic University (PolyU)(香港理工大学) Zhejiang University(浙江大学) PolyU-Daya Bay Technology and Innovation Research Institute(香港理工大学-大亚湾技术与创新研究院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出InfiFPO方法,通过将DPO中的参考模型替换为融合源模型,在序列级别合成多源概率,实现隐式模型融合,从而在偏好对齐阶段有效融合多个LLM并提升性能。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05660 2026-05-22 cs.CR cs.AI cs.CL 85%

Optimus: A Robust Defense Framework for Mitigating Toxicity while Fine-Tuning Conversational AI

Optimus: 一种用于在微调对话AI时缓解毒性行为的稳健防御框架

Aravind Cheruvu, Shravya Kanchi, Sifat Muhammad Abdullah, Nicholas Ka-Shing Kong, Daphne Yao, Murtuza Jadliwala, Bimal Viswanath

机构 * University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 本研究提出Optimus框架,通过整合训练无关的毒性分类方案和双重策略对齐过程,有效缓解微调过程中的毒性问题,并在有毒性分类器偏差时仍能保持高召回率,优于现有最佳防御方法StarDSS。

Comments Accepted at ACM CODASPY 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27401 2026-05-01 cs.CL cs.LG 85%

Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs

扰动探测:对齐语言模型中FFN行为电路的双次提示诊断

Hongliang Liu, Tung-Ling Li, Yuhao Wu

机构 * Palo Alto Networks(帕洛阿尔托网络公司)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 通过双次提示传递和无反向传播的扰动探测,识别LLM中两种行为电路结构,揭示RLHF组织的行为机制及模板层编辑工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11079 2026-04-28 cs.LG cs.AI 85%

Probe-Based Data Attribution: Discovering and Mitigating Undesirable Behaviors in LLM Post-Training

基于探针的数据归因:发现并缓解LLM微调后的不良行为

Frank Xiao, Santiago Aranguri

机构 * California Institute of Technology(加利福尼亚理工学院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于探针的数据归因方法,通过分析测试提示和偏好对的激活差异向量,识别导致特定行为的数据点,并通过重新训练验证归因。该方法在OLMo 2的生产DPO训练中发现有害行为,过滤数据点可显著减少此类行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15780 2026-04-20 cs.LG cs.CL 85%

Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs

裁剪不安全的票据:一种资源高效的更安全且更稳健的大语言模型框架

Wai Man Si, Mingjie Li, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 本文提出一种资源高效的剪枝框架,通过识别并移除与不安全行为相关的参数,减少不安全生成并提高对抗鲁棒性,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏