arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3266 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3266 篇

2601.22664 2026-05-19 cs.AI 81%

Real-Time Aligned Reward Model beyond Semantics

实时对齐奖励模型超越语义

Zixuan Huang, Xin Xia, Yuxi Ren, Jianbin Zheng, Xuefeng Xiao, Hongyan Xie, Li Huaqiu, Songshi Liang, Zhongxiang Dai, Fuzhen Zhuang, Jianxin Li, Yikun Ban, Deqing Wang

机构 * Beihang University(北京航空航天大学) Tsinghua University(清华大学) Renmin University of China(中国人民大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 偏好对齐 :RLHF(summary_cn,abstract);分类 cs.AI

AI总结 本文提出R2M框架,通过实时利用策略模型反馈来对齐策略分布偏移,解决RLHF中奖励过拟合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00778 2026-05-18 cs.LG 81%

What Is Preference Optimization Doing, and Why?

偏好优化在做什么,为什么这样做?

Yue Wang, Qizhou Wang, Zizhuo Zhang, Gang Niu, Bo Han, Masashi Sugiyama

机构 * TMLR Group, Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系 TMLR 组) RIKEN AIP(理化学研究所 AIP 分室) The University of Tokyo(东京大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.LG

AI总结 本文分析了偏好优化中DPO和PPO的优化动态,揭示了其算法行为差异及根本原因,探讨了正学习、负学习和损失再加权的作用,并通过消融研究验证了这些动态对优化效率和性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13307 2026-05-14 cs.CL cs.HC 81%

PRISM-X: Experiments on Personalised Fine-Tuning with Human and Simulated Users

PRISM-X:基于人类和模拟用户的人个性化微调实验

Hannah Rose Kirk, Liu Leqi, Fanzhi Zeng, Henry Davidson, Bertie Vidgen, Christopher Summerfield, Scott A. Hale

机构 * University of Oxford(牛津大学) UK AI Security Institute(英国人工智能安全研究所) University of Texas at Austin(德克萨斯大学奥斯汀分校) Mercor Meedan

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 研究通过大规模内侧实验评估个性化语言模型在多轮对话中的表现,发现基于偏好微调的P-DPO方法优于通用模型和个性化提示,但个性化数据训练收益有限,且微调会放大趋炎附势行为,可能带来长期负面影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08178 2026-05-12 cs.AI 81%

Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling

通过规划对齐代理:一个轨迹级奖励建模的基准测试

Jiaxuan Wang, Yulan Hu, Wenjin Yang, Zheng Pan, Xin Li, Lan-Zhe Guo

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) AMAP, Alibaba Group(阿里集团AMAP)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出Plan-RewardBench,用于评估奖励模型在复杂工具使用场景中区分优选与干扰代理轨迹的能力,揭示了代理级奖励建模在长周期轨迹上的挑战。

Comments accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26120 2026-04-30 cs.AI 81%

Hierarchical Multi-Persona Induction from User Behavioral Logs: Learning Evidence-Grounded and Truthful Personas

层级多角色诱导从用户行为日志:学习证据导向且真实的角色

Nayoung Choi, Haeyu Jeong, Changbong Kim, Hongjun Lim, Jinho D. Choi

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) Naver Corporation(Naver公司)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出层级框架,通过聚类和标注用户行为记忆,诱导多个证据支撑的角色,提升角色的连贯性、证据性和可信度,同时提高未来交互预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24953 2026-04-30 cs.CV cs.AI 81%

ViPO: Visual Preference Optimization at Scale

ViPO:大规模视觉偏好优化

Ming Li, Jie Wu, Justin Cui, Xiaojie Li, Rui Wang, Chen Chen

机构 * University of Central Florida(中央佛罗里达大学) ByteDance Seed(字节跳动种子) UCLA(加州大学洛杉矶分校)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI

AI总结 本文提出ViPO大规模偏好数据集和Poly-DPO方法,通过提升数据质量和算法鲁棒性,实现视觉生成模型的高效偏好优化。

Comments ICLR 2026 Paper. Project Page: https://liming-ai.github.io/ViPO ; Code: https://github.com/liming-ai/ViPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23646 2026-04-28 cs.AI cs.CR 81%

Structural Enforcement of Goal Integrity in AI Agents via Separation-of-Powers Architecture

通过分权架构在AI代理中强制实施目标完整性

Rong Xiang

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出分权架构PEA,通过分离意图生成、授权和执行层,强制保障系统安全,解决AI代理目标不一致问题,提出五个核心贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19406 2026-04-22 cs.CV cs.AI 81%

HP-Edit: A Human-Preference Post-Training Framework for Image Editing

HP-Edit:一种用于图像编辑的人类偏好后训练框架

Fan Li, Chonghuinan Wang, Lina Lei, Yuping Qiu, Jiaqi Xu, Jiaxiu Jiang, Xinran Qin, Zhikai Chen, Fenglong Song, Zhixin Wang, Renjing Pei, Wangmeng Zuo

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Harbin Institute of Technology(哈尔滨工业大学) Nankai University(南开大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出HP-Edit框架和RealPref-50K数据集,通过少量人类偏好评分数据和预训练视觉大语言模型开发自动评估器,提升图像编辑模型对人类偏好的契合度。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18489 2026-04-21 cs.SD cs.CL eess.AS 81%

Aligning Language Models for Lyric-to-Melody Generation with Rule-Based Musical Constraints

基于规则的音乐约束对齐语言模型用于歌词到旋律生成

Hao Meng, Siyuan Zheng, Shuran Zhou, Qiangqiang Wang, Yang Song

机构 * Zuoyebang Education Technology(中关村教育科技)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.CL

AI总结 本文提出基于规则的音乐约束对齐框架,通过DPO和KTO优化减少旋律生成中的约束违规,提升音乐性和连贯性。

Comments Accepted by IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08441 2026-01-14 cs.AI 81%

YaPO: Learnable Sparse Activation Steering Vectors for Domain Adaptation

YaPO: 用于领域适应的可学习稀疏激活引导向量

Abdelaziz Bounhar, Rania Hossam Elmohamady Elbadry, Hadi Abdine, Preslav Nakov, Michalis Vazirgiannis, Guokan Shang

机构 * MBZUAI Ecole Polytechnique(巴黎政治学院)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);safety(abstract);jailbreak(abstract)

AI总结 YaPO通过学习稀疏激活引导向量实现LLM的高效、稳定和细粒度对齐,适用于领域适应和文化对齐等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03300 2026-01-08 cs.CR cs.LG 81%

TRYLOCK: Defense-in-Depth Against LLM Jailbreaks via Layered Preference and Representation Engineering

TRYLOCK:通过分层偏好和表征工程实现对LLM劫持的纵深防御

Scott Thornton

机构 * AI/ML Security Researcher(人工智能与机器学习安全研究员)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);safety(abstract);jailbreak(abstract)

AI总结 TRYLOCK通过分层偏好和表征工程实现对LLM劫持的纵深防御,结合DPO、RepE、自适应侧车和输入规范化,有效降低攻击成功率并提升安全性与易用性的平衡。

Comments 14 pages, 4 figures. Code and datasets at https://github.com/scthornton/trylock

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08123 2025-12-05 cs.CL 81%

QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA

QA-LIGN:通过宪法分解的问答对对齐大语言模型

Jacob Dineen, Aswin RRV, Qin Liu, Zhikun Xu, Xiao Ye, Ming Shen, Zhaonan Li, Shijie Lu, Chitta Baral, Muhao Chen, Ben Zhou

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);safety(abstract);harmlessness(abstract)

AI总结 QA-LIGN通过分解奖励信号提升LLM对齐效果,降低攻击成功率并保持低拒绝率,实现安全与帮助性的帕累托最优。

Comments Findings of the Association for Computational Linguistics: EMNLP 2025, pages 20619-20642, Suzhou, China

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 20619-20642, Suzhou, China, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21819 2025-03-31 cs.CL 81%

Optimizing Safe and Aligned Language Generation: A Multi-Objective GRPO Approach

Xuying Li, Zhuo Li, Yuji Kosuga, Victor Bian

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15997 2024-07-04 cs.CL 81%

Aligning Large Language Models with Human Preferences through Representation Engineering

Wenhao Liu, Xiaohua Wang, Muling Wu, Tianlong Li, Changze Lv, Zixuan Ling, Jianhao Zhu, Cenyuan Zhang, Xiaoqing Zheng, Xuanjing Huang

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);harmlessness(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13787 2024-06-11 cs.LG 81%

RewardBench: Evaluating Reward Models for Language Modeling

Nathan Lambert, Valentina Pyatkin, Jacob Morrison, LJ Miranda, Bill Yuchen Lin, Khyathi Chandu, Nouha Dziri, Sachin Kumar, Tom Zick, Yejin Choi, Noah A. Smith, Hannaneh Hajishirzi

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);safety(abstract)

Comments 44 pages, 19 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07124 2023-10-10 cs.CL 81%

RAIN: Your Language Models Can Align Themselves without Finetuning

Yuhui Li, Fangyun Wei, Jinjing Zhao, Chao Zhang, Hongyang Zhang

专题命中 偏好对齐 :alignment(abstract);safety(abstract);harmlessness(abstract);AI safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24192 2026-08-26 cs.AI cs.CL 新提交 81%

Preference Data Selection for Mitigating the Alignment Tax in Large Language Models

缓解大语言模型对齐税的偏好数据选择

Minsu Kim, Jianxun Lian, Xing Xie, Steven Euijong Whang

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出BALIGN策略,通过筛选偏好数据的三个关键特征,缓解大语言模型对齐税,在保留通用能力的同时提升对齐效果,达到最优帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23149 2026-08-25 cs.CL cs.AI 新提交 81%

Language Chain in Alignment: Cross-Lingual Ranking Preference Optimization

对齐中的语言链:跨语言排序偏好优化

Seungyoon Lee, Minhyuk Kim, Jungseob Lee, Heuiseok Lim

机构 * Korea University(高丽大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型对齐依赖英语偏好数据导致其他语言性能欠佳的问题,提出CRPO框架,通过层级结构联合优化语言内与跨语言偏好,在多语言实验中性能优于标准方法。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17117 2026-08-25 cs.CL cs.AI 81%

Histoires Morales: A French Dataset for Assessing Moral Alignment

Thibaud Leteno, Irina Proskurina, Antoine Gourru, Julien Velcin, Charlotte Laclau, Guillaume Metzler, Christophe Gravier

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19824 2026-07-23 cs.AI cs.CL 新提交 81%

Rewarding Better Thinking for LLM Preference Alignment

奖励更好的思维以实现大语言模型偏好对齐

Xubo Liu, Wenya Guo, Ruxue Yan, Xinying Qian, Ying Zhang

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型偏好对齐问题,提出思维清单奖励(TCR)方法,将偏好对转化为思维清单评估推理轨迹,引入EMA残差公式减少与结果监督重叠,实验证明该方法能提升对齐性能。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03248 2026-07-07 cs.LG cs.AI 新提交 81%

Unbiased Alignment for Large Language Models with Noisy Preferences

具有噪声偏好的大语言模型的无偏对齐

Jialiang Wang, Xianming Liu, Xiong Zhou, Hui Liu, Haoliang Li

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型与人类偏好对齐问题,针对真实偏好数据集中噪声大的问题,提出无偏对齐理论框架,引入新损失函数,能直接从噪声数据集无偏训练模型,实验表明优于现有基线。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00001 2026-07-02 cs.AI cs.CY 新提交 81%

Constructive Alignment: Governing Preference Dynamics in Human-AI Interaction

建构性对齐:人机交互中的偏好动态治理

Max Kanwal, Caryn Tran

机构 * Stanford University(斯坦福大学) Northwestern University(西北大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 提出建构性对齐范式,将对齐问题重构为控制人类偏好轨迹演化的控制问题,而非静态偏好满足,通过控制论框架确保价值轨迹的连贯性与反思性。

Comments 23 pages, 1 figure; Proceedings of the AAAI-26 Workshop on Machine Ethics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26387 2026-06-26 cs.CV cs.CL cs.LG 新提交 81%

Staying VIGILant: Mitigating Visual Laziness via Counterfactual Visual Alignment in MLLMs

保持VIGILant:通过多模态大语言模型中的反事实视觉对齐缓解视觉懒惰

Xi Xiao, Chen Liu, Chih-Ting Liao, Yunbei Zhang, Qizhen Lan, Yuxiang Wei, Lin Zhao, Janet Wang, Jianyang Gu, Muchao Ye, Tianyang Wang, Hao Xu

机构 * UAB(阿拉巴马大学伯明翰分校) Yale(耶鲁大学) UNSW(新南威尔士大学) Tulane(杜兰大学) Georgia Tech(佐治亚理工学院) NEU(东北大学) OSU(俄亥俄州立大学) UIowa(爱荷华大学) Harvard(哈佛大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 提出VIGIL框架,通过强化学习后训练最大化视觉输入与生成响应间的互信息,惩罚“盲目自信”实例,有效缓解MLLMs的视觉懒惰问题,在幻觉和推理基准上优于现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23816 2026-06-26 cs.LG cs.AI 版本更新 81%

Improved Bounds for Private and Robust Alignment

私有和鲁棒对齐的改进界

Wenqian Weng, Yi He, Xingyu Zhou

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文从理论角度研究语言模型的私有和鲁棒对齐,通过建立离线与在线设置下的次优性差距上界,分析隐私与对抗性腐败的两种交互模式,并给出改进的界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02572 2026-06-09 cs.LG cs.AI 版本更新 81%

Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective

奖励塑形用于(推理时)对齐:一个Stackelberg博弈视角

Haichuan Wang, Tao Lin, Lingkai Kong, Ce Li, Hezi Jiang, Milind Tambe

机构 * University of Southern California(南加州大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 针对KL正则化导致LLM继承基策略偏见的问题,提出将奖励模型优化形式化为Stackelberg博弈,并通过简单奖励塑形方案近似最优奖励模型,在推理时对齐中持续提升平均奖励并达到超过66%的胜率。

Comments Accepted to ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03160 2026-06-08 cs.AI cs.CL 版本更新 81%

VALUEFLOW: Toward Pluralistic and Steerable Value-based Alignment in Large Language Models

VALUEFLOW:迈向大语言模型中多元化和可引导的基于价值的对齐

Woojin Kim, Sieun Hyeon, Jusang Oh, Jaeyoung Do

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能交叉学科项目)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 提出VALUEFLOW框架,通过分层价值嵌入、强度标注数据库和锚定评估器,实现大语言模型在价值强度上的可控对齐,解决现有方法在提取、评估和引导方面的不足。

Comments Accepted in ICML 2026 (Oral). Code available at https://github.com/AIDASLab/VALUEFLOW

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03165 2026-06-03 cs.CL cs.AI 81%

Fully Automated Identification of Lexical Alignment and Preference-Stage Shifts in Large Language Models

大型语言模型中词汇对齐和偏好阶段转变的完全自动识别

Thomas Stephan Juzek, Xiaoyang Ming, Jose A. Hernandez

机构 * University of Washington(华盛顿大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出两种无需人工干预的评估指标——词汇对齐分数和三角化偏好转变,用于自动识别大型语言模型中的词汇过度使用及其与人类偏好学习的关联。

Comments 16 pages, 2 figures, 10 tables

Journal ref Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026), pages 6116-6131

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01755 2026-06-02 cs.AI cs.CL 81%

TriAlign: Towards Universal Truth Consistency in Personalized LLM Alignment

TriAlign: 迈向个性化大语言模型对齐中的通用真值一致性

Thi-Nhung Nguyen, Linhao Luo, Rollin Omari, Junae Kim, Thuy-Trang Vu, Dinh Phung

机构 * Department of Data Science & AI, Monash University(数据科学与人工智能系,墨尔本大学) Defence Science and Technology Group, Australia(澳大利亚国防科学与技术集团)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 针对个性化大语言模型在不同社会群体间存在的通用真值不一致问题,提出TriAlign框架,通过离线多智能体强化学习联合优化真值准确性、跨群体一致性和个性化,实现公平对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30808 2026-06-01 cs.CR cs.AI cs.LG 81%

Differentially Private Preference Data Synthesis for Large Language Model Alignment

面向大语言模型对齐的差分隐私偏好数据合成

Fengyu Gao, Jing Yang

机构 * Department of Computer Science, University of Virginia, Charlottesville, Virginia, USA(弗吉尼亚大学计算机科学系) Department of Electrical and Computer Engineering, University of Virginia, Charlottesville, Virginia, USA(弗吉尼亚大学电气与计算机工程系)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 提出DPPrefSyn算法,基于Bradley-Terry偏好模型和DP-PCA生成差分隐私合成偏好数据,实现隐私保护的偏好对齐。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29267 2026-05-29 cs.AI cs.LG 81%

When and How Human Curation Backfires: Preference Alignment under Multi-Model Self-Consuming Loop

人类策展何时以及如何适得其反:多模型自消费循环下的偏好对齐

Yang Zhang, Xiukun Wei, Xueru Zhang

机构 * Department of Computer Science and Engineering, The Ohio State University, Columbus, Ohio(计算机科学与工程系,俄亥俄州立大学,哥伦布,俄亥俄)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 研究多模型自消费训练中人类策展对模型对齐的影响,发现跨模型交互可能削弱甚至逆转策展效果,导致长期对齐退化。

详情

展开后加载摘要…

URL PDF HTML 收藏