arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-03 至 2026-03-03 共收录 16 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 16 篇

2506.05619 2026-03-03 cs.AI cs.LG 87%

Beyond RLHF and NLHF: Population-Proportional Alignment under an Axiomatic Framework

超越RLHF和NLHF:在公理框架下的人口比例对齐

Kihyun Kim, Jiawei Zhang, Asuman Ozdaglar, Pablo A. Parrilo

机构 * MIT LIDS(麻省理工学院LIDS) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(title);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于公理框架的人口比例对齐方法,通过社会选择理论解决传统偏好学习中的偏差和操纵问题,并在推荐任务和语言模型对齐中验证了其有效性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18991 2026-03-03 cs.CL cs.AI cs.LG 85%

Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment

逆强化学习与动态奖励缩放用于大语言模型对齐

Ruoxi Cheng, Haoxuan Ma, Weixin Wang, Ranjie Duan, Jiexi Liu, Xiaoshuang Jia, Simeng Qin, Xiaochun Cao, Yang Liu, Xiaojun Jia

机构 * Beijing Electronic Science and Technology Institute(北京电子科技学院) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学) Duke University(杜克大学) BraneMatrix AI Renmin University of China(中国人民大学) Northeast University(东北大学) Nanyang Technological University(南洋理工大学) Zhejiang Lab(浙江实验室) Sun Yat-sen University(中山大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DR-IRL通过动态奖励缩放和逆强化学习提升大语言模型的安全对齐性能,有效解决数据不平衡和静态奖励模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11661 2026-03-03 cs.AI 83%

Quark Medical Alignment: A Holistic Multi-Dimensional Alignment and Collaborative Optimization Paradigm

夸克医疗对齐:一种全面的多维对齐与协作优化范式

Tianxiang Xu, Jiayi Liu, Yixuan Tong, Jialu Xu, Yunqing Wei, Kaiwen Feng, PanPan Hou, Kangping Yin, Jiyuan Hu, Hao Zhou, Zhenxin Ma, Jian Xu, Guanjun Jiang

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出夸克医疗对齐范式,通过多维对齐矩阵和统一优化机制解决医疗问答中的对齐问题,实现正确性、安全性和合规性的协同优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13575 2026-03-03 cs.CL cs.AI 81%

Elo-Evolve: A Co-evolutionary Framework for Language Model Alignment

Elo-Evolve:一种用于语言模型对齐的共进化框架

Jing Zhao, Ting Zhen, Junwei Bao, Hongfei Jiang, Yang Song

机构 * Zuoyebang, Beijing, China(北京中关村)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 Elo-Evolve通过动态多代理竞争和自适应对手选择,提升大型语言模型对齐的稳定性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07638 2026-03-03 cs.LG 79%

Data Selection for LLM Alignment Using Fine-Grained Preferences

利用细粒度偏好进行LLM对齐的数据选择

Jia Zhang, Yao Liu, Chen-Xi Zhang, Yi Liu, Yi-Xuan Jin, Lan-Zhe Guo, Yu-Feng Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Algorithm Tech, Taobao & Tmall Group of Alibaba(阿里巴巴集团算法技术部) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于细粒度偏好的数据选择方法,通过优化偏好分歧来提升LLM对齐效果,实验表明在少量数据下也能实现显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20838 2026-03-03 cs.LG cs.AI cs.CL cs.CY 77%

Reward Models Inherit Value Biases from Pretraining

奖励模型继承预训练中的价值偏见

Brian Christian, Jessica A. F. Thompson, Elle Michelle Yang, Vincent Adam, Hannah Rose Kirk, Christopher Summerfield, Tsvetomira Dumbalska

机构 * Department of Experimental Psychology, University of Oxford(心理学系,牛津大学) Department of Computer Science, University of Oxford(计算机科学系,牛津大学) AI/ML Research Group, Universitat Pompeu Fabra(人工智能/机器学习研究组,庞培法华大学) Oxford Internet Institute, University of Oxford(牛津互联网研究所,牛津大学)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究发现奖励模型继承预训练模型的价值偏见,影响其对代理和共融的偏好,揭示了预训练阶段对安全和对齐的重要性。

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19653 2026-03-03 cs.AI 77%

Token-Importance Guided Direct Preference Optimization

基于令牌重要性的直接偏好优化

Ning Yang, Hai Lin, Yibo Liu, Baoliang Tian, Guoqing Liu, Haijun Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ByteDance(字节跳动) Microsoft Research AI4Science(微软研究院AI4Science) University of Science and Technology Beijing(北京科技大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.AI

AI总结 本文提出TI-DPO方法,通过混合加权机制和三元组损失实现细粒度语义控制,提升模型对偏好响应的准确性和生成多样性。

Comments ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26601 2026-03-03 cs.CL cs.AI cs.LG 67%

MENLO: From Preferences to Proficiency -- Evaluating and Modeling Native-like Quality Across 47 Languages

MENLO:从偏好到熟练度——在47种语言上评估和建模原生质量

Chenxi Whitehouse, Sebastian Ruder, Tony Lin, Oksana Kurylo, Haruka Takagi, Janice Lam, Nicolò Busetto, Denise Diaz, Francisco Guzmán

机构 * Meta Superintelligence Labs(Meta超智能实验室) Handshake AI

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MENLO通过偏好评估和建模提升多语言LLM的原生质量,结合强化学习和多任务学习方法改进模型表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02041 2026-03-03 cs.CL cs.AI 62%

EstLLM: Enhancing Estonian Capabilities in Multilingual LLMs via Continued Pretraining and Post-Training

EstLLM:通过持续预训练和后训练增强多语言大语言模型中的爱沙尼亚能力

Aleksei Dorkin, Taido Purason, Emil Kalbaliyev, Hele-Andra Kuulmets, Marii Ojastu, Mark Fišel, Tanel Alumäe, Eleri Aedmaa, Krister Kruusmaa, Kairit Sirts

机构 * Institute of Computer Science, University of Tartu(塔尔图大学计算机科学研究院) Department of Software Science, Tallinn University of Technology(塔林技术大学软件科学系) Institute of the Estonian Language, Tallinn, Estonia(爱沙尼亚语言研究院) School of Humanities, Tallinn University(塔林大学人文学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 EstLLM通过持续预训练和后训练提升多语言大语言模型中爱沙尼亚的能力,增强语言和推理表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23239 2026-03-03 cs.AI cs.CY 62%

Agency and Architectural Limits: Why Optimization-Based Systems Cannot Be Norm-Responsive

代理与架构限制:为何基于优化的系统无法回应规范

Radha Sarma

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.CY

AI总结 本文指出基于优化的系统无法回应规范,提出真正的代理性需要不可比较的边界和否定性回应机制,揭示了优化与规范治理的不兼容性及由此引发的收敛危机。

Comments About 10,600 words in all (includes ~1000 words of literature and ~2400 words of Appendices). Under journal review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03253 2026-03-03 cs.LG cs.AI 62%

Solving the Granularity Mismatch: Hierarchical Preference Learning for Long-Horizon LLM Agents

解决粒度不匹配问题:用于长周期LLM代理的层次化偏好学习

Heyang Gao, Zexu Sun, Erxue Min, Hengyi Cai, Shuaiqiang Wang, Dawei Yin, Xu Chen

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(人工智能与数字经济广东实验室) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Baidu Inc.(百度公司)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 本文提出层次化偏好学习方法,通过双层课程引导解决LLM代理长周期任务中的粒度不匹配问题,提升多粒度偏好优化能力。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10985 2026-03-03 cs.CL cs.AI 62%

When Data is the Algorithm: A Systematic Study and Curation of Preference Optimization Datasets

当数据成为算法:对偏好优化数据集的系统研究与整理

Aladin Djuhera, Farhan Ahmed, Swanand Ravindra Kadhe, Syed Zawad, Heiko Ludwig, Holger Boche

机构 * Technical University Munich(慕尼黑技术大学) IBM Research(IBM研究院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文系统研究并整理了多个开源DPO数据集,提出UltraMix混合数据集,通过Magpie框架进行精细标注,揭示偏好质量差异,并在关键基准上超越最佳单个数据集性能。

Journal ref The Fourteenth International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26346 2026-03-03 cs.CV cs.AI cs.CL 62%

EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing

EditReward:一种用于指令引导图像编辑的人类对齐奖励模型

Keming Wu, Sicong Jiang, Max Ku, Ping Nie, Minghao Liu, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) McGill University(麦吉尔大学) Independent(独立研究者)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 EditReward是一种基于人类偏好的奖励模型,通过大规模标注数据提升图像编辑任务的质量与性能,展示了在指令引导图像编辑中的卓越对齐能力。

Comments Accepted by ICLR 2026. Project Page: https://tiger-ai-lab.github.io/EditReward

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01124 2026-03-03 cs.CV cs.AI 57%

ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models

ClinCoT:面向医学视觉语言模型的临床感知视觉推理链

Xiwei Liu, Yulong Li, Xinlin Zhuang, Xuhui Li, Jianxu Chen, Haolin Yang, Imran Razzak, Yutong Xie

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) East China Normal University(东华大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 ClinCoT通过引入临床感知的视觉推理链框架,提升医学视觉语言模型在临床决策中的事实性支撑与多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05534 2026-03-03 cs.CL 57%

Revisiting Self-Play Preference Optimization: On the Role of Prompt Difficulty

重新审视自我对弈偏好优化:关于提示难度的作用

Yao Xiao, Jung-jae Kim, Roy Ka-wei Lee, Lidong Bing

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 本文研究了提示难度对自我对弈偏好优化的影响,发现困难提示会降低性能,而简单提示更有效,提出通过训练少量简单提示来提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00724 2026-03-03 cs.CL 57%

RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models

RLAR:一种用于大型语言模型多任务强化学习的代理奖励系统

Andrew Zhuoer Feng, Cunxiang Wang, Bosi Wen, Yidong Wang, Yu Luo, Hongning Wang, Minlie Huang

机构 * Tsinghua Univeristy(清华大学) Peking University(北京大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 RLAR通过动态生成奖励函数提升大型语言模型在多任务强化学习中的性能和泛化能力。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏