arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-04 至 2026-02-04 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 10 篇

2602.02824 2026-02-04 cs.CL 83%

CATNIP: LLM Unlearning via Calibrated and Tokenized Negative Preference Alignment

CATNIP:通过校准和令牌化的负偏好对齐实现LLM去学习

Zhengbang Yang, Yisheng Zhong, Junyuan Hong, Zhuangdi Zhu

机构 * George Mason University(乔治·马歇尔大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 CATNIP通过校准和令牌化的负偏好对齐方法,实现有效LLM去学习,无需保留数据或对比对,提升知识遗忘与保留的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03665 2026-02-04 cs.CV cs.HC 82%

MM-SCALE: Grounded Multimodal Moral Reasoning via Scalar Judgment and Listwise Alignment

MM-SCALE: 基于标量判断和列表对齐的 grounded 多模态道德推理

Eunkyu Park, Wesley Hanwen Deng, Cheyon Jin, Matheus Kunzler Maldaner, Jordan Wheeler, Jason I. Hong, Hong Shen, Adam Perer, Ken Holstein, Motahhare Eslami, Gunhee Kim

机构 * Seoul National University(首尔国立大学) Carnegie Mellon University(卡内基梅隆大学) University of Florida(佛罗里达大学) Epic Games

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract)

AI总结 MM-SCALE通过5点标量评分和显式模态接地,提升多模态模型在道德推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07743 2026-02-04 cs.CL 79%

OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment

OpenRubrics: 向奖励建模和大语言模型对齐的可扩展合成 rubric 生成迈进

Tianci Liu, Ran Xu, Tony Yu, Ilgee Hong, Carl Yang, Tuo Zhao, Haoyu Wang

机构 * Purdue University(普渡大学) Emory University(埃默里大学) Georgia Institute of Technology(佐治亚理工学院) University at Albany(阿尔巴尼大学)

专题命中 偏好对齐 :alignment(title);RLHF(abstract);分类 cs.CL

AI总结 OpenRubrics 提出了一种基于对比的 rubric 生成方法,通过大规模(提示,rubric)对提升奖励建模和大语言模型对齐的性能。

Comments The first two authors contributed equally. Updated OpenRubrics dataset, RMs, and results

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03622 2026-02-04 cs.CL cs.AI cs.LG 75%

Align to Structure: Aligning Large Language Models with Structural Information

对齐结构:将大型语言模型与结构信息对齐

Zae Myung Kim, Anand Ramachandran, Farideh Tavazoee, Joo-Kyung Kim, Oleg Rokhlenko, Dongyeop Kang

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过整合语言学话语框架到强化学习中,结构对齐方法提升LLMs在长文本生成和摘要任务中的连贯性和结构组织能力。

Comments Accepted to AAAI 2026 AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02383 2026-02-04 cs.LG 70%

SLIME: Stabilized Likelihood Implicit Margin Enforcement for Preference Optimization

SLIME:偏好优化中的稳定性似然隐边界的隐式约束

Maksim Afanasyev, Illarion Iov

机构 * Floating Point Sigma Lab(浮点数Sigma实验室)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG

AI总结 SLIME通过引入稳定性似然隐边界的隐式约束,解决偏好优化中的目标不匹配问题,提升模型生成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02033 2026-02-04 cs.CV cs.AI cs.MM 70%

One Size, Many Fits: Aligning Diverse Group-Wise Click Preferences in Large-Scale Advertising Image Generation

一个尺寸,多种适配:在大规模广告图像生成中对多样化群体点击偏好进行对齐

Shuo Lu, Haohan Wang, Wei Feng, Weizhen Wang, Shen Zhang, Yaoyu Li, Ao Ma, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Bing Zhan, Yuan Xu, Huizai Yao, Yongcan Yu, Chenyang Si, Jian Liang

机构 * NLPR & MAIS, CASIA(中国科学院长春光学精密机械与物理研究所 & 中国科学院自动化所) School of AI, UCAS(中国科学院大学人工智能学院) HKUST(gz)(香港科技大学) PRLab, NJU(南京大学PRLab)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI

AI总结 本文提出OSMF框架,通过自适应分组和群组感知多模态模型,解决广告图像生成中用户群体点击偏好多样性的优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07326 2026-02-04 cs.CL cs.AI cs.CY cs.LG 70%

Reward Model Interpretability via Optimal and Pessimal Tokens

通过最优和最劣 tokens 实现奖励模型可解释性

Brian Christian, Hannah Rose Kirk, Jessica A. F. Thompson, Christopher Summerfield, Tsvetomira Dumbalska

机构 * University of Oxford(牛津大学)

专题命中 偏好对齐 :harmlessness(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过分析奖励模型对不同token的评分,揭示了模型间的异质性、评分不对称性及潜在偏见,挑战了奖励模型的可互换性及代理人类价值观的假设。

Comments Accepted for publication in Proceedings of the 2025 ACM Conference on Fairness, Accountability, and Transparency (FAccT '25), to appear June 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03635 2026-02-04 cs.CL cs.LG 62%

TRE: Encouraging Exploration in the Trust Region

TRE: 在信任区域中鼓励探索

Chao Huang, Yujing Lu, Quangang Li, Shenghe Wang, Yan Wang, Yueyang Zhang, Long Xia, Jiashu Zhao, Zhiyuan Sun, Daiting Shi, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Baidu Inc.(百度公司) Wilfrid Laurier University(威尔弗里德·劳里埃大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 TRE通过在模型信任区域内鼓励探索,提升了大型语言模型在数学推理、组合搜索和偏好对齐任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03097 2026-02-04 cs.AI 57%

De-conflating Preference and Qualification: Constrained Dual-Perspective Reasoning for Job Recommendation with Large Language Models

解构偏好与资格:基于大语言模型的约束双视角推理 job 推荐

Bryce Kan, Wei Yang, Emily Nguyen, Ganghui Yi, Bowen Yi, Chenxiao Yu, Yan Liu

机构 * University of Southern California(南加州大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 JobRec通过约束双视角推理解构偏好与资格,提升职位推荐的可控性和匹配质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02178 2026-02-04 cs.CL 57%

AR-MAP: Are Autoregressive Large Language Models Implicit Teachers for Diffusion Large Language Models?

AR-MAP:自回归大语言模型是否是扩散大语言模型的隐式教师?

Liang Lin, Feng Xiong, Zengbin Wang, Kun Wang, Junhao Dong, Xuecai Hu, Yong Wang, Xiangxiang Chu

机构 * AMAP, Alibaba Group(AMAP,阿里巴巴集团) Nanyang Technological University(南洋理工大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 AR-MAP通过利用自回归大语言模型作为隐式教师,有效提升扩散大语言模型的偏好对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏