arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3266 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3266 篇

2407.14622 2024-07-23 cs.LG cs.AI cs.CL 75%

BOND: Aligning LLMs with Best-of-N Distillation

Pier Giuseppe Sessa, Robert Dadashi, Léonard Hussenot, Johan Ferret, Nino Vieillard, Alexandre Ramé, Bobak Shariari, Sarah Perrin, Abe Friesen, Geoffrey Cideron, Sertan Girgin, Piotr Stanczyk, Andrea Michi, Danila Sinopalnikov, Sabela Ramos, Amélie Héliou, Aliaksei Severyn, Matt Hoffman, Nikola Momchev, Olivier Bachem

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02119 2024-07-10 cs.LG cs.AI cs.CL 75%

Cost-Effective Proxy Reward Model Construction with On-Policy and Active Learning

Yifang Chen, Shuohang Wang, Ziyi Yang, Hiteshi Sharma, Nikos Karampatziakis, Donghan Yu, Kevin Jamieson, Simon Shaolei Du, Yelong Shen

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08114 2024-07-01 cs.LG cs.AI cs.CL 75%

Active Preference Learning for Large Language Models

William Muldrew, Peter Hayes, Mingtian Zhang, David Barber

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 13 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08673 2024-06-14 cs.CL cs.AI cs.LG 75%

HelpSteer2: Open-source dataset for training top-performing reward models

Zhilin Wang, Yi Dong, Olivier Delalleau, Jiaqi Zeng, Gerald Shen, Daniel Egert, Jimmy J. Zhang, Makesh Narsimhan Sreedhar, Oleksii Kuchaiev

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02756 2024-06-06 cs.CL cs.AI cs.LG 75%

Aligning Large Language Models via Fine-grained Supervision

Dehong Xu, Liang Qiu, Minseok Kim, Faisal Ladhak, Jaeyoung Do

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02992 2024-05-27 cs.LG cs.AI cs.CL 75%

Decoding-time Realignment of Language Models

Tianlin Liu, Shangmin Guo, Leonardo Bianco, Daniele Calandriello, Quentin Berthet, Felipe Llinares, Jessica Hoffmann, Lucas Dixon, Michal Valko, Mathieu Blondel

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments In Proceedings of the 41st International Conference on Machine Learning (ICML 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02263 2024-04-04 cs.CL cs.AI cs.LG 75%

Automatic Pair Construction for Contrastive Post-training

Canwen Xu, Corby Rosset, Ethan C. Chau, Luciano Del Corro, Shweti Mahajan, Julian McAuley, Jennifer Neville, Ahmed Hassan Awadallah, Nikhil Rao

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NAACL 2024 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10949 2024-03-27 cs.CL cs.AI cs.LG 75%

SelfIE: Self-Interpretation of Large Language Model Embeddings

Haozhe Chen, Carl Vondrick, Chengzhi Mao

专题命中 偏好对齐 :RLHF(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06754 2024-03-19 cs.CL cs.AI cs.LG 75%

ALaRM: Align Language Models via Hierarchical Rewards Modeling

Yuhang Lai, Siyuan Wang, Shujun Liu, Xuanjing Huang, Zhongyu Wei

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.06176 2024-03-06 cs.CL cs.AI cs.LG 75%

Fine-tuning Language Models with Generative Adversarial Reward Modelling

Zhang Ze Yu, Lau Jia Jaw, Zhang Hui, Bryan Kian Hsiang Low

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 22 pages, 9 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10210 2024-02-16 cs.LG cs.AI cs.CL cs.CV stat.ML 75%

Self-Play Fine-Tuning of Diffusion Models for Text-to-Image Generation

Huizhuo Yuan, Zixiang Chen, Kaixuan Ji, Quanquan Gu

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 28 pages, 8 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12187 2024-01-23 cs.LG cs.AI cs.CL 75%

WARM: On the Benefits of Weight Averaged Reward Models

Alexandre Ramé, Nino Vieillard, Léonard Hussenot, Robert Dadashi, Geoffrey Cideron, Olivier Bachem, Johan Ferret

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14387 2024-01-09 cs.LG cs.AI cs.CL 75%

AlpacaFarm: A Simulation Framework for Methods that Learn from Human Feedback

Yann Dubois, Xuechen Li, Rohan Taori, Tianyi Zhang, Ishaan Gulrajani, Jimmy Ba, Carlos Guestrin, Percy Liang, Tatsunori B. Hashimoto

专题命中 偏好对齐 :DPO(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Spotlight at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11455 2023-05-22 cs.CL cs.AI cs.LG 75%

Shattering the Agent-Environment Interface for Fine-Tuning Inclusive Language Models

Wanqiao Xu, Shi Dong, Dilip Arumugam, Benjamin Van Roy

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04638 2025-09-09 cs.CL cs.CY 74%

Affective Computing in the Era of Large Language Models: A Survey from the NLP Perspective

Yiqun Zhang, Xiaocui Yang, Xingle Xu, Zeran Gao, Yijie Huang, Shiyi Mu, Shi Feng, Daling Wang, Yifei Zhang, Kaisong Song, Ge Yu

机构 * Northeastern University, China(东北大学) Alibaba Group, Hangzhou, China(阿里巴巴集团)

专题命中 偏好对齐 :RLHF(abstract,comments);safety(abstract);分类 cs.CL、cs.CY

Comments Compared with the previous version, reinforcement learning has been added (as a new section), including RLHF, RLVR, and RLAIF

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11702 2025-06-16 cs.CL cs.AI 74%

Configurable Preference Tuning with Rubric-Guided Synthetic Data

Víctor Gallego

机构 * Komorebi AI Technologies, Madrid, Spain(Komorebi人工智能技术公司)

专题命中 偏好对齐 :alignment(abstract,comments);DPO(abstract);分类 cs.CL、cs.AI

Comments Accepted to ICML 2025 Workshop on Models of Human Feedback for AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12138 2025-03-27 cs.LG cs.CL 74%

Preference Optimization with Multi-Sample Comparisons

Chaoqi Wang, Zhuokai Zhao, Chen Zhu, Karthik Abinav Sankararaman, Michal Valko, Xuefei Cao, Zhaorun Chen, Madian Khabsa, Yuxin Chen, Hao Ma, Sinong Wang

专题命中 偏好对齐 :alignment(abstract,comments);RLHF(abstract);分类 cs.CL、cs.LG

Comments Code is available at https://github.com/alecwangcq/multi-sample-alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.05862 2022-04-13 cs.CL cs.LG 74%

Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Yuntao Bai, Andy Jones, Kamal Ndousse, Amanda Askell, Anna Chen, Nova DasSarma, Dawn Drain, Stanislav Fort, Deep Ganguli, Tom Henighan, Nicholas Joseph, Saurav Kadavath, Jackson Kernion, Tom Conerly, Sheer El-Showk, Nelson Elhage, Zac Hatfield-Dodds, Danny Hernandez, Tristan Hume, Scott Johnston, Shauna Kravec, Liane Lovitt, Neel Nanda, Catherine Olsson, Dario Amodei, Tom Brown, Jack Clark, Sam McCandlish, Chris Olah, Ben Mann, Jared Kaplan

专题命中 偏好对齐 :RLHF(abstract,comments);alignment(abstract);分类 cs.CL、cs.LG

Comments Data available at https://github.com/anthropics/hh-rlhf

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17653 2026-08-11 cs.CL 74%

Differences in Typological Alignment in Language Models' Treatment of Differential Argument Marking

语言模型处理差异论元标记中的类型学对齐差异

Iskar Deng, Nathalia Xu, Shane Steinert-Threlkeld

机构 * University of Washington(华盛顿大学)

专题命中 偏好对齐 :alignment(title);分类 cs.CL

AI总结 通过控制合成语料训练GPT-2模型,发现模型在标记方向(自然标记方向)上表现出类人偏好,但在论元角色偏好(宾语vs主语)上未复现人类语言的强烈宾语偏好。

Comments 16 pages, 8 figures, 7 tables. To appear at CoNLL 2026

Journal ref Proceedings of the 30th Conference on Computational Natural Language Learning (CoNLL 2026), pp. 268-283, San Diego, California, USA, Association for Computational Linguistics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25136 2026-07-29 cs.AI 新提交 74%

Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization

数据更少,对齐更好:用于偏好优化的数据中心多评估器一致性方法

Zhengtao Yao, Runhao Li, Xupeng Chen, Jiayi Cheng, Chenqian Le, Michael Yue, Siheng Wang, Haoyan Xu, Yuqi Li, Chenhao Wei, Zhengdao Li, Rongchao Zhang, Guang Yang, Yidong Wang, Junhao Dong

机构 * University of Southern California(南加州大学) New York University(纽约大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加利福尼亚大学伯克利分校) City College of New York, CUNY(纽约市立大学城市学院) Stevens Institute of Technology(史蒂文斯理工学院) Nanyang Technological University(南洋理工大学)

专题命中 偏好对齐 :alignment(title);分类 cs.AI

AI总结 研究聚焦偏好优化,提出DMAPO方法,从目标策略生成候选响应,经多评估器评估、校正后保留高一致性示例。实验表明该方法数据效率高,能提升模型在MT - Bench等指标上的表现,且改变评估器或准则对下游性能影响小。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19665 2026-07-10 cs.SE cs.AI 版本更新 74%

CriterAlign: Criterion-Centric Rationale Alignment for Code Preference Judging

CriterAlign: 以标准为中心的推理对齐用于代码偏好判断

Zhenyu Li, Aleksandar Cvejic, Zehui Chen, Peter Wonka

机构 * KAUST(卡塔尔人工智能研究 institute) ByteDance(字节跳动)

专题命中 偏好对齐 :alignment(title);分类 cs.AI

AI总结 本文提出CriterAlign,一种以标准为中心的推理对齐框架,通过直接的标准级 pairwise 判断、tie-driven 标准细化、swap-consistency 过滤和最终 pairwise 合成,改进了代码偏好判断的准确性,同时引入Human-Preference-Aligned Guidance (HPAG)来提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03110 2026-06-04 cs.CL 74%

Coherence Maximization Improves Pluralistic Alignment

一致性最大化改进多元对齐

Taslim Mahbub, Yiding Pei, Shi Feng

机构 * George Washington University(乔治·华盛顿大学)

专题命中 偏好对齐 :alignment(title);分类 cs.CL

AI总结 提出内部一致性最大化(ICM)方法,通过最大化标签的互可预测性生成个性化示例,无需人工监督即可将模型与目标群体价值观对齐,并证明示例一致性比单独准确性更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04445 2026-05-26 cs.LG 74%

Towards Cognitively-Faithful Decision-Making Models to Improve AI Alignment

朝向认知忠实决策模型以改善AI对齐

Cyrus Cousins, Vijay Keswani, Vincent Conitzer, Hoda Heidari, Jana Schaich Borg, Walter Sinnott-Armstrong

机构 * Duke University(杜克大学) IIT Delhi(德里印度理工学院) CMU(卡内基梅隆大学)

专题命中 偏好对齐 :alignment(title);分类 cs.LG

AI总结 提出一种基于公理的方法,从成对比较中学习认知忠实的决策过程,以解决标准偏好诱导方法未能捕捉人类决策认知过程的问题,并在肾脏分配任务中验证了模型的有效性。

Comments In ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06987 2026-05-11 cs.LG cs.GT econ.TH stat.ML 74%

Response Time Enhances Alignment with Heterogeneous Preferences

响应时间增强异质偏好对齐

Federico Echenique, Alireza Fallah, Baihe Huang, Michael I. Jordan

机构 * Department of Economics, University of California, Berkeley(加州大学伯克利分校经济系) Department of Computer Science and Ken Kennedy Institute, Rice University(休斯敦大学计算机科学系和肯尼迪研究所) Departments of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系) Departments of Electrical Engineering and Computer Sciences and Statistics, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系和统计学系;巴黎Inria) Inria Paris

专题命中 偏好对齐 :alignment(title);分类 cs.LG

AI总结 本文提出通过引入用户响应时间信号来纠正传统偏好数据中对异质偏好的估计偏差,证明该方法能准确识别群体平均偏好,提升大型语言模型对人类偏好的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04118 2026-04-28 cs.LG stat.ML 74%

Guided Speculative Inference for Efficient Test-Time Alignment of LLMs

引导推测推断用于大型语言模型的高效测试时间对齐

Jonathan Geuter, Youssef Mroueh, David Alvarez-Melis

机构 * Harvard SEAS(哈佛大学SEAS学院) Kempner Institute(Kempner研究所) IBM Research(IBM研究院)

专题命中 偏好对齐 :alignment(title);分类 cs.LG

AI总结 本文提出引导推测推断(GSI),通过结合软最佳n次测试时间缩放、奖励模型和小型辅助模型的推测样本,提高大语言模型的奖励引导解码效率,并在多个基准测试中实现更高的准确性和更低的延迟。

Comments 41 pages, 11 figures. Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26721 2026-04-21 cs.AI cs.MM 74%

MaLoRA: Gated Modality LoRA for Key-Space Alignment in Multimodal LLM Fine-Tuning

MaLoRA:基于关键空间对齐的门控模态LoRA

Xinhan Zheng, Huyu Wu, Xueting Wang, Duo Su, Haiyun Jiang

机构 * University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-鲁维尔研究所) Rajiv Gandhi University(拉贾·甘地大学) Palmer Research Laboratories(帕勒实验室)

专题命中 偏好对齐 :alignment(title);分类 cs.AI

AI总结 本文提出MaLoRA,通过门控机制对齐多模态LLM微调中的关键空间,揭示文本偏见源于注意力键空间内在不匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04215 2026-04-07 cs.CL 74%

DARE: Diffusion Large Language Models Alignment and Reinforcement Executor

DARE:扩散大语言模型对齐与强化执行器

Jingyi Yang, Yuxian Jiang, Xuhao Hu, Shuang Cheng, Biqing Qi, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 偏好对齐 :alignment(title);分类 cs.CL

AI总结 DARE框架整合了监督微调、参数高效微调、偏好优化和强化学习,为扩散大语言模型提供统一的执行栈,支持多种模型家族,实现算法覆盖、可重复评估和实际加速。

Comments 14 pages,3 figures,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17694 2026-03-19 cs.AI 74%

MALLES: A Multi-agent LLMs-based Economic Sandbox with Consumer Preference Alignment

MALLES:基于多智能体LLM的经济沙盒与消费者偏好对齐

Yusen Wu, Yiran Liu, Xiaotie Deng

专题命中 偏好对齐 :alignment(title);分类 cs.AI

AI总结 本文提出MALLES,通过大规模模型的泛化能力构建统一模拟框架,利用偏好学习对齐LLM,解决高维环境下的数据稀疏问题,提升经济模拟的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08987 2026-03-11 cs.LG 74%

MAPLE: Elevating Medical Reasoning from Statistical Consensus to Process-Led Alignment

MAPLE:从统计共识到过程导向对齐的医学推理提升

Kailong Fan, Anqi Pu, Yichen Wu, Wanhua Li, Yicong Li, Hanspeter Pfister, Huafeng Liu, Xiang Li, Quanzheng Li, Ning Guo

机构 * Zhejiang University(浙江大学) Harvard University(哈佛大学) Harvard Medical School(哈佛医学院)

专题命中 偏好对齐 :alignment(title);分类 cs.LG

AI总结 MAPLE通过整合医学过程奖励模型与TTRL,提升医学推理的准确性和可靠性,实现从统计共识到过程导向对齐的转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01581 2026-02-03 cs.LG 74%

Nearly Optimal Active Preference Learning and Its Application to LLM Alignment

近优主动偏好学习及其在大语言模型对齐中的应用

Yao Zhao, Kwang-Sung Jun

机构 * University of Arizona(亚利桑那大学) Department of Computer Science(计算机科学系)

专题命中 偏好对齐 :alignment(title);分类 cs.LG

AI总结 本文提出两种主动学习算法,通过实例依赖标签复杂性保证和贪心方法提升大语言模型对齐的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏