arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3266 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3266 篇

2605.27374 2026-05-28 cs.CL 79%

ICG: Improving Cover Image Generation via MLLM-based Prompting and Personalized Preference Alignment

ICG: 通过基于MLLM的提示和个性化偏好对齐改进封面图像生成

Zhipeng Bian, Jieming Zhu, Qijiong Liu, Wang Lin, Guohao Cai, Zhaocheng Du, Jiacheng Sun, Zhou Zhao, Zhenhua Dong

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 提出ICG框架,利用多模态大语言模型和扩散模型,通过元标记提取语义特征、用户嵌入个性化对齐及多奖励学习策略,实现高质量、个性化封面图像生成。

Comments Published in Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 12268-12278, EMNLP 2025. Official version: https://doi.org/10.18653/v1/2025.emnlp-main.617

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (Main Track) EMNLP 2025 12268-12278

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25342 2026-05-26 cs.CL 79%

MATO: Multi-objective Personalized Alignment with Test-time Optimization for Large Language Models

MATO: 面向大语言模型的多目标个性化对齐与测试时优化

Linhao Luo, Thuy-Trang Vu, Van-Anh Nguyen, Junae Kim, Gholamreza Haffari, Dinh Phung

机构 * Monash University(墨尔本大学) Defence Science and Technology Group, Australia(澳大利亚国防科学与技术集团)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 提出MATO框架,通过测试时优化在解码过程中动态调整多目标权重,无需训练或外部奖励模型,实现大语言模型与用户多样化偏好的对齐。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24270 2026-05-26 cs.AI cs.CR 79%

Safety-Oriented Routing Analysis of Mixtral MoE Under Benign and Harmful Prompts

面向安全的路由分析:Mixtral MoE在良性及有害提示下的表现

Md Nurul Absar Siddiky

机构 * Department of Electrical Computer Engineering University of Hawai'i at M\= a noa Honolulu, HI, USA

专题命中 偏好对齐 :safety(title,abstract);分类 cs.AI

AI总结 通过激活和梯度两种信号分析Mixtral 8x7B-Instruct在良性及有害提示下的路由行为,发现安全相关的路由是微妙、深度依赖且分布式的,而非由固定专家集主导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17352 2026-05-19 cs.CL 79%

AMATA: Adaptive Multi-Agent Trajectory Alignment for Knowledge-Intensive Question Answering

AMATA: 适应性多智能体轨迹对齐用于知识密集型问答

Taolin Zhang, Dongyang Li, Chen Chen, Qizhou Chen, Jiuheng Wan, Xiaofeng He, Chengyu Wang, Richang Hong

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) Shanghai University of Electric Power(上海电力大学) East China Normal University(华东师范大学) Guangdong University of Finance and Economics(广东财经大学) Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 本研究提出AMATA框架,通过动态整合外部知识提高知识密集型问答的响应可解释性和事实准确性,采用六个专门化智能体协作执行复杂问题推理,并引入两种创新:轨迹内偏好学习和智能体间依赖学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11483 2026-05-13 cs.CL 79%

StoicLLM: Preference Optimization for Philosophical Alignment in Small Language Models

StoicLLM:在小型语言模型中通过偏好优化实现哲学对齐

Ishmam Khan, Sindhuja Thogarrati, Shuo Zhang

机构 * Tufts University(塔夫茨大学) Bose Corporation(博世公司)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 研究通过偏好优化方法对小型语言模型进行微数据集训练,实现对斯多葛主义内在美德的强对齐,但发现模型在处理斯多葛主义外在义务时存在代表性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08556 2026-05-12 cs.LG 79%

Can Revealed Preferences Clarify LLM Alignment and Steering?

揭示偏好能否澄清大语言模型对齐与引导?

Khurram Yamin, Jingjing Tang, Eric Horvitz, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research(微软研究院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出一种经验方法,通过估计LLM在决策任务中的隐含偏好,评估模型是否一致地追求目标,是否能描述其目标,以及提示是否能可靠引导策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01237 2026-05-12 cs.LG 79%

The Differences Between Direct Alignment Algorithms are a Blur

直接对齐算法之间的差异变得模糊

Alexey Gorbatovski, Boris Shaposhnikov, Viacheslav Sinii, Alexey Malakhov, Daniil Gavrilov

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文系统比较了直接对齐算法,发现排名目标是影响对齐质量的主要因素,而特定的标量分数次之。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05403 2026-05-08 cs.AI 79%

When Helpfulness Becomes Sycophancy: Sycophancy is a Boundary Failure Between Social Alignment and Epistemic Integrity in Large Language Models

当有益变成谄媚:谄媚是大型语言模型中社会契合与认知完整性之间的边界失败

Jiechen Li, Catherine A. Barry, Rishika Randev, Janet Chen, Ella Jorgensen, Brinnae Bent

机构 * Duke University(杜克大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文探讨大型语言模型中谄媚现象作为社会契合与认知完整性之间边界失败的问题,提出三条件框架以界定谄媚,并讨论其分类、评估及缓解策略。

Comments Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12134 2026-04-28 cs.AI cs.HC 79%

Value Alignment Tax: Measuring Value Trade-offs in LLM Alignment

价值对齐税:在大语言模型对齐中测量价值权衡

Jiajun Chen, Hua Shen

机构 * Center for Data Science, NYU Shanghai(纽约大学上海分校数据科学中心)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出VAT框架,用于测量对齐干预如何影响价值系统,揭示目标值与非目标值之间的系统性权衡,通过实验数据展示对齐过程中的潜在风险。

Comments Preprint. Under review. 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06168 2026-04-22 cs.AI 79%

Chain-of-Thought as a Lens: Evaluating Structured Reasoning Alignment between Human Preferences and Large Language Models

思维链作为镜像:评估大语言模型与人类偏好之间结构化推理的对齐

Boxuan Wang, Zhuoyun Li, Xinmiao Huang, Xiaowei Huang, Yi Dong

机构 * School of Computer Science and Informatics, University of Liverpool, United Kingdom(利物浦大学计算机科学与信息学学院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出一种量化评估大语言模型多步结构化推理与人类偏好对齐的方法,引入对齐分数指标,通过构建基于语义熵的矩阵比较模型生成的思维链与人类偏好参考,发现对齐分数在2步推理时达到峰值,支持其作为诊断信号。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02264 2026-04-21 cs.CL 79%

CoDial: Interpretable Task-Oriented Dialogue Systems Through Dialogue Flow Alignment

通过对话流程对齐构建可解释的任务导向对话系统:CoDial

Radin Shayanfar, Chu Fei Luo, Rohan Bhambhoria, Samuel Dahan, Xiaodan Zhu

机构 * Department of Electrical and Computer Engineering & Ingenuity Labs, Queen’s University(电气与计算机工程系及Ingenuity实验室,女王大学) Conflict Analytics Lab, Queen’s University(冲突分析实验室,女王大学) Cornell Law School(康奈尔法学院) Vector Institute for AI(人工智能向量研究所)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 CoDial通过将预定义任务 schema 转换为结构化异构图并生成程序化 LLM 防御代码,实现对话策略的高效可解释对齐,提升任务导向对话系统的泛化能力与可解释性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16923 2026-04-21 cs.AI 79%

Alignment Imprint: Zero-Shot AI-Generated Text Detection via Provable Preference Discrepancy

对齐印记:通过可证明的偏好偏差实现零样本AI生成文本检测

Junxi Wu, Kailin Huang, Dongjian Hu, Bin Chen, Hao Wu, Shu-Tao Xia, Changliang Zou

机构 * Nankai University(南开大学) Tsinghua University(清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Wuhan University(武汉大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出通过可证明的偏好偏差检测AI生成文本,利用对齐印记理论分析,引入LAPD统计量提升检测性能,实验显示在多种设置下均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20075 2026-04-21 cs.AI 79%

Curriculum-RLAIF: Curriculum Alignment with Reinforcement Learning from AI Feedback

Curriculum-RLAIF: 通过人工智能反馈的强化学习进行课程对齐

Jiaye Lin, Mengdi Li, Xufeng Zhao, Wenhao Lu, Peilin Zhao, Stefan Wermter, Di Wang

机构 * Tsinghua University(清华大学) Provable Responsible AI and Data Analytics Lab(可证明责任AI与数据 analytics 实验室) King Abdullah University of Science and Technology(卡布斯王国科学与技术大学) University of Hamburg(汉堡大学) Tencent Inc.(腾讯公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出Curriculum-RLAIF框架,通过构建不同难度的偏好对,提升奖励模型的泛化能力,从而显著提高策略模型对齐性能,且无需额外推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13828 2026-04-16 cs.CL 79%

MUSE: Multi-Domain Chinese User Simulation via Self-Evolving Profiles and Rubric-Guided Alignment

MUSE:通过自演化档案和评分引导对齐实现多领域中文用户模拟

Zihao Liu, Hantao Zhou, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Peng Wang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Meituan(美团)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 MUSE通过自演化档案和评分引导对齐,生成逼真且行为一致的中文用户响应,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13551 2026-04-16 cs.CL cs.IR 79%

Debate to Align: Reliable Entity Alignment through Two-Stage Multi-Agent Debate

辩论以对齐:通过双阶段多智能体辩论实现可靠的实体对齐

Cunda Wang, Ziying Ma, Po Hu, Weihua Wang, Feilong Bao

机构 * Hubei Provincial Key Laboratory of Artificial Intelligence and Smart Learning, Central China Normal University, Wuhan, China(湖北人工智能与智能学习省级重点实验室,中央财经大学,武汉,中国) School of Computer Science, Central China Normal University, Wuhan, China(中央财经大学计算机科学学院,武汉,中国) National Language Resources Monitoring and Research Center for Network Media, Central China Normal University, Wuhan, China(网络媒体语言资源监测与研究中心,中央财经大学,武汉,中国) College of Computer Science, Inner Mongolia University, Hohhot, China(内蒙古大学计算机学院,呼和浩特,中国) National and Local Joint Engineering Research Center of Intelligent Information Processing Technology for Mongolian, Inner Mongolia University, Hohhot, China(蒙古语智能信息处理技术国家与地方联合工程研究中心,内蒙古大学,呼和浩特,中国) Inner Mongolia Key Laboratory of Multilingual Artificial Intelligence Technology, Inner Mongolia University, Hohhot, China(内蒙古多语言人工智能技术重点实验室,内蒙古大学,呼和浩特,中国)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出AgentEA框架,通过双阶段多角色辩论机制提升实体对齐的可靠性,实验表明其在跨语言、稀疏、大规模和异构场景下均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10673 2026-04-14 cs.AI cs.HC 79%

Principles Do Not Apply Themselves: A Hermeneutic Perspective on AI Alignment

原则不自行应用:一种诠释学视角下的人工智能对齐

Behrooz Razeghi

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文从诠释学角度探讨AI对齐问题,指出原则应用需依赖情境判断,强调对齐过程中的解释性成分,并指出部署响应分布与语料库分布差异可能导致审计失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06670 2026-04-10 cs.CL 79%

PIKA: Expert-Level Synthetic Datasets for Post-Training Alignment from Scratch

PIKA:从零开始的专家级合成数据集用于训练后对齐

Shangjian Yin, Shining Liang, Wenbiao Ding, Yuli Qian, Zhouxing Shi, Hongzhi Li, Yutao Xie

机构 * University of California, Riverside(加州大学河滨分校) Microsoft AI(微软人工智能)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 PIKA通过高效的数据集提升对齐效果,仅用3万例超越大规模数据集,在AlpacaEval 2.0等基准测试中表现优异,且提供高质量偏好优化数据,降低数据需求,促进资源受限研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07181 2026-04-09 cs.CL 79%

PACIFIC: Can LLMs Discern the Traits Influencing Your Preferences? Evaluating Personality-Driven Preference Alignment in LLMs

PACIFIC:LLM能否辨别影响您偏好的特质?评估LLM中由性格驱动的偏好对齐

Tianyu Zhao, Siqi Li, Yasser Shoukry, Salma Elmalaki

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 研究通过实验发现,基于用户性格特征的偏好对齐可显著提升个性化问答准确性,提出PACIFIC数据集及自动检索框架,用于改进LLM回答生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05965 2026-04-08 cs.AI 79%

Beyond Compromise: Pareto-Lenient Consensus for Efficient Multi-Preference LLM Alignment

超越妥协:用于高效多偏好LLM对齐的帕累托宽容共识

Renxuan Tan, Rongpeng Li, Zhifeng Zhao, Honggang Zhang

机构 * Zhejiang Lab(之江实验室) Macau University of Science and Technology(澳门科技大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出帕累托宽容共识框架,通过动态谈判过程解决多目标偏好对齐中的局部收敛问题,提升模型对全局帕累托最优前沿的探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14708 2026-04-03 econ.TH cs.AI cs.GT 79%

Human Misperception of Generative-AI Alignment: A Laboratory Experiment

人类对生成式人工智能对齐的误判:一项实验室实验

Kevin He, Ran Shorrer, Mengjia Xia

机构 * University of Pennsylvania(宾夕法尼亚大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 研究通过激励性实验室实验探讨人们在经济决策中对生成式人工智能对齐的感知,发现人们高估了生成式人工智能与人类选择的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27868 2026-03-31 econ.TH cs.AI cs.GT 79%

A Revealed Preference Framework for AI Alignment

为AI对齐的揭示偏好框架

Elchin Suleymanov

机构 * Department of Economics, Mitch Daniels School of Business, Purdue University(普渡大学米奇·丹尼尔斯商学院经济系)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出Luca对齐模型,通过揭示偏好技术研究AI是否实现人类偏好,证明在实验室和实地设置中可识别对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13212 2026-03-17 cs.LG 79%

Towards Understanding Valuable Preference Data for Large Language Model Alignment

迈向理解大型语言模型对齐的有价值偏好数据

Zizhuo Zhang, Qizhou Wang, Shanshan Ye, Jianing Zhu, Jiangchao Yao, Bo Han, Masashi Sugiyama

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文研究了大型语言模型对齐中偏好数据的质量问题,提出截断影响函数(TIF)评估数据质量,并引入两种计算更简单的评分函数以提高偏好数据选择的准确性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13776 2026-03-17 cs.IR cs.AI 79%

Retrieval-Feedback-Driven Distillation and Preference Alignment for Efficient LLM-based Query Expansion

检索-反馈驱动的蒸馏与偏好对齐用于高效的基于大语言模型的查询扩展

Minghan Li, Guodong Zhou

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出一种检索反馈驱动的蒸馏与偏好对齐框架,通过从强教师模型转移检索友好的扩展行为到紧凑的学生模型,以降低推理成本并提升检索效果。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12565 2026-03-16 cs.SD cs.CL 79%

Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization

通过直接偏好优化实现日语SpeechLLMs的Speech-Worthy对齐

Mengjie Zhao, Lianbo Liu, Yusuke Fujita, Hao Shi, Yuan Gao, Roman Koshkin, Yui Sudo

机构 * SB Intuitions

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出通过直接偏好优化方法,改进日语SpeechLLMs以生成适合语音合成的简洁、口语化文本,引入SpokenElyza基准测试,并在保持原有性能的同时显著提升语音质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25762 2026-03-06 cs.LG 79%

OPPO: Accelerating PPO-based RLHF via Pipeline Overlap

OPPO: 通过管道重叠加速基于PPO的RLHF

Kaizhuo Yan, Yingjie Yu, Yifan Yu, Haizhong Zheng, Fan Lai

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.LG

AI总结 OPPO通过管道重叠技术提升基于PPO的RLHF训练效率,加速训练过程并提高GPU利用率

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00485 2026-03-06 cs.AI 79%

Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models

用偏好替代参数:异构视觉-语言模型的联邦对齐

Shule Lu, Yujing Wang, Hainan Zhang, Xiaoshan Yang, Hongwei Zheng, Yongxin Tong, Changsheng Xu, Zhiming Zheng

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出MoR框架,通过用偏好替代参数实现异构视觉-语言模型的联邦对齐,提升泛化、鲁棒性和跨客户端适应性。

Comments Due to the need for substantial revisions, the authors believe that the paper should be retracted first.A revised version may be resubmitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07638 2026-03-03 cs.LG 79%

Data Selection for LLM Alignment Using Fine-Grained Preferences

利用细粒度偏好进行LLM对齐的数据选择

Jia Zhang, Yao Liu, Chen-Xi Zhang, Yi Liu, Yi-Xuan Jin, Lan-Zhe Guo, Yu-Feng Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Algorithm Tech, Taobao & Tmall Group of Alibaba(阿里巴巴集团算法技术部) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于细粒度偏好的数据选择方法,通过优化偏好分歧来提升LLM对齐效果,实验表明在少量数据下也能实现显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22718 2026-02-27 cs.AI cs.DC 79%

RLHFless: Serverless Computing for Efficient RLHF

RLHFless:用于高效RLHF的无服务器计算

Rui Wei, Hanfei Yu, Shubham Jain, Yogarajan Sivakumar, Devesh Tiwari, Jian Li, Seung-Jong Park, Hao Wang

机构 * Stevens Institute of Technology Northeastern University Stony Brook University Missouri University of Science \& Technology

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI

AI总结 RLHFless通过无服务器计算环境实现高效同步RLHF训练,预计算共享前缀并采用成本感知的演员扩展策略,提升训练速度并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20457 2026-02-25 cs.LG stat.ML 79%

Oracle-Robust Online Alignment for Large Language Models

面向大语言模型的Oracle鲁棒在线对齐

Zimeng Li, Mudit Gaur, Vaneet Aggarwal

机构 * Purdue University(普渡大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出了一种Oracle鲁棒的在线对齐方法,通过引入不确定性集和敏感性惩罚,实现了对大语言模型在不准确偏好反馈下的鲁棒优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09650 2026-02-23 cs.LG 79%

Cultivating Pluralism In Algorithmic Monoculture: The Community Alignment Dataset

在算法单一性中培育多元主义:社区对齐数据集

Lily Hong Zhang, Smitha Milli, Karen Jusko, Jonathan Smith, Brandon Amos, Wassim Bouaziz, Manon Revel, Jack Kussman, Yasha Sheynin, Lisa Titus, Bhaktipriya Radharapu, Jane Yu, Vidya Sarma, Kris Rose, Maximilian Nickel

机构 * FAIR at Meta(Meta 的 FAIR 部门) Governance at Meta(Meta 的治理部门) AI at Meta(Meta 的人工智能部门) Social Issues Research at Meta(Meta 的社会问题研究部门) AI Policy Team at Meta(Meta 的人工智能政策团队) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文通过构建社区对齐数据集,探讨如何通过负相关采样提升LLM对不同偏好的适应能力,推动算法多元主义发展。

详情

展开后加载摘要…

URL PDF HTML 收藏