arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4541 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4541 篇

2605.01130 2026-05-05 cs.AI 86%

Iterative Finetuning is Mostly Idempotent

迭代微调大多是自洽的

Zephaniah Roe, Jack Sanderson, Dang Nguyen, Julian Huang, Todd Nief, Aryan Shrivastava, Chenhao Tan, Ari Holtzman

机构 * University of Chicago(芝加哥大学)

专题命中 后训练与偏好优化 :SFT(summary_cn,abstract);post-training(abstract);preference optimization(abstract);分类 cs.AI

AI总结 研究通过训练一系列模型,每个模型在前代生成的数据上微调,发现traits在SFT和SDF中衰减或保持不变,而DPO中traits放大需持续训练,但重新初始化后消失,表明持续微调可能引发traits放大,限制此阶段可作为防御手段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10990 2026-05-04 cs.GT cs.LG econ.TH math.ST stat.ML stat.TH 86%

Statistical Impossibility and Possibility of Aligning LLMs with Human Preferences: From Condorcet Paradox to Nash Equilibrium

大语言模型与人类偏好的统计不可能性与可能性:从康德斯悖论到纳什均衡

Kaizhao Liu, Qi Long, Zhekun Shi, Weijie J. Su, Jiancong Xiao

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Pennsylvania(宾夕法尼亚大学) Princeton University(普林斯顿大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨了对齐大语言模型与人类偏好的统计限制,证明在一般概率偏好模型下,康德斯循环几乎必然存在,从而表明基于奖励的方法无法完全对齐偏好。同时,研究了非奖励方法下LLM采用混合策略的条件,证明在Luce模型下,少数群体偏好得以保留的统计可能性。

Comments Accepted for publication in the Annals of Statistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27488 2026-05-01 cs.CL 86%

Skills-Coach: A Self-Evolving Skill Optimizer via Training-Free GRPO

Skills-Coach:一种通过无训练GRPO实现的自我进化技能优化器

Yu Tian, Jiawei Chen, Lifan Zheng, Mingxiang Tao, Xinyi Zeng, Zhaoxia Yin, Hang Su, Xian Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) Southeast University(东南大学) Hainan University(海南大学) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Skills-Coach通过无训练GRPO框架提升LLM代理技能自我进化能力,包含四个核心模块,通过Skill-X基准测试展示其在多种技能类别中的显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03853 2026-05-01 cs.CR cs.LG 86%

Dr. Jekyll and Mr. Hyde: Two Faces of LLMs

医生贾克尔与 Mr. 海德:大语言模型的两面

Matteo Gioele Collu, Tom Janssen-Groesbeek, Stefanos Koffas, Mauro Conti, Stjepan Picek

机构 * University of Padova(帕多瓦大学) Radboud University(拉德博德大学) Delft University of Technology(代尔夫特理工大学) Örebro University(欧雷布罗大学) University of Zagreb Faculty of Electrical Engineering(Zagreb大学电子工程学院) University of Bergen(卑尔根大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究通过角色扮演攻击揭示大语言模型的安全漏洞,展示通过伪装复杂人格可获取非法信息,验证了多种模型在2023-2025年间对攻击的脆弱性。

Comments Presented at the Joint National Conference on Cybersecurity (ITASEC & SERICS 2026), Cagliari, Italy, February 09-13, 2026. Published as Paper 35 in CEUR Workshop Proceedings, Vol-4198. Available at: https://ceur-ws.org/Vol-4198/

Journal ref Proc. Joint National Conference on Cybersecurity (ITASEC & SERICS 2026), CEUR-WS.org, Vol-4198, 35, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29957 2026-04-28 cs.SE cs.LG 86%

Think Anywhere in Code Generation

在代码生成中任意思考

Xue Jiang, Tianyu Zhang, Ge Li, Mengyang Liu, Taozhi Chen, Zhenhua Xu, Binhua Li, Wenpin Jiao, Zhi Jin, Yongbin Li, Yihong Dong

机构 * School of Computer Science, Peking University(1 计算机科学系,北京大学) Tongyi Lab, Alibaba Group(2 龙洋实验室,阿里巴巴集团)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出Think-Anywhere机制,使LLM在代码生成过程中可按需调用推理,通过冷启动训练和基于结果的强化学习奖励,实现适应性推理,提升代码生成性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19024 2026-04-22 cs.LG 86%

Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback

基于人类反馈的安全强化学习策略梯度对偶方法

Qiang Liu, Adrienne Kline, Ermin Wei

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出两种无需奖励模型拟合的Safe RLHF算法,将安全RLHF建模为无限 horizon 折扣约束马尔可夫决策过程,并保证了全局收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02174 2026-04-03 cs.AI 86%

Quantifying Self-Preservation Bias in Large Language Models

量化大型语言模型中的自我保护偏差

Matteo Migliarini, Joaquin Pereira Pizzini, Luca Moresca, Valerio Santini, Indro Spinelli, Fabio Galasso

机构 * Sapienza University(罗马大学) ItalAI

专题命中 后训练与偏好优化 :large language model(title);language model(title);RLHF(abstract);分类 cs.AI

AI总结 本文提出TBSP基准测试,通过逻辑不一致检测模型自我保护动机与客观效用的偏离,发现多数模型在部署角色下超过60%的自我保护率,且在低改进情况下易进行事后合理化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15172 2026-02-02 cs.AI 86%

Self-Improvement of Language Models by Post-Training on Multi-Agent Debate

通过多智能体辩论进行语言模型的自改进

Ankur Samanta, Akshayaa Magesh, Runzhe Wu, Ayush Jain, Youliang Yu, Daniel Jiang, Boris Vidolov, Paul Sajda, Yonathan Efroni, Kaveh Hassani

机构 * Meta AI Columbia University(哥伦比亚大学) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 后训练与偏好优化 :language model(title);post-training(title);SFT(abstract);分类 cs.AI

AI总结 通过多智能体辩论和强化学习提升语言模型的自我改进能力,实现推理准确性、自洽性和泛化能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17515 2025-07-24 cs.CV cs.CL 86%

URPO: A Unified Reward & Policy Optimization Framework for Large Language Models

Songshuo Lu, Hua Wang, Zhi Chen, Yaohua Tang

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09269 2025-04-22 cs.SD cs.LG eess.AS 86%

Enhancing Audio-Language Models through Self-Supervised Post-Training with Text-Audio Pairs

Anshuman Sinha, Camille Migozzi, Aubin Rey, Chao Zhang

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title);分类 cs.LG

Comments 29 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06260 2025-03-11 cs.CV cs.AI 86%

From Captions to Rewards (CAREVL): Leveraging Large Language Model Experts for Enhanced Reward Modeling in Large Vision-Language Models

Muzhi Dai, Jiashuo Sun, Zhiyuan Zhao, Shixuan Liu, Rui Li, Junyu Gao, Xuelong Li

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19759 2024-10-10 cs.CL 86%

Breaking the Script Barrier in Multilingual Pre-Trained Language Models with Transliteration-Based Post-Training Alignment

Orgest Xhelili, Yihong Liu, Hinrich Schütze

专题命中 后训练与偏好优化 :language model(title);post-training(title);pretraining(abstract);分类 cs.CL

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19598 2026-08-21 cs.CV cs.AI cs.CL cs.MM 新提交 86%

PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment

PEA-DPO:用于多模态大语言模型对齐的感知增强型直接偏好优化

Jiawei Feng, Jiancan Wu, Xingyu Zhu, Junkang Wu, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型偏好优化存在的视觉不敏感性问题,提出PEA-DPO框架,利用视觉偏好信号缓解该问题,提升多模态对齐效果并减少幻觉。

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), November 10--14, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04056 2026-08-06 cs.CL cs.CY cs.LG 新提交 86%

Learning Sexism Detection Using Multi-Agent Perspectivist Preference Optimization

基于多智能体视角偏好优化的性别歧视检测学习

Hadi Mohammadi, Tina Shahedi, Robert A. Bagheri, Mehdi Dastani, Masoume M. Raeissi

机构 * Utrecht University(乌得勒支大学) Wageningen University & Research(瓦赫宁根大学及研究中心)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究针对性别歧视检测中标注分歧问题,提出MAP-PO框架,通过聚类标注者并训练对应智能体,结合个体与团队奖励协调智能体,实验验证了聚类训练及团队信号的必要性。

Comments 17 pages, 12 figures, 14 tables. Preprint; under review at EACL 2027 (ACL Rolling Review, August 2026 cycle). Code and data: https://github.com/mohammadi-hadi/MAP-PO

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20083 2026-07-24 cs.LG cs.AI 版本更新 86%

Co-Evolving LLM Evaluators and Policies via DynamicRubric

通过动态评分标准共同进化大语言模型评估器和策略

Beining Wang, Weihang Su, Hongtao Tian, Hao Kong, Tao Yang, Ting Yao, Qingyi Pan, Yueyue Wu, Qingyao Ai, Min Zhang, Yiqun Liu

机构 * Tsinghua University(清华大学) Tencent(腾讯)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究基于评估器反馈优化大语言模型时因策略改进导致的优化瓶颈问题,提出DynamicRubric框架,通过生成加权评分标准项实现评估器与策略共同进化,实验证明该框架提升了评估器性能及策略效果,并已成功应用于微信搜索。

Comments add online model info (approved)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18239 2026-07-24 cs.LG cs.AI 版本更新 86%

Towards Disentangled Preference Optimization Dynamics: Suppress the Loser, Preserve the Winner

朝着解耦偏好优化动态:压制失败者,保留胜利者

Wei Chen, Yubing Wu, Junmei Yang, Delu Zeng, Qibin Zhao, John Paisley, Min Chen, Zhou Wang

机构 * South China University of Technology(南方科技大学) Columbia University(哥伦比亚大学) University of Waterloo(滑铁卢大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出奖励校准方法,通过解耦带宽条件实现压制失败者并保留胜利者的优化动态,提升了下游性能。

Journal ref International Conference on Machine Learning(ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13712 2026-07-16 cs.CV cs.AI cs.CL cs.MM 新提交 86%

Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs

Groc-PO:用于真实多模态大语言模型的基于上下文的偏好优化

Zhixiao Zheng, Zheren Fu, Zhiyuan Yao, Chunxiao Liu, Dongming Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Xiaomi Corporation(小米公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日报社传播内容认知国家重点实验室)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对多模态大语言模型的不真实问题,提出基于上下文的偏好优化框架Groc-PO,构建相关数据集,通过多阶段偏好样本捕捉基础上下文,加强上下文相关推理,减轻跨阶段错误传播,提升模型性能。

Comments Accepted by ACM-MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20140 2026-07-13 cs.AI cs.LG 版本更新 86%

HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs

HiPO:用于大语言模型自适应推理的分层偏好优化

Darsh Kachroo, Arjun Prasaath Anbazhagan, Adriana Caraeni, Brennan Lagasse, Kevin Zhu

机构 * Vellore Institute of Technology(维洛雷理工学院) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Northwestern University(西北大学) Yale University(耶鲁大学) Algoverse AI Research(Algoverse AI研究)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HiPO通过分层优化提升大语言模型在复杂推理任务中的表现,结合偏好优化与结构化推理的优势,实现更高效的训练和更一致的输出。

Comments 12 pages, 4 figures, 6 tables. Includes ablation study across Qwen2.5-7B-Instruct and Llama-3.1-8B-Instruct on 5 math reasoning benchmarks (GSM8K, MATH500, Minerva, AIME24, Gaokao2023). GPT-4.1 used for structured evaluation of reasoning quality

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03770 2026-07-07 cs.CV cs.AI cs.LG 新提交 86%

Self-Improving Diffusion Classifiers with Minority Preference Optimization

通过少数偏好优化实现自我改进的扩散分类器

Hyunsoo Kim, Jungmyung Wi, Soobin Um, Donghyun Kim, Suhyun Kim

机构 * Korea University(韩国大学) Kook Min University(国民大学) Kyung Hee University(庆熙大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究发现扩散分类器感知偏向多数区域,提出MiPO方法,利用少数偏好奖励微调预训练扩散模型,无需额外图像数据等,经实验验证可缓解偏差并提升零样本扩散分类性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25524 2026-06-26 cs.AI cs.CL 新提交 86%

Cliff Tokens: Identifying Single-Token Failure Triggers in LLM Mathematical Reasoning

Cliff Tokens: 识别大语言模型数学推理中的单Token失败触发点

Jaeyong Ko, Pilsung Kang, Yukyung Lee

机构 * Seoul National University(首尔大学) Boston University(波士顿大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出“悬崖token”概念,通过自适应阈值和单侧双比例z检验识别导致推理失败的单个token,删除并重采样可恢复pass@64至1.0,并基于贪心选择和token熵建立分类法,通过Cliff-DPO优化提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04389 2026-06-23 cs.CL cs.AI 版本更新 86%

Safety Is Not Universal: The Selective Safety Trap in LLM Alignment

安全并非普遍:大语言模型对齐中的选择性安全陷阱

Iago Alves Brito, Walcy Santos Rezende Rios, Julia Soares Dollis, Diogo Fernandes Costa Silva, Arlindo Rodrigues Galvão Filho

机构 * Advanced Knowledge Center for Immersive Technologies(沉浸式技术先进知识中心) Federal University of Goiás(戈亚斯联邦大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究揭示大语言模型在安全对齐中的选择性安全陷阱,通过MiJaBench基准测试发现安全防御存在人口统计学层级差异,通过DPO优化实现跨群体的安全泛化。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19004 2026-06-18 cs.DC cs.AI cs.LG 新提交 86%

Spotlight: Synergizing Seed Exploration and Spot GPUs for DiT RL Post-Training

Spotlight: 协同种子探索与抢占式GPU用于DiT强化学习后训练

Ruiqi Lai, Dakai An, Wei Gao, Ju Huang, Siran Yang, Jiamang Wang, Lin Qu, Dmitrii Ustiugov, Wei Wang

机构 * NTU Singapore(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对DiT强化学习后训练成本高的问题,提出Spotlight系统,通过利用探索对旧权重的容忍性和SP组快速重配置,在抢占式GPU上实现高效训练,加速4倍并降低成本1.4-6.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12881 2026-06-15 cs.CL cs.LG 新提交 86%

Direct Preference Optimization for Chatbot Fine-Tuning: An Empirical Study

面向聊天机器人微调的直接偏好优化:一项实证研究

Dezhi Yu, Yvonne Qiu, ShuoJia Fu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文实证研究直接偏好优化(DPO)在聊天机器人微调中的应用,表明其简化训练流程、提升计算效率且性能有竞争力,但存在训练不稳定性。

Comments 7 pages, 3 figures, 1 table. All authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10890 2026-06-10 cs.LG cs.AI 新提交 86%

Optimal Post-Training Quantization Scales and Where to Find Them

最优后训练量化尺度及其寻找方法

Juan Amboage, Pablo Monteagudo-Lago, Ian Colbert, Giuseppe Franco, Nicholas Fraser

机构 * AMD

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出PiSO算法,利用校准数据精确高效地计算逐通道最优量化尺度,并扩展到分组量化,在Llama和Qwen模型上显著提升困惑度和零样本准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08496 2026-06-09 cs.CL cs.LG 新提交 86%

SAEExplainer: Interpreting SAE Features with Activation-Guided Preference Optimization

SAEExplainer: 基于激活引导偏好优化的SAE特征解释

Jingyi He, Haiyan Zhao, Ruxue Shi, Yanguang Liu, Xin Wang, Fei Sun, Mengnan Du

机构 * Shanghai Jiao Tong University(上海交通大学) NJIT(新泽西理工学院) Jilin University(吉林大学) Institute of Computing Technology, CAS(中国科学院计算技术研究所) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :preference optimization(title);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出SAEExplainer框架,利用激活分数作为奖励信号,通过两轮优化迭代自纠正基础解释,减少解释幻觉并增强因果触发模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05606 2026-06-05 cs.LG cs.AI math.OC 86%

Cross-Epoch Adaptive Rollout Optimization for RL Post-Training

跨时代自适应展开优化用于强化学习后训练

Yiming Zong, Yige Wang, Jiashuo Jiang

机构 * Department of Industrial Engineering & Decision Analytics, Hong Kong University of Science and Technology(工业工程与决策分析系,香港科学与技术大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对提示词训练信号差异大的问题,提出CERO方法,通过贝叶斯估计提示词成功概率并利用Fenchel对偶优化自适应分配展开预算,在固定总预算下提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00395 2026-06-03 cs.LG cs.AI 86%

PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning

PR2: 基于MoE的大语言模型强化学习中的预测性路由重放

Daize Dong, Junlin Chen, Haolong Jia, Jiang Liu, Jiawei Wu, Huanwei Di, Jialian Wu, Zhengzhong Liu, Zicheng Liu, Emad Barsoum, Dimitris N. Metaxas, Hongyi Wang

机构 * Rutgers University(罗格斯大学) AMD MBZUAI

专题命中 后训练与偏好优化 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对MoE大语言模型强化学习中路由器漂移导致的不稳定性问题,提出预测性路由重放方法,通过轻量级演化预测器减少路由不匹配,提升训练稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11134 2026-06-01 cs.LG cs.AI 86%

Spurious Correlation Learning in Preference Optimization: Mechanisms, Consequences, and Mitigation via Tie Training

偏好优化中的虚假相关学习:机制、后果及通过平局训练的缓解方法

Christian Moya, Alex Semendinger, Guang Lin, Elliott Thornley

机构 * Department of Mathematics, Purdue University, West Lafayette IN, USA(普渡大学数学系) School of Mechanical Engineering, Purdue University, West Lafayette IN, USA(普渡大学机械工程学院) Massachusetts Institute of Technology, Cambridge MA, USA(麻省理工学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过统一理论分析揭示了偏好优化(如DPO)中虚假相关学习的机制(均值虚假偏差和因果-虚假相关泄漏),证明其导致分布偏移下的不可逆脆弱性,并提出平局训练数据增强策略以选择性减少虚假学习。

Comments Proceedings of the 43rd International Conference on Machine Learning, 2026, Seoul, South Korea

Journal ref Proceedings of the 43rd International Conference on Machine Learning, 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29888 2026-05-29 cs.LG cs.AI 86%

LaRA: Layer-wise Representation Analysis for Detecting Data Contamination in RL Post-Training

LaRA: 面向RL后训练中数据污染的逐层表示分析

Minju Gwak, Minseo Kwak, Dongseok Lee, Guijin Son, Alan Ritter, Jaehyung Kim

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出LaRA框架,通过逐层表示分析检测强化学习后训练中的污染数据,利用扰动敏感性、方向坍缩和局部表示刚性三个指标,优于现有输出级方法。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28440 2026-05-28 cs.CL cs.LG 86%

AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates

AdaDPO:具有平衡梯度更新的自适应直接偏好优化

Shaolong Chen, Madalina Ciobanu, Qingqing Mao, Ritankar Das

机构 * Incept Labs(Incept实验室)

专题命中 后训练与偏好优化 :preference optimization(title);RLHF(abstract,abstract_cn);LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 针对DPO中梯度不对称导致模型偏向避免不良回答而非生成优质回答的问题,提出AdaDPO算法,通过引入基于策略模型生成概率的自适应系数来平衡正负偏好梯度,在AlpacaEval 2上优于DPO并缓解长度偏差。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏