arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4541 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4541 篇

2608.06310 2026-08-07 cs.LG cs.CL 新提交 88%

RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction

RRC:基于排序的奖励构造解锁LLM强化学习中的生成式奖励模型

Chenglong Wang, Ziming Zhu, Yifu Huo, Bei Li, Qiaozhi He, Yan Ding, Xiaoyang Hao, Yuxin Gao, Tianhua Zhou, Xiaojia Chang, Tongran Liu, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) NiuTrans Research(NiuTrans研究院) Institute of Psychology, CAS(中国科学院心理研究所) Kunming University of Science and Technology(昆明理工大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本研究针对生成式奖励模型在LLM强化学习中潜力未充分发挥的问题,提出RRC方法,通过两种互补策略提升RL训练效果,在多基准上取得一致增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05446 2026-08-07 cs.LG cs.CL 新提交 88%

EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents

EvoHarness-RL:为长视野大语言模型智能体学习自进化运行时管控器

Xuying Ning, Dongqi Fu, Tianxin Wei, Hanqing Zeng, Yuanchen Bei, Bingxuan Li, Zihao Li, Qifan Wang, Xiang Shen, Yifan Wu, Jiayi Liu, Hong Li, Yinglong Xia, Xiangjun Fan, Hanghang Tong, Jingrui He

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta AI

专题命中 后训练与偏好优化 :LLM(title,summary_cn);分类 cs.CL、cs.LG

AI总结 本研究提出 EvoHarness-RL 方法,通过学习管控器策略解决长视野 LLM 智能体的外部状态管理问题,在 ALFWorld 上达到 96.9% 的任务成功率,验证了可训练管控器策略的有效性。

Comments Accepted to LLA@COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01879 2026-08-04 cs.LG cs.AI 新提交 88%

LAB-Tab: LLM-Augmented Bayesian Network Adaptation for Few-Shot Tabular Generation

LAB-Tab:面向小样本表格生成的大语言模型增强型贝叶斯网络适配方法

Zijian Shen, Taijie Chen, Bin Zhou, Ziyang Jiang, Jintao Ke

专题命中 后训练与偏好优化 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 针对小样本表格生成的分布偏移问题,提出LLM增强的贝叶斯网络适配框架LAB-Tab,在六个ACS分布偏移场景中表现优于基准方法,性能提升显著。

Comments 21 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14171 2026-07-17 cs.LG cs.CL 新提交 88%

Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning

分支策略优化:沙盒原生语言智能体强化学习

Bowei He, Yankai Chen, Xiaokun Zhang, Xue Liu

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) McGill Univeristy(麦吉尔大学) City University of Hong Kong(香港城市大学)

专题命中 后训练与偏好优化 :language agent(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究基于可执行沙盒的大语言模型智能体强化学习,提出分支策略优化(BPO)算法,利用沙盒特性构建新展开拓扑,通过自适应快照、分叉动作等方式计算优势,实验验证该算法能提升成功率、降低方差并减少策略更新。

Comments Accepted by WAIC Academic 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26102 2026-07-14 cs.CL cs.AI cs.CY 版本更新 88%

Helpfulness Hurts: Domain-Dependent Degradation of Mid-Trained Compassion Values Under Post-Training

帮助有害:后训练中领域依赖的中期训练同情价值观退化

Jasmine Brazilek, Juliana Seawell

机构 * Compassion Aligned Machine Learning (CaML)(同情心对齐机器学习实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract);SFT(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究后训练数据领域对中期训练同情价值观的影响,发现帮助性训练比编程训练更显著降低动物同情和道德推理能力,但跨语言迁移存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01692 2026-07-13 cs.AI cs.LG 版本更新 88%

A Descriptive and Normative Theory of Human Beliefs in RLHF

基于人类反馈强化学习中的人类信念描述性与规范性理论

Sylee Dandekar, Shripad Deshmukh, Frank Chiu, W. Bradley Knox, Scott Niekum

机构 * College of Information and Computer Sciences University of Massachusetts Amherst(信息与计算机科学学院 马萨诸塞大学阿姆赫斯特分校) Department of Computer Science The University of Texas at Austin(计算机科学系 德州大学奥斯汀分校)

专题命中 后训练与偏好优化 :RLHF(title,summary_cn);分类 cs.AI、cs.LG

AI总结 研究 RLHF 中人类信念作用,提出新偏好模型,通过人类和综合实验,证实人类对智能体能力信念影响偏好,指出减少信念与能力不匹配可提升 RLHF 并给出新实践方向。

Comments Published at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07468 2026-07-07 cs.LG cs.CL cs.MA 版本更新 88%

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

通过在线自我博弈强化学习追踪移动目标以实现更安全的语言模型

Mickel Liu, Liwei Jiang, Yancheng Liang, Simon Shaolei Du, Yejin Choi, Tim Althoff, Natasha Jaques

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)

AI总结 研究传统大语言模型安全对齐问题,引入Self-RedTeam算法,通过在线自我博弈多智能体强化学习持续共同进化攻防策略,有理论安全保障,实证效果好,推动从被动修补到主动协同进化转变。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01083 2026-07-03 cs.LG cs.AI 新提交 88%

Staleness-Learning Rate Scaling Laws for Asynchronous RLHF

异步RLHF的陈旧度-学习率缩放定律

Jingwei Song, Haofeng Xu, Jie Xiao, Chengke Bao, Jingwei Shi, Pengbin Feng, Weixun Wang, Yuhang Han, Chuan Wu, Linfeng Zhang, Bill Shi

机构 * The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) Gradient University of Southern California(南加州大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);分类 cs.AI、cs.LG

AI总结 研究异步GRPO中陈旧rollout的影响,推导出陈旧度与学习率之间的缩放定律,揭示稳定性受累积漂移和陈旧度约束的双重条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06096 2026-06-30 cs.LG cs.CL 88%

The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives

对齐审计员:一种用于验证和细化大语言模型目标的贝叶斯框架

Matthieu Bou, Nyal Patel, Arjun Jagota, Satyapriya Krishna, Sonali Parbhoo

机构 * Imperial College London(伦敦帝国学院) Amazon AGI(亚马逊通用人工智能)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出一种贝叶斯框架,通过验证和细化LLM目标,解决逆强化学习中奖励函数推断的非识别性问题,提供可操作的诊断和验证政策效用的方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18606 2026-06-18 cs.CL cs.AI 新提交 88%

Steerable Cultural Preference Optimization of Reward Models

可引导的文化偏好优化奖励模型

Minsik Oh, Advit Deepak, Sophie Wu, Douwe Kiela, Ekaterina Shutova

机构 * Stanford University(斯坦福大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 后训练与偏好优化 :preference optimization(title);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出SCPO算法,通过平衡多种文化偏好训练奖励模型,在PRISM和GlobalOpinionQA数据集上提升少数群体偏好预测准确率最多7点,训练效率提高280%。

Comments Accepted to Pluralistic Alignment @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01561 2026-06-16 cs.AI cs.LG 版本更新 88%

S-SPPO: Semantic-Calibrated Self-Play Preference Optimization

S-SPPO:语义校准的自对弈偏好优化

Xiwen Chen, Wenhui Zhu, Jingjing Wang, Peijie Qiu, Zhipeng Wang, Huayu Li, ZhengXiao He, Xuanzhao Dong, Prayag Tiwari, Mingkun Xu, Yujian Xiong, Feng Luo, Abolfazl Razi, Brendan Hogan Rappazzo, Anderson Schneider, Yuriy Nevmyvaka

机构 * University of Arizona, USA(亚利桑那大学) Arizona State University, USA(亚利桑那州立大学) Now at Google LLC, work done at Rice University(现就职于谷歌公司,曾就职于里士大学) Clemson University, USA(克莱姆森大学) Washington University in St. Louis, USA(圣路易斯华盛顿大学) Halmstad University, Sweden(哈姆斯塔德大学) Guangdong Institute of Intelligence Science and Technology, China(广东智能科学与技术研究院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对自对弈偏好优化(SPPO)中因偏好预测过度自信导致策略退化的问题,提出双空间语义校准框架S-SPPO,通过语义门控监督校准和潜在排斥表示校准,在保持博弈结构的同时提升对齐性能。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03077 2026-06-11 cs.LG cs.AI cs.DC 版本更新 88%

Libra: Efficient Resource Management for Agentic RL Post-Training

Libra:面向智能体强化学习后训练的高效资源管理

Kaiwen Chen, Xin Tan, Jingzong Li, Hong Xu

机构 * The Chinese University of Hong Kong(香港中文大学) The Hang Seng University of Hong Kong (2018)(香港恒生大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对智能体强化学习中长尾、非平稳工作负载带来的资源管理挑战,提出Libra系统,通过周期性全局资源规划器和因果驱动多级反馈队列调度器,实现GPU分配优化和请求调度,最高提升3倍吞吐量和2.5倍收敛速度。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18899 2026-05-20 cs.LG cs.AI 88%

Don't Let Bandit Feedback Pull Continual LLM-Recommender Updates Off Target

不要让多臂老虎机反馈将连续LLM推荐系统更新偏离目标

Taesan Kim, Hyeongjun Yun, Jaegul Choo, Chung Park

机构 * SK Telecom(SK电信) KAIST(韩国科学技术院)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出了一种名为Anchored Bandit Policy Optimization (ABPO)的框架,用于持续改进基于生成式大语言模型的推荐系统,通过结合组内相对策略优化(GRPO)和显式处理曝光偏差和反馈模糊性,以减少因部署日志提供的策略形状上下文老虎机反馈导致的偏差,并提高推荐准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06850 2026-05-11 cs.LG cs.AI 88%

How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment

如何在RL后训练中压缩KV缓存?基于影子遮罩的内存高效对齐

Rui Zhu, Weiheng Bai, Qiushi Wu, Yang Ren, Haixu Tang, Yuchu Liu

机构 * Yale University(耶鲁大学) University of Minnesota Twin Cities(明尼苏达大学双城分校) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 后训练与偏好优化 :post-training(title);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出影子遮罩蒸馏方法,用于缓解RL后训练中KV缓存内存瓶颈问题,通过减少采样时的上下文密度来降低偏置,提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06036 2026-05-08 cs.LG cs.AI 88%

Optimal Transport for LLM Reward Modeling from Noisy Preference

基于噪声偏好的LLM奖励建模中的最优传输

Licheng Pan, Haochen Yang, Haoxuan Li, Yunsheng Lu, Yongqi Tong, Yinuo Wang, Shijian Wang, Zhixuan Chu, Lei Shen, Yuan Lu, Hao Wang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 后训练与偏好优化 :LLM(title,title_cn);RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出SelectiveRM框架,利用最优传输对噪声偏好进行去噪,通过联合一致性差异对齐模型预测分布与偏好数据,并引入质量放松机制以排除矛盾样本,提升奖励建模性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15395 2026-05-08 cs.CL cs.AI cs.HC 88%

Beyond Fixed Psychological Personas: State Beats Trait, but Language Models are State-Blind

超越固定心理人格:状态胜过特质,但语言模型是状态盲的

Tamunotonye Harry, Ivoline Ngong, Chima Nweke, Yuanyuan Feng, Joseph Near

机构 * University of Vermont(佛蒙特大学) Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract,abstract_cn);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 本文通过Chameleon数据集发现语言模型对状态盲,而奖励模型对用户状态反应不一致,推动情感计算和个性化对话研究。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23988 2026-04-28 cs.LG cs.AI 88%

Hindsight Preference Optimization for Financial Time Series Advisory

金融时间序列建议的 hindsight 偏好优化

Yanwei Cui, Guanghui Wang, Xing Zhang, Peiyang He, Ziyuan Li, Bing Zhu, Wei Qiu, Xusheng Wang, Zheng Yu, Anqi Xin

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) HSBC Holdings Plc(汇丰控股有限公司) HSBC Technology Center China(汇丰技术中心(中国))

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过回顾性偏好优化方法,利用观测结果生成偏好对,提升语言模型在金融时间序列预测中的建议质量。

Comments Accepted at ICLR 2026 TSALM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03192 2026-03-31 cs.CV cs.CL cs.LG 88%

MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization

MoD-DPO:通过模态解耦偏好优化缓解多模态幻觉

Ashutosh Chaubey, Jiacheng Pang, Mohammad Soleymani

机构 * University of Southern California(南加州大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出MoD-DPO框架,通过引入模态感知正则化项和语言先验去偏惩罚,提升多模态大模型的模态对齐能力,实验表明其在多模态幻觉基准测试中表现优异。

Comments CVPR 2026. Project Page: https://mod-dpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03253 2026-03-03 cs.LG cs.AI 88%

Solving the Granularity Mismatch: Hierarchical Preference Learning for Long-Horizon LLM Agents

解决粒度不匹配问题:用于长周期LLM代理的层次化偏好学习

Heyang Gao, Zexu Sun, Erxue Min, Hengyi Cai, Shuaiqiang Wang, Dawei Yin, Xu Chen

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(人工智能与数字经济广东实验室) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Baidu Inc.(百度公司)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出层次化偏好学习方法,通过双层课程引导解决LLM代理长周期任务中的粒度不匹配问题,提升多粒度偏好优化能力。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12522 2026-02-27 cs.CL cs.AI 88%

Evaluating the Diversity and Quality of LLM Generated Content

评估大型语言模型生成内容的多样性和质量

Alexander Shypula, Shuo Li, Botong Zhang, Vishakh Padmakumar, Kayo Yin, Osbert Bastani

机构 * University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学) UC Berkeley(伯克利大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出有效语义多样性测量框架,发现偏好微调模型在质量阈值下具有更高多样性,且小模型在固定预算内更高效生成独特内容。

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16833 2026-02-20 cs.LG cs.AI 88%

VAM: Verbalized Action Masking for Controllable Exploration in RL Post-Training -- A Chess Case Study

VAM:在RL后训练中可控探索的可言行动屏蔽——国际象棋案例研究

Zhicheng Zhang, Ziyan Wang, Yali Du, Fei Fang

机构 * Carnegie Mellon University(卡内基梅隆大学) King's College London(国王学院伦敦)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 VAM通过可言化动作屏蔽提升LLM后训练强化学习的探索效率,在国际象棋中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23631 2026-02-11 cs.LG cs.AI stat.ME stat.ML 88%

Beyond Pairwise: Empowering LLM Alignment With Ranked Choice Modeling

超越成对:通过排名选择建模增强大语言模型对齐

Yuxuan Tang, Yifan Feng

机构 * Institute of Operations Research and Analytics(运营研究与分析研究所) National University of Singapore(新加坡国立大学) Department of Analytics and Operations(分析与运营系) NUS Business School(新加坡国立大学商学院)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出RCPO框架,通过最大似然估计结合排名选择建模,提升大语言模型对齐效果,实验显示其在多种模型和设置中均优于基线方法。

Comments Accepted by The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06669 2026-02-09 cs.CL cs.AI 88%

compar:IA: The French Government's LLM arena to collect French-language human prompts and preference data

compar:IA:法国政府的LLM竞技场,用于收集法语人类提示和偏好数据

Lucie Termignon, Simonas Zilinskas, Hadrien Pélissier, Aurélien Barrot, Nicolas Chesnais, Elie Gavoty

机构 * The French Government(法国政府)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 compar:IA由法国政府开发,旨在通过收集法语人类提示和偏好数据,提升非英语语言中LLM的性能和文化契合度,同时推动多语言模型训练和评估的国际发展。

Comments 18 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00166 2026-02-06 cs.LG cs.AI 88%

Joint Continual Learning of Local Language Models and Cloud Offloading Decisions with Budget Constraints

带有预算约束的本地语言模型与云卸载决策的联合持续学习

Evan Chen, Wenzhi Fang, Shiqiang Wang, Christopher Brinton

机构 * Elmore Family School of Electrical and Computer Engineering, Purdue University, West Lafayette, IN(电子与计算机工程学院,普渡大学) Department of Computer Science, University of Exeter, UK(计算机科学系,埃克塞特大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);small language model(abstract);post-training(abstract)

AI总结 本文提出DA-GRPO方法,通过联合学习本地语言模型和云卸载决策,有效解决持续学习中的预算约束问题,提升任务准确性并减少遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13131 2026-02-05 cs.CL cs.LG stat.ML 88%

Improving Detection of Watermarked Language Models

提升水印语言模型的检测能力

Dara Bahri, John Wieting

机构 * Google DeepMind(谷歌DeepMind)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);instruction tuning(abstract);RLHF(abstract)

AI总结 本文通过结合水印与非水印检测器提升大型语言模型的检测能力。

Comments Published at TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22881 2026-01-27 cs.LG cs.CL 88%

Offline Preference Optimization via Maximum Marginal Likelihood Estimation

通过最大边际似然估计实现离线偏好优化

Saeed Najafi, Alona Fyshe

机构 * Department of Computing Science, University of Alberta, Canada(计算科学系,阿尔伯塔大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出基于最大边际似然估计的MMPO方法,通过隐式偏好优化提升模型稳定性与对齐性能。

Comments EACL 2026, camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11574 2026-01-21 cs.LG cs.AI 88%

GRADE: Replacing Policy Gradients with Backpropagation for LLM Alignment

GRADE: 用反向传播替代策略梯度以实现大语言模型对齐

Lukas Abrie Nel

机构 * Lotus Health AI(Lotus健康AI)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 GRADE通过可微松弛的离散令牌采样过程替代策略梯度,实现大语言模型对齐的更稳定和高效方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06092 2026-01-21 cs.LG cs.CL 88%

Learning from Failures: Understanding LLM Alignment through Failure-Aware Inverse RL

从失败中学习:通过失败意识反向强化学习理解LLM对齐

Nyal Patel, Matthieu Bou, Arjun Jagota, Satyapriya Krishna, Sonali Parbhoo

机构 * Imperial College London(帝国理工学院伦敦分校) Amazon AGI(亚马逊人工智能实验室)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出一种失败意识反向强化学习算法,通过聚焦于误分类或困难的例子来提取更准确的奖励函数,从而提升LLM对齐的可解释性和安全性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06157 2026-01-13 cs.LG cs.AI 88%

ECLIPTICA -- A Framework for Switchable LLM Alignment via CITA - Contrastive Instruction-Tuned Alignment

ECLIPTICA -- 一种通过CITA进行可切换LLM对齐的框架

Kapil Wanaskar, Gaytri Jena, Vinija Jain, Aman Chadha, Amitava Das

机构 * San José State University(圣何塞州立大学) Google(谷歌) Apple(苹果) Pragya Lab, BITS Pilani Goa, India(BITS Pilani Goa 印度分校实验室)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 ECLIPTICA通过CITA实现LLM对齐的可切换框架,以高效率提升指令对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06103 2026-01-13 cs.LG cs.AI 88%

The Impact of Post-training on Data Contamination

训练后阶段对数据污染的影响

Muhammed Yusuf Kocyigit, Caglar Yildirim

机构 * Boston University(波士顿大学) Northeastern University(东北大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 研究发现数据污染在训练后阶段会引发性能波动,但通过SFT和GRPO方法可缓解,且模型规模越大,污染影响越显著。

详情

展开后加载摘要…

URL PDF HTML 收藏