arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-13 至 2026-01-13 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 16 篇

2601.06108 2026-01-13 cs.AI cs.CL 92%

From RLHF to Direct Alignment: A Theoretical Unification of Preference Learning for Large Language Models

从RLHF到直接对齐:大型语言模型偏好学习的理论统一

Tarun Raheja, Nilay Pochhi

机构 * Independent Researchers(独立研究者)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(title,abstract);preference optimization(abstract)

AI总结 本文提出了一种理论统一框架,将大型语言模型的偏好学习方法归结为三个正交轴上的原则性选择,揭示了不同方法之间的本质联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06700 2026-01-13 cs.CL cs.AI 88%

Characterising Toxicity in Generative Large Language Models

表征生成大语言模型中的毒性

Zhiyao Zhang, Yazan Mash'Al, Yuhan Wu

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(title);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了生成大语言模型在提示下的毒性输出生成程度及影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06157 2026-01-13 cs.LG cs.AI 88%

ECLIPTICA -- A Framework for Switchable LLM Alignment via CITA - Contrastive Instruction-Tuned Alignment

ECLIPTICA -- 一种通过CITA进行可切换LLM对齐的框架

Kapil Wanaskar, Gaytri Jena, Vinija Jain, Aman Chadha, Amitava Das

机构 * San José State University(圣何塞州立大学) Google(谷歌) Apple(苹果) Pragya Lab, BITS Pilani Goa, India(BITS Pilani Goa 印度分校实验室)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 ECLIPTICA通过CITA实现LLM对齐的可切换框架,以高效率提升指令对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06103 2026-01-13 cs.LG cs.AI 88%

The Impact of Post-training on Data Contamination

训练后阶段对数据污染的影响

Muhammed Yusuf Kocyigit, Caglar Yildirim

机构 * Boston University(波士顿大学) Northeastern University(东北大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 研究发现数据污染在训练后阶段会引发性能波动,但通过SFT和GRPO方法可缓解,且模型规模越大,污染影响越显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18676 2026-01-13 cs.LG 87%

Right Now, Wrong Then: Non-Stationary Direct Preference Optimization under Preference Drift

此刻正确,此后错误:在偏好漂移下的非平稳直接偏好优化

Seongho Son, William Bankes, Sayak Ray Chowdhury, Brooks Paige, Ilija Bogunovic

机构 * Department of Computer Science, University College London, London, United Kingdom(计算机科学系,伦敦大学学院,英国) Department of Electronic and Electrical Engineering, University College London, London, United Kingdom(电子与电气工程系,伦敦大学学院,英国) Department of Computer Science and Engineering, IIT Kanpur, India(计算机科学与工程系,印度IIT坎浦尔)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 NS-DPO通过动态Bradley-Terry模型建模时间依赖奖励函数,在偏好漂移下提升LLM微调性能。

Comments 31 pages, 10 figures. Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07593 2026-01-13 cs.AR cs.CL cs.LG 86%

GRPO with State Mutations: Improving LLM-Based Hardware Test Plan Generation

GRPO与状态突变:改进基于LLM的硬件测试计划生成

Dimple Vijay Kochar, Nathaniel Pinckney, Guan-Ting Liu, Chia-Tung Ho, Chenhui Deng, Haoxing Ren, Brucek Khailany

机构 * Electrical Engineering and Computer Science, Massachusetts Institute of Technology, Cambridge, MA(麻省理工学院电子工程与计算机科学系) NVIDIA Research, Austin, TX(NVIDIA研究部) NVIDIA Research, Taiwan(NVIDIA台湾研究部) NVIDIA Research, Santa Clara, CA(NVIDIA圣克拉拉研究部)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 GRPO-SMu通过改进LLM训练方法,显著提升硬件验证中测试计划生成的准确率和突变检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07199 2026-01-13 cs.LG cs.AI 86%

Forward versus Backward: Comparing Reasoning Objectives in Direct Preference Optimization

正向与反向:在直接偏好优化中比较推理目标

Murtaza Nikzad, Raghuram Ramanujan

机构 * Department of Math and Computer Science(数学与计算机科学系)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过直接偏好优化比较正向与反向推理目标,发现正向训练提升准确性,反向训练降低误报率,两者互补提升模型推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07320 2026-01-13 cs.LG cs.AI 84%

Segmental Advantage Estimation: Enhancing PPO for Long-Context LLM Training

段落优势估计:增强PPO用于长上下文LLM训练

Xue Gong, Qi Yi, Ziyuan Nan, Guanhua Huang, Kejiao Li, Yuhao Jiang, Ruibin Xiong, Zenan Xu, Jiaming Guo, Shaohui Peng, Bo Zhou

机构 * LLM Department, Tencent(腾讯大语言模型部门) University of Chinese Academy of Sciences(中国科学院大学) Intelligent Software Research Center, Institute of Software, CAS(软件研究所智能软件研究中心) State Key Lab of Processors, Institute of Computing Technology, CAS(计算技术研究所处理器国家重点实验室)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 段落优势估计通过减少稀疏奖励环境中的偏差,提升PPO在长上下文LLM训练中的稳定性和效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06238 2026-01-13 cs.LG cs.AI cs.CL 83%

SPINAL -- Scaling-law and Preference Integration in Neural Alignment Layers

SPINAL -- 神经对齐层中的缩放律与偏好整合

Arion Das, Partha Pratim Saha, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

AI总结 SPINAL通过分析神经对齐层的几何特性,量化对齐在深度层的集中表现及稳定性变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18913 2026-01-13 cs.LG cs.AI stat.ML 81%

ADPO: Anchored Direct Preference Optimization

ADPO:基于锚定的直接偏好优化

Wang Zixian

机构 * China Mobile Communications Group Shandong Co., Ltd. Tai’an Branch(中国移动通信集团山东有限公司 Tai’an 分部)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 ADPO通过锚定logits优化相对优势,统一了监督微调、强化学习和排序目标,在推理任务中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07483 2026-01-13 cs.CV 78%

FocalOrder: Focal Preference Optimization for Reading Order Detection

FocalOrder:阅读顺序检测中的焦点偏好优化

Fuyuan Liu, Dianyu Yu, He Ren, Nayu Liu, Xiaomian Kang, Delai Qiu, Fa Zhang, Genpeng Zhen, Shengping Liu, Jiaen Liang, Wei Huang, Yining Wang, Junnan Zhu

机构 * Unisound AI Technology Co.Ltd(Unisound人工智能技术有限公司) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) Beihang University(北航大学) School of Computer Science and Technology, Tiangong University(技术学院,天津大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 FocalOrder通过焦点偏好优化解决阅读顺序检测中位置差异问题,提升复杂文档结构处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06403 2026-01-13 cs.CL 77%

Steer Model beyond Assistant: Controlling System Prompt Strength via Contrastive Decoding

超越助手的引导模型:通过对比解码控制系统提示强度

Yijiang River Dong, Tiancheng Hu, Zheng Hui, Nigel Collier

机构 * University of Cambridge(剑桥大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 通过对比解码控制系统提示强度,提升模型在复杂指令下的引导能力和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10008 2026-01-13 cs.AI 77%

RIPRAG: Hack a Black-box Retrieval-Augmented Generation Question-Answering System with Reinforcement Learning

RIPRAG:通过强化学习攻击基于检索增强生成的黑盒问答系统

Meng Xi, Sihan Lv, Yechen Jin, Guanjie Cheng, Naibo Wang, Ying Li, Jianwei Yin

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RIPRAG通过强化学习攻击黑盒RAG系统,提升污染攻击成功率0.72,揭示LLM安全防御的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06180 2026-01-13 cs.LG cs.AI cs.CL 75%

MixDPO: Modeling Preference Strength for Pluralistic Alignment

MixDPO:建模偏好强度以实现多元对齐

Saki Imai, Pedram Heydari, Anthony Sicilia, Asteria Kaeberlein, Katherine Atwell, Malihe Alikhani

机构 * Northeastern University(东北大学) Johns Hopkins University(约翰霍普金斯大学) West Virginia University(西弗吉尼亚大学)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MixDPO通过建模偏好强度差异,提升多样的偏好对齐性能,同时保持子群体偏好,适用于高异质性场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07149 2026-01-13 cs.AI cs.CL 73%

Rewarding Creativity: A Human-Aligned Generative Reward Model for Reinforcement Learning in Storytelling

奖励创造力:一种人类对齐的生成奖励模型用于故事创作中的强化学习

Zhaoyan Li, Hang Lei, Yujia Wang, Lanbo Liu, Hao Liu, Liang Yu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种人类对齐的生成奖励模型和强化学习框架,用于提升故事创作的质量和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07821 2026-01-13 cs.RO cs.AI cs.LG 62%

Failure-Aware RL: Reliable Offline-to-Online Reinforcement Learning with Self-Recovery for Real-World Manipulation

具有自恢复能力的失败感知强化学习:用于现实世界操控的可靠离线到在线强化学习

Huanyu Li, Kun Lei, Sheng Zang, Kaizhe Hu, Yongyuan Liang, Bo An, Xiaoli Li, Huazhe Xu

机构 * Shanghai Qi Zhi Institute(上海启智研究院) Shanghai Jiao Tong University(上海交通大学) IIIS, Tsinghua University(清华大学人工智能研究院) Nanyang Technological University(南洋理工大学) A*STAR Institute for Infocomm Research(新加坡科技动力研究院) University of Maryland(马里兰大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出FARL框架,通过整合安全批评者和恢复策略,有效减少现实世界强化学习中的失败并提升性能。

Comments Project page: https://failure-aware-rl.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏