arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-06 至 2026-02-06 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 13 篇

2602.05205 2026-02-06 cs.CL cs.AI 90%

Aligning Large Language Model Behavior with Human Citation Preferences

使大型语言模型行为与人类引用偏好对齐

Kenichiro Ando, Tatsuya Harada

机构 * RIKEN AIP(日本研究所)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(title);LLM(abstract);preference optimization(abstract)

AI总结 本研究通过构建数据集分析LLM引用行为与人类偏好的一致性,发现模型在引用医学文本和数字句子上存在偏差,通过优化可提升对齐效果。

Comments Work In Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05890 2026-02-06 cs.LG cs.CL 88%

DFPO: Scaling Value Modeling via Distributional Flow towards Robust and Generalizable LLM Post-Training

DFPO:通过分布流扩展价值建模以实现鲁棒且可泛化的LLM后训练

Dingwei Zhu, Zhiheng Xi, Shihan Dou, Jiahan Li, Chenhao Huang, Junjie Ye, Sixian Li, Mingxu Chai, Yuhui Wang, Yajie Yang, Ming Zhang, Jiazheng Zhang, Shichun Liu, Caishuang Huang, Yunke Zhang, Yuran Wang, Tao Gui, Xipeng Qiu, Qi Zhang, Xuanjing Huang

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.CL、cs.LG

AI总结 DFPO通过分布流扩展价值建模,提升LLM后训练的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00166 2026-02-06 cs.LG cs.AI 88%

Joint Continual Learning of Local Language Models and Cloud Offloading Decisions with Budget Constraints

带有预算约束的本地语言模型与云卸载决策的联合持续学习

Evan Chen, Wenzhi Fang, Shiqiang Wang, Christopher Brinton

机构 * Elmore Family School of Electrical and Computer Engineering, Purdue University, West Lafayette, IN(电子与计算机工程学院,普渡大学) Department of Computer Science, University of Exeter, UK(计算机科学系,埃克塞特大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);small language model(abstract);post-training(abstract)

AI总结 本文提出DA-GRPO方法,通过联合学习本地语言模型和云卸载决策,有效解决持续学习中的预算约束问题,提升任务准确性并减少遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05933 2026-02-06 cs.LG 84%

Approximation of Log-Partition Function in Policy Mirror Descent Induces Implicit Regularization for LLM Post-Training

在策略镜像下降中近似对数分区函数诱导隐式正则化以提升LLM训练

Zhenghao Xu, Qin Lu, Changlong Yu, Tuo Zhao

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊)

专题命中 后训练与偏好优化 :LLM(title);post-training(title);分类 cs.LG

AI总结 PMD-mean通过近似对数分区函数实现隐式正则化,提升LLM训练的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05113 2026-02-06 cs.AI cs.LG 84%

Democratic Preference Alignment via Sortition-Weighted RLHF

通过排序加权RLHF实现民主偏好对齐

Suvadip Sana, Jinzhou Wu, Martin T. Wells

机构 * cornell(康奈尔大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 DemPO通过算法排序机制优化偏好对齐,确保民主代表性,提升模型对代表性公众价值观的反映能力。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05049 2026-02-06 cs.CV cs.AI cs.LG cs.RO 84%

VISTA: Enhancing Visual Conditioning via Track-Following Preference Optimization in Vision-Language-Action Models

VISTA: 通过视觉跟踪偏好优化增强视觉条件化在视觉-语言-动作模型中

Yiye Chen, Yanan Jian, Xiaoyi Dong, Shuxin Cao, Jing Wu, Patricio Vela, Benjamin E. Lundell, Dongdong Chen

机构 * Nvidia(Nvidia公司) Microsoft(微软公司) University of Oxford(牛津大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 VISTA通过视觉跟踪偏好优化提升视觉条件化,增强VLA模型在视觉-动作对齐和任务性能上的表现。

Comments In submission. Project website: https://vista-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05910 2026-02-06 cs.LG 83%

Chunky Post-Training: Data Driven Failures of Generalization

块状后训练:数据驱动的泛化失败

Seoirse Murray, Allison Qi, Timothy Qian, John Schulman, Collin Burns, Sara Price

机构 * Thinking Machines Lab(思维机器实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);分类 cs.LG

AI总结 研究发现大语言模型在后训练过程中因数据块的不平衡或不明确导致泛化失败,提出SURF和TURF工具用于检测和追溯这些问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13579 2026-02-06 cs.LG cs.AI 82%

Learning to summarize user information for personalized reinforcement learning from human feedback

学习总结用户信息以实现基于人类反馈的个性化强化学习

Hyunji Nam, Yanming Wan, Mickel Liu, Peter Ahnn, Jianxun Lian, Natasha Jaques

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) DoorDash Microsoft Research Asia(微软亚洲研究院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 PLUS通过学习用户信息摘要实现个性化强化学习,提升奖励模型准确性并实现零样本个性化。

Comments 10 pages for main text, 10 pages for appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11298 2026-02-06 cs.LG cs.AI cs.CL 82%

When Are Two RLHF Objectives the Same?

何时两个强化学习中的偏好优化目标是相同的?

Madhava Gaikwad

专题命中 后训练与偏好优化 :RLHF(title);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Opal算法,用于判断强化学习中不同偏好优化目标是否等价,揭示多数常用方法实际优化相同目标,部分方法则存在本质差异。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05125 2026-02-06 cs.LG cs.AI 81%

Rethinking Rubric Generation for Improving LLM Judge and Reward Modeling for Open-ended Tasks

重新思考评估标准生成以改进LLM评判与开放任务的奖励建模

William F. Shen, Xinchi Qiu, Chenxi Whitehouse, Lisa Alazraki, Shashwat Goel, Francesco Barbieri, Timon Willi, Akhil Mathur, Ilias Leontiadis

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 RRD通过递归分解-过滤循环优化评估标准,提升LLM评判准确性和奖励建模效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04349 2026-02-06 cs.CL cs.AI 79%

GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy

GTPO和GRPO-S:基于策略熵的token和序列级奖励塑造

Hongze Tan, Zihan Wang, Jianfei Pan, Jinghao Lin, Hao Wang, Yifan Wu, Tao Chen, Zhihang Zheng, Zhihao Tang, Haihua Yang

机构 * Northeastern University(东北大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GTPO和GRPO-S两种算法,通过引入熵权机制实现token和序列级的细粒度奖励塑造,提升大型语言模型在长链推理任务中的稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04912 2026-02-06 cs.IR cs.CL cs.LG 79%

Atomic Information Flow: A Network Flow Model for Tool Attributions in RAG Systems

原子信息流:一种用于RAG系统工具归因的网络流模型

James Gao, Josh Zhou, Qi Sun, Ryan Huang, Steven Yoo

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 原子信息流通过分解工具输出和LLM调用为原子单元,提升RAG系统中工具归因的准确性和上下文压缩效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05261 2026-02-06 cs.CL 70%

Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR

长度无偏序列策略优化:揭示和控制RLVR中的响应长度变化

Fanfan Liu, Youyang Yin, Peng Shi, Siqi Yang, Zhixiong Zeng, Haibo Qiu

机构 * Meituan(美团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出LUSPO算法,通过消除长度偏差解决RLVR中响应长度崩溃问题,并在多个任务中展示出优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏