arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-02 至 2026-02-02 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 19 篇

2601.22801 2026-02-02 cs.LG 90%

Clipping-Free Policy Optimization for Large Language Models

无需裁剪的策略优化用于大语言模型

Ömer Veysel Çağatan, Barış Akgün, Gözde Gül Şahin, Xuandong Zhao

机构 * KUIS AI Center, Koç University, Istanbul, Türkiye(Koç大学) Koç University, Istanbul, Türkiye(Koç大学) University of California, Berkeley, CA, USA(加州大学伯克利分校)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 CFPO通过凸二次惩罚替代裁剪机制,实现稳定策略优化,适用于大语言模型的训练。

Comments 23 pages, 10 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01458 2026-02-02 cs.LG 87%

How Well Can Preference Optimization Generalize Under Noisy Feedback?

在有噪声反馈下,偏好优化能有多好?

Shawn Im, Sharon Li

机构 * Department of Computer Sciences(计算机科学系) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了在噪声反馈下偏好优化的一般化能力,分析了不同噪声类型和强度对模型性能的影响,并验证了其在实际LLM训练中的有效性。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15172 2026-02-02 cs.AI 86%

Self-Improvement of Language Models by Post-Training on Multi-Agent Debate

通过多智能体辩论进行语言模型的自改进

Ankur Samanta, Akshayaa Magesh, Runzhe Wu, Ayush Jain, Youliang Yu, Daniel Jiang, Boris Vidolov, Paul Sajda, Yonathan Efroni, Kaveh Hassani

机构 * Meta AI Columbia University(哥伦比亚大学) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 后训练与偏好优化 :language model(title);post-training(title);SFT(abstract);分类 cs.AI

AI总结 通过多智能体辩论和强化学习提升语言模型的自我改进能力,实现推理准确性、自洽性和泛化能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22385 2026-02-02 cs.CL cs.AI cs.LG 85%

SP^2DPO: An LLM-assisted Semantic Per-Pair DPO Generalization

SP^2DPO: 一种基于大语言模型的语义逐对DPO泛化

Chaoyue He, Xin Zhou, Di Wang, Hong Xu, Wei Liu, Chunyan Miao

机构 * Alibaba--NTU Global e-Sustainability CorpLab (ANGEL), Singapore(阿里-NTU全球可持续性公司实验室(ANGEL),新加坡) Alibaba Group, China(阿里集团,中国)

专题命中 后训练与偏好优化 :LLM(title);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SP^2DPO通过语义逐对DPO泛化提升AlpacaEval 2.0的长度控制胜率,避免每模型beta扫描。

Comments 39 pages, 15 figures, 16 tables, 60 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21282 2026-02-02 cs.LG cs.AI 84%

It's Not You, It's Clipping: A Soft Trust-Region via Probability Smoothing for LLM RL

并非你,而是剪裁:通过概率平滑的软信任区域进行大语言模型强化学习

Madeleine Dwyer, Adam Sobey, Adriane Chapman

机构 * University of Southampton(索姆塞特大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PSPO方法,通过概率平滑改进大语言模型强化学习中的信任区域,提升数学推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23129 2026-02-02 cs.CL 83%

Evaluating the Utility of Grounding Documents with Reference-Free LLM-based Metrics

评估基于参考-free LLM的文档接地的效用

Yilun Hua, Giuseppe Castellucci, Peter Schulam, Heba Elfardy, Kevin Small

机构 * Department of Computer Science and Cornell Tech, Cornell University(计算机科学系和Cornell Tech,康奈尔大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 本文提出GroGU,一种无需注释的模型特定指标,用于评估RAG中文档接地的效用,通过优化查询重写器提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16245 2026-02-02 cs.CL 83%

Diverse, not Short: A Length-Controlled Data Selection Strategy for Improving Response Diversity of Language Models

多样而非简短:一种长度控制的数据选择策略以提高语言模型的响应多样性

Vijeta Deshpande, Debasmita Ghose, John D. Patterson, Roger Beaty, Anna Rumshisky

机构 * University of Massachusetts Lowell(马萨诸塞大学洛维尔分校) Yale University(耶鲁大学) Pennsylvania State University(宾夕法尼亚州立大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 Diverse-NS通过长度控制的数据选择策略提升语言模型响应多样性,适用于创造性生成任务,并在不同规模模型间展示出显著效果。

Comments Accepted to EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00665 2026-02-02 cs.CL cs.AI 82%

SAFER: Probing Safety in Reward Models with Sparse Autoencoder

SAFER: 通过稀疏自动编码器探索奖励模型的安全性

Wei Shi, Ziyuan Xie, Sihang Li, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 SAFER通过稀疏自动编码器探索奖励模型的安全性,揭示可解释特征并改进安全性对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22718 2026-02-02 cs.AI cs.LG 82%

A Step Back: Prefix Importance Ratio Stabilizes Policy Optimization

后退一步:前缀重要性比率稳定了策略优化

Shiye Lei, Zhihao Cheng, Dacheng Tao

机构 * The University of Sydney(悉尼大学) ByteDance(字节跳动) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出MinPRO目标,通过使用非累积的最小token级比率替代累积前缀比率,以稳定LLM在非策略性条件下的训练和优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20433 2026-02-02 cs.CV 82%

MARE: Multimodal Alignment and Reinforcement for Explainable Deepfake Detection via Vision-Language Models

MARE: 多模态对齐与强化学习用于通过视觉-语言模型的可解释深度伪造检测

Wenbo Xu, Wei Lu, Xiangyang Luo, Jiantao Zhou

机构 * School of Computer Science and Engineering, MoE Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-sen University, Guangzhou 510006, China(计算机科学与工程学院,信息技术MOE实验室,广东省信息安全技术重点实验室,中山大学,广州510006,中国) State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) Department of Computer and Information Science, University of Macau.(计算机与信息科学系,澳门大学)

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract)

AI总结 MARE通过多模态对齐和强化学习提升视觉-语言模型在深度伪造检测中的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27410 2026-02-02 cs.AI 74%

Closing the Expression Gap in LLM Instructions via Socratic Questioning

通过苏格拉底提问缩小LLM指令的表达差距

Jianwen Sun, Yukang Feng, Yifan Chang, Chuanhao Li, Zizhen Li, Jiaxin Ai, Fanrui Zhang, Yu Dai, Kaipeng Zhang

机构 * Nankai University(南开大学) Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学) Shanghai AI Laboratory(上海人工智能实验室) Shanda AI Research(上海沙达人AI研究所)

专题命中 后训练与偏好优化 :LLM(title);分类 cs.AI

AI总结 通过苏格拉底提问方法,提出Nous代理以主动探测用户意图,解决人类与AI协作中的意图表达差距问题,提升效率和输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00677 2026-02-02 cs.LG cs.AI 73%

IRPM: Intergroup Relative Preference Modeling for Pointwise Generative Reward Models

IRPM:基于组间相对偏好的点wise生成奖励模型

Haonan Song, Qingchen Xie, Huan Zhu, Feng Xiao, Luxi Xing, Liu Kang, Fuzhen Li, Zhiyong Zheng, Feng Jiang, Ziheng Li, Kun Yan, Qingyi Si, Yanghua Xiao, Hongcheng Guo, Fan Yang

机构 * HUJING Digital Media \& Entertainment Group (XingYun Lab), Beijing, China Department of Automation, Tsinghua University, Beijing, China Fudan University, Shanghai, China Beihang University, Beijing, China Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China

专题命中 后训练与偏好优化 :post-training(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 IRPM通过组间比较扩展Bradley-Terry模型,从成对偏好数据中训练点wise GRMs,实现高效可扩展的奖励建模。

Comments Comments: Updated title for clarity; improved theoretical derivations; added experiments at additional parameter scales and more ablations; added experimental details in the appendix; updated author list (added five co-authors) to reflect contributions to experiments and writing

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23058 2026-02-02 cs.LG 70%

From Absolute to Relative: Rethinking Reward Shaping in Group-Based Reinforcement Learning

从绝对到相对:重新思考基于群体的强化学习中的奖励塑造

Wenzhe Niu, Wei He, Zongxia Xie, Jinpeng Ou, Huichuan Fan, Yuchen Ge, Yanru Sun, Ziyin Wang, Yizhao Sun, Chengshun Shi, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * Tianjin University(天津大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出RLRR框架,通过将奖励塑造从绝对评分转为相对排名,解决群体强化学习中奖励稳定性与监督稀疏性问题,并在推理和生成任务中取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22249 2026-02-02 cs.LG cs.SE 70%

FunPRM: Function-as-Step Process Reward Model with Meta Reward Correction for Code Generation

FunPRM:基于元奖励校正的函数作为步骤过程奖励模型用于代码生成

Ruiyi Zhang, Peijia Qin, Qi Cao, Eric Xue, Pengtao Xie

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 FunPRM通过元学习的奖励校正机制提升代码生成性能,实现更高质量的代码输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25562 2026-02-02 cs.AI cs.CL cs.CV cs.LG 67%

IRIS: Intrinsic Reward Image Synthesis

IRIS:内在奖励图像合成

Yihang Chen, Yuanhao Ban, Yunqi Hong, Cho-Jui Hsieh

机构 * Department of Computer Science, University of California, Los Angeles, USA(计算机科学系,加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 IRIS通过内在奖励提升自回归T2I模型性能,改进图像生成质量并促进细致推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22582 2026-02-02 cs.LG cs.AI 62%

MC-GRPO: Median-Centered Group Relative Policy Optimization for Small-Rollout Reinforcement Learning

MC-GRPO:用于小回滚强化学习的中位数中心组相对策略优化

Youngeun Kim

机构 * Amazon(亚马逊)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 MC-GRPO通过使用中位数基线替代平均基线,提高小回滚强化学习的稳定性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22432 2026-02-02 cs.LG cs.CL 62%

ReNCE: Learning to Reason by Noise Contrastive Estimation

ReNCE: 通过噪声对比估计学习推理

Wenzheng Zhang, Karl Stratos

机构 * Rutgers University(罗杰斯大学)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 ReNCE通过噪声对比估计学习提升大语言模型的推理能力,采用显式对比学习方法在数学基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23135 2026-02-02 cs.LG 57%

Why GRPO Needs Normalization: A Local-Curvature Perspective on Adaptive Gradients

为何GRPO需要规范化:从局部曲率角度探讨自适应梯度

Cheng Ge, Caitlyn Heqi Yin, Hao Liang, Jiawei Zhang

机构 * Department of Aeronautics and Astronautics, MIT(麻省理工学院航空与宇航系) Department of Statistics, University of Wisconsin--Madison(威斯康星大学麦迪逊分校统计系) Department of Informatics, King's College London(伦敦国王学院信息学系) Department of Computer Sciences, University of Wisconsin--Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG

AI总结 GRPO中标准差规范化通过局部曲率视角解释了其自适应梯度机制,理论和实验表明规范化能提升收敛速度并优化训练阶段表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23222 2026-02-02 cs.CV 50%

Region-Normalized DPO for Medical Image Segmentation under Noisy Judges

区域归一化的DPO用于在噪声裁判下的医学图像分割

Hamza Kalisch, Constantin Seibold, Jens Kleesiek, Ken Herrmann, Frederic Jonske

机构 * Institute for AI in Medicine (IKIM), University Hospital Essen (AöR), Essen, Germany(人工智能医学研究所(IKIM)、埃森大学医院(AöR)) Department of Nuclear Medicine, University Hospital Essen (AöR), Essen, Germany(核医学系、埃森大学医院(AöR)) Department of Physics, TU Dortmund, Dortmund, Germany(物理系、多特蒙德技术大学) Heidelberg University Hospital, Heidelberg, Germany(海德堡大学医院)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 本文提出区域归一化的DPO方法,用于在噪声裁判下提升医学图像分割的性能和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏