arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2304.01852 2023-08-25 cs.CL 90%

Summary of ChatGPT-Related Research and Perspective Towards the Future of Large Language Models

Yiheng Liu, Tianle Han, Siyuan Ma, Jiayue Zhang, Yuanyuan Yang, Jiaming Tian, Hao He, Antong Li, Mengshen He, Zhengliang Liu, Zihao Wu, Lin Zhao, Dajiang Zhu, Xiang Li, Ning Qiang, Dingang Shen, Tianming Liu, Bao Ge

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

Comments 21 pages, 4 figures, accepted by Meta-Radiology

Journal ref Meta-Radiology (2023)100017

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05453 2023-03-10 cs.CL cs.CY 90%

Personalisation within bounds: A risk taxonomy and policy framework for the alignment of large language models with personalised feedback

Hannah Rose Kirk, Bertie Vidgen, Paul Röttger, Scott A. Hale

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)

Comments 19 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11922 2026-08-21 cs.CL cs.IR cs.LG 版本更新 90%

LODESTAR: Robust Entropy-Based Answer Selection in Retrieval-Augmented Generation for Question Answering -- Directing Frozen-LLM Entropy with a Reinforcement-Learned Prompt Polarizer under Misleading Passages

LODESTAR:可信赖熵是被引导的,而非仅被测量——强化偏振器防止冻结型大语言模型(LLM)被错误证据误导而自信出错

Hung-Chun Hsu, Po-Jen Ko, Che-Cheng Wu, Li-Yang Chang, Chuan-Ju Wang

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 LODESTAR是首个通过强化学习训练偏振器、依据第三方冻结型LLM的不确定性评分文本干预的方法,可提升检索增强问答的F1值等指标,减少模型读取误导性段落的概率。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17804 2026-08-19 cs.LG cs.CL 新提交 90%

An Empirical Study of Reward Specification and Benchmark Reliability in GRPO-based LLM Unlearning

基于GRPO的大语言模型遗忘中奖励规范与基准可靠性的实证研究

Rubén Balbastre, Juan Manuel Orduña, Mariano Pérez

机构 * University of Valencia(瓦伦西亚大学)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 该研究针对基于GRPO的LLM遗忘,探究奖励规范与基准可靠性问题,对比四种奖励设计开展实验,发现优化成功与行为遗忘并不等价,并分析了分歧的来源。

Comments 32 pages, 4 figures. Code and artifacts linked in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11381 2026-08-13 cs.AI cs.LG 新提交 90%

From Numbers to Judgment: Specialist LLM Agents and Reinforcement Learning for European Listed Real Estate

从数字到判断:专业大语言模型智能体与欧洲上市房地产的强化学习研究

Pardis Taghavi, Santosh Bhavani

专题命中 后训练与偏好优化 :LLM(title,summary_cn);post-training(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本研究以欧洲上市房地产分析为对象,提出Larix框架将分析维度映射为专业LLM智能体,结合GRPO微调Qwen3.5-9B,实现数值任务与判断任务的性能提升且可迁移至新企业与监管体系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12991 2026-08-11 cs.LG cs.AI 版本更新 90%

Not Just RLHF: Why Alignment Alone Won't Fix Multi-Agent Sycophancy

不只是RLHF:为何仅对齐不足以解决多智能体趋同

Adarsh Kumarappan, Ananya Mujoo

机构 * California Institute of Technology(加州理工学院) Evergreen Valley College(艾弗绿谷学院)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文研究了多智能体系统在模拟同伴分歧下的错误率问题,发现预训练基础模型与指令模型存在相似的替换模式,且错误率较高。通过激活修补发现错误集中在中间层,修复后可恢复大部分正确率差距。研究还指出压力抑制了清洁推理特征,而非激活新的趋同回路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10727 2026-08-04 stat.ML cs.AI cs.LG math.PR math.ST stat.TH 版本更新 90%

Tail-Aware Information-Theoretic Bounds for LLM Alignment under Heavy-Tailed Rewards

尾感知信息论泛化用于RLHF和SGLD

Huiming Zhang, Binghan Li, Wan Tian, Qiang Sun

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算高精尖创新中心) Advanced Institute of Information Technology, Peking University(北京大学信息技术高等研究院) Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) Computer and Mathematical Sciences, Computer Science, and Statistics, University of Toronto(多伦多大学计算机与数学科学、计算机科学和统计学系) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 后训练与偏好优化 :RLHF(title_cn,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出一种尾依赖信息论框架,用于处理亚韦尔bull数据,通过移位对数f_θ-分歧来界定制换测度期望,从而在重尾数据下获得更精确的泛化界限。

Comments 47 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27580 2026-06-29 cs.LG cs.AI 新提交 90%

Retroactive Advantage Correction: Closed-Form V-Trace Bias Correction for Delay-Aware RLHF

回溯优势修正:面向延迟感知RLHF的闭式V-Trace偏差修正

Arnav Raj

专题命中 后训练与偏好优化 :RLHF(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对RLHF中奖励信号延迟的问题,提出回溯优势修正(RAC),通过非负核函数队列化延迟反馈并注入优势估计,理论证明其无偏性,在表格MDP实验中偏差降低达47.9倍。

Comments Accepted at the ICML 2026 Workshop on Reinforcement Learning from World Feedback (RLxF). Code: https://github.com/deadsmash07/rac-rlxf-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27578 2026-06-29 cs.LG cs.AI 新提交 90%

PEBS: Per-rater Empirical-Bayes Shrinkage for RLHF Reward-Model Calibration

PEBS: 用于RLHF奖励模型校准的每评分者经验贝叶斯收缩

Arnav Raj

专题命中 后训练与偏好优化 :RLHF(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对RLHF中奖励模型忽略评分者个体差异的问题,提出PEBS方法,对每个评分者拟合仿射校准器并应用经验贝叶斯收缩,在PRISM和PluriHarms数据集上分别降低RMSE 8.58%和9.66%。

Comments Accepted at the ICML 2026 Workshop on Pluralistic Alignment. Code: https://github.com/deadsmash07/pebs-pluralistic

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23075 2026-06-29 cs.LG cs.AI cs.IT math.IT stat.ML 版本更新 90%

Trust Region Masking for Long-Horizon LLM Reinforcement Learning

长程大语言模型强化学习的信任区域掩码

Yingru Li, Jiacai Liu, Jiawei Xu, Yuxuan Tong, Ziniu Li, Qian Liu, Baoxiang Wang

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM强化学习中因实现差异导致的off-policy误差随序列长度二次增长的问题,提出信任区域掩码(TRM)方法,通过掩码违反信任区域的整个序列,实现首个非平凡的长程单调改进保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26917 2026-06-26 cs.LG cs.AI 新提交 90%

GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning

GEOALIGN: 用于鲁棒大语言模型强化学习的几何轨迹策展

Ting Zhou, Zhenqing Ling, Yiyang Zhao, Ying Shen, Daoyuan Chen

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对在线强化学习训练LLM时奖励噪声导致的不稳定性,提出GEOALIGN,通过检测并修正方向不一致的轨迹来稳定更新,提升最终性能并减少训练震荡。

Comments Accepted as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23038 2026-06-23 cs.LG cs.AI 新提交 90%

EvoRubrics: Dynamic Rubrics as Rewards via Adversarial Co-Evolution for LLM Reinforcement Learning

EvoRubrics:通过对抗性协同进化为LLM强化学习提供动态评分准则作为奖励

Hongxin Ding, Baixiang Huang, Yue Fang, Weibin Liao, Zheng Li, Jinyang Zhang, Zhijing Wu, Junfeng Zhao, Yasha Wang

机构 * National Engineering Research Center of Software Engineering, Peking University(北京大学软件工程国家工程研究中心) School of Computer Science, Peking University(北京大学计算机学院) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) Peking University Information Technology Institute, Tianjin Binhai(北京大学滨海信息技术研究院) Research Institute, GRGBanking Equipment Co., Ltd.(广电运通金融电子股份有限公司研究院)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出EvoRubrics框架,通过策略LLM与评分准则生成器的对抗性协同进化,在训练中动态调整奖励标准,解决静态评分准则导致的奖励饱和与策略欺骗问题,实验表明其优于静态和动态基线,且自监督变体也能有效提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20482 2026-06-19 cs.CL cs.HC cs.LG 新提交 90%

Your Mouse and Eyes Secretly Leak Your Preference: LLM Alignment using Implicit Feedback from Users

你的鼠标和眼睛悄悄泄露你的偏好:利用用户隐式反馈进行LLM对齐

Haw-Shiuan Chang, Jeffrey Gomez, Mehul Patwari, Aryan Sajith, Hamed Zamani

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) York University(约克大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对显式反馈稀缺的问题,提出利用鼠标轨迹和眼动数据等隐式反馈训练奖励模型,将文本奖励模型准确率从55%提升至64%,并显著提高DPO对齐后响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19818 2026-06-19 cs.LG cs.AI 新提交 90%

Uncertainty-Aware Reward Modeling for Stable RLHF

不确定性感知的奖励建模用于稳定的RLHF

Licheng Pan, Haocheng Yang, Haoxuan Li, Yichen Sun, Yunsheng Lu, Shijian Wang, Lei Shen, Yuan Lu, Zhixuan Chu, Hao Wang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出不确定性感知奖励建模(UARM),通过分位数保形预测校准不确定性并利用异方差方差分解重加权GRPO优势,以缓解奖励黑客问题,提升对齐质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00392 2026-06-02 cs.LG cs.AI 90%

Detector-Evasive LLM Paraphrasing via Constrained Policy Optimization

通过约束策略优化实现检测器规避的LLM释义

Mingyi Wang, Zhuoer Shen, Yuheng Bu, Shaofeng Zou

机构 * School of ECEE, Arizona State University(亚利桑那州立大学电子工程与计算机科学学院) Department of Computer Science, University of California, Santa Barbara(加州大学圣巴巴拉分校计算机科学系)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出DEPO算法,将检测器规避的LLM释义建模为约束马尔可夫决策过程,通过拉格朗日对偶强化学习在保持语义的同时实现高效规避。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10388 2026-06-01 cs.CL cs.AI 90%

Less is Enough: Synthesizing Diverse Data in LLM Feature Space with Sparse Autoencoders

少即是多:利用稀疏自编码器在LLM特征空间中合成多样化数据

Zhongzhi Li, Xuansheng Wu, Yijiang Li, Lijie Hu, Ninghao Liu

机构 * Department of Computing, University of Georgia, Georgia, United States(佐治亚大学计算机系) Computer Engineering, University of California San Diego, California, United States(加州大学圣地亚哥分校计算机工程系) Machine Learning Department, Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, United Arab Emirates(Mohamed bin Zayed人工智能大学机器学习系) Department of Computing, Hong Kong Polytechnic University, Hong Kong, China(香港理工大学计算机系)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出基于稀疏自编码器的特征激活覆盖率(FAC)指标及数据合成框架FAC Synthesis,通过识别缺失特征并生成对应样本来提升数据多样性和下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30273 2026-05-29 cs.HC cs.AI cs.CL cs.CY cs.SI 90%

LLUMI: Improving LLM Writing Assistance for Mental Health Support with Online Community Feedback

LLUMI: 利用在线社区反馈改进心理健康支持中的LLM写作辅助

Jiwon Kim, Maya Ajit, Sherry Gong, Soorya Ram Shimgekar, Dong Whi Yoo, Eshwar Chandrasekharan, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 提出LLUMI框架,通过在线社区反馈(如Reddit投票)构建偏好对,结合监督微调和直接偏好优化训练开源小模型,在隐私保护下实现与GPT相当的心理健康支持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29271 2026-05-29 cs.AI cs.IR cs.LG 90%

CoHyDE: Iterative Co-Training of LLM Rewriter & Dense Encoder for Tool Retrieval

CoHyDE: 用于工具检索的LLM改写器与稠密编码器的迭代协同训练

Vaishali Senthil, Ashutosh Hathidara, Sebastian Schreiber

机构 * SAP Labs(SAP实验室)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出CoHyDE方法,通过迭代协同训练稠密编码器和LLM改写器,结合对比学习和偏好对齐,在工具检索任务中同时提升标准查询和模糊查询的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17570 2026-05-19 cs.LG cs.CL 90%

How Off-Policy Can GRPO Be? Mu-GRPO for Efficient LLM Reinforcement Learning

GRPO在离线策略下的可能性:Mu-GRPO用于高效的大语言模型强化学习

Minghao Tian, Yunfei Xie, Chen Wei

机构 * Rice University(里士大学)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了GRPO在离线策略下的可行性,提出Mu-GRPO方法,通过减少rollout-optimization切换开销,实现高效的LLM强化学习,同时在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16346 2026-05-19 cs.LG cs.AI cs.CR 90%

PropGuard: Safeguarding LLM-MAS via Propagation-Aware Exploration and Remediation

PropGuard: 通过传播感知探索与修复保障LLM-MAS

Bingyu Yan, Xiaoming Zhang, Jinyu Hou, Chaozhuo Li, Ziyi Zhou, Xiaozhe Zhang, Litian Zhang

机构 * Beihang University(北航) Beijing University of Posts and Telecommunications(北京邮电大学) City University of Hong Kong(香港城市大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 PropGuard通过构建双视角时空图,结合响应中心风险评估与全状态证据保存,实现对LLM-MAS中传播性攻击的检测与修复,有效降低攻击成功率并保持高任务防御效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19241 2026-05-18 cs.LG cs.AI 90%

ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment

ActiveDPO: 用于高效对齐的主动直接偏好优化

Xiaoqiang Lin, Arun Verma, Zhongxiang Dai, Daniela Rus, See-Kiong Ng, Bryan Kian Hsiang Low

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) Singapore-MIT Alliance for Research and Technology Centre(新加坡-麻省理工联盟研究技术中心) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) CSAIL, Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究院)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);preference optimization(title);large language model(abstract);language model(abstract)

AI总结 ActiveDPO通过理论支撑的非线性奖励函数选择方法,利用LLM自身参数化奖励模型,提升对齐效率和数据收集效果。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08577 2026-05-12 cs.LG cs.AI 90%

Distributionally Robust Token Optimization in RLHF

强化学习中对抗性令牌优化

Yeping Jin, Jiaming Hu, Ioannis Ch. Paschalidis

机构 * Department of System Engineering(系统工程系) Boston University(波士顿大学) Department of Math & Statistics(数学与统计学系)

专题命中 后训练与偏好优化 :RLHF(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DRTO方法,结合RLHF与DRO,通过构建f-散度模糊集增强策略优化中的困难响应段,提升多步骤推理任务在分布变化下的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07669 2026-05-04 cs.LG cs.AI cs.CE 90%

Reinforcement Learning with LLM-Guided Action Spaces for Synthesizable Lead Optimization

基于LLM引导的动作空间的强化学习用于可合成先导优化

Tao Li, Kaiyuan Hou, Tuan Vinh, Monika Raj, Zhichun Guo, Carl Yang

机构 * Emory University(埃默里大学) University of Oxford(牛津大学) Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MolReAct框架,通过合成约束的动作空间和GRPO算法优化先导分子,提升性质同时保证合成可行性,实现高效分子生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18417 2025-07-25 cs.CL cs.LG q-fin.ST q-fin.TR 90%

FinDPO: Financial Sentiment Analysis for Algorithmic Trading through Preference Optimization of LLMs

Giorgos Iacovides, Wuyang Zhou, Danilo Mandic

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01479 2025-07-03 cs.CL cs.AI 90%

Evaluating the Effectiveness of Direct Preference Optimization for Personalizing German Automatic Text Simplifications for Persons with Intellectual Disabilities

Yingqiang Gao, Kaede Johnson, David Froehlich, Luisa Carrer, Sarah Ebling

机构 * University of Zurich(苏黎世大学) EPFL(瑞士联邦理工学院) Zurich University of Applied Sciences(苏黎世应用科学大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13221 2025-04-23 cs.LG cs.CL cs.DC 90%

Optimizing RLHF Training for Large Language Models with Stage Fusion

Yinmin Zhong, Zili Zhang, Bingyang Wu, Shengyu Liu, Yukun Chen, Changyi Wan, Hanpeng Hu, Lei Xia, Ranchen Ming, Yibo Zhu, Xin Jin

机构 * School of Computer Science, Peking University(北京大学计算机学院)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(title);language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12138 2025-03-27 cs.LG cs.CL 90%

Preference Optimization with Multi-Sample Comparisons

Chaoqi Wang, Zhuokai Zhao, Chen Zhu, Karthik Abinav Sankararaman, Michal Valko, Xuefei Cao, Zhaorun Chen, Madian Khabsa, Yuxin Chen, Hao Ma, Sinong Wang

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Code is available at https://github.com/alecwangcq/multi-sample-alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19332 2024-11-06 cs.LG cs.AI 90%

Self-Exploring Language Models: Active Preference Elicitation for Online Alignment

Shenao Zhang, Donghan Yu, Hiteshi Sharma, Han Zhong, Zhihan Liu, Ziyi Yang, Shuohang Wang, Hany Hassan, Zhaoran Wang

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02139 2026-08-05 cs.CL cs.AI cs.LG 版本更新 90%

Self-Improving Large Language Models via Progressive Experience Evolution

基于渐进式经验演化的自我改进大语言模型

Shijie Ren, Xiting Wang, Meng Li, Yujie Guo, Yunhang Yao, Ziheng Peng, Xunlong Wang, Yuetan Chen, Haoyang Zhou, Yunlong Liang, Fandong Meng

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出统一后训练框架SPEE,通过显式经验演化与隐式策略优化结合,在五种数学推理基准上提升了大语言模型的自我改进能力,优于现有基线方法。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03058 2026-06-23 cs.LG cs.AI cs.CL 版本更新 90%

VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training

VRPO: 重新思考价值建模以实现大语言模型后训练中噪声监督下的鲁棒强化学习

Dingwei Zhu, Shihan Dou, Zhiheng Xi, Senjie Jin, Guoqiang Zhang, Jiazheng Zhang, Junjie Ye, Mingxu Chai, Enyu Zhou, Ming Zhang, Yuhui Wang, Caishuang Huang, Chenhao Huang, Yunke Zhang, Yuran Wang, Tao Gui, Qi Zhang, Xipeng Qiu, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Honor Device Co., Ltd(荣耀设备有限公司) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对强化学习中噪声监督导致策略不稳定问题,提出VRPO框架,通过熵和困惑度辅助损失及变分信息瓶颈增强价值模型,使其能过滤噪声并生成可靠优势估计,在多项任务上优于PPO和GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏