arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 510 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 510 篇

2606.19327 2026-06-18 cs.AI cs.CL 新提交 73%

Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation

重新思考奖励监督:基于评分准则的自蒸馏

Siyi Gu, Jialin Chen, Sophia Zhou, Arman Cohan, Rex Ying

机构 * Yale University(耶鲁大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 提出评分准则条件自蒸馏框架,通过结构化细粒度反馈指导推理模型,在科学推理基准上平均超越GRPO 1.0分、OPSD 0.9分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18831 2026-06-18 cs.CL cs.AI 新提交 73%

Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning

超越奖励工程:长上下文强化学习的数据配方

Xiaoyue Xu, Sikui Zhang, Xiaorong Wang, Xu Han, Chaojun Xiao

机构 * OpenBMB Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种简单有效的数据配方,结合最小化基于结果的GRPO设置,显著提升大语言模型的长上下文推理能力,在多个基准和智能体任务上取得平均+3.2至+7.2点的提升。

Comments 15 pages, 6 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15134 2026-06-16 cs.CV cs.AI cs.LG 新提交 73%

Beyond Scalar Distances: Semantic Attribute Gradients from Frozen MLLMs for Visual Embeddings

超越标量距离:来自冻结MLLM的语义属性梯度用于视觉嵌入

Shubhang Bhatnagar, Dheeraj Baiju, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SAGA框架,利用冻结的多模态大语言模型(MLLM)通过GRPO奖励机制为视觉编码器提供属性级监督,替代传统标量距离,提升零样本图像检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07678 2026-06-16 cs.LG cs.AI 新提交 73%

DOG-DPO:Dynamic Optimization in Geometry for Safety Alignment

DOG-DPO:几何中的动态优化用于安全对齐

Yi Nian, Tiankai Yang, Yudi Zhang, Qi Pan, Zelong Xu, Shenzhe Zhu, Qingqing Luan, Yue Huang, Xiangliang Zhang, Yue Zhao

机构 * University of Southern California(南加州大学) Iowa State University(爱荷华州立大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) UT Austin(德克萨斯大学奥斯汀分校) Independent Researcher(独立研究员) University of Notre Dame(圣母大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出DOG-DPO框架,将偏好对表示为模型表示空间中的方向,通过几何分解和多样性覆盖选择子集,仅用11%数据即可恢复大部分安全增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10768 2026-06-10 cs.LG cs.CL 新提交 73%

N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy Optimization

N-GRPO:嵌入级邻居混合增强策略优化

Xukun Zhu, Hang Yu, Peng Di, Linchao Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对大语言模型数学推理中探索策略的折衷问题,提出N-GRPO方法,通过语义邻居混合机制在嵌入层注入多样性,在保持语义一致性的同时提升策略优化效果。

Comments ACL 2026 Findings. 16 pages, 3 figures. Code: https://github.com/ZJUSCL/N-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10184 2026-06-10 cs.LG cs.AI 新提交 73%

Dropout-GRPO: Variational Stochasticity for Continuous Latent Reasoning

Dropout-GRPO: 用于连续潜在推理的变分随机性

Wooil Jung

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 后训练与偏好优化 :LLM(abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对GRPO在连续潜在推理模型中因确定性轨迹导致优势为零的问题,提出通过结构化Dropout引入随机性,使GRPO能优化贝叶斯模型平均策略,在GSM8K上提升Coconut基线准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10321 2026-06-10 cs.LG cs.AI cs.RO math.OC 新提交 73%

Baseline-Free Policy Optimization for Neural Combinatorial Optimization

无基线的神经组合优化策略优化

Carlos S. Sepúlveda, Gonzalo A. Ruz

机构 * Facultad de Ingeniería y Ciencias, Universidad Adolfo Ibáñez(阿道夫·伊瓦涅斯大学工程与科学学院) Dirección de Programas, Investigación y Desarrollo, Armada de Chile(智利海军计划、研究与发展局) Millennium Nucleus for Social Data Science (SODAS)(千禧年社会数据科学核心(SODAS)) Millennium Nucleus in Data Science for Plant Resilience (PhytoLearning)(千禧年植物韧性数据科学核心(PhytoLearning))

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出使用GRPO算法消除神经组合优化中的基线依赖,避免训练崩溃,在TSP和CVRP上达到接近POMO的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13924 2026-08-17 cs.RO 新提交 71%

BICPO-VLA: Behavior-Identified Continuation Preference Optimization for Smooth Asynchronous Vision-Language-Action Control

BICPO-VLA:用于平滑异步视觉-语言-动作控制的行为识别延续偏好优化

Ming Shang, Yuchen Huang, Jiaoyang Chen, Haoyuan Hu, Han Yu, Liping Song, Luyun Feng, Shuo Bao, Wei Dong, Xinzhou Wang, Fuchun Sun

专题命中 后训练与偏好优化 :preference optimization(title)

AI总结 BICPO-VLA针对异步视觉-语言-动作控制的请求交接间隙问题,通过行为识别、动作分解重建、参考相对Flow-DPO优化,实现平滑控制。

Comments 9 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17776 2026-08-19 cs.LG 新提交 70%

Debate Training Reduces Reward Hacking in RLAIF

辩论训练可减少RLAIF中的奖励黑客行为

Zachary Kenton, Lili Janzer, Rory Greig, Tian Huey Teh, Kirill Tyshchuk, Jonah Brown-Cohen, Harri Edwards, Senthooran Rajamanoharan, Noah Y. Siegel, Natasha Jaques, Rohin Shah

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 该研究提出用辩论训练替代RLAIF基线,在数学任务中可减少奖励黑客行为,维持裁判性能并恢复45%的性能差距,还验证了多方面相关实验结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17289 2026-08-19 cs.AI 新提交 70%

PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs

PlanPO:面向多轮智能体大语言模型的组规划感知策略优化

Dayang Liang, Liyuan He, Xuan Feng, Shuxin Li, Bo An, Yunlong Liu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有组相对策略优化无法区分成功轨迹效率差异的问题,提出 PlanPO 方法,引入由粗到细的优势信号,在三类多轮基准上较 GRPO 平均提升 27.2%,且训练成本可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16710 2026-08-18 cs.LG 新提交 70%

The Ethical Decision Head: Operationalizing Normative Ethics in Autonomous Vehicles via Reinforcement Learning from Human Feedback

伦理决策头:基于人类反馈的强化学习在自动驾驶中实现规范伦理

Thomas Mbrice, Ammar Ali, Sami Mian, Khai Hern Low, Eric Chen, Arshia Aghajani, Wolf Schäfer, Amin Shirangi

机构 * Stony Brook University(石溪大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出伦理决策头(EDH)框架,结合PPO与人类偏好奖励模型,在CARLA仿真中训练自动驾驶智能体,发现人类对自动驾驶伦理的理论规定与实践奖励存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16082 2026-08-18 cs.LG 新提交 70%

Towards Reasonable Molecular Structure Elucidation from Infrared Spectroscopy with Chemical Feedback

基于化学反馈的红外光谱合理分子结构解析研究

Yusen Tan, Hongyu Zhan, Hai-tao Yu, Changxi Chi, Wenjie Du, Jun Xia

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Westlake University(西湖大学) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :preference optimization(abstract,abstract_cn);分类 cs.LG

AI总结 针对现有分子结构解析模型预测结果不合理的问题,提出化学反馈驱动的FIRMPO框架,在三类红外数据集上显著提升了解析准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13854 2026-08-17 cs.CL 新提交 70%

Bootstrapping Niche Multilingual Code Translation via Reinforcement Learning with Execution-Based Verifiable Supervision

基于执行可验证监督的强化学习引导小众多语言代码翻译

Kouki Yuki, Jie Zeng, Kyoko Ogawa, Ryunosuke Ikeda, Yohei Kobashi, Takeshi Kojima, Ikuya Yamada, Yusuke Iwasawa, Yutaka Matsuo

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究针对多语言代码翻译中热门语言外场景并行监督稀缺、翻译不可执行的问题,提出基于执行监督的偏好强化学习方法,引入HumanEval-X++基准,用Qwen模型验证了方法的有效性。

Comments 11 pages, 3 figures, 5 tables. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13345 2026-08-14 cs.AI 新提交 70%

Rules or Character? Scaling Laws for AI Safety Design

规则还是特性?AI安全设计的缩放定律

Satoshi Takahashi, Nobuji Kouno, Masaaki Komatsu, Ryuji Hamamoto

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 该研究构建模型分析AI安全的特性塑造与规则执行的资源分配,发现部署规模对最优分配影响较小,特性脆弱率才是主导因素,二者的最优值在大规模部署下会收敛。

Comments Accepted at AIES 2026 (9th AAAI/ACM Conference on AI, Ethics, and Society). 10 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12564 2026-08-14 cs.LG 新提交 70%

Scaling Automatic Research Agents via World Models

通过世界模型扩展自动研究智能体

Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li, Huiyuan Chen, Haiyang Zhang, Chenlei Guo, Jingrui He, Zhenyu Liao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司)

专题命中 后训练与偏好优化 :LLM(abstract_cn);post-training(abstract);分类 cs.LG

AI总结 针对自动研究智能体扩展时的训练瓶颈,提出WMRL方法,结合两种缓解措施提升收敛性,训练加速3-4倍且性能优于更大规模智能体,还可迁移至多类任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12290 2026-08-13 cs.CV cs.AI cs.MM 新提交 70%

Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence

超越试错:面向图像到视频一致性的智能体优化

Aman Tyagi, Hemanth Boinpally, Jonathan Chen, Douglas Gebert, Steven Hickson

机构 * Google Cloud(谷歌云) Google DeepMind(谷歌DeepMind)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对图像到视频模型试错效率低的问题,提出Agentic Self-Improvement框架,通过两阶段优化提升视频与文本一致性,生成视频胜率达69%,为视频生成模型提供实用可控的优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08491 2026-08-11 cs.AI 新提交 70%

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models

TrustRoboReward:面向多范式机器人奖励模型的偏好有序保序分数编辑方法

Yidong Wang, Yan Zhan, Ziteng Feng, Zhenyu Cui, Ziyi Zhou, Renzhao Liang, Jiaxuan Zhu, Zilei Yang, Yiran Zhao, Zhongkuan Mao, Bo Jia, Hanchu Ni, Chenggang Xie, Biao Liu, Yi Zhang, Yong Dai, Xiaozhu Ju, Wei Ye, Shikun Zhang

机构 * Peking University(北京大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Southern University of Science and Technology(南方科技大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Beijing Language and Culture University(北京语言大学) Sichuan University(四川大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 针对现有机器人奖励模型的跨范式偏好与分数不一致问题,本文提出 TrustRoboReward 框架,通过 POISE 方法解决反转冲突,训练的 Qwen3-VL-4B 性能接近 GPT-5-mini,优于 RoboReward 基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08021 2026-08-11 cs.CV cs.AI 新提交 70%

Evidence-RL: Towards Evidence-intensive Visual Reasoning

Evidence-RL:面向证据密集型视觉推理

Haojie Huang, Xinlei Yu, Chengming Xu, Zhangquan Chen, Cheng Yang, Qingdong He, Yu Yang, Jiangning Zhang, Xiaobin Hu

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) Fudan University(复旦大学) Tsinghua University(清华大学) Tencent(腾讯)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 针对视觉-语言模型依赖语言先验等问题,提出反事实证据解缠方法,结合GRPO框架在9个基准和4种骨干模型上优于现有基于RL的后训练方法。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03119 2026-08-05 cs.AI 新提交 70%

Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR

请勿偷看答案:用于无标签RLVR的结果掩码组相对策略优化

Yongshi Ye, Liang Zhang, Yidong Chen, Xiaodong Shi, Biao Fu

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对无标签RLVR中模型易强化答案标记的问题,提出OM-GRPO框架,解耦奖励估计与策略优化,结合对比增强奖励,在多推理基准及测试时训练场景中性能优于现有方法。

Comments 25 pages, 16 figures, and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01055 2026-08-04 cs.CV cs.AI 新提交 70%

Credit the Right Box: Marginal Contribution Assignment for Structured Visual Perception

为正确的边界框分配信用:结构化视觉感知的边际贡献分配

Xinheng Han, Jianfei Wang, Yu Chen, Xiang Wang, Shuai Li, Weixing Li, Feng Pan

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型结构化视觉感知中响应级监督的粒度不匹配问题,提出MCR-GRPO框架,通过边界框级边际贡献分配优化,在多个基准上取得了优于现有GRPO基线的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27686 2026-07-31 cs.AI 新提交 70%

Evaluating and Pricing Advertisements in AI-Generated Responses

评估和定价AI生成响应中的广告

John L. Turner-Smith, Zimeng Huang, Yuhan Fu, Yihang Zhang, Tonghan Wang

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对AI生成响应中广告评估与定价的核心挑战,该研究构建智能体模拟框架生成监督,提炼出高效评估器,实现更优的点击意图预测,还推导了最优支付规则并扩展了广告生成的训练目标。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27562 2026-07-31 cs.AI 新提交 70%

DeepResearch Agent System

DeepResearch 智能体系统

Yong Huang, Yulu Huang, for the team Collaboration

机构 * Software Copyright Research and Development Document(软件版权研究与开发文档)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DeepResearch 智能体系统是基于稀疏激活架构的大语言模型,通过双模式推理引擎、多工具协调等技术,在多个智能体基准测试中取得最优性能,已完全开源并支持多领域应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26795 2026-07-30 cs.CL 新提交 70%

When Does Span-Guided Detoxification Help? Human Preferences and Evaluator Diagnostics in a Controlled Comparison

基于跨度引导的解毒方法何时有效?受控比较中的人类偏好与评估者诊断

Kyungwon Park

机构 * Yonsei University(延世大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究对比跨度引导与无引导解毒方法的人类偏好,发现二者存在权衡,不同分层偏好不同,自动评估无法替代人类判断,推动了新评估协议的发展。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23364 2026-07-28 cs.LG 新提交 70%

On the Impossibility of Unbiased and Length-Invariant Policy Optimization with Outcome Rewards

关于使用结果奖励进行无偏且长度不变的策略优化的不可能性

Fei Ding, Yongkang Zhang, Yuhao Liao, Zijian Zeng, Huiming Yang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究在标准结果奖励+GRPO设置下,无基于长度的加权方案能同时兼具梯度无偏性与长度不变性。通过参数族刻画权衡谱,揭示GRPO和Dr. GRPO各有优劣,处于不可避免的权衡两端,都非完美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21626 2026-07-27 cs.AI 新提交 70%

Discrete Action Space as a Prerequisite for GRPO Convergence in Small-Model Continuous Control

离散动作空间是小模型连续控制中GRPO收敛的前提条件

Dmytro Filatov, Valentyn Fedorov, Vira Filatova

专题命中 后训练与偏好优化 :language model(abstract);small language model(abstract);分类 cs.AI

AI总结 研究GRPO对小语言模型用于四旋翼连续控制任务微调的情况,发现普通GRPO微调失败,两项消融实验虽防熵崩溃但无法学习,更换动作接口后训练收敛,描绘出帕累托前沿,该方法在三个模型上评估,还对比了经典基线并发现训练分布差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20082 2026-07-23 cs.CL 新提交 70%

The Two-Process Theory of Machine Self-Report

机器自我报告的双过程理论

Hubert Plisiecki, Filip Chmielewski, Kacper Dudzic, Anna Sterna, Karolina Drożdż, Marcin Moskalewicz

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.CL

AI总结 研究针对语言模型自我报告缺乏有效方式的问题,提出双过程理论,通过角色设定和归因门控反映自我报告结构。经量表操作化及测试,发现训练后维度变化,表明其非固定属性,为语言模型自我报告研究提供新理论与方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19044 2026-07-22 cs.LG 新提交 70%

Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation

采用具有可验证奖励的强化学习进行分子生成

Mingxuan Ouyang, Hao Lan, Wanyu Lin

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究利用大语言模型进行分子生成时面临的问题,提出LLMol框架,采用监督学习与强化学习结合的两阶段训练范式,引入RLVR及GRPO算法,有效处理多种分子设计任务,实验证明其性能优于现有方法。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16850 2026-07-21 cs.CL 新提交 70%

Group Entropy-Controlled Policy Optimization

组熵控制策略优化

Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对大语言模型强化学习中异构任务的探索利用问题,提出组熵控制策略优化(GEPO)方法,利用组熵进行优势塑造,通过实验验证该方法优于GRPO等,能实现跨任务平衡改进并保持任务探索水平。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16263 2026-07-21 cs.LG cs.CE q-bio.QM 新提交 70%

Preference-based Antibody Expression Ranking: Scaling with Large-scale Weak Supervision

基于偏好的抗体表达排序:大规模弱监督下的扩展

Josh Qixuan Sun, Morteza Babaie, Wenyang Hou, Mark Crowley, David Young

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 研究针对抗体表达排序中标记数据稀缺问题,提出基于偏好的学习框架,结合定量表达与弱监督,通过改进DPO适用于蛋白质语言模型,在多样数据集上评估,该方法优于基线,为抗体可表达性优化提供可扩展方案。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16205 2026-07-21 cs.AI 新提交 70%

It Takes 8 Tokens: Weak-to-Strong Off-Policy RL via Auxiliary Branches

需要8个令牌:通过辅助分支实现从弱到强的离策略强化学习

Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Liwei Qian, Xin Pei, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对可验证奖励强化学习中目标模型样本语义冗余问题,提出从弱到强学习范式,引入W2SPO方法,通过注入短辅助段指导策略探索,实验表明该方法在数学推理基准测试中性能优异,能提升训练速度和准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏