arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 290 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 290 篇

2608.09805 2026-08-11 cs.LG cs.AI cs.CL 新提交 67%

Parameter Exploration for RLVR via Variational Learning

基于变分学习的RLVR参数探索

Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych

机构 * INSAIT, Sofia University “St. Kliment Ohridski”(INSAIT,圣克莱门特奥赫里德斯基索非亚大学) National Research Center for Applied Cybersecurity ATHENE(ATHENE国家应用网络安全研究中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文针对LLM强化学习的探索问题,提出参数空间探索思路,引入3PO方法,在OLMo-3-1025-7B等模型的数学推理等任务上,以相近计算成本相比GRPO提升性能,减少训练中的异常分组与轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07528 2026-08-11 cs.AI cs.CL cs.LG 新提交 67%

The Knowing-Saying Gap: When Probes See Errors that Confidence Misses

知-言差距:当探测模型发现错误而置信度未察觉时

Jyotin Goel, Ipshita Bandyopadhyay, Justin Shenk

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究发现线性探测模型能精准检测语言模型的上下文破坏,但无法可靠预测最终答案正确性,推翻了相关假设,表明基于探测模型的监控需结合模型与错误类型的路由策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01522 2026-08-04 cs.LG cs.AI cs.CL 新提交 67%

Question Begets Question: Self-Evolving Curriculum for Reinforcement Fine-Tuning on Competition Mathematics

问题催生问题:面向竞赛数学强化微调的自演进课程

Longtian Bao, Jianyou Wang, Yang Zhang, Youze Zheng, Ramamohan Paturi

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文针对竞赛数学强化微调的三大困难,提出Question-begets-Question(QbQ)方法及自演进课程,使Qwen2.5-Math-7B的AIME任务pass@1从5.6%提升至16.5%,且能解决更难问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00004 2026-08-04 cs.CL cs.AI cs.LG 新提交 67%

Cost-Effective Automated Judging of Natural-Language Mathematical Proofs

自然语言数学证明的高性价比自动评判

Benjamin Grayzel

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究以 IMO-GradingBench 为基准,验证 GPT-OSS 120B 等三个低成本模型作为数学证明评判器的效果,发现全票通过规则的低成本方案与前沿模型效果相当,成本低达 100 倍。

Comments 7 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22837 2026-07-28 cs.LG cs.AI cs.CL 新提交 67%

Frustratingly Simple Black-Box Adaptation of Language Models via Logit Bias

通过对数偏差对语言模型进行极其简单的黑箱适应

Ofek I. Cohen, Lior Shani, Aviv Rosenberg, Ankur Samanta, Tal Wagner, Yonathan Efroni

机构 * Tel Aviv University(特拉维夫大学) Google Research(谷歌研究院) Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究如何通过简单API级控制调整语言模型,开发黑箱方法学习对数偏差向量,无需修改模型权重或梯度,该方法在数学和推理基准上优于基础模型,是一种轻量级的语言模型适应机制。

Comments 36 pages, 4 figures, 6 tables. Appendix included. Code available at https://github.com/Ofek-Israeli/logit_bias_lm_adaptation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22554 2026-07-28 cs.AI cs.CL cs.LG 新提交 67%

Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy

相同问题,不同答案:超越准确率评估大语言模型的可靠性

Kazem Faghih, Yize Cheng, Shoumik Saha, Mobina Pournemat, Armin Gerami, Soheil Feizi

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型在不同等效表述问题下的答案变化,发现其输出依赖措辞,准确率指标掩盖不稳定性,实例级行为不稳定,提出自释义策略可恢复潜在知识提升性能,强调评估一致性对展现模型可靠性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16872 2026-07-21 cs.CL cs.AI cs.LG 新提交 67%

Trace-Based On-Policy Distillation for Masked Diffusion Language Models

基于轨迹的策略蒸馏用于掩码扩散语言模型

Haolin Ren, Ziyang Huang, Chenhao Yuan, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对扩散大语言模型推理训练后处理难的问题,提出基于轨迹的策略蒸馏(TOPD)框架,通过在目标模型去噪轨迹上监督,利用教师模型获取令牌分布并以反向KL目标更新,在数学推理基准上提升了模型准确率且减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16255 2026-07-21 cs.LG cs.AI cs.CL 新提交 67%

Feature Generation Using LLMs: An Evolutionary Algorithm Approach

使用大语言模型进行特征生成:一种进化算法方法

Aria Nourbakhsh, Benoît Alcaraz, Christoph Schommer

机构 * University of Luxembourg(卢森堡大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究利用大语言模型解决表格数据特征生成问题,创建管道结合属性与提示生成新特征,经选择算法筛选,应用于八个不同数据集,结果显示语言模型生成的新特征有助于给定任务并提升分类效果。

Journal ref Commun. Comput. Inf. Sci. 2471, 48-64 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15200 2026-07-17 cs.CL cs.AI cs.LG 新提交 67%

Mask-Aware Policy Gradients for Diffusion Language Models

用于扩散语言模型的掩码感知策略梯度

Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对强化学习扩展到MDLMs的难题,将MDLM生成形式化为两阶段动作MDP,使策略梯度分解为令牌项和掩码项,结合优化这两项在数学推理和编码基准测试中取得了最优成绩。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13643 2026-07-16 cs.LG cs.AI cs.CL 新提交 67%

Consensus as Privileged Context for Label-Free Self-Distillation

作为无标签自蒸馏特权上下文的共识

John Gkountouras, Josip Jukić, Ivan Titov

机构 * ILLC, University of Amsterdam(逻辑、语言与计算研究所,阿姆斯特丹大学) ILCC, University of Edinburgh(信息实验室,爱丁堡大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究旨在提高无标签大语言模型推理准确性,提出CANON方法将共识转化为token级监督,通过采样多个解决方案并以达到多数答案的方案为条件设置模型快照来监督。实验表明该方法大幅提升性能,还能迁移,改进非单纯分布锐化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25996 2026-07-07 cs.AI cs.CL cs.LG 新提交 67%

Autodata: An agentic data scientist to create high quality synthetic data

Autodata: 一种创建高质量合成数据的智能数据科学家方法

Ilia Kulikov, Chenxi Whitehouse, Tianhao Wu, Yixin Nie, Swarnadeep Saha, Eryk Helenowski, Weizhe Yuan, Olga Golovneva, Jack Lanchantin, Yoram Bachrach, Jakob Foerster, Xian Li, Han Fang, Sainbayar Sukhbaatar, Jason Weston

机构 * Meta

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Autodata方法,让AI代理充当数据科学家,通过元优化学习创建更优的训练和评估数据,在计算机科学、法律推理和数学推理任务上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00254 2026-07-02 cs.DB 新提交 67%

Query-Centric Optimization of AI Workflows via Approximate Query Processing and Proxy Models

基于近似查询处理和代理模型的AI工作流查询中心优化

Huayi Wang, Jun Xu, Gromit Yeuk-Yin Chan

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract)

AI总结 提出将AI工作流视为声明式查询,利用近似查询处理(AQP)和代理模型(PM)过滤减少昂贵模型调用,在TPC-DS和LLM流水线上实现85-90%和60-70%的调用减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01002 2026-07-02 cs.CL cs.AI cs.LG 新提交 67%

Logit-Contribution Scoring Identifies Non-Literal Retrieval Heads

Logit贡献评分识别非字面检索头

Aryo Pradipta Gema, Beatrice Alex, Pasquale Minervini

机构 * University of Edinburgh(爱丁堡大学) Heriot-Watt University(赫瑞瓦特大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Logit贡献评分(LOCOS),通过OV电路输出投影到答案标记方向,识别大语言模型中执行非字面检索的注意力头,消融实验显著降低ROUGE-L而保持其他能力。

Comments 41 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30704 2026-07-01 cs.LG cs.AI cs.CL 新提交 67%

From Search to Synthesis: Training LLMs as Zero-Shot Workflow Generators

从搜索到合成:训练大语言模型为零样本工作流生成器

Gan Luo, Zihan Qin, Bin Dong, Wotao Yin

机构 * School of Mathematics Science, Peking University(北京大学数学科学学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MetaFlow,将工作流生成视为元学习问题,通过两阶段训练(监督微调+强化学习)使模型能生成可泛化的任务级工作流,在问答、代码生成和数学推理任务上实现零样本泛化。

Comments 35 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27731 2026-06-29 cs.CL cs.AI cs.CE cs.LG 新提交 67%

Enhancing Numerical Prediction in LLMs via Smooth MMD Alignment

通过平滑MMD对齐增强LLM中的数值预测

Zhuo Zuo, Li Yue, Wenhao Zheng, Chenpeng Wang, Xianggen Liu

机构 * College of Computer Science, Sichuan University, Chengdu, China(四川大学计算机学院,成都,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM在数值预测任务中精度不足的问题,提出平滑最大均值差异(SMMD)方法,通过数值令牌的距离核和图平滑对齐预测分布,在数学推理等任务中显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13598 2026-06-12 cs.AI cs.CL cs.LG cs.MA 新提交 67%

Reward Modeling for Multi-Agent Orchestration

多智能体编排的奖励建模

King Yeung Tsang, Zihao Zhao, Vishal Venkataramani, Haizhou Shi, Zixuan Ke, Semih Yavuz, Shafiq Joty, Hao Wang

机构 * Rutgers University(罗杰斯大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出OrchRM框架,通过自监督学习从多智能体执行中间产物构建奖励模型,无需人工标注,实现高效编排器训练和测试时扩展,在多个领域提升性能并降低计算成本。

Comments Preprint; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07810 2026-06-09 cs.CL cs.AI cs.LG 新提交 67%

SLMJury: Can Small Language Models Judge as Well as Large Ones?

SLMJury:小型语言模型能否像大型模型一样进行评判?

Anish Laddha, Nitesh Pradhan, Gaurav Srivastava

机构 * LNMIIT Virginia Tech(弗吉尼亚理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SLMJury框架,评估小型语言模型作为评判者的能力,发现领域依赖的过度思考效应、领域泛化差异、闭端与开端评判能力分离,以及多智能体辩论降低准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07527 2026-06-09 cs.CL cs.AI cs.LG 新提交 67%

Post-training is (Massive) Supervised Learning

后训练是(大规模)监督学习

Michael Hassid, Yossi Adi, Roy Schwartz

机构 * FAIR, Meta AI(Meta AI 基础人工智能研究团队) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文论证当前LLM后训练阶段(SFT+RL)实质是回归到BERT时代的“预训练-微调”范式,通过实验表明从零开始后训练的模型也能取得显著性能,并提出应转向“学会学习”的训练方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16072 2026-08-18 cs.LG cs.AI 新提交 62%

Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization

学习剩余内容,而非已掌握内容:面向多奖励策略优化的饱和感知优势重加权方法

Yixuan Wang, Yifei Chen, Haichao Zhang, Haozheng Luo, Xander Wu, Jie Ni, Yun Fu, Nuno Vasconcelos, Yijiang Li

机构 * University of Florida(佛罗里达大学) UC San Diego(加州大学圣迭戈分校) Northeastern University(东北大学) Northwestern University(西北大学) Stanford University(斯坦福大学) Universität Innsbruck(因斯布鲁克大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对多奖励策略优化中现有方法的缺陷,提出SA-MRPO方法,动态分配优化资源,在数学推理、自适应推理、编码任务中均实现性能提升。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15360 2026-08-18 cs.LG cs.AI 新提交 62%

SAPE: Sandwich Adapters for Parameter Efficiency in Large Language Model Fine-Tuning

SAPE:用于大语言模型微调参数效率的三明治适配器

Mohammad Aref Jafari-Raddani, Morteza Mohajjel Kafshdooz

机构 * Qom University of Technology(库姆理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SAPE是一种基于三明治式硬权重共享拓扑的PEFT框架,通过隔离边界变换降低内存与计算开销,在低参数约束下,于RoBERTa-large、LLaMA-3.2等模型的多项任务中取得优于现有方法的性能。

Comments 16 pages, 4 figures, 10 tables, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10537 2026-08-12 cs.AI cs.LG 新提交 62%

Measuring Semantic Abstractness of SAE Features via Nonlocality

通过非局部性测量SAE特征的语义抽象性

Chuqiao Lin, Shivaji Sondhi, Xiao-Liang Qi

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出特征非局部性(FNL)指标,可区分SAE特征的抽象层级,用于审计越狱缓解特征及引导DeepSeek-R1模型特征提升数学推理准确率。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09893 2026-08-11 cs.CL cs.AI 新提交 62%

Fusion Training for Mathematical Generalization in Large Language Models

大型语言模型中数学泛化的融合训练

Congfeng Cao, Pengyu Zhang, Jelke Bloem

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对思维模式融合(TMF)训练动态开展系统性研究,揭示两种模式间的非对称相互作用与负相关关系,为设计TMF训练设置提供指导。

Comments ACL SRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09836 2026-08-11 cs.AI cs.CL 新提交 62%

Mismatch Matters: On-Policy Distillation Beyond Token Agreement

失配很重要:超越token一致性的在线蒸馏

Zichao Yu, Chengzhi Yu, Shengze Xu, Yujin Han, Bingqing Jiang, Xu Wang, Difan Zou

机构 * The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文针对在线蒸馏存在的退化一致性失效问题,提出TIDE方法修正师生失配,在数学推理基准上显著提升性能、缩短响应长度并减少格式错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09745 2026-08-11 cs.LG cs.AI stat.ML 新提交 62%

SR-OPSD: Self-Referenced On-Policy Self-Distillation

SR-OPSD:自引用同策略自蒸馏

Zhuo Sun, Entong Li, Yanlong Zhao, Xiaoyuan Cheng, Wenxuan Yuan, Kaiyu Li, Che Liu, Huihang Liu, Harrison Bo Hua Zhu, Li Zeng

机构 * Shanghai University of Finance and Economics(上海财经大学) Imperial College London(伦敦帝国学院) University of Science and Technology of China(中国科学技术大学) University College London(伦敦大学学院) Nanyang Technological University(南洋理工大学) Technical University of Denmark(丹麦技术大学) University of Copenhagen(哥本哈根大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对同策略自蒸馏的优化不稳定问题,提出SR-OPSD方法,通过几何插值结合Rényi散度优化蒸馏目标,在多任务大语言模型实验中取得最优或竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08726 2026-08-11 cs.LG cs.AI 新提交 62%

PAST: Privileged Adaptation from Complete Student Trajectories for On-Policy Self-Distillation

PAST:基于完整学生轨迹的特权适配用于在线策略自蒸馏

Yangyang Feng, Zhuoyan Feng, Junlan Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 PAST将完整学生轨迹作为OPSD教师的额外特权信息,通过前向KL蒸馏等方法优化教师,在三个数学推理基准上使Avg@12宏观平均值较Vanilla OPSD提升5.6个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06819 2026-08-10 cs.CL cs.AI 新提交 62%

FutureBridge: Token Selection Beyond Local Preference in Collaborative Decoding

FutureBridge:协作解码中超越局部偏好的令牌选择

Quanquan Li, Hongbo Zhang, Yihe Chi, Jingyu Li, Xidong Xi, Liuyang Song, Hongzhen Zhang, Yuxiang Huang, Jing Ke, Siyuan Ma, Junyi Lin, Guitao Cao

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 FutureBridge通过联合LLM-SLM令牌对SLM后续推理的支持度排序,在5个数学推理基准上使Qwen3-1.7B SLM的数学平均得分较贪心解码提升35.1%,超越了仅依赖LLM局部偏好的现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06735 2026-08-10 cs.AI cs.CL 新提交 62%

IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents

IB-RL:用于策略性对话智能体的孤立双边强化学习

Senhao Wang, Chenghao Cai, Haitao Hu, Mingxing Huang, Xingguang Wang, Wenhao Li, Zecheng Lin

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对现有RL训练范式的静态对应智能体不匹配问题,提出IB-RL方法,在Vehicle TeleSales和Deal-or-NoDeal任务上较单边RL基线显著提升了策略对未见过对应智能体的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04588 2026-08-06 cs.CL cs.AI 新提交 62%

EASy: Towards Efficient LLM-Based Agentic System

EASy:迈向高效的基于大语言模型的智能体系统

Junnan Liu, Linhao Luo, Thuy-Trang Vu, Gholamreza Haffari

机构 * Monash University(莫纳什大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 EASy是一种可训练的智能体框架,通过强化学习优化任务性能与计算效率,采用里程碑-规划-执行工作流,在多类基准上实现了更优的性能-效率权衡。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02867 2026-08-05 cs.CL cs.AI 新提交 62%

BODHI: Do LLMs Branch Out and Discover Heterogeneous Inferences?

BODHI:大型语言模型是否会分支拓展并发现异构推理?

Soumadeep Saha, Krish Sharma, Akshay Chaturvedi, Nicholas Asher

机构 * ANITI, Université de Toulouse(图卢兹大学ANITI) LINAGORA Labs(LINAGORA实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过迷宫求解实验和BODHI-Trees分析,发现RLVR训练的LLMs存在策略熵崩溃,其采样效率提升以推理分支多样性下降为代价。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01418 2026-08-04 cs.AI cs.LG 新提交 62%

Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning

策略滞后下的回滚复用:面向大语言模型强化学习的前缀归一化策略优化

Wenhao Zhang, Yibo Xie, Rui Wang, Jiahua Yang, Lei Jiang, Zibo Yang, Yawei Wang, Jiali Xu, jasperawang, Haoyang Long, Huan Xiong, alantzhao

机构 * Tencent(腾讯) Harbin Institute of Technology(哈尔滨工业大学) Jinan University(暨南大学) University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型强化学习中回滚复用导致的离策略问题,提出前缀归一化策略优化(PNPO),在4个更新周期时其数学推理性能优于GSPO,可降低更新批次需求。

详情

展开后加载摘要…

URL PDF HTML 收藏