arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45417 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3252 篇

2605.17003 2026-05-20 cs.LG cs.AI 62%

Learning-Zone Energy: Online Data Selection for Efficient RL Post-Training

学习区能量:用于高效RL后训练的在线数据选择

Peng Cui, Boyao Yang, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech.(计算机科学与技术系) Institute for AI(人工智能研究院) BNRist Center(BNRist中心) Tsinghua-Bosch Joint ML Center(清华大学-博世联合机器学习中心) THBI Lab(THBI实验室) Tsinghua University(清华大学) Dept. of Automation(自动化系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出学习区能量(LZE)方法,通过在线数据选择框架集中计算在模型的主动学习前沿,提高RL后训练的效率,实验表明在多个数据集上表现优异,且计算资源消耗减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06462 2026-05-20 cs.CL cs.LG 62%

Diffusion-State Policy Optimization for Masked Diffusion Language Models

扩散状态策略优化用于掩码扩散语言模型

Daisuke Oba, Hiroki Furuta, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究院)

专题命中 数学推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Diffusion-State Policy Optimization(DiSPO),一种用于掩码扩散语言模型的插件信用分配层,通过直接优化中间填充决策来改进生成过程,实验表明其在数学和规划基准测试中优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14292 2026-05-19 cs.LG cs.CL 62%

Minimal-Intervention KV Retention via Set-Conditioned Diversity

通过集合条件多样性实现最小干预的KV保留

Libo Sun, Po-wei Harn, Peixiong He, Xiao Qin

机构 * Department of Computer Science and Software Engineering(计算机科学与软件工程系) Department of Information Management(信息管理系) Auburn University(阿伯丁大学) National Central University(国立中央大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究通过改进TriAttention保留评分器,在有限预算下提升KV缓存压缩效果,采用V空间冗余惩罚机制,验证了最小修改优于结构性重设计。

Comments 15 pages, 3 figures, 3 tables. Code and data: https://github.com/libophd/minimal-kv-retention

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19590 2026-05-19 cs.LG cs.CL 62%

Learning to Reason without External Rewards

无需外部奖励的学习推理

Xuandong Zhao, Zhewei Kang, Aosong Feng, Sergey Levine, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校) Yale University(耶鲁大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Intuitor方法,通过内在反馈实现无需外部奖励的自主学习,实验表明其在数学基准和代码生成等任务中表现优异,为无监督学习提供了新途径。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16470 2026-05-19 cs.LG cs.AI 62%

Strategic Over-Parameterization for Generalizable Low-Rank Adaptation

战略性过参数化以实现通用的低秩适应

Jing Gao, Zhong-Yi Lu, Pan Zhang, Ze-Feng Gao

机构 * School of Fundamental Physics and Mathematical Sciences, Hangzhou Institute for Advanced Study, UCAS, Hangzhou 310024, China(1 基础物理与数学科学学院,杭州先进研究院,UCAS,杭州 310024,中国) School of Physical Sciences, University of Chinese Academy of Sciences, No. 19A Yuquan Road, Beijing 100049, China(2 物理科学学院,中国科学院大学,玉泉路19A号,北京 100049,中国) CAS Key Laboratory of Theoretical Physics, Institute of Theoretical Physics, Chinese Academy of Sciences, Beijing 100190, China(3 中国科学院理论物理重点实验室,理论物理研究所,中国科学院,北京 100190,中国) School of Physics and Key Laboratory of Quantum State Construction and Manipulation (Ministry of Education), Renmin University of China, Beijing 100872, China(4 物理学院和量子态构造与操控(教育部)重点实验室,中国人民大学,北京 100872,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LoRA-Over框架,通过训练时丰富优化景观并推理时压缩,提升低秩适应的泛化能力,实验显示其在多个任务上优于传统LoRA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19470 2026-05-19 cs.LG cs.AI 62%

Adaptive Layerwise Perturbation: Unifying Off-Policy Corrections for LLM RL

自适应分层扰动:统一LLM RL中的非策略修正

Chenlu Ye, Xuanchang Zhang, Yifan Hao, Zhou Yu, Ziji Zhang, Abhinav Gullapalli, Hao Chen, Jing Huang, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自适应分层扰动(ALP),通过在更新过程中向每一层的输入隐藏状态注入可控噪声,缓解策略退化和训练-推理不匹配问题,提升训练稳定性与探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15726 2026-05-18 cs.AI cs.CL 62%

Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR

走出舒适区:为RLVR的高效策略引导探索

Chanuk Lee, Sangwoo Park, Minki Kang, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出NudgeRL框架,通过策略引导实现结构化和多样性探索,提升RLVR在数学基准上的表现,相比标准GRPO和oracle引导方法更高效。

Comments 28 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15604 2026-05-18 cs.LG cs.CL 62%

VSPO: Vector-Steered Policy Optimization for Behavioral Control

VSPO:用于行为控制的向量引导策略优化

Xuechen Zhang, Zijian Huang, Kai Yang, Weijia Zhang, Jiasi Chen, Samet Oymak

机构 * University of Michigan(密歇根大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 VSPO通过引入与目标行为关联的引导向量,控制生成轨迹的行为强度,解决多目标优化中的稀疏奖励问题,提升策略优化效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15565 2026-05-18 cs.LG cs.AI 62%

AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs

AstraFlow:面向代理大语言模型的数据流强化学习

Haizhong Zheng, Yizhuo Di, Jiahui Wang, Shuowei Jin, Xueshen Liu, Yongji Wu, Z. Morley Mao, Ion Stoica, Jiawei Zhao, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) UC Berkeley(加州大学伯克利分校) Meta

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AstraFlow通过数据流导向的强化学习系统,实现复杂多策略协作训练和高效利用异构计算资源,提升代理LLM的推理与工具使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15436 2026-05-18 cs.CL cs.LG 62%

Neural Activation Patterns Across Language Model Architectures: A Comprehensive Analysis of Cognitive Task Performance

神经激活模式在语言模型架构中的跨分析:对认知任务性能的全面研究

Mahdi Naser-Moghadasi, Faezeh Ghaderi

机构 * Research Division, BrightMind AI(BrightMind AI 研究部) Texas Tech University(德克萨斯理工大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文分析了六种大型语言模型架构在十二种认知任务上的神经激活模式,揭示了编码器和解码器架构在处理不同任务时的差异,发现数学推理产生最高注意力熵,解码器模型在稀疏性上更高。

Comments 8 pages, accepted at IEEE BigData 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19241 2026-05-18 cs.LG cs.AI 62%

ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment

ActiveDPO: 用于高效对齐的主动直接偏好优化

Xiaoqiang Lin, Arun Verma, Zhongxiang Dai, Daniela Rus, See-Kiong Ng, Bryan Kian Hsiang Low

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) Singapore-MIT Alliance for Research and Technology Centre(新加坡-麻省理工联盟研究技术中心) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) CSAIL, Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ActiveDPO通过理论支撑的非线性奖励函数选择方法,利用LLM自身参数化奖励模型,提升对齐效率和数据收集效果。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14841 2026-05-15 cs.LG cs.AI 62%

GPart: End-to-End Isometric Fine-Tuning via Global Parameter Partitioning

GPart:通过全局参数划分实现端到端等距微调

Paolo Mandica, Michał Brzozowski, Zuzanna Dubanowska, Neo Christopher Chung

机构 * Samsung AI Center(三星人工智能中心) University of Warsaw(华沙大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 GPart通过全局参数划分方法实现端到端等距微调,无需低秩结构,仅需一个随机投影即可高效微调模型,实现存储成本低且性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13935 2026-05-15 cs.LG cs.CL 62%

Beyond Mode-Seeking RL: Trajectory-Balance Post-Training for Diffusion Language Models

超越模式寻求强化学习:扩散语言模型的轨迹平衡后训练

Saba Ahmadi, Prasanna Parthasarathi, Yufei Cui

机构 * Noah’s Ark Lab(Noah’s Ark 实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出TraFL方法,通过轨迹平衡目标提升扩散语言模型的后训练效果,在多个基准测试中均优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13695 2026-05-14 cs.CL cs.AI 62%

RTLC -- Research, Teach-to-Learn, Critique: A three-stage prompting paradigm inspired by the Feynman Learning Technique that lifts LLM-as-judge accuracy on JudgeBench with no fine-tuning

RTLC -- 研究、教以学、批判:一种受费曼学习技术启发的三阶段提示范式,无需微调即可提升LLM-as-judge在JudgeBench上的准确性

Andrea Morandi

机构 * Cisco(思科)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RTLC通过三阶段提示方法提升LLM在JudgeBench上的准确性,无需微调或外部工具,其核心方法包括研究、教以学和批判三个阶段,显著提升客观正确性评分的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13295 2026-05-14 cs.CL cs.AI cs.MA 62%

CANTANTE: Optimizing Agentic Systems via Contrastive Credit Attribution

CANTANTE:通过对比信用分配优化代理系统

Tom Zehle

机构 * University of Freiburg(弗赖堡大学) ELLIS Institute(埃里克·林斯研究所) Tübingen(图宾根)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CANTANTE框架,通过对比多个联合配置的rollouts分解系统奖励为单个代理的更新信号,提升多代理系统优化效果,在编程、数学推理和多跳问答任务中均取得最佳排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13399 2026-05-14 cs.AI cs.CL 62%

Differentiable Evolutionary Reinforcement Learning

可微分进化强化学习

Sitao Cheng, Tianle Li, Xuhan Huang, Xunjian Yin, Difan Zou

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DERL,通过可微分的元优化器自动发现最优奖励结构,实现复杂任务中的高效强化学习,优于传统非可微方法。

Comments Work in Progress. We release our code and model at https://github.com/sitaocheng/DERL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11274 2026-05-14 cs.CL cs.LG 62%

Learning a Continue-Thinking Token for Enhanced Test-Time Scaling

学习一个持续思考标记以增强测试时扩展

Liran Ringel, Elad Tolochinsky, Yaniv Romano

机构 * Department of Computer Science, Technion – Israel Institute of Technology(计算机科学系,技术学院–以色列理工学院) Department of Electrical and Computer Engineering, Technion – Israel Institute of Technology(电气与计算机工程系,技术学院–以色列理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了通过学习专用持续思考标记来提升测试时扩展性能的方法,实验表明该方法在数学基准测试中优于固定标记方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05410 2026-05-14 cs.AI cs.CL 62%

ChatSR: Multimodal Large Language Models for Scientific Formula Discovery

ChatSR:用于科学公式发现的多模态大语言模型

Yanjie Li, Lina Yu, Weijun Li, Min Wu, Liping Zhang, Jingyi Liu, Yusong Deng, Mingzhu Wan, Xin Ning

机构 * AnnLab, Institute of Semiconductors, Chinese Academy of Sciences, Beijing, China(安 lab,半导体研究所,中国科学院,北京,中国) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences, Beijing, China(电子、电气与通信工程学院,中国科学院大学,北京,中国) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing 101408, China(先进交叉科学学院,中国科学院大学,北京101408,中国) College of Materials Science and Opto-Electronic Technology, University of Chinese Academy of Sciences, Beijing, 100049, China(材料科学与光电技术学院,中国科学院大学,北京100049,中国) School of Integrated Circuits, University of Chinese Academy of Sciences, Beijing 100049, China(集成电路学院,中国科学院大学,北京100049,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ChatSR通过设计专用编码器和模态对齐机制,将科学数据映射到可被大语言模型处理的表示空间,从而生成符合领域先验的数学公式,推动科学发现自动化。

Comments 14 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11491 2026-05-13 cs.LG cs.AI 62%

Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization

理解与防止RLVR中的熵崩溃:基于策略熵流的在线优化

Huimin Xu, Shuai Zhao, Xiaobao Wu, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) VinUniversity(文大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OPEFO方法,通过平衡熵动态缓解RLVR中的熵崩溃问题,提升训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11235 2026-05-13 cs.LG cs.AI 62%

Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning

将课程判断内部化以优化大语言模型强化微调

Han Zheng, Yining Ma, Karthick Gunasekaran, Bharathan Balaji, Zheng Du, Shiv Vitaladevuni, Cathy Wu

机构 * MIT(麻省理工学院) Amazon AGI(亚马逊人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出METIS框架,通过内部化课程判断提升LLM强化微调效率与性能,利用训练结果动态分配训练资源,实现闭环优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08577 2026-05-12 cs.LG cs.AI 62%

Distributionally Robust Token Optimization in RLHF

强化学习中对抗性令牌优化

Yeping Jin, Jiaming Hu, Ioannis Ch. Paschalidis

机构 * Department of System Engineering(系统工程系) Boston University(波士顿大学) Department of Math & Statistics(数学与统计学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DRTO方法,结合RLHF与DRO,通过构建f-散度模糊集增强策略优化中的困难响应段,提升多步骤推理任务在分布变化下的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04783 2026-05-12 cs.AI cs.CL 62%

Breaking Contextual Inertia: Reinforcement Learning with Single-Turn Anchors for Stable Multi-Turn Interaction

打破情境惯性:基于单轮锚点的强化学习用于稳定多轮交互

Xingwu Chen, Zhanqiu Zhang, Yiwen Guo, Difan Zou

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RLSTA方法,通过单轮锚点提供奖励信号,帮助模型打破情境惯性,提升多轮交互稳定性,实验显示其在不同领域表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09745 2026-05-12 cs.LG cs.AI cs.IT math.IT 62%

Entropy-informed Decoding: Adaptive Information-Driven Branching

基于熵的信息解码:自适应信息驱动的分支

Benjamin Patrick Evans, Sumitra Ganesh, Leo Ardon

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) JP Morgan AI Research, London, UK(摩根大通AI研究,伦敦,英国) JP Morgan AI Research, New York, USA(摩根大通AI研究,纽约,美国)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EDEN解码框架,通过自适应分配计算资源提升生成效率,在数学推理、代码生成等任务中优于传统解码策略。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18880 2026-05-12 cs.CL cs.AI cs.CY 62%

Can LLMs Estimate Student Struggles? Human-AI Difficulty Alignment with Proficiency Simulation for Item Difficulty Prediction

LLMs能否估计学生困难?人类-人工智能难度对齐用于项目难度预测的 proficiency 模拟

Ming Li, Han Chen, Yunze Xiao, Jian Chen, Hong Jiao, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Carnegie Mellon University(卡内基梅隆大学) University at Buffalo(布法罗大学) MBZUAI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLMs在估计学生困难方面的表现,发现模型规模扩大并不总能提高准确性,且模型倾向于形成机器共识而非与人类对齐,揭示了当前模型在自动难度预测中的挑战。

Comments ACL2026, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08646 2026-05-12 cs.LG cs.CL cs.DC 62%

PAAC: Privacy-Aware Agentic Device-Cloud Collaboration

PAAC:隐私感知的代理设备-云协作

Liangqi Yuan, Wenzhi Fang, Shiqiang Wang, Christopher G. Brinton

机构 * Purdue University(普渡大学) University of Exeter(埃克塞特大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 PAAC框架通过设备-云边界对齐规划-执行分解,使角色专业化成为隐私机制,提升隐私与准确性的平衡,平均准确率提升15-36%,泄漏减少2-6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08441 2026-05-12 cs.LG cs.AI 62%

DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards

DUET:基于可验证奖励的强化学习中优化令牌预算分配

Haoyu Hu, Xuandong Zhao, Xuhai "Orson'' Xu, Nori Jacoby

机构 * Cornell University(康奈尔大学) University of California, Berkeley(加州大学伯克利分校) Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DUET通过联合调整令牌预算分配的两个维度,提升强化学习的推理质量和训练效率,同时在多个基准测试中表现优异,且在预算减少时性能优势扩大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07488 2026-05-11 cs.AI cs.LG 62%

Efficient Data Selection for Multimodal Models via Incremental Optimization Utility

通过增量优化效用实现多模态模型的数据选择效率

Jinhao Jing, Qiannian Zhao, Chao Huang, Zhan Su

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OST框架,将数据选择转化为增量优化效用排名问题,通过轻量代理模拟单步更新估算样本边际效用,实验证明在减少训练成本的同时提升性能,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07331 2026-05-11 cs.LG cs.AI 62%

Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective

重新思考LLM策略优化中的重要性采样:从累积token视角

Yuheng Zhang, Chenlu Ye, Shuowei Jin, Changlong Yu, Wei Xiong, Saurabh Sahu, Nan Jiang

机构 * UIUC(伊利诺伊大学香槟分校) University of Michigan(密歇根大学) Amazon(亚马逊)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CTPO,通过累积token重要性采样比解决偏倚-方差困境,结合位置自适应裁剪提升稳定性,实现更一致的正则化,在数学推理基准上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06755 2026-05-11 cs.LG cs.AI 62%

Gradient Extrapolation-Based Policy Optimization

基于梯度外推的策略优化

Ismam Nur Swapnil, Aranya Saha, Tanvir Ahmed Khan, Mohammad Ariful Haque, Ser-Nam Lim

机构 * Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) University of Maryland, College Park(马里兰大学学院公园分校) Illinois Institute of Technology(伊利诺伊理工学院) University of Central Florida(佛罗里达中央大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GXPO算法,通过三步反向传播模拟多步前瞻,提升强化学习中大语言模型的推理能力,实验显示在数学推理任务中性能优于GRPO和SFPO。

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01003 2026-05-11 cs.LG cs.AI 62%

ESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-Tuning

ESSAM:一种用于内存高效的LLM微调的强化学习竞争进化策略方法

Zhishen Sun, Sizhe Dang, Guang Dai, Haishan Ye

机构 * Xi’an Jiaotong University(西安交通大学) SGIT AI Lab(SGIT人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ESSAM,结合进化策略的零阶搜索与SAM提升泛化能力,实现低内存高精度的LLM微调,实验显示其在GSM8K任务中表现优异,内存使用显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏