arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3240 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3240 篇

2606.00172 2026-06-02 cs.AI 70%

CAST: Non-Privileged Clipped Asymmetric Self-Teaching with Advantage Flipping for GRPO

CAST:用于GRPO的非特权裁剪非对称自教学与优势翻转

Yang Li, Gongle Xue, Yijia Guo, Yuheng Yuan, Liwen Hu, Lei Ma

机构 * School of Software and Microelectronics, Peking University, Beijing(北京大学软件与微电子学院) School of Artificial Intelligence, Peking University, Beijing(北京大学人工智能学院) School of Computer Science, Peking University, Beijing(北京大学计算机科学学院) School of Future Technology, Peking University, Beijing(北京大学未来技术学院)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 提出CAST方法,通过无答案的自教师模型和双向局部优势符号翻转,解决GRPO中奖励稀疏和组相对优势消失的问题,提升数学推理性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09907 2026-06-02 cs.AI cs.MA 70%

RADAR: Redundancy-Aware Diffusion for Multi-Agent Communication Structure Generation

RADAR:面向多智能体通信结构生成的冗余感知扩散方法

Zhen Zhang, Wanjing Zhou, Juncheng Li, Hao Fei, Jun Wen, Wei Ji

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出一种基于条件离散图扩散模型的冗余感知生成框架RADAR,通过逐步生成通信拓扑并利用图有效尺寸引导,在六项基准上实现更高准确率、更低令牌消耗和更强鲁棒性。

Comments Accepted by ICML 2026 (fix typos)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29648 2026-05-29 cs.CL 70%

Verifiable Rewards Beyond Math and Code: Lightweight Corpus-Grounded Process Supervision for Factual Question Answering

超越数学与代码的可验证奖励:面向事实问答的轻量级语料库基础过程监督

Shicheng Fan, Haochang Hao, Dehai Min, Weihao Liu, Philip S. Yu, Lu Cheng

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 提出CorVer,一种基于语料库共现统计的轻量级过程奖励方法,通过句子级信用分配和令牌级优势映射,在多个模型和基准上显著提升事实问答准确性且训练速度更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28003 2026-05-28 cs.CL 70%

ResearchMath-14K: Scaling Research-Level Mathematics via Agents

ResearchMath-14K: 通过智能体扩展研究级数学

Guijin Son, Seungyeop Yi, Minju Gwak, Hyunwoo Ko, Wongi Jang, Youngjae Yu

机构 * Seoul National University(首尔国立大学) OneLineAI Yonsei University(延世大学)

专题命中 数学推理 :reasoning(abstract,abstract_cn);分类 cs.CL

AI总结 本文通过多智能体流程从学术来源构建了最大的研究级数学问题数据集ResearchMath-14K(14,056个问题),并生成220K教师轨迹,经智能体过滤后微调Qwen3模型(4B-30B)平均提升9.2个点,表明过滤后的开放问题尝试即使没有完全正确的推理轨迹也能提供有效监督。

Comments Work in progress. Dataset available at: https://huggingface.co/datasets/amphora/ResearchMath-14k

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25981 2026-05-27 cs.CL 70%

When Do LLM Agents Treat Surface Noise Differently from Semantic Noise? A 68-Cell Measurement Study with a Held-Out Trace-Level Validation

LLM 代理何时对表面噪声与语义噪声做出不同处理?一项基于 68 个单元格的测量研究及留出轨迹级验证

Liyun Zhang, Jiayi Guo

机构 * School of Information and Software Engineering, UESTC(信息与软件工程学院,电子科技大学) Jacobs School of Engineering, UC San Diego(工程学院,加州大学圣地亚哥分校)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究通过 68 个单元格的测量实验,发现大语言模型驱动的思维链和 ReAct 代理对语义扰动(如释义、同义词)比表现扰动(如格式、重排序)更敏感,并基于留出模型和轨迹级机制分析提出了“隐蔽发散”解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23914 2026-05-26 cs.DC cs.AI cs.MA 70%

VineLM: Trie-Based Fine-Grained Control for Agentic Workflows

VineLM: 基于Trie的细粒度控制用于智能体工作流

Nikos Pagonas, Matthew Lou, Tianyi Peng, Dan Rubenstein, Kostis Kaffes

机构 * Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 提出VineLM工作流管理器,通过Trie结构动态选择每个阶段调用的模型,在请求级目标下优化成本-延迟-准确率边界,稀疏分析减少离线分析成本98-99.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17734 2026-05-19 cs.AI 70%

Harnessing LLM Agents with Skill Programs

通过技能程序 harnessing LLM agents

Hongjun Liu, Yifei Ming, Shafiq Joty, Chen Zhao

机构 * New York University(纽约大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 本文提出 HASP 框架,通过将技能转化为可执行程序函数(PFs)来提升 LLM agent 在复杂任务中的表现,其核心方法是通过 PFs 在失败状态时介入并修正行动,主要贡献是通过模块化设计实现推理、训练和自改进的多场景应用。

Comments 40 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08504 2026-05-14 cs.CL 70%

A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models

一层解释所有:理解大语言模型中大规模激活现象

Zeru Shi, Zhenting Wang, Fan Yang, Qifan Wang, Ruixiang Tang

机构 * Rutgers University(罗格斯大学) Wake Forest University(威克森林大学) Meta AI

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 研究大语言模型中大规模激活的起源,发现ME层是大规模激活首次出现的层,并提出方法减少大规模激活的刚性,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11731 2026-04-30 cs.CL 70%

Thinking with Drafting: Optical Decompression via Logical Reconstruction

用草图思考:通过逻辑重建实现光学解压

Jingxuan Wei, Honghao He, Caijun Jia, Siyuan Li, Zheng Sun, Yuhang Xu, Yuanyuan Lin, Linzhuang Sun, Yuchen Wu, Bihui Yu, Xiangxiang Zhang, Cheng Tan

机构 * Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) University of Chinese Academy of Sciences 3 ByteDance 4 Westlake University(中国科学院大学 3 字节跳动 4 西湖大学) Key Laboratory of Computing Power Network(计算功率网络重点实验室) Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(信息安全,教育部,山东计算机科学中心(济南国家超级计算中心),齐鲁工业大学(山东省科学院))

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出通过逻辑重建实现光学解压,引入TwD方法,利用领域特定语言作为中间表示,以生成可执行代码的视觉证明,建立视觉生成与逻辑验证的闭环系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25419 2026-04-29 cs.AI 70%

JURY-RL: Votes Propose, Proofs Dispose for Label-Free RLVR

JURY-RL: 选票提议,证明判定用于无标签的RLVR

Xinjie Chen, Biao Fu, Jing Wu, Guoxin Chen, Xinggao Liu, Dayiheng Liu, Minpeng Liao

机构 * Zhejiang University, Hangzhou, China(浙江大学,杭州,中国) Tongyi Lab, Alibaba Group, Hangzhou, China(通义实验室,阿里巴巴集团,杭州,中国)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 JURY-RL提出一种无标签RLVR框架,通过模型回放提议候选答案,形式验证器判定是否可获正奖,从而稳定训练并提升数学推理性能。

Comments Preprint. 32 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12373 2026-04-28 cs.CL 70%

Masked by Consensus: Disentangling Privileged Knowledge in LLM Correctness

被共识掩盖:在LLM正确性中解构特权知识

Tomer Ashuach, Shai Gretz, Yoav Katz, Yonatan Belinkov, Liat Ein-Dor

机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院) IBM Research(IBM研究院) Kempner Institute, Harvard University(哈弗大学凯普纳研究所)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 研究探讨大语言模型是否具备类似人类的内部状态评估正确性知识,通过自代表和外部模型对比发现,在分歧子集上,自代表在事实任务中表现更优,但数学推理中无优势。

Comments Accepted to ACL 2026 (Main Conference). 8 pages, 16 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04695 2026-04-28 cs.LG 70%

TRINITY: An Evolved LLM Coordinator

TRINITY:一个进化的人工智能语言模型协调器

Jinglue Xu, Qi Sun, Peter Schwendeman, Stefan Nielsen, Edoardo Cetin, Yujin Tang

机构 * Sakana AI University of Michigan(密歇根大学) Institute of Science Tokyo(东京科学研究所)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.LG

AI总结 TRINITY通过轻量级协调器高效分配角色,提升多轮查询处理能力,在多个任务中超越单一模型和现有方法,实现卓越性能。

Comments To appear at the 14th International Conference on Learning Representation (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19087 2026-04-22 cs.AI 70%

OLLM: Options-based Large Language Models

OLLM:基于选项的大型语言模型

Shashank Sharma, Janina Hoffmann, Vinay Namboodiri

机构 * Department of Computer Science(计算机科学系) University of Bath(巴斯大学) Department of Psychology(心理学系)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 OLLM通过引入学习选项提升语言模型的生成可控性与鲁棒性,利用低维选项空间实现更高效的奖励优化,减少常见对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16917 2026-04-21 cs.CL 70%

x1: Learning to Think Adaptively Across Languages and Cultures

x1: 在多种语言和文化中学习适应性思考

Yangfan Ye, Xiaocheng Feng, Xiachong Feng, Yichong Huang, Zekun Yuan, Lei Huang, Weitao Ma, Qichen Hong, Yunfei Lu, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) The University of Hong Kong(香港大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 x1通过在实例层面选择有利语言进行推理,提升多语言数学推理和文化相关任务的性能,挑战了单纯扩大模型规模的假设。

Comments Findings of ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13371 2026-04-16 cs.CL 70%

Empirical Evidence of Complexity-Induced Limits in Large Language Models on Finite Discrete State-Space Problems with Explicit Validity Constraints

大语言模型在有限离散状态空间问题中复杂性诱导限制的实证证据

Md. Fahad Ullah Utsho, Mohd. Ruhul Ameen, Akif Islam, Md. Golam Rashed, Dipankar Das

机构 * Department of Information and Communication Engineering, University of Rajshahi, Bangladesh(拉贾沙希大学信息与通信工程系,孟加拉国) College of Engineering and Computer Sciences, Marshall University, Huntington, WV, USA(马歇尔大学工程与计算机科学学院,美国,亨廷顿,西弗吉尼亚) Department of Computer Science and Engineering, University of Rajshahi, Bangladesh(拉贾沙希大学计算机科学与工程系,孟加拉国)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 本文通过构建九个经典推理任务,系统评估大推理模型在逐渐增加的复杂性下的鲁棒性,发现模型在低复杂度时表现良好,但超过特定阈值后显著退化,提出推理崩溃现象。

Comments 45 pages, 36 figures, 7 tables, Journal Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06298 2026-04-09 cs.LG 70%

Limits of Difficulty Scaling: Hard Samples Yield Diminishing Returns in GRPO-Tuned SLMs

难度扩展的极限:在GRPO调优的SLMs中困难样本产生递减回报

Suraj Yadav, Siddharth Yadav, Parth Goyal

机构 * IIIT Delhi(德里印度理工学院)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 本文研究了在资源受限条件下,GRPO与LoRA应用于SLMs进行数学推理时,难度增加对准确率的影响,发现高难度样本的提升效果递减。

Comments Accepted at ICLR Workshop 2026 ICBINB

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04131 2026-04-07 cs.AI 70%

Profile-Then-Reason: Bounded Semantic Complexity for Tool-Augmented Language Agents

Profile-Then-Reason: 用于工具增强语言代理的有界语义复杂度

Paulo Akira F. Enabe

机构 * Escola Politénica University of São Paulo(圣保罗大学理工学院)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出Profile-Then-Reason框架,通过预设工作流和验证机制减少语言模型调用次数,提升工具增强推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28052 2026-03-31 cs.AI 70%

Meta-Harness: End-to-End Optimization of Model Harnesses

Meta-Harness:端到端优化模型Harness

Yoonho Lee, Roshen Nair, Qizheng Zhang, Kangwook Lee, Omar Khattab, Chelsea Finn

机构 * Stanford(斯坦福大学) KRAFTON MIT(麻省理工学院)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 本文提出Meta-Harness,通过自动搜索优化模型Harness代码,提升文本分类、数学推理和编程任务性能,减少上下文token使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22206 2026-03-24 cs.LG 70%

Chimera: Latency- and Performance-Aware Multi-agent Serving for Heterogeneous LLMs

Chimera:面向异构大语言模型的延迟与性能感知多智能体服务

Kangqi Ni, Wenyue Hua, Xiaoxiang Shi, Jiang Guo, Shiyu Chang, Tianlong Chen

机构 * University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft(微软) Carnegie Mellon University(卡内基梅隆大学) Amazon(亚马逊) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 Chimera通过语义路由和预测调度优化多智能体工作流服务,提升端到端延迟与任务性能,减少1.2-2.4倍延迟并提高8.0-9.5个百分点性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21475 2026-03-24 cs.AI 70%

Unified-MAS: Universally Generating Domain-Specific Nodes for Empowering Automatic Multi-Agent Systems

统一-MAS:通用领域节点生成以增强自动多智能体系统

Hehai Lin, Yu Yan, Zixuan Wang, Bo Xu, Sudong Wang, Weiquan Huang, Ruochen Zhao, Minzhi Li, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Institute for Infocomm Research (I 2 R), A*STAR(信息通信研究院(I2R),A*STAR)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出统一-MAS,通过离线节点合成解耦细粒度节点实现与拓扑编排,提升多智能体系统在知识密集型领域的性能与成本效益。

Comments Code is available at https://github.com/linhh29/Unified-MAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02833 2026-03-24 cs.LG 70%

TIC-GRPO: Provable and Efficient Optimization for Reinforcement Learning from Human Feedback

TIC-GRPO:基于人类反馈的强化学习优化的可证明和高效方法

Lei Pang, Jun Luo, Ruinan Jin

机构 * Peking University, Beijing, China(北京大学) The Ohio State University, Columbus, USA(俄亥俄州立大学) Shugu Yuntai Technology Co., Ltd.(舒guard云泰科技有限公司)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 本文提出TIC-GRPO算法,通过改进重要性采样方法,提升GRPO在人类反馈强化学习中的性能与收敛速度。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08916 2026-03-23 cs.CL 70%

HalluClean: A Unified Framework to Combat Hallucinations in LLMs

HalluClean:一种用于对抗大语言模型幻觉的统一框架

Yaxin Zhao, Yu Zhang

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 HalluClean通过规划、执行和修订三阶段推理增强方法,有效检测并修正LLM生成文本中的幻觉,提升事实一致性并优于基线方法。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(42), 36092-36100 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10357 2026-03-12 cs.NI cs.AI 70%

Utility Function is All You Need: LLM-based Congestion Control

效用函数就是一切:基于LLM的拥塞控制

Neta Rozen-Schiff, Liron Schiff, Stefan Schmid

专题命中 数学推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出GenCC框架,利用LLM生成代码能力设计拥塞控制效用函数,实验表明其在不同场景下可提升拥塞控制协议性能37%-142%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08727 2026-03-11 cs.AR cs.AI cs.DC cs.PF 70%

ARKV: Adaptive and Resource-Efficient KV Cache Management under Limited Memory Budget for Long-Context Inference in LLMs

ARKV:在有限内存预算下为LLMs长上下文推理实现自适应和资源高效的KV缓存管理

Jianlong Lei, Shashikant Ilager

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 ARKV通过动态分配精度级别,实现LLMs长上下文推理中的高效内存管理,减少内存使用并保持高精度。

Comments Accepted in ACM/IEEE CCGRID 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03512 2026-03-06 cs.CY cs.AI 70%

Baseline Performance of AI Tools in Classifying Cognitive Demand of Mathematical Tasks

AI工具在分类数学任务认知需求中的基准性能

Danielle S. Fox, Brenda L. Robles, Elizabeth DiPietro Brovey, Christian D. Schunn

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究评估了AI工具在分类数学任务认知需求的准确性,发现通用工具与教育专用工具均存在显著误差,需改进提示工程和工具开发。

Comments 30 pages, 2 tables, 5 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26585 2026-03-03 cs.MA cs.AI 70%

Stop Wasting Your Tokens: Towards Efficient Runtime Multi-Agent Systems

停止浪费你的令牌:迈向高效的运行时多智能体系统

Fulin Lin, Shaowen Chen, Ruishan Fang, Hongwei Wang, Tao Lin

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 SupervisorAgent通过运行时自适应监督框架减少多智能体系统中的令牌消耗,提升效率与鲁棒性。

Comments Accepted to ICLR 2026. The code is available at https://github.com/LINs-lab/SupervisorAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05629 2026-03-02 cs.LG 70%

On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification

在SFT的泛化上:从强化学习视角的奖励校正

Yongliang Wu, Yizhou Zhou, Zhou Ziheng, Yingzhe Peng, Xinyu Ye, Xinting Hu, Wenbo Zhu, Lu Qi, Ming-Hsuan Yang, Xu Yang

机构 * Southeast University(东南大学) University of California, Los Angeles(加州大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) Wuhan University(武汉大学) University of California, Merced(加州大学默塞德分校)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 本文提出动态微调方法,通过奖励校正提升SFT的泛化能力,在多个任务中表现优于传统SFT。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02377 2026-02-20 cs.CL 70%

Proof-RM: A Scalable and Generalizable Reward Model for Math Proof

Proof-RM: 一种可扩展且通用的数学证明奖励模型

Haotong Yang, Zitong Wang, Shijia Kang, Siqi Yang, Wenkai Yu, Xu Niu, Yike Sun, Yi Hu, Zhouchen Lin, Muhan Zhang

机构 * Peking University, Beijing, China(北京大学,北京,中国)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 Proof-RM通过构建可扩展的数据管道和训练证明检查奖励模型,提升LLM在数学证明验证中的准确性和泛化能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08344 2026-02-10 cs.AI 70%

OPE: Overcoming Information Saturation in Parallel Thinking via Outline-Guided Path Exploration

OPE:通过大纲引导路径探索克服并行思维中的信息饱和

Qi Guo, Jianing Wang, Deyang Kong, Xiangyu Xi, Jianfei Zhang, Yi Lu, Jingang Wang, Wei Wang, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University, Beijing, China(软件工程国家工程研究中心,北京大学,北京,中国)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 OPE通过生成多样化的推理大纲,减少信息冗余,提升并行思维在复杂问题中的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05933 2026-02-06 cs.LG 70%

Approximation of Log-Partition Function in Policy Mirror Descent Induces Implicit Regularization for LLM Post-Training

在策略镜像下降中近似对数分区函数诱导隐式正则化以提升LLM训练

Zhenghao Xu, Qin Lu, Changlong Yu, Tuo Zhao

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 PMD-mean通过近似对数分区函数实现隐式正则化,提升LLM训练的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏