arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 202 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 202 篇

2601.21522 2026-06-09 cs.LG cond-mat.dis-nn cs.AI stat.ML 版本更新 62%

More Bang for the Buck: Improving the Inference of Large Language Models at a Fixed Budget using Reset and Discard (ReD)

更高效利用预算:使用重置与丢弃(ReD)方法在固定预算下提升大型语言模型的推理性能

Sagi Meir, Tommer D. Keidar, Noam Levi, Shlomi Reuveni, Barak Hirshberg

机构 * School of Chemistry, Tel Aviv University(特拉维夫大学化学系) The Center for Physics and Chemistry of Living Systems, Tel Aviv University(特拉维夫大学生命系统物理与化学中心) School of Physics and Astronomy, Tel Aviv University(特拉维夫大学物理与天文学系) The Center for Computational Molecular and Materials Science, Tel Aviv University(特拉维夫大学计算分子与材料科学中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对固定预算下大型语言模型推理的收益递减问题,提出重置与丢弃(ReD)查询方法,通过优化尝试分配提升覆盖率,并在编码、数学和推理基准上验证了其成本节约效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06052 2026-06-09 cs.AI cs.CL 版本更新 62%

MixReasoning: Switching Modes to Think

MixReasoning: 切换模式以思考

Haiquan Lu, Gongfan Fang, Xinyin Ma, Qi Li, Xinchao Wang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出MixReasoning框架,动态调整推理深度,对困难步骤详细推理、简单步骤简洁推理,在GSM8K、MATH-500和AIME上缩短推理长度并提高效率,不牺牲准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00322 2026-06-09 cs.CL cs.AI cs.SE 版本更新 62%

Failure by Interference: Language Models Make Balanced Parentheses Errors When Faulty Mechanisms Overshadow Sound Ones

干扰导致的失败:当有缺陷机制掩盖健全机制时,语言模型在平衡括号任务中出错

Daking Rai, Samuel Miller, Kevin Moran, Ziyu Yao

机构 * George Mason University(乔治·马歇尔大学) University of Central Florida(中央佛罗里达大学) Department of Computer Science(计算机科学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示语言模型在平衡括号任务中出错的原因:部分组件实现可靠机制,而其他组件引入噪声,当噪声机制主导时导致错误。提出RASteer方法,通过增强可靠组件贡献,将部分模型准确率从0%提升至近100%,并在算术推理任务中取得约20%的性能提升。

Comments 23 pages, 10 figures, accepted for NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06127 2026-08-21 cs.AR cs.AI 版本更新 57%

PrefixAgent: An LLM-Powered Design Framework for Efficient Prefix Adder Optimization

PrefixAgent:一种基于大语言模型的高效前缀加法器优化设计框架

Dongsheng Zuo, Jiadong Zhu, Yang Luo, Yuzhe Ma

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对前缀加法器设计空间随位宽指数增长的优化难题,提出基于LLM的PrefixAgent框架,通过将任务拆分为两个子任务并利用等价图构建训练数据,在几乎所有配置下实现了更小的加法器面积,且在位宽更大时优势更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12756 2026-08-18 cs.LG 版本更新 57%

Closing the Loop: A Control-Theoretic Framework for Provably Stable Time Series Forecasting with LLMs

闭环:基于控制理论的具有可证明稳定性的时序预测框架与大语言模型

Xingyu Zhang, Jingyao Wang, Zeen Song, Changwen Zheng, Wenwen Qiang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出F-LLM框架,通过控制理论方法解决大语言模型在时序预测中的误差累积问题,提供理论保证并实验验证其有效性。

Comments Accepted by ACM MM26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08322 2026-08-14 cs.AI cs.HC math.CO 版本更新 57%

Agentic Neurosymbolic Collaboration for Mathematical Discovery: A Case Study in Combinatorial Design

代理神经符号协作用于数学发现:组合设计的一个案例研究

Hai Xia, Carla P. Gomes, Bart Selman, Stefan Szeider

机构 * Algorithms and Complexity Group, TU Wien(算法与复杂性组,维也纳技术大学) Department of Computer Science, Cornell University(计算机科学系,康奈尔大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过代理神经符号协作方法,在组合设计理论中发现了一个新的紧下界,展示了人类与AI协作在数学发现中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26690 2026-08-13 cs.LG 版本更新 57%

LoRAQuant: Mixed-Precision Quantization of LoRA to Ultra-Low Bits

LoRAQuant:将LoRA混合精度量化至超低比特

Amir Reza Mirzaei, Yuqiao Wen, Yanshuai Cao, Lili Mou

机构 * Dept. Computing Science & Alberta Machine Intelligence Institute (Amii), University of Alberta(计算科学系及阿尔伯塔人工智能研究所(Amii),阿尔伯塔大学) RBC Borealis Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 针对多LoRA适配器规模化部署的高存储成本问题,提出专为LoRA定制的混合精度后训练量化方法LoRAQuant,在LLaMA 2、Mistral模型的多任务上,以更低比特实现了相当或更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00422 2026-08-12 cs.AI 版本更新 57%

TrAC: Trace-Conditioned Answer Consistency for Efficient Uncertainty Quantification in LLMs

TrAC:用于大语言模型高效不确定性量化的轨迹条件答案一致性

Dahai Yu, Lin Jiang, Rongchao Xu, Guang Wang

机构 * Florida State University(佛罗里达州立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 针对大语言模型推理轨迹与答案不一致的问题,提出TrAC框架,结合主动与被动信号实现高效不确定性量化,在数学推理基准上提升了AUROC并降低了AURC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06296 2026-08-11 cs.LG 版本更新 57%

On-Policy Self-Distillation without Any Supervision

无任何监督的在线策略自蒸馏

Yijiang Li, Bingyang Wang, Yijun Liang, Yunjie Tian, Di Fu, Nuno Vasconcelos

机构 * UC San Diego(加州大学圣迭戈分校) Georgia Institute of Technology(佐治亚理工学院) University of Maryland, College Park(马里兰大学帕克分校) ByteDance(字节跳动)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本研究提出无监督在线策略自蒸馏(U-OPSD),仅用模型自身生成结果实现在线策略自蒸馏,在多数学基准上优于基础模型,部分场景超越OPSD、GRPO等监督方法。

Comments Project page at https://williamium3000.github.io/u-opsd/ and code at https://github.com/williamium3000/u-opsd

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06574 2026-08-11 cs.LG 版本更新 57%

Skip a Layer or Loop It? Learning Program-of-Layers in LLMs

跳过一层还是循环它?学习LLM中的层程序

Ziyue Li, Yang Li, Tianyi Zhou

机构 * Ziyue Li, Yang Li, Tianyi Zhou(李子悦、李阳、周天毅)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出PoLar方法,通过轻量级预测网络学习为每个输入动态跳过或重复预训练层,在数学推理任务上以更少层数提升准确率。

Comments Accepted at ICML 2026. Substantially extends arXiv:2507.07996. Updated DART-Math experiments by removing duplicate examples; conclusions remain unchanged. Code: https://github.com/tianyi-lab/PoLar

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04721 2026-08-06 cs.AI 版本更新 57%

AI Assistance Reduces Persistence and Hurts Independent Performance

人工智能辅助降低坚持性并损害独立表现

Grace Liu, Brian Christian, Tsvetomira Dumbalska, Michiel A. Bakker, Rachit Dubey

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学) Massachusetts Institute of Technology(麻省理工学院) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究发现人工智能辅助虽短期提升表现,但降低用户坚持性并损害独立完成任务的能力,尤其在数学推理和阅读理解等任务中表现显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19058 2026-08-06 cs.CL 版本更新 57%

MathDebugger: Detecting and Diagnosing Errors in Synthetic Mathematical Data

MathDebugger:检测与诊断合成数学数据中的错误

Hao Liang, Meiyi Qiang, Yuying Li, Zefeng He, Xiaochen Ma, Ruichuan An, Yongzhen Guo, Zhengzhou Zhu, Bin Cui, Wentao Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 MathDebugger是用于评估模型检测诊断合成数学数据错误的基准,含6000个标注实例,评估发现模型在该任务上表现不足,错误类型信息可提升修正效果,为数学数据质量控制提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26246 2026-08-04 cs.LG 版本更新 57%

Weak-to-Strong On-Policy Distillation

弱到强在线策略蒸馏

Fangxu Yu, Weijia Xu, Michael Xu, Tianyi Zhou, Zinan Lin

机构 * University of Maryland(马里兰大学) Microsoft Research(微软研究院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出W2S-OPD框架,从多个弱模型蒸馏提升强学生模型,在数学、代码基准测试中优于OPD,可让学生超越领域教师,监督源更弱时仍能提升性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22186 2026-08-04 cs.AI 版本更新 57%

Deconstructing Off-Policy Ratios: Entropy-Scaled Trust Regions for Asynchronous Reinforcement Learning

解构离策略比率:用于异步强化学习的熵缩放信任区域

Guanqun Zhao, Zijun Xie, Binbin Zheng, Enlei Gong, Jiafeng Lu, Yehan Yang, Aoqi Hu, Zeyu Chen

机构 * Baidu(百度)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究异步强化学习中离策略数据问题,提出熵缩放信任区域(ESTR)方法,通过令牌局部熵缩放离策略偏差,无需辅助前向传递等,在多任务和基准测试中优于现有异步方法,提升训练-推理一致性与速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21994 2026-08-04 cs.LG 版本更新 57%

Prefix-Guided On-Policy Distillation: Mining Golden Trajectories from Rollouts

前缀引导的在线策略蒸馏:从轨迹中挖掘黄金轨迹

Qingfei Zhao, Huan Song, Shuyu Tian, Jiawei Shao, Xuelong Li

机构 * TeleAI Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 针对在线策略蒸馏在长程数学推理中效率低、噪声大的问题,提出前缀引导的在线策略蒸馏,通过前缀长度估计轨迹价值,仅对高重叠候选继续生成长轨迹,在多个基准上提升准确率并减少训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23802 2026-08-03 cs.AI 版本更新 57%

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

从可验证奖励强化学习到自验证奖励强化学习:任务转换为开放式语言模型自我改进带来自验证奖励

Qinsi Wang, Jing Shi, Huazheng Wang, Kun Wan, Yiran Wu, Bo Liu, Qingyun Wu, Hai Helen Li, Yiran Chen, Handong Zhao, Wentian Zhao

机构 * Duke University(杜克大学) Adobe Inc.(奥多比公司) Oregon State University(俄勒冈州立大学) Pennsylvania State University(宾夕法尼亚州立大学) National University of Singapore(新加坡国立大学) Amazon(亚马逊)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对开放式LLM自我改进中奖励验证问题,提出基于任务转换的RLSVR方法,通过SpyRL实例化,在文本摘要等任务实验中,该方法在不可验证任务上优于现有方法,在可验证推理任务上有提升,扩展了基于RLVR的自我改进。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18622 2026-08-03 cs.CR cs.AI 版本更新 57%

CPInj: Uncovering Prompt Injection Risks in Textual Collaborative Prompt Optimization

CPInj:揭示文本协作式提示优化中的提示注入风险

Xinting Liao, Behnoosh Zamanlooy, Masoumeh Shafieinejad, David B. Emerson, Ruinan Jin, Deval Pandya, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) McMaster University(麦斯特大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究文本协作式提示优化(TCPO)中提示注入风险,提出协作式提示注入攻击CPInj,用恶意指令污染全局提示,降低下游任务性能,现有防御方法无效;还提出防御导向聚合方法APAgg,实验表明TCPO存在关键漏洞,攻击有待更强大防御。

Comments Accepted by COLM 2026 and AI4GOOD workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16140 2026-07-31 cs.LG 版本更新 57%

Noisy Data is Destructive to Reinforcement Learning with Verifiable Rewards

具有可验证奖励的强化学习中噪声数据是破坏性的

Yuxuan Zhu, Daniel Kang

机构 * Siebel School of Computing and Data Science, University of Illinois Urbana Champaign, USA(计算机与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 研究指出,现有RLVR算法无法缓解噪声影响,噪声会破坏强化学习性能,真实世界噪声导致Text2SQL任务准确率下降5-12%。

Comments 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24847 2026-07-30 math.NT cs.AI math.GR 版本更新 57%

Extremal Chowla sets and their linear analogues: A human-AI mathematical investigation using Co-Scientist

极值乔拉集及其线性类似物:使用联合科学家进行的人机数学研究

Mohsen Aliabadi, Keith Driscoll, Elliot Krop, Petar Sirkovic, Everett Sullivan, Elahe Vedadi

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究有限群和有限域扩张中与乔拉型序条件相关的极值不变量,通过专家指导的人机合作,利用联合科学家探索示例与策略,得出循环群、有限阿贝尔群及有限域扩张相关公式及结论。

Comments Minor typos have been corrected. Comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00045 2026-07-28 cs.AI cs.ET quant-ph 版本更新 57%

Universal Quantum Transformer

通用量子Transformer

Sungyong Chung, Alireza Talebpour

机构 * Grainger College of Engineering, Department of Civil and Environmental Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院土木与环境工程系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出通用量子Transformer(UQT),利用多量子比特系统的物理特性作为归纳偏置,通过参数化几何相位嵌入和SU(2)波干涉实现精确的数学和代数推理,在紧凑的5量子比特基板上完美学习循环模算术和非阿贝尔代数,并实现确定性泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18672 2026-07-24 cs.LG stat.ML 版本更新 57%

Concept Concentration for Faithful Representation Intervention

用于忠实表示干预的概念集中化

Hongzheng Yang, Yongqiang Chen, Zeyu Qin, Tongliang Liu, Chaowei Xiao, Kun Zhang, Bo Han

机构 * SAIC Centre, USYD(SAIC中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 研究大语言模型表示干预中定位忠实概念的问题,提出概念集中化(COCA)方法,通过重构训练数据简化决策边界,有效降低分布内和分布外越狱成功率,且在常规任务上保持性能。

Comments ICML'26; Hongzheng and Yongqiang contributed equally; project page: https://causalcoat.github.io/coca

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15841 2026-07-21 cs.AI 版本更新 57%

Heteroskedastic Signals in Budgeted LLM Verification: Structural Heterogeneity Limits Optimization Gains

预算受限LLM验证中的异方差信号:结构异质性限制了优化收益

Jinlong Yang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文发现LLM不确定性信号在预算受限验证中存在异方差性,导致全局分配扭曲;通过分层阈值干预(CST)在强异质性设置下提升命中率达17个百分点,揭示结构异质性是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07836 2026-07-16 cs.AI 版本更新 57%

Infinity-Parser2 Technical Report

Infinity-Parser2技术报告

Zuming Huang, Jun Huang, Kexuan Ren, Baode Wang, Weizhen Li, Jianming Feng, Yu Wang, Yichen Yao, Shijun Lin, Yige Tang, Cheng Peng, Weidi Xu, Wei Chu, Yinghui Xu, Yuan Qi

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 针对文档解析语料库稀缺问题,Infinity-Parser2结合可控数据合成与多任务强化学习。贡献包括构建合成引擎及开源语料库,引入多任务奖励系统,发布Infinity-Parser2-Flash和Infinity-Parser2-Pro两个变体,后者在多项任务中达先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14477 2026-07-16 cs.LG 版本更新 57%

Test-Time Learning with an Evolving Library

测试时学习与进化库

Weijia Xu, Alessandro Sordoni, Chandan Singh, Zelalem Gero, Michel Galley, Xingdi Yuan, Jianfeng Gao

机构 * Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 EvoLib通过维护知识库实现大语言模型在不同实例间积累和进化知识,无需参数更新或外部监督,提升数学推理、代码生成等任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00492 2026-07-15 cs.AI 版本更新 57%

Rethinking Reward Models for Multi-Domain Test-Time Scaling

重新思考多领域测试时扩展的奖励模型

Dong Bok Lee, Seanie Lee, Sangwoo Park, Minki Kang, Jinheon Baek, Dongki Kim, Dominik Wagner, Jiongdao Jin, Heejun Lee, Tobias Bocklet, Jinyu Wang, Jingjing Fu, Sung Ju Hwang, Jiang Bian, Lei Song

机构 * KAIST(韩国科学技术院) Microsoft Research Asia(微软亚洲研究院) TH Nürnberg

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究多领域测试时扩展的奖励模型,对四种奖励模型变体进行统一评估,发现dORM与dPRM相当,gPRM无竞争力,gORM最稳健,挑战细粒度监督更好的假设,支持生成式结果验证并公开代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03595 2026-07-13 cs.CL 版本更新 57%

Decoupling Task-Solving and Output Formatting in LLM Generation

在大语言模型生成中解耦任务解决与输出格式

Haikang Deng, Po-Nien Kung, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对大语言模型任务指令与格式要求交织致性能下降的问题,提出解耦框架Deco-G,将格式遵循委托给单独模块,引入指令感知蒸馏等三项创新,实验证明其优于基线方法,能保证格式符合。

Comments Update to the latest ACL published version and add a link to the released code

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), Association for Computational Linguistics, 2026, pp. 16764-16781

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26076 2026-07-10 cs.CL 版本更新 57%

IMProofBench: Benchmarking AI on Research-Level Mathematical Proof Generation

IMProofBench:在研究级数学证明生成上对人工智能进行基准测试

Johannes Schmitt, Gergely Bérczi, Jasper Dekoninck, Jeremy Feusi, Tim Gehrunger, Raphael Appenzeller, Pieter Belmans, Alessio Bottini, Jim Bryan, João Camarneiro, Ana Cannas da Silva, Niklas Canova, Ana-Maria Castravet, Timo de Wolff, Claudio Fontanari, Filippo Gaia, Baran Hashemi, Daniel Holmes, David Holmes, Aitor Iribar Lopez, Victor Jaeck, Martina Jørgensen, Steven Kelk, Martijn Kool, Stefan Kuhlmann, Adam Kurpisz, Johannes Lengler, Chiara Meroni, Ingmar Metzler, Martin Möller, Samuel Muñoz-Echániz, David Muñoz-Lahoz, Robert Nowak, Georg Oberdieck, Daniel Platt, Dylan Possamaï, Gabriel Ribeiro, Aluna Rizzoli, Daria Sakhanda, Raúl Sánchez Galán, Zheming Sun, Diaaeldin Taha, Josef Teichmann, Richard P. Thomas, Henk van der Pol, Michel van Garrel, Charles Vial, Ignacio Barros, Benjamin Doerr, Peter Grünwald, Henry Liu, David Martins, Aleksandar Mijatović, Sergej Monavari, Marc Roth, Patrick Schnider, Yannik Schuler, Pim Spelier, Yuuji Tanaka, Ronald van Luijk

机构 * ETH Zurich(苏黎世联邦理工学院) Aarhus University(奥胡斯大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 针对大语言模型数学能力评估,引入IMProofBench基准测试,由专家开发77个经同行评审问题,涵盖详细证明及子问题,模拟现实研究环境,结果显示当前LLMs能解决不少研究级问题,该基准测试将持续发展。

Comments v2: benchmark expanded from 39 to 77 problems; evaluation extended to 14 models including GPT-5.4, Gemini 3.1 Pro, and Claude Opus 4.6; new analyses (IRT-based score aggregation, inter-rater reliability, tool/token usage, non-agentic ablation); contributor author list updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21476 2026-07-09 cs.CL 版本更新 57%

Thinking Seeds: Leveraging Historical Diversity for Position-Aware RL in LLMs

思维种子:在语言模型中利用历史多样性进行位置感知强化学习

Lei Yang, Wei Bi, Chenxi Sun, Renren Jin, Deyi Xiong

机构 * TJUNLP Lab, College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院 TJUNLP 实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究语言模型在线强化学习问题,提出思维种子这一令牌级混合策略框架,利用模型历史检查点作离线前缀,通过令牌级重要性比率有效利用历史多样性,实验表明其性能优于标准在线训练和现有离线扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00860 2026-07-08 cs.LG 版本更新 57%

Policy Improvement Reinforcement Learning

策略改进强化学习

Huaiyang Wang, Xiaojie Li, Xiaohan Wang, Zhixia Zhang, Xiaodong Lu, Zixuan Huang, Jiajun Chai, Guojun Yin, Deqing Wang, Haoyi Zhou, Yaodong Yang, Jianxin Li, Yikun Ban

机构 * Beihang University(北航) Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 提出策略改进强化学习(PIRL)框架,通过最大化跨迭代的累积策略改进来替代替代奖励最大化,并基于此设计策略改进策略优化(PIPO)算法,实现闭环优化,在数学推理基准上提升稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00602 2026-07-07 cs.CL 版本更新 57%

OpenSIR: Open-Ended Self-Improving Reasoner

OpenSIR: 开放式自我改进推理器

Wai-Chung Kwan, Joshua Ong Jun Leang, Pavlos Vougiouklis, Jeff Z. Pan, Marco Valentino, Pasquale Minervini

机构 * University of Edinburgh(爱丁堡大学) Imperial College London(伦敦帝国理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出OpenSIR框架,通过多样性奖励和难度校准实现开放式自我对弈,无需外部验证器或标注数据,在七个数学基准上平均提升指令模型3.6分、推理模型3.1分,且唯一能泛化到通用推理。

详情

展开后加载摘要…

URL PDF HTML 收藏