arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3227 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3227 篇

2606.07190 2026-06-08 cs.CL 新提交 79%

From Correctness to Utility: Gain-Based Prefix Evaluation for LLM Reasoning

从正确性到效用:基于增益的LLM推理前缀评估

Yuhang Zhou, Yixin Cao, Guangnan Ye

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出前缀增益概念,训练前缀效用模型(PUM)通过成对排序目标评估推理前缀对成功率的提升,在数学推理任务中优于传统正确性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06745 2026-06-08 cs.CL 新提交 79%

When to Think Deeply: Inhibitory Deliberation for LLM Reasoning

何时深度思考:用于LLM推理的抑制性深思

Zhixuan He, Yue Feng

机构 * University of Birmingham, United Kingdom(英国伯明翰大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出IDPR框架,通过抑制控制器根据快速答案决定是否启动慢速推理,在数学推理测试集上仅调用8.20%的慢速推理,准确率从47.90%提升至48.92%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06252 2026-06-05 cs.AI 79%

Closing the Loop on Latent Reasoning via Test-Time Reconstruction

通过测试时重建实现潜在推理的闭环

Xiaopeng Yuan, Haibo Jin, Ye Yu, Peng Kuang, Lijun Yu, Yushun Dong, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌) Florida State University(佛罗里达州立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出ReLAT方法,利用自监督测试时训练通过查询重建损失优化潜在状态,实现潜在推理的闭环,提升数学推理、知识问答和代码生成的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03606 2026-06-04 cs.CR cs.AI 79%

Testing LLM Arithmetic Reasoning Generalization with Automatic Numeric-Remapping Attacks

测试大语言模型算术推理泛化能力:自动数值重映射攻击

Malia Barker, Bishal Lakha, Edoardo Serra, Francesco Gullo

机构 * Department of Computer Science, Boise State University(计算机科学系,博伊州立大学) University of L’Aquila(拉奎拉大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出自动数值重映射攻击算法,通过保持推理程序的小数值变化测试LLM算术推理鲁棒性,发现GSM8K上准确率下降12-26个百分点,而MAWPS和MultiArith更稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09803 2026-06-04 cs.LG 79%

Good Reasoning Makes Good Demonstrations: Implicit Reasoning Quality Supervision via In-Context Reinforcement Learning

好的推理产生好的示范:通过上下文强化学习进行隐式推理质量监督

Tiehua Mei, Minxuan Lv, Leiyu Pan, Zhenpeng Su, Hongru Hou, Hengrui Chen, Ao Xu, Deqing Yang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) University of Chinese Academy of Sciences(中国科学院大学) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 提出In-Context RLVR方法,利用策略模型自身的上下文学习能力衡量示范效用(Demonstration Utility),通过隐式奖励加权提升推理质量和准确性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03234 2026-06-03 cs.LG 79%

Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning

正确即力量:对齐验证的隐藏状态增强强化学习推理

Ziyue Wang, Aomufei Yuan, Yongfu Zhu, Shuai Dong, Wenpu Liu, Yiran Yao, Weichu Xie, Yuqi Xu, Caoyuan Ma, Wenqi Shao, Xiaoying Zhang, Nan Duan, Jiaqi Wang

机构 * Peking University(北京大学) JINGDONG(京东) Shanghai Innovation Institute(上海创新研究院) The University of Tokyo(东京大学) Tianjin University(天津大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 提出Hidden-Align辅助损失函数,在强化学习训练中对齐正确rollout在锚点token处的最后一层隐藏状态,提升数学推理性能。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17708 2026-06-03 cs.AI 79%

Co-evolving Agent Architectures and Interpretable Reasoning for Automated Optimization

协同进化智能体架构与可解释推理用于自动化优化

Jiahao Huang, Peilan Xu, Xiaoya Nan, Wenjian Luo

机构 * School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院) Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies, Institute of Cyberspace Security, School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出EvoOR-Agent协同进化框架,通过将智能体工作流表示为活动边网络,并利用图介导的路径条件重组、多粒度语义变异和精英种群更新,实现自动化优化中的自适应协调与可解释推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00532 2026-06-02 cs.AI 79%

KACE: Knowledge-Adaptive Context Engineering for Mathematical Reasoning

KACE: 知识自适应上下文工程用于数学推理

Jayant Parashar, Suchendra M. Bhandarkar

机构 * School of Computing, University of Georgia(计算学院,佐治亚大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出KACE方法,通过难度和领域分层的知识库与分层自一致性,解决数学推理中上下文膨胀问题,在AIME 2025上达到62.2%准确率。

Comments 9 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01914 2026-06-01 cs.LG 79%

Towards Long-Horizon Interpretability: Efficient and Faithful Multi-Token Attribution for Reasoning LLMs

面向长程可解释性:高效且忠实的多Token归因用于推理大语言模型

Wenbo Pan, Zhichao Liu, Xianlong Wang, Haining Yu, Xiaohua Jia

机构 * Department of Computer Science, City University of Hong Kong, Hong Kong SAR, China(香港城市大学计算机科学系) Harbin Institute of Technology, Harbin, China(哈尔滨工业大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 提出FlashTrace方法,通过跨跨度聚合和递归归因机制,在长上下文推理中实现高效且忠实的多Token归因,速度提升超130倍。

Comments Accepted as an Oral paper at ICML 2026. Code available at https://github.com/wbopan/flashtrace

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18760 2026-06-01 cs.AI cs.FL 79%

HERMES: Towards Efficient and Verifiable Mathematical Reasoning in LLMs

HERMES: 迈向高效且可验证的LLM数学推理

Azim Ospanov, Zijin Feng, Jiacheng Sun, Haoli Bai, Xin Shen, Farzan Farnia

机构 * Department of Computer Science \& Engineering, The Chinese University of Hong Kong Huawei Foundation Model Department

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出Hermes框架,通过将非正式推理与Lean形式化验证交替结合,并引入中间形式化检查和记忆模块,在提升推理准确性的同时显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21235 2026-05-29 cs.CL 79%

LamPO: A Lambda Style Policy Optimization for Reasoning Language Models

LamPO: 一种用于推理语言模型的Lambda风格策略优化

Redacted by arXiv

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出LamPO方法,通过成对分解优势函数和置信度加权,改进基于可验证奖励的强化学习在推理语言模型中的信用分配和训练稳定性。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission. Author list and submitter name redacted due to disputed authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10520 2026-05-29 cs.LG 79%

Prioritize the Process, Not Just the Outcome: Rewarding Latent Thought Trajectories Improves Reasoning in Looped Language Models

优先过程而非结果:奖励潜在思维轨迹改善循环语言模型的推理能力

Jonathan Williams, Esin Tureci

机构 * Department of Computer Science, Princeton University, Princeton NJ, U.S.A(普林斯顿大学计算机科学系)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 针对循环语言模型(LoopLM)中标准强化学习(如GRPO)仅奖励最终潜在状态导致推理改进失败的问题,提出RLTT框架,通过在整个潜在推理轨迹上分配奖励实现密集的轨迹级信用分配,显著提升数学推理性能并泛化至非数学任务。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28389 2026-05-28 cs.CL 79%

FABSVer: Faster Training and Better Self-Verification for LLM Mathematical Reasoning

FABSVer: 更快的训练与更好的自验证用于大语言模型数学推理

Haihui Pan, Junwei Bao, Hongfei Jiang, Yang Song

机构 * Zuoyebang Education Technology(左岳邦教育科技)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出FABSVer方法,通过融合解生成与自验证为单次前向传播,并引入动态参考模型更新(DRMU)突破奖励瓶颈,在三个模型规模上实现更优的自验证与推理性能,训练时间仅为现有方法的51%-71%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28028 2026-05-28 cs.LG 79%

BPPO: Binary Prefix Policy Optimization for Efficient GRPO-Style Reasoning RL with Concise Responses

BPPO: 二元前缀策略优化用于高效GRPO式推理强化学习与简洁响应

Qingfei Zhao, Huan Song, Shuyu Tian, Jiawei Shao, Xuelong Li

机构 * TeleAI Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 针对GRPO更新成本高且易产生冗长推理的问题,提出BPPO方法,通过仅使用最短正确和错误完成作为更新单元并聚焦前缀优化,实现6倍加速并缩短30-50%响应长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27715 2026-05-28 cs.CL 79%

Beyond Input Understanding: Diagnosing Multilingual Mathematical Reasoning with Directed Acyclic Trace Graphs

超越输入理解:使用有向无环迹图诊断多语言数学推理

Jiaqiao Zhang, Zhoujun Li, Raoyuan Zhao, Jian Lan, Thomas Seidl, Michael A. Hedderich, Hinrich Schütze, Yihong Liu

机构 * Southwest University(西南大学) LMU Munich(慕尼黑莱茵-瓦尔德大学) MCML

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出有向无环迹图(DATG)框架,通过将推理迹映射到与语言无关的数学锚点和依赖关系,诊断多语言数学推理中的语言影响,并设计Loop-Retry和Formula-Retry两种测试时控制方法改善低资源语言性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27712 2026-05-28 cs.AI 79%

Prefix-Safe Bayesian Belief Tracking for LLM Reasoning Reliability:Separating Calibration from Ranking

前缀安全贝叶斯信念追踪用于LLM推理可靠性:将校准与排序分离

Zhenghan Song, Yunyi Li, Yulong Liu

机构 * Cornell University(康奈尔大学) Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出前缀安全贝叶斯信念追踪(SBBT)框架,通过分离概率质量与排序能力,在长链推理中实现可靠的在线校准与不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27570 2026-05-28 cs.AI 79%

LaneRoPE: Positional Encoding for Collaborative Parallel Reasoning and Generation

LaneRoPE: 用于协同并行推理与生成的位置编码

Gabriele Cesa, Thomas Hehn, Aleix Torres-Camps, Àlex Batlle Casellas, Jordi Ros-Giralt, Arash Behboodi, Tribhuvanesh Orekondy

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出LaneRoPE方法,通过序列间注意力掩码和扩展的RoPE位置编码,使多个序列在生成时协同合作,提升数学推理任务在有限生成长度下的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21128 2026-05-28 cs.AI 79%

RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs

RL 压缩,SFT 扩展:推理型大语言模型的比较研究

Kohsei Matsutani, Shota Takashiro, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过轨迹级和步骤级分析框架,比较了强化学习(RL)和监督微调(SFT)对数学推理大语言模型推理路径的影响,发现RL压缩错误轨迹并集中推理功能,而SFT扩展正确轨迹并均匀化推理功能。

Comments Accepted at ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26849 2026-05-27 cs.CL 79%

Uncertainty-Aware Budget Allocation for Adaptive Test-Time Reasoning

不确定性感知的自适应测试时推理预算分配

Manh Nguyen, Sunil Gupta, Hung Le

机构 * Applied Artificial Intelligence Initiative(应用人工智能计划)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出不确定性感知预算分配(UAB)框架,通过基于每问题不确定性的凹整数优化重新分配固定采样预算,无需额外推理成本,在多个推理基准上提升准确率高达3-5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25384 2026-05-26 cs.CL 79%

GeoMathCode: Understanding Interleaved Math-Code Reasoning for Geometry Problem Solving

GeoMathCode: 理解几何问题求解中交织的数学-代码推理

Yingji Zhang, Yong Dai, André Freitas

机构 * Idiap Research Institute(Idiap研究 institute) X-Humanoid Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Cancer Biomarker Centre, CRUK Manchester Institute(癌症生物标志物中心,CRUK曼彻斯特研究所)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出GeoMathCode,通过程序化表示作为中间视觉输出,分析多模态大模型在几何问题中的推理与代码生成,发现推理与代码步骤在潜在空间可解耦,监督微调使推理流形更结构化,且层次化代码结构包含更多数学符号信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25065 2026-05-26 cs.AI 79%

Rewarding Structural Conformance of Reasoning using Process Mining

使用过程挖掘奖励推理的结构符合性

Yongjae Lee, Taekhyun Park, Sunghyun Sim, Hyerim Bae

机构 * Dept. of Industrial Engineering(工业工程系) Pusan National University(釜山国立大学) Dept. of Data Science(数据科学系) Changwon National University(昌原国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出TACReward奖励模型,利用过程挖掘技术聚合推理步骤的结构偏差,以改进稀疏奖励策略梯度方法在数学推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14958 2026-05-26 cs.CL 79%

MUR: Momentum Uncertainty guided Reasoning for Large Language Models

MUR: 面向大型语言模型的动量不确定性引导推理

Hang Yan, Fangzhi Xu, Rongman Xu, Yifei Li, Jian Zhang, Haoran Luo, Xiaobao Wu, Luu Anh Tuan, Haiteng Zhao, Qika Lin, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) VinUniversity(Vin大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出动量不确定性引导推理(MUR)方法,通过追踪和聚合逐步不确定性动态分配推理预算,并引入γ控制机制,在不额外训练的情况下减少冗余计算,在多个基准上平均减少45%以上计算量并提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22567 2026-05-22 cs.CL 79%

LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance

LANG: 用于多语言推理的强化学习与语言自适应提示引导

Yuchun Fan, Bei Li, Peiguang Li, Yilin Wang, Yongyu Mu, Jian Yang, Xin Chen, Rongxiang Weng, Jingang Wang, Xunliang Cai, Jingbo Zhu, Tong Xiao

机构 * NLP Lab, School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院自然语言处理实验室) Meituan Inc.(美团公司) NiuTrans Research, Shenyang, China(牛译研所)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出LANG框架,通过语言条件提示引导非英语推理任务的探索,解决了多语言环境下强化学习在输入语言一致性与推理质量之间的权衡问题,提升了推理性能而不影响语言一致性。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22211 2026-05-22 cs.AI 79%

CLORE: Content-Level Optimization for Reasoning Efficiency

CLORE:面向推理效率的内容级优化

Yuyang Wu, Qiyao Xue, Guanxing Lu, Weichen Liu, Zihan Wang, Manling Li, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学) Northwestern University(西北大学) University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) University of Pittsburgh(匹兹堡大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出CLORE框架,通过编辑正确在线轨迹来提升大语言模型的推理效率,通过外部增强模型删除冗余、不可读或无关内容,同时保留最终答案,并结合辅助参考-free DPO目标和标准策略梯度训练优化增强-原始对,实验表明CLORE在五个数学推理基准上提升了准确性和效率的平衡,并与GRPO、DAPO、Training Efficient和ThinkPrune兼容。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29735 2026-05-22 cs.AI 79%

Unveiling the Reasoning Process of Large Language Models

揭示大型语言模型的推理过程

Junjie Zhang, Zhen Shen, Xisong Dong, Gang Xiong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过分析Transformer层中注意力头和层的信息转换,揭示了大型语言模型在数学和符号推理任务中,中间层将token级信息转化为可重用的关联结构的核心机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19358 2026-05-20 cs.CL 79%

Taming the Thinker: Conditional Entropy Shaping for Adaptive LLM Reasoning

驯服思考者:面向自适应大语言模型推理的条件熵塑造

Shuyu Wei, Jian Sun, Delai Qiu, Yining Wang, Shengping Liu, Jiaen Liang, Ying Fu, Wei Huang, Jitao Sang

机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通大数据挖掘与具身智能重点实验室) Beijing Jiaotong University(北京交通大学) Unisound AI Technology Co., Ltd.(Unisound AI科技有限公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出条件熵塑造(CES)框架,通过动态控制token级响应熵,使大语言模型在简单问题上产生简洁解,在复杂问题上促进深入探索,从而平衡响应长度与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18500 2026-05-19 cs.CL 79%

Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning

隐式层次GRPO:将工具调用与执行解耦以实现工具集成的数学推理

Li Wang, Xiaohan Wang, Xiaodong Lu, Zipeng Zhang, Jinyang Wu, Jiajun Chai, Wei Lin, Guojun Yin

机构 * Meituan(美团) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出了一种将工具调用与执行解耦的方法,通过引入延迟执行和显式控制来增强工具集成推理能力,并提出了一个分层控制框架和理论推导出的替代损失函数,从而得到隐式分层策略,最终提出IH-GRPO算法,在六个跨领域数学推理基准测试中,Qwen3-1.7B、Qwen3-4B和Qwen3-8B在最强基线方法上分别实现了1.87%、2.16%和2.53%的绝对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17958 2026-05-19 cs.LG cs.PL 79%

Enhancing the Code Reasoning Capabilities of LLMs via Consistency-based Reinforcement Learning

通过基于一致性的强化学习增强大语言模型的代码推理能力

Zhanyue Qin, Jia Feng, Yibo Lyu, Yun Peng, Dianbo Sui, Cuiyun Gao, Qing Liao

机构 * Harbin Institute of Technology(哈尔滨工业大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出CodeThinker框架,通过一致性驱动的强化学习方法提升大语言模型的代码推理能力,实验表明其在多个基准测试中表现优异,显著提升了代码生成和数学推理任务的准确性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16727 2026-05-19 cs.AI 79%

PopuLoRA: Co-Evolving LLM Populations for Reasoning Self-Play

PopuLoRA: 为推理自博弈的协同进化LLM种群

Roger Creus Castanyer, Geoffrey Bradway, Lorenz Wolf, Maxwill Lin, Augustine N. Mavor-Parker, Matthew James Sargent

机构 * Absolute Zero Reasoner(绝对零理由器) LoRA adapters(LoRA适配器)

专题命中 数学推理 :reasoning(title);verifier(abstract);分类 cs.AI

AI总结 本文提出PopuLoRA,一种基于种群的非对称自博弈框架,用于强化学习中可验证奖励(RLVR)的后训练LLM。通过专门的LoRA适配器在共享冻结基座上进行教师和学生分工,教师提出问题,学生在程序验证器下解决,不同亚种群间的交叉评估取代了限制单智能体自博弈的自我校准。LoRA权重空间进化算子家族作为7B规模种群训练循环的替代步骤,实现了种群的协同进化竞赛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17831 2026-05-19 cs.AI 79%

The Token Games: Evaluating Language Model Reasoning with Puzzle Duels

令牌游戏:通过谜题对决评估语言模型推理能力

Simon Henniger, Gabriel Poesia

机构 * Harvard University(哈佛大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文设计了令牌游戏(TTG)评估框架,通过模型自创谜题进行对决,利用Elo评分比较模型能力,验证了10个前沿模型的推理能力,且无需人工参与谜题创作。

Comments Project website: https://token-games.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏