arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45515 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3258 篇

2605.26849 2026-05-27 cs.CL 79%

Uncertainty-Aware Budget Allocation for Adaptive Test-Time Reasoning

不确定性感知的自适应测试时推理预算分配

Manh Nguyen, Sunil Gupta, Hung Le

机构 * Applied Artificial Intelligence Initiative(应用人工智能计划)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出不确定性感知预算分配(UAB)框架,通过基于每问题不确定性的凹整数优化重新分配固定采样预算,无需额外推理成本,在多个推理基准上提升准确率高达3-5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25384 2026-05-26 cs.CL 79%

GeoMathCode: Understanding Interleaved Math-Code Reasoning for Geometry Problem Solving

GeoMathCode: 理解几何问题求解中交织的数学-代码推理

Yingji Zhang, Yong Dai, André Freitas

机构 * Idiap Research Institute(Idiap研究 institute) X-Humanoid Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Cancer Biomarker Centre, CRUK Manchester Institute(癌症生物标志物中心,CRUK曼彻斯特研究所)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出GeoMathCode,通过程序化表示作为中间视觉输出,分析多模态大模型在几何问题中的推理与代码生成,发现推理与代码步骤在潜在空间可解耦,监督微调使推理流形更结构化,且层次化代码结构包含更多数学符号信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25065 2026-05-26 cs.AI 79%

Rewarding Structural Conformance of Reasoning using Process Mining

使用过程挖掘奖励推理的结构符合性

Yongjae Lee, Taekhyun Park, Sunghyun Sim, Hyerim Bae

机构 * Dept. of Industrial Engineering(工业工程系) Pusan National University(釜山国立大学) Dept. of Data Science(数据科学系) Changwon National University(昌原国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出TACReward奖励模型,利用过程挖掘技术聚合推理步骤的结构偏差,以改进稀疏奖励策略梯度方法在数学推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14958 2026-05-26 cs.CL 79%

MUR: Momentum Uncertainty guided Reasoning for Large Language Models

MUR: 面向大型语言模型的动量不确定性引导推理

Hang Yan, Fangzhi Xu, Rongman Xu, Yifei Li, Jian Zhang, Haoran Luo, Xiaobao Wu, Luu Anh Tuan, Haiteng Zhao, Qika Lin, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) VinUniversity(Vin大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出动量不确定性引导推理(MUR)方法,通过追踪和聚合逐步不确定性动态分配推理预算,并引入γ控制机制,在不额外训练的情况下减少冗余计算,在多个基准上平均减少45%以上计算量并提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22567 2026-05-22 cs.CL 79%

LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance

LANG: 用于多语言推理的强化学习与语言自适应提示引导

Yuchun Fan, Bei Li, Peiguang Li, Yilin Wang, Yongyu Mu, Jian Yang, Xin Chen, Rongxiang Weng, Jingang Wang, Xunliang Cai, Jingbo Zhu, Tong Xiao

机构 * NLP Lab, School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院自然语言处理实验室) Meituan Inc.(美团公司) NiuTrans Research, Shenyang, China(牛译研所)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出LANG框架,通过语言条件提示引导非英语推理任务的探索,解决了多语言环境下强化学习在输入语言一致性与推理质量之间的权衡问题,提升了推理性能而不影响语言一致性。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22211 2026-05-22 cs.AI 79%

CLORE: Content-Level Optimization for Reasoning Efficiency

CLORE:面向推理效率的内容级优化

Yuyang Wu, Qiyao Xue, Guanxing Lu, Weichen Liu, Zihan Wang, Manling Li, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学) Northwestern University(西北大学) University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) University of Pittsburgh(匹兹堡大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出CLORE框架,通过编辑正确在线轨迹来提升大语言模型的推理效率,通过外部增强模型删除冗余、不可读或无关内容,同时保留最终答案,并结合辅助参考-free DPO目标和标准策略梯度训练优化增强-原始对,实验表明CLORE在五个数学推理基准上提升了准确性和效率的平衡,并与GRPO、DAPO、Training Efficient和ThinkPrune兼容。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29735 2026-05-22 cs.AI 79%

Unveiling the Reasoning Process of Large Language Models

揭示大型语言模型的推理过程

Junjie Zhang, Zhen Shen, Xisong Dong, Gang Xiong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过分析Transformer层中注意力头和层的信息转换,揭示了大型语言模型在数学和符号推理任务中,中间层将token级信息转化为可重用的关联结构的核心机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19358 2026-05-20 cs.CL 79%

Taming the Thinker: Conditional Entropy Shaping for Adaptive LLM Reasoning

驯服思考者:面向自适应大语言模型推理的条件熵塑造

Shuyu Wei, Jian Sun, Delai Qiu, Yining Wang, Shengping Liu, Jiaen Liang, Ying Fu, Wei Huang, Jitao Sang

机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通大数据挖掘与具身智能重点实验室) Beijing Jiaotong University(北京交通大学) Unisound AI Technology Co., Ltd.(Unisound AI科技有限公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出条件熵塑造(CES)框架,通过动态控制token级响应熵,使大语言模型在简单问题上产生简洁解,在复杂问题上促进深入探索,从而平衡响应长度与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18500 2026-05-19 cs.CL 79%

Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning

隐式层次GRPO:将工具调用与执行解耦以实现工具集成的数学推理

Li Wang, Xiaohan Wang, Xiaodong Lu, Zipeng Zhang, Jinyang Wu, Jiajun Chai, Wei Lin, Guojun Yin

机构 * Meituan(美团) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出了一种将工具调用与执行解耦的方法,通过引入延迟执行和显式控制来增强工具集成推理能力,并提出了一个分层控制框架和理论推导出的替代损失函数,从而得到隐式分层策略,最终提出IH-GRPO算法,在六个跨领域数学推理基准测试中,Qwen3-1.7B、Qwen3-4B和Qwen3-8B在最强基线方法上分别实现了1.87%、2.16%和2.53%的绝对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17958 2026-05-19 cs.LG cs.PL 79%

Enhancing the Code Reasoning Capabilities of LLMs via Consistency-based Reinforcement Learning

通过基于一致性的强化学习增强大语言模型的代码推理能力

Zhanyue Qin, Jia Feng, Yibo Lyu, Yun Peng, Dianbo Sui, Cuiyun Gao, Qing Liao

机构 * Harbin Institute of Technology(哈尔滨工业大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出CodeThinker框架,通过一致性驱动的强化学习方法提升大语言模型的代码推理能力,实验表明其在多个基准测试中表现优异,显著提升了代码生成和数学推理任务的准确性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16727 2026-05-19 cs.AI 79%

PopuLoRA: Co-Evolving LLM Populations for Reasoning Self-Play

PopuLoRA: 为推理自博弈的协同进化LLM种群

Roger Creus Castanyer, Geoffrey Bradway, Lorenz Wolf, Maxwill Lin, Augustine N. Mavor-Parker, Matthew James Sargent

机构 * Absolute Zero Reasoner(绝对零理由器) LoRA adapters(LoRA适配器)

专题命中 数学推理 :reasoning(title);verifier(abstract);分类 cs.AI

AI总结 本文提出PopuLoRA,一种基于种群的非对称自博弈框架,用于强化学习中可验证奖励(RLVR)的后训练LLM。通过专门的LoRA适配器在共享冻结基座上进行教师和学生分工,教师提出问题,学生在程序验证器下解决,不同亚种群间的交叉评估取代了限制单智能体自博弈的自我校准。LoRA权重空间进化算子家族作为7B规模种群训练循环的替代步骤,实现了种群的协同进化竞赛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17831 2026-05-19 cs.AI 79%

The Token Games: Evaluating Language Model Reasoning with Puzzle Duels

令牌游戏:通过谜题对决评估语言模型推理能力

Simon Henniger, Gabriel Poesia

机构 * Harvard University(哈佛大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文设计了令牌游戏(TTG)评估框架,通过模型自创谜题进行对决,利用Elo评分比较模型能力,验证了10个前沿模型的推理能力,且无需人工参与谜题创作。

Comments Project website: https://token-games.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19069 2026-05-18 cs.AI 79%

Asking the Right Questions: Improving Reasoning with Generated Stepping Stones

问对问题:通过生成的中间步骤提升推理能力

Hengyuan Hu, Tingchen Fu, Minqi Jiang, Alexander H Miller, Yoram Bachrach, Jakob Nicolaus Foerster

机构 * FAIR at Meta(Meta的FAIR) Stanford University(斯坦福大学) University of Oxford(牛津大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了生成中间步骤对提升LLM推理能力的作用,提出ARQ框架通过生成问题增强推理过程,展示了生成问题的有效性和训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15778 2026-05-18 cs.CL 79%

Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR

稳定知识,促进推理:双令牌约束用于RLVR

Jiakang Wang, Runze Liu, Fuzheng Zhang, Xiu Li, Guorui Zhou, Ling Pan

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Kuaishou Technology(快手科技) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Archer框架,通过双令牌约束在RLVR中平衡优化,提升LLM的推理和知识保持能力,实验显示在数学推理和代码生成任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13338 2026-05-15 cs.CR cs.AI 79%

Inducing Overthink: Hierarchical Genetic Algorithm-based DoS Attack on Black-Box Large Language Reasoning Models

诱导过度思考:基于分层遗传算法的黑盒大语言推理模型DoS攻击

Shuqiang Wang, Wei Cao, Jiaqi Weng, Jialing Tao, Licheng Pan, Hui Xue, Zhixuan Chu

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种基于分层遗传算法的黑盒攻击方法,通过系统扰动输入问题的逻辑结构,诱导大语言模型产生过度思考,从而引发资源耗尽攻击。

Comments Accepted at ICML 2026. Code available at: https://github.com/EndlessCao/Overthink-HGA

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026), PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11636 2026-05-13 cs.AI 79%

Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning

Seirênes:具有演变干扰的对抗自博弈用于LLM推理

Chi Zhang, Haibo Qiu, Qiming Zhang, Yufei Xu, Xinbo Gao, Jing Zhang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Independent Researchers(独立研究者) Xidian University(西安电子科技大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Seirênes通过对抗自博弈框架将LLM推理中的上下文干扰转化为训练信号,提升推理鲁棒性,在多个数学推理基准测试中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09879 2026-05-12 cs.AI 79%

M2A: Synergizing Mathematical and Agentic Reasoning in Large Language Models

M2A:在大型语言模型中协同数学与代理推理

Junjian Wang, Xin Zhou, Qiran Xu, Kun Zhan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Li Auto Inc.(Li Auto公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出M2A框架,通过模型融合协同数学与代理推理,提升多任务学习下的推理稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09548 2026-05-12 cs.CL 79%

Crosslingual On-Policy Self-Distillation for Multilingual Reasoning

跨语言在线策略自蒸馏用于多语言推理

Yihong Liu, Raoyuan Zhao, Michael A. Hedderich, Hinrich Schütze

机构 * Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出COPSD方法,通过将高资源语言的推理行为迁移到低资源语言,提升多语言推理能力,实验显示其在17种低资源非洲语言上表现优异,优于GRPO。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09292 2026-05-12 cs.AI cs.CY 79%

Beyond Accuracy: Evaluating Strategy Diversity in LLM Mathematical Reasoning

超越准确性:评估大语言模型数学推理中的策略多样性

Xia Yang, Xuanyi Zhang, Hao Hu, Feng Ji

机构 * University of Toronto(多伦多大学) Upper Canada College(上加拿大学院) East China Normal University(华东师范大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究探讨了大语言模型在数学推理中策略多样性与准确性之间的关系,发现策略多样性是评估数学推理的重要补充维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27977 2026-05-12 cs.AI 79%

SARL: Label-Free Reinforcement Learning by Rewarding Reasoning Topology

SARL:通过奖励推理拓扑实现无标签强化学习

Yifan Wang, Bolian Li, David Cho, Ruqi Zhang, Fanping Sui, Ananth Grama

机构 * Purdue University(普渡大学) Texas Instruments(德州仪器)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SARL框架,通过奖励推理拓扑而非最终结果来提升大模型的推理能力,在可验证数学任务和非可验证开放任务中均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10960 2026-05-12 cs.LG math.ST stat.TH 79%

Ranking Reasoning LLMs under Test-Time Scaling

在测试时间扩展下对推理LLM进行排名

Mohsen Hariri, Michael Hinczewski, Jing Ma, Vipin Chaudhary

机构 * Department of Computer and Data Sciences(计算机与数据科学系) Department of Physics(物理系) Case Western Reserve University(凯斯西储大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出Scorio库,通过统计排名方法评估推理模型,在20个数学竞赛基准上验证了多种排名方法的有效性,并展示了在不同测试时间扩展下的性能。

Comments Code is available at https://github.com/mohsenhariri/scorio

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics (ACL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08061 2026-05-11 cs.AI 79%

Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning

基于评分标准的强化学习:用于通用推理的结构化评判奖励

Manish Bhattarai, Ismael Boureima, Nishath Rajiv Ranasinghe, Scott Pakin, Dan O'Malley

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出基于评分标准的强化学习框架,通过LLM评判器生成多标准奖励,提升模型在通用推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07316 2026-05-11 cs.AI 79%

Implicit Compression Regularization: Concise Reasoning via Internal Shorter Distributions in RL Post-Training

隐式压缩正则化:通过内部更短分布实现简洁推理(在强化学习后训练)

Chen Wang, Hexuan Deng, Yining Zhang, Yuchen Zhang, Jionghao Bai, Zhaochun Li, Ge Lan, Yue Wang

机构 * College of Software, Nankai University(南开大学软件学院) Zhongguancun Academy(中关村学院) Harbin Institute of Technology(哈尔滨工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) East China Normal University(华东师范大学) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出隐式压缩正则化(ICR),通过内部更短分布实现简洁推理,改进强化学习后训练中的推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24832 2026-04-28 cs.AI 79%

Scheduling Your LLM Reinforcement Learning with Reasoning Trees

用推理树调度你的LLM强化学习

Hong Wang, Zhezheng Hao, Jian Luo, Chenxing Wei, Yao Shu, Lei Liu, Qiang Lin, Hande Dong, Jiawei Chen

机构 * Cranberry-Lemon University(Cranberry-Lemon 大学) University of the Witwatersrand(独立研究者) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出基于推理树结构的Re-Schedule算法,通过r-score衡量查询难度,提升数据效率和准确性,实验显示在数学推理任务中平均准确率提升3.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23623 2026-04-28 cs.AI 79%

Tandem: Riding Together with Large and Small Language Models for Efficient Reasoning

Tandem: 大小语言模型协同以实现高效的推理

Zichuan Fu, Xian Wu, Guojing Li, Yejing Wang, Yijun Chen, Zihao Zhao, Yixuan Luo, Hanyu Yan, Yefeng Zheng, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯Jarvis实验室) Renmin University of China(中国人民大学) Westlake University(西湖大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Tandem通过结合大语言模型和小语言模型,减少计算成本并提升推理质量,实验表明其在数学推理和代码生成任务中性能优越。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21321 2026-04-28 cs.AI 79%

LLM-Assisted Op-Amp Behavioral-Level Design via Agentic Human-Mimicking Reasoning

通过代理人类模拟推理的LLM辅助运算放大器行为级设计

Zihao Chen, Ziyi Sun, Jiayin Wang, Ji Zhuang, Jinyi Shen, Xiaoyue Ke, Li Shang, Xuan Zeng, Fan Yang

机构 * State Key Laboratory of Integrated Chips and Systems(集成芯片与系统国家重点实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出White-Op框架,利用大语言模型代理的类人推理能力,实现运算放大器行为级参数设计,通过符号推理与数值求解分离方法,结合模拟验证和迭代优化,提升设计可解释性与电路功能保持性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14368 2026-04-28 cs.CL 79%

Beyond Math: Stories as a Testbed for Memorization-Constrained Reasoning in LLMs

超越数学:故事作为LLM中受记忆限制推理的测试平台

Yuxuan Jiang, Francis Ferraro

机构 * Department of Computer Science and Electrical Engineering(计算机科学与电气工程系) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过故事测试平台探讨LLM在记忆受限推理中的表现,提出减少机械记忆的方法,发现记忆驱动性能下降,揭示现有基准测试的数据污染问题。

Comments published on EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05038 2026-04-27 cs.CL 79%

Toward Automated Robustness Evaluation of Mathematical Reasoning

迈向数学推理的自动化鲁棒性评估

Yutao Hou, Zeguan Xiao, Fei Yu, Yihan Jiang, Ma Shuguang, Zhaoqian Dai, Hailiang Huang, Yun Chen, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海金融学院) Ant Group(蚂蚁集团) Southern University of Science and Technology(南方科技大学) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济学交叉学科研究教育部重点实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Math Stress Tester框架,通过多轮重写验证循环生成对抗样本,提升数学推理任务的鲁棒性评估能力,并验证其在非数学任务中的扩展性。

Comments Accepted by Findings of ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07527 2026-04-23 cs.LG 79%

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning

卡尔曼滤波增强的GRPO用于基于强化学习的语言模型推理

Hu Wang, Congbo Ma, Ian Reid, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出KRPO,通过卡尔曼滤波估计潜在提示级奖励基线,提升语言模型推理的训练奖励和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19567 2026-04-22 cs.AI 79%

Multi-modal Reasoning with LLMs for Visual Semantic Arithmetic

基于LLM的多模态推理用于视觉语义算术

Chuou Xu, Liya Ji, Qifeng Chen

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出两种新型任务和IRPD数据集,通过SAri-RFT方法提升大视觉语言模型的跨模态关系推理能力,实现视觉语义算术的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏