arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 290 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 290 篇

2607.18026 2026-07-21 cs.AI 新提交 57%

Rethinking Heterogeneous LLM Merging: A Weighted Model Averaging Perspective

重新思考异构语言模型合并:加权模型平均视角

Jiahe Fan, Yinghao Hou, Si Chen, Aiyuan Zhang, Hong Xie, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究异构语言模型合并问题,通过无训练的维度适配和比率控制插值,在联合式与交叉式合并中进行实验,结果表明简单参数平均结合轻量级适配和比率控制是强大基线,揭示直接加权融合的限制及对复杂方法的制约。

Comments 17 pages, 3 figures, 20 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16704 2026-07-21 cs.CL 新提交 57%

Though Language Models Err While They Strive: Conformal Prediction for Self-Correcting Scientific Generation

尽管语言模型在努力时会出错:用于自我纠正科学生成的共形预测

Mingqiao Mo, Yunlong Tan, Hao Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对大语言模型生成技术内容常违反科学原理的问题,提出图结构共形预测框架SFC,将科学推理分解为单元,考虑逻辑依赖,通过实时验证和动态分支纠错,在多基准测试中表现出色,提升准确率、有效性并减少定律违反。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16209 2026-07-21 cs.AI 新提交 57%

Shapley Context Pruning: A Cooperative Game Perspective for Context Reranking and Pruning

Shapley上下文剪枝:一种用于上下文重排和剪枝的合作博弈视角

Yanqiao Chen, Dongsheng Hou, Yuhan Rui, Zhen Cao, Yepang Liu

机构 * Southern University of Science and Technology(南方科技大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文针对检索增强生成系统上下文重排和剪枝缺乏可解释统一框架的问题,提出Shapley上下文剪枝框架,用合作博弈视角归因重要性,采用深度集架构和蒙特卡罗采样,经多实验验证,模型在下游问答性能上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16206 2026-07-21 cs.AI 新提交 57%

PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization

PPO-HSC:基于广域策略覆盖优化的探索性强化学习框架

Yujie Shen, Haowen Chen

机构 * School of Mathematics, Hunan University(湖南大学数学学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 PPO-HSC是用于解决大语言模型微调中模式崩溃问题的探索性强化学习框架,通过纳入高阶采样覆盖奖励及维护动态轨迹库,提高解决方案多样性与状态空间覆盖,在数学推理和代码生成任务中表现出色。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16205 2026-07-21 cs.AI 新提交 57%

It Takes 8 Tokens: Weak-to-Strong Off-Policy RL via Auxiliary Branches

需要8个令牌:通过辅助分支实现从弱到强的离策略强化学习

Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Liwei Qian, Xin Pei, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对可验证奖励强化学习中目标模型样本语义冗余问题,提出从弱到强学习范式,引入W2SPO方法,通过注入短辅助段指导策略探索,实验表明该方法在数学推理基准测试中性能优异,能提升训练速度和准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15544 2026-07-20 cs.CL 新提交 57%

EpiNarrate: Agentic Generation of Grounded Narratives from Epidemiological Scenario Projections

EpiNarrate:基于流行病学情景预测的有智能体的叙事生成

Rituparna Datta, Srini Venkatramanan, Bryan L. Lewis, Yiqi Su, Harry Hochheiser, Lucie Contamin, Parantapa Bhattacharya, Naren Ramakrishnan, Anil Vullikanti

机构 * University of Virginia(弗吉尼亚大学) Biocomplexity Institute(生物复杂性研究所) Virginia Tech(弗吉尼亚理工大学) University of Pittsburgh(匹兹堡大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究旨在生成公共卫生叙事,提出EpiNarrate框架,将数值推理与自然语言生成分离,通过提取情景轴、构建数据集等步骤,经实验验证该模型能生成事实依据更充分、覆盖范围更广且风格类似专家报告的叙事。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14628 2026-07-17 cs.CL cs.CR 新提交 57%

Routing Ceilings Are Domain-Independent: Structural Prior Injection in Code Security Vulnerability Detection

路由上限与领域无关:代码安全漏洞检测中的结构先验注入

Manuel Israel Cázares

机构 * Bytepro AI(字节专业人工智能公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究在代码安全漏洞检测中测试路由器假设是否跨领域,通过重现SAIR设计评估三个大语言模型。结果表明结构先验能提升语义漏洞召回率,零样本性能随语义复杂度下降,备忘单在真实数据上效果不佳,迭代重新校准也有问题,证实了SAIR的跨分布权衡及路由器假设的跨领域性。

Comments 12 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14522 2026-07-17 cs.LG 新提交 57%

A Continuous-Time Reinforcement Learning Framework for Fine-Tuning Discrete Diffusion Models

用于微调离散扩散模型的连续时间强化学习框架

Zikun Zhang, Jiayuan Sheng, David D. Yao, Wenpin Tang

机构 * Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究提出连续时间强化学习框架,推导策略梯度方法得到PPO和GRPO的连续时间变体。以此开发框架微调离散扩散模型,无需奖励信号可微,能纳入中间奖励或优势信号,还为MDM提供统一视角,用轨迹子采样技术降低计算成本,在相关任务中验证了方法有效性。

Comments 36 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11849 2026-07-14 cs.CL 新提交 57%

AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification

高级数学基准测试:用于高级数学证明生成与验证的基准测试套件

Lingkai Kong, Zijian Wu, Yuzhe Gu, Haiteng Zhao, Wenyong Huang, Shuang Sun, Zhicheng Xiong, Xiaotian Zhang, Shuya Zhao, Yan Wang, Disheng Xu, Wenwei Zhang, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) MMLab, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai Jiao Tong University(上海交通大学) Great Bay University(大湾区大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 介绍用于评估高级数学推理能力的AdvancedMathBench基准测试套件,含ProverBench证明生成基准及自动验证管道,还有VerifierBench。实验显示前沿模型在证明生成与验证上表现不佳,该套件对模型提升高级数学证明能力有挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10110 2026-07-14 cs.AI 新提交 57%

Looped State-Space Language Models with Adaptive Exit-State Selection

具有自适应退出状态选择的循环状态空间语言模型

Zhenxuan Yu, Takeshi Kojima, Yutaka Matsuo, Yusuke Iwasawa

机构 * Rikkyo University(立教大学) The University of Tokyo(东京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究循环状态空间语言模型在推理任务及预训练中的表现,采用循环曼巴等架构,在推理任务中优于非循环基线,预训练时在下游基准测试有竞争力,适配退出门后在中间深度提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09839 2026-07-14 cs.AI cs.CV cs.HC 新提交 57%

Exploring Agentic Workflows for Generating High Quality Math Visual Aids

探索用于生成高质量数学视觉辅助工具的智能工作流程

Rizwaan Malik, Ashna Khetan, Isabel Sieh, Samin Khan

机构 * Stanford Graduate School of Education(斯坦福大学教育研究生院) Department of Computer Science(计算机科学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对中学数学图表可靠生成难的问题,引入智能工作流程,让 LLM 智能体评估并迭代改进生成的视觉效果,通过探索性评估确定改进关键领域,初步证明可提高 AI 生成数学图表的可靠性和教育价值。

Comments 13 pages, 9 figures. Exploratory course project on agentic workflows for generating and evaluating K 12 mathematical diagrams

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08018 2026-07-10 cs.AI 新提交 57%

Concretized Proposition Prompting Resolves Composition-Knowledge Dichotomy in Large Language Models

具体化命题提示解决大语言模型中的组合-知识二分法

Changhun Lee, Minguk Jeon, Jongkyung Shin, Chiehyeon Lim

机构 * Columbia University(哥伦比亚大学) UNIST(全南科学技术大学) POSCO Holdings(POSCO控股)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对大语言模型组合-知识二分法难题,提出具体化命题提示(CPP)框架。通过明确相关命题具体化,提升推理性能,尤其在医学基准测试中表现突出,且可扩展到多种模型和参数规模,弥合两类方法差距,解决了二分法问题。

Comments 9

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07727 2026-07-10 cs.PL cs.CL 新提交 57%

SPL: Orchestrating Workflows with Declarative Deterministic-Probabilistic Composition

SPL:使用声明式确定性-概率性组合编排工作流

Wen G. Gong

机构 * Independent Researcher(独立研究者)

专题命中 数学推理 :verifier(abstract);分类 cs.CL

AI总结 研究提出SPL语言统一确定性与概率性计算模式,通过共享语法等实现跨平台运行。经实验验证,求解器分支有较高机器验证正确性,对比仅用大语言模型的分支,呈现后端难度梯度,主要失败模式为求解器错误。

Comments 24 pages, 2 figures, under review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06820 2026-07-09 cs.AI 新提交 57%

Evaluating SageMath-Augmented LLM Agents for Computational and Experimental Mathematics

评估用于计算和实验数学的SageMath增强型大语言模型智能体

Pavel Snopov, German Magai

机构 * The Sage Developers(Sage开发者团队)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究聚焦AI在数学领域进展,提出结合大语言模型推理与SageMath反馈的智能体设置,改进RealMath基准。实验表明该设置能提升模型性能,缩小模型差距,CAS增强型智能体在计算探索上有潜力,朝自动猜想发现迈进。

Comments 37 pages, 16 figures, accepted to 3rd AI for Math Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05835 2026-07-09 math.AG cs.AI math.CO 新提交 57%

Tangent classes of matroids and wonderful compactifications

拟阵的切线类与美妙紧化

Ronnie Cheng, Shurui Liu, Guoxiong Gao

机构 * Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文针对无环拟阵 \(M\) 及特定构建集 \(\mathcal{G}\) 构造整切线类 \(T_{M,\mathcal{G}}^{\mathbb{Z}}\),可恢复周环希尔伯特级数等。主体由人工智能达努斯自主生成,在相关论文公开前解决问题,展现了AI在数学研究中的潜力。

Comments v2: added reference to Danus report [Liu et al., arXiv:2607.06447] and minor edits

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26359 2026-07-08 cs.AI 新提交 57%

Accelerating Returns and the Qualitative Engine for Science

加速回报与科学的定性引擎

Guojun Liao

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文解释加速回报理论,指出其适用于执行能力,但科学发现依赖定性推理;引入定性引擎(QES)弥补这一缺失,强调保存人类智慧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22511 2026-07-08 cs.CL stat.ML 新提交 57%

Breaking the Likelihood Trap: Variance-Calibrated Modulation for Large Language Model Decoding

打破似然陷阱:面向大语言模型解码的方差校准调制

Yuanhao Ding, Meimingwei Li, Esteban Garces Arias, Matthias Aßenmacher, Christian Heumann, Chongsheng Zhang

机构 * School of Computer and Information Engineering, Henan University(河南大学计算机与信息工程学院) Department of Statistics, LMU Munich(慕尼黑大学统计系) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出方差校准调制(VCM),通过上下文PMI搜索和自适应自去偏置两种动态机制,在截断前重塑概率分布,以缓解LLM的似然陷阱问题,提升生成多样性、连贯性和推理准确性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04394 2026-07-07 cs.AI cs.SC 新提交 57%

MechMath Agent Team: LLM Driven Agents for Mathematical Research

机械数学智能体团队:用于数学研究的大语言模型驱动智能体

Yichuan Cao, Ruichen Qiu, Junqi Liu, Jiaqi Wang, Dakai Guo, Ruyong Feng, Lihong Zhi, Xiao-Shan Gao

机构 * State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, CAS(中国科学院数学与系统科学研究院数学科学国家重点实验室) School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学高等研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 针对数学研究给现有推理系统带来的挑战,提出机械数学智能体团队,设计三方架构,实例化三个专业智能体,闭环协作生成形式化认证的数学证明,经评估可在研究全周期辅助,有通用架构、系统实例及实证验证三大贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26997 2026-07-07 cs.DC cs.LG 新提交 57%

RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning

RolloutPipe: 分离式在线策略LLM强化学习中的流水线化Rollout与训练重叠

Rongjian Chen, Jianmin Hu, Kejiang Ye, Minxian Xu

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Southern University of Science and Technology(南方科技大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 针对分离式RLVR系统中rollout与训练阶段空闲问题,提出RolloutPipe框架,通过完整组流水线(CGP)和前沿组调度(FGD)实现训练与rollout重叠,保持在线策略正确性,减少训练等待时间30.7%-42.3%。

Comments 15 pages

Journal ref Proceedings of the 2026 International Conference on Cognitive Computing (ICCC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01775 2026-07-03 cs.LG 新提交 57%

Set Diffusion: Interpolating Token Orderings Between Autoregression and Diffusion for Fast and Flexible Decoding

Set Diffusion: 在自回归与扩散之间插值令牌顺序以实现快速灵活的解码

Marianne Arriola, Volodymyr Kuleshov

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 提出Set Diffusion模型,通过将似然参数化为灵活位置和长度的令牌集,并设计集因果扩散架构,支持任意顺序解码和KV缓存更新,在数学推理、摘要和无条件生成上优于先前的扩散语言模型。

Comments ICML 2026. We provide the code at https://github.com/kuleshov-group/setdlms

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30789 2026-07-02 cs.LG stat.ML 新提交 57%

Predictable GRPO: A Closed-Form Model of Training Dynamics

可预测的GRPO:训练动力学的闭式模型

Rajat Ghosh, Datta Nimmaturi, Aryan Singhal, Vaishnavi Bhargava, Henry Wong, Johnu George, Debojyoti Dutta

机构 * Nutanix Unsloth

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 提出GRPO训练动力学的第一性原理降阶模型,揭示其指数饱和律的物理含义,预测群大小不变性、稳定性阈值和过阻尼-振荡转变,并在多个模型和基准上验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22723 2026-07-01 cs.CL 新提交 57%

BLUEX v2: Benchmarking LLMs on Open-Ended Questions from Brazilian University Entrance Exams

BLUEX v2: 对巴西大学入学考试开放性问题的大语言模型基准测试

João Guilherme Alves Santos, Giovana Kerche Bonás, Thiago Laitz, Thales Sales Almeida, Helio Pedrini

机构 * UNICAMP(坎皮纳斯州立大学) Tropic AI Maritaca AI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 针对葡萄牙语开放性问题评估的不足,提出BLUEX v2基准,包含巴西两所顶尖大学第二阶段入学考试的395道题,采用LLM-as-a-judge评估21个模型,发现数学推理和图像理解是最难的能力维度。

Comments 15 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26671 2026-06-26 cs.AI 新提交 57%

NebulaExp-8B: An Empirical Post-Training Pipeline via Full-Scale Ablation Research

NebulaExp-8B:基于全尺度消融研究的经验性后训练流程

Qiaobo Hao, Yangqian Wu, Shunyi Wang, Zhongjian Zhang, Ziqun Li, Yayin He, Muqing Li, Chen Zhong

机构 * ZTE NebulaL0 Post-Training Team(中兴通讯NebulaL0后训练团队)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出NebulaExp透明后训练流程,基于Qwen3-8B-base,通过数据清洗、三阶段SFT和GRPO RL优化指令与推理分支,并探索OPD/MOPD替代RL,在8B模型上实现性能提升。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21906 2026-06-23 cs.CL 新提交 57%

Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding

更深并非总是更好:通过置信层解码缓解对齐税

Xuanming Zhang, Sining Zhoubian, Yuxuan Chen, Tianyi Tang, An Yang, Sean Du, Chujie Zheng, Fei Huang, Dayiheng Liu, Gao Huang, Jingren Zhou

机构 * Qwen Team, Alibaba Inc.(阿里巴巴集团 Qwen 团队) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出Confident Decoding,一种无需训练的解码策略,通过熵引导的保守反向搜索动态选择最可靠的近最终层,以缓解对齐微调导致的最终层扰动,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20713 2026-06-23 cs.AI 新提交 57%

FairTutor: Equity-Aware Pedagogical LLM Routing for Budget-Constrained AI Tutoring

FairTutor: 预算受限AI辅导中的公平感知教学LLM路由

Qingyang Xu

机构 * Independent researcher, Shanghai, China(独立研究者,上海,中国)

专题命中 数学推理 :planning(abstract);分类 cs.AI

AI总结 提出FairTutor框架,通过教学驱动的多智能体编排实现成本效益AI辅导,在降低71.6%服务成本的同时达到97.1%的优质教学质量,并引入AIED优势差距指标衡量公平性。

Comments AI for Education Day at SIGKDD 2026, 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20643 2026-06-23 cs.AI cs.CV 新提交 57%

SPARC: A Multi-Agent System for Electrical Circuit Question Answering

SPARC:用于电路问答的多智能体系统

Mushtari Sadia, Zhenning Yang, Umme Habiba Lamia, Nishat Shawrin, Ang Chen, Amrita Roy Chowdhury

机构 * University of Michigan(密歇根大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出SPARC多智能体系统,通过可执行的物理仿真程序进行推理,在电路问答任务上实现83%准确率,较基线提升高达58%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17999 2026-06-23 cs.CL 新提交 57%

VoidPadding: Let [VOID] Handle Padding in Masked Diffusion Language Models so that [EOS] Can Focus on Semantic Termination

VoidPadding: 让 [VOID] 处理掩码扩散语言模型中的填充,以便 [EOS] 专注于语义终止

Chunyu Liu, Zhengyang Fan, Kaisen Yang, Alex Lamb

机构 * Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 提出VoidPadding方法,通过引入[VOID]令牌处理填充,将[EOS]从双重角色中解放,实现大块解码下的早期停止和自适应响应扩展,在数学推理和代码生成任务上平均提升17.84分,并减少55.7%的NFE。

Comments Minor related-work revisions; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20008 2026-06-19 cs.LG 新提交 57%

VIMPO: Value-Implicit Policy Optimization for LLMs

VIMPO: 值隐式策略优化用于大语言模型

Zhewei Kang, Aosong Feng, Sergey Levine, Dawn Song, Xuandong Zhao

机构 * UC Berkeley(加州大学伯克利分校) Yale University(耶鲁大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 提出VIMPO方法,通过KL正则化强化学习的最优条件导出策略隐含值函数,无需训练评论家,实现细粒度信用分配,在数学推理基准上优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18844 2026-06-18 cs.LG 新提交 57%

Learning from Your Own Mistakes: Constructing Learnable Micro-Reflective Trajectories for Self-Distillation

从自身错误中学习:为自蒸馏构建可学习的微反思轨迹

Zhilin Huang, Hang Gao, Ziqiang Dong, Yuan Chen, Yifeng Luo, Chujun Qin, Jingyi Wang, Yang Yang, Guanjun Jiang

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问事业部) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 提出TAPO方法,通过对比正确与错误轨迹构建微反思修正,实现从隐式分布对齐到显式轨迹构建的自蒸馏改进,在多个数学推理基准上优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18453 2026-06-18 cs.CL 新提交 57%

LLM Parameters for Math Across Languages: Shared or Separate?

跨语言数学问题的LLM参数:共享还是分离?

Behzad Shomali, Luisa Victor, Tim Selbach, Ali Hamza Bashir, David Berghaus, Joachim Koehler, Mehdi Ali, Markus Frey

机构 * Lamarr Institute(Lamarr研究所) University of Bonn(波恩大学) Fraunhofer IAIS(弗劳恩霍夫智能分析和信息系统研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 通过跨语言机制分析,发现多语言LLM中数学相关参数存在部分跨语言重叠,且主要集中在中间层,英语参数集最大,低资源语言参数集较小。

Comments 5 pages. Accepted at ACL Student Research Workshop (SRW) 2026. Code: https://github.com/luisavictor/math-across-languages Translated Datasets: https://huggingface.co/math-across-languages Webpage: https://math-across-languages.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏