SCREWS: A Modular Framework for Reasoning with Revisions
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at the Findings of ACL 2023
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to ACL 2023. The repository is available at https://github.com/lupantech/dl4math
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Project Webpage and Code: https://composable-models.github.io/llm_debate/
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2022
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments The paper has been accepted to the ACL-IJCNLP 2021 conference
ProgramTab:通过编程范式提升大语言模型的表格推理能力
机构 * Big Data and AI Platform Department, Tencent(腾讯大数据与人工智能平台部) ; Institute of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究基于大语言模型的表格推理问题,提出ProgramTab框架,指导LLMs用Python代码预处理表格数据并进行关键内容提取,实验证明该框架能有效处理表格推理任务,性能优于基于LLM的基线。
Comments Large Language Models, Table Reasoning, In-context Learning
学习如何使用工具,而非仅仅何时:基于模式的工具集成推理
机构 * University of Georgia(佐治亚大学) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) ; The University of Hong Kong(香港大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种两阶段框架,通过构建代码能力并对齐模式选择与教师偏好,提升工具集成推理的代码使用和准确性,实验显示在数学数据集上显著提升。
Journal ref The 5th Workshop on Mathematical Reasoning and AI at NeurIPS 2025
通过混合训练缓解数学推理微调中的灾难性遗忘
机构 * Department of Computer Science(计算机科学系) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出混合训练策略,通过交错数学和NLI任务来缓解微调中的灾难性遗忘,同时保持数学性能和NLI准确性。
Comments 11 pages, 2 figures. Code available at https://github.com/johngrahamreynolds/mathematical_catastrophe_mitigation. Models available at https://huggingface.co/collections/MarioBarbeque/catastrophic-forgetting-in-mathematical-reasoning
机构 * MIT(麻省理工学院) ; Comenius University in Bratislava(布拉迪斯拉发孔院大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments Accepted to The 5th Workshop on Mathematical Reasoning and AI at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025); 25 pages, 14 figures, 8 tables; Code available at https://github.com/NaiveNeuron/FractalBench
机构 * UC San Diego(加州大学圣地亚哥分校) ; Capital One(Capital One公司)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments NeurIPS 2025 Workshop on Efficient Reasoning
机构 * IBM Research – Zurich(IBM瑞士研究中心) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments Accepted at the 5th Workshop on Mathematical Reasoning and AI (MATH-AI), NeurIPS 2025
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; KRAFTON(KRAFTON公司) ; UC Berkeley(伯克利大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments Accepted into Test-time Scaling and Reasoning Models (SCALR) workshop at COLM 2025. 28 pages
机构 * University of California Los Angeles(加州大学洛杉矶分校) ; School of Artificial Intelligence Chinese Academy of Sciences(中国科学院人工智能学院) ; Microsoft(微软) ; Tsinghua University(清华大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
Comments Reinforcement Learning; Large Language Models; LLM Reasoning
是解码格式,而非扰动:审计视觉语言模型测试时扩展的基于一致性的选择
专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 该研究发现视觉语言模型测试时的选择效果由解码格式而非扰动决定,提出的扰动基选择(Pgs)在控制格式后无显著收益,说明其无法作为有效选择信号。
HoT: 用于从输入中引用支持事实的高亮推理链
机构 * Auburn University(亚伯拉罕大学) ; University of Alberta(阿尔伯塔大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)
AI总结 本文提出HoT技术,通过XML标签高亮输入中的关键事实,减少LLM的幻觉问题,提升22项任务的准确性,并帮助人类更高效地验证结果。
Formula-One Prompting:一种可组合的方程优先前缀用于应用数学
机构 * SCB DataX, SCBX Group(SCB数据X,SCBX集团)
专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 提出公式提示(FP)和Formula-One提示(F-1),通过先形式化问题中的控制方程再求解,在多个应用数学基准上优于思维链和程序思维提示,平均提升5.76和8.42个百分点。
大型语言模型在语义保持变异下的理解鲁棒性如何?
机构 * Department of Computer Science University of Oxford(计算机科学系牛津大学)
专题命中 数学推理 :reasoning(summary_cn,abstract);分类 cs.AI
AI总结 本文评估了大型语言模型在Python程序上的推理能力,通过五种语义保持的代码变异测试,发现模型在语义变换下表现出显著的脆弱性,正确预测基于 flawed reasoning 的比例在10%-50%之间,且预测稳定性差。
Comments 17 pages, 5 tables, 1 figure
令牌级策略优化:通过序列级似然将群体级奖励与令牌级聚合联系起来
机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) ; Key Laboratory of Symbolic Computation and Knowledge Engineering of MOE, Jilin University(教育部符号计算与知识工程重点实验室,吉林大学) ; Baidu Inc.(百度公司) ; Tsinghua University(清华大学) ; State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室,计算技术研究所)
专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文提出TEPO,通过序列级似然将群体奖励与单个令牌联系,并引入KL散度掩码约束以提升训练稳定性,实验显示其在数学推理任务中表现优异且收敛时间减少50%。
机构 * PhysicsWallah(物理墙)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)
Comments Published at ICLR 2024
为什么自蒸馏(有时)会降低大语言模型的推理能力?
机构 * Microsoft Research(微软研究院) ; KAIST(韩国成均馆大学) ; Seoul National University(首尔国立大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 本文研究了自蒸馏在数学推理中降低大语言模型推理能力的原因,发现其通过抑制模型在推理过程中的不确定性表达,导致在未见过的问题上表现下降,强调了适当表达不确定性对鲁棒推理的重要性。
Comments Accepted to COLM 2026. Code is available at https://github.com/beanie00/self-distillation-analysis
KV-Rescue:通过逐步交错恢复推理语言模型的KV驱逐损失
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 KV-Rescue是一种无需训练的推理框架,通过交错轻量级辅助模型的推理步骤,结合在线检测器,在驱逐预算B=64时平均恢复了87%的KV驱逐损失准确率,还减少了43%的基础模型token生成量。
SimpleOPD:适用于长上下文推理的、简单的与分词器无关的在线策略蒸馏
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出SimpleOPD方法,通过共享文本空间对齐令牌、引入学生参考KL损失并屏蔽特殊终止令牌优势,将长上下文模型SU-01的推理能力迁移至多类学生模型,在数学及科学基准上取得显著提升。
Cloud-ScPO:面向大语言模型推理的半监督偏好优化的隐状态几何
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出Cloud-ScPO框架,利用少量标注集构建参考云,结合拓扑引导的偏好挖掘与自一致性,在GSM8K等数据集上较ScPO提升LLM数学推理性能。
Comments 14 pages, 2 figures, 7 tables. Preprint
Social Gym与SPaRTan:通过多智能体游戏锦标赛对LLM社会推理进行基准测试与改进
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究推出Social Gym多智能体社会游戏环境与SPaRTan自博弈反思迁移方法,前者可客观基准测试LLM社会推理,后者可提升GPT-5-mini的弱角色表现,为改进LLM社会推理提供了可复现基础。
校准大语言模型推理的置信度边际过程监督
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出RLCM框架,通过增强的边际过程奖励优化正确性和置信度可靠性,提升模型校准性能并保持准确性,同时实现更高效的置信度加权聚合。
并非所有转折都同样困难:为高效多轮推理的自适应思维预算
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出TAB方法,通过自适应预算分配提升多轮推理效率,在数学推理基准中实现更高的准确率与token节省。
多目标进化融合实现高效推理模型
机构 * Sapienza University of Rome(罗马大学) ; Independent Researcher(独立研究员) ; EPFL(瑞士联邦理工学院洛桑) ; NVIDIA(英伟达)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出Evo-L2S框架,通过多目标优化解决长到短推理问题,减少生成推理轨迹长度同时保持或提升推理准确性。
Comments Published as a conference paper at COLM 2026