Solving Math Word Problems by Combining Language Models With Symbolic Solvers
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
专题命中 数学推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
Comments Accepted to EACL 2023
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG
Comments Kumar Shridhar and Jakub Macina contributed equally to this work. Accepted at the 2022 Conference on Empirical Methods in Natural Language Processing (EMNLP 2022). Code available: https://github.com/eth-nlped/scaffolding-generation
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
Comments 181 pages, 8 figures, 280 tables
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
Comments 20 Pages, 8 Figures, 5 Tables
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
Comments An earlier version of this article appeared in the following edited book. Pascal Hitzler and Md Kamruzzaman Sarker, editors. Neuro-Symbolic Artificial Intelligence: The State of the Art, volume 342 of Frontiers in Artificial Intelligence and Applications. IOS Press, 2021
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
Comments 120 pages
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
Comments Adding journal reference, recommended by JAIR editors upon publication
Journal ref Journal of Artificial Intelligence Research 72 (2021) 1307-1341
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG
Comments 8 pages, 3 figures
专题命中 数学推理 :planning(abstract);分类 cs.CL、cs.AI
Comments EMNLP'21: The 2021 Conference on Empirical Methods in Natural Language Processing, 2021
专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
Comments In AAAI Workshop: Statistical Relational Artificial Intelligence, 2020
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
Comments 8 pages, 3 figures
机构 * Faculty of Mathematics and Computer Science, Georg-August-Universität Göttingen(数学与计算机科学学院,哥廷根乔治-奥古斯特大学)
专题命中 数学推理 :reasoning(abstract,comments);分类 cs.AI
Comments 14 pages, 4 figures, 2 tables. Evaluation study on LLM-based reasoning for HPC scheduling. Published in Research in Academic Engineering Journal (RAEJ), 2025
Journal ref Robot Autom Eng J. 2025; 6(5): 555696
专题命中 数学推理 :reasoning(abstract,comments);分类 cs.AI
Comments Accepted at NeSy 2023, 17th International Workshop on Neural-Symbolic Learning and Reasoning
ProgRouter:面向质量-成本权衡的多智能体大语言模型工作流的在线进度引导编排
机构 * Aston University(阿斯顿大学) ; Queen Mary University of London(伦敦玛丽女王大学) ; University of Exeter(埃克塞特大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 ProgRouter是一种在线进度引导路由框架,通过多视图任务进度评分器等机制,在多智能体LLM工作流中平衡任务质量与时间、成本预算,在多类任务数据集上较基线降低运营成本且保持性能。
Comments Accepted in Findings of the Association for Computational Linguistics: EMNLP 2026. Index Terms: Collaborative agentic workflows, LLM agent orchestration, Quality-cost trade-off, Task progress prediction, Online decision-making
前缀去噪一致性:扩散语言模型的测试时验证方法
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Nagoya University(名古屋大学) ; RIKEN AIP(理化学研究所人工智能项目)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 该研究针对扩散语言模型提出测试时自验证方法PDC,通过前缀条件再生的轨迹稳定性差异修正初始生成样本,在两类推理基准中提升性能且具鲁棒性。
市场而非规划者:利用私有信息对大语言模型智能体进行去中心化协调
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 针对中心化LLM智能体协调的瓶颈与易操控问题,提出去中心化的AgentLance重复劳动力市场机制,经多类任务验证,其匹配专长、转向廉价智能体的表现优于基线方法,还可通过修正市场失灵进一步提升效率。
Comments Working paper
用于代码偏好优化的函数级执行反馈
机构 * Seoul National University(首尔大学) ; Konkuk University(建国大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出STEP-KTODER框架,将代码步骤定义为多函数程序的模块级函数,结合函数级过程监督与程序结果级反馈,在多个代码基准测试中优于KTO、DPO等方法,且验证了执行标签的重要性。
Comments 20 pages, 8 figures, 14 tables. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026
超越稳定性-探索困境:面向大语言模型策略优化的环境正则化方法
机构 * Alibaba Group(阿里巴巴集团) ; Beijing Normal University(北京师范大学) ; National University of Singapore(新加坡国立大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 该研究针对大语言模型策略优化的稳定性-探索困境,提出ERPO方法,通过查询KL散度正则化输入侧分布,接入现有策略优化流水线,在数学推理基准上实现了更强准确率与更稳定行为。
Comments Accepted to EMNLP 2026 main conference
AI生成数学证明的审计:量子并行重复中一个贪心条件引理的修正
机构 * Polish–Japanese Academy of Information Technology(波兰-日本信息技术学院) ; Chair of Theoretical Physics of Naturally Intelligent Systems (NIS)(自然智能系统理论物理研究所(NIS))
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文审计OpenAI相关工作中AI生成的数学证明,发现其量子并行重复中贪心条件引理的证明存在极性错误,给出反例并提供局部修正证明,揭示AI论证可能隐藏互补事件的关键反转。
Comments 8 pages, 5 references. V2: 11 pages, 8 references. Substantially revised. The polarity error reported in v1 is withdrawn: it resulted from loss of an overbar during PDF text extraction, not from an error in the OpenAI manuscript. The revised paper retains and extends the independent human assessment of Chapter 6. No confirmed mathematical error was found in the examined argument
DIAG:面向数据高效数学偏好蒸馏的诊断式迭代对齐与生成
机构 * Tsinghua University(清华大学) ; Kyoto University(京都大学) ; Nanjing University(南京大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 DIAG是一种自适应调整训练分布的框架,通过诊断偏好对产出与生成针对性训练数据,提升数学推理任务中偏好监督的信息价值,在同等训练预算下增强模型性能。
Comments Accepted by EMNLP 2026 findings
CAI-DLLM:面向扩散语言模型的感知收敛推理
机构 * Virginia Tech(弗吉尼亚理工大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 CAI-DLLM 是一种无需训练的扩散语言模型推理方法,通过利用第一步置信度调整解码策略,在多类任务上实现显著推理加速,同时保持较高准确率并降低能耗。
AI验证的几何:独立同分布N选最优搜索的精确认证极限
机构 * Technical University of Darmstadt(达姆施塔特工业大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 该研究针对独立同分布N选最优搜索推导了精确认证极限,提出双门审计规则,其在数学推理和代码选择的回顾性分析中可降低保留误差。
Comments 32 pages, 4 figures; includes Supporting Information. Code and processed data are available at https://github.com/rfitas-lab/geometry-of-ai-validation
将反向KL重新思考为自适应熵蒸馏
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; School of Science and Technology, Hong Kong Metropolitan University(香港都会大学科技学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 该研究针对知识蒸馏难以平衡忠实模仿与鲁棒生成的问题,提出自适应熵蒸馏(AED)方法,通过分解反向KL目标函数并利用教师熵动态校准模仿强度,在指令遵循与数学推理基准上表现更优。
通过认知成对训练增强LLM元认知
机构 * National Engineering Laboratory for Intelligent Information Processing, Academy of Mathematics and Physics, Chinese Academy of Sciences(智能信息处理国家工程实验室,中国科学院数学物理研究所) ; University of Science and Technology of China(中国科学技术大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 提出认知成对训练(CPT),通过成对比较推理轨迹来学习区分可靠与不可靠推理,从而提升LLM的推理与元认知权衡。