arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-01 至 2026-01-01 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 4 篇

2512.24505 2026-01-01 cs.AI 79%

Evaluating the Reasoning Abilities of LLMs on Underrepresented Mathematics Competition Problems

评估大语言模型在不常见数学竞赛问题上的推理能力

Samuel Golladay, Majid Bani-Yaghoub

机构 * University of Missouri: Kansas City(密苏里大学:堪萨斯城)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究评估了三种LLM在不常见数学竞赛问题上的推理能力,发现DeepSeek-V3在微积分、解析几何和离散数学中表现最佳,但所有模型在几何学上均表现较弱。

Comments 7 pages, submitted to ACM Transactions on Intelligent Systems and Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06337 2026-01-01 cs.AI 79%

DaGRPO: Rectifying Gradient Conflict in Reasoning via Distinctiveness-Aware Group Relative Policy Optimization

DaGRPO:通过意识性群相对策略优化纠正推理中的梯度冲突

Xuan Xie, Xuan Wang, Wenjie Wang, Shuai Chen, Wei Lin

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 DaGRPO通过意识性群相对策略优化纠正推理中的梯度冲突,提升推理能力和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22998 2026-01-01 cs.AI 79%

TIM-PRM: Verifying multimodal reasoning with Tool-Integrated PRM

TIM-PRM:利用工具集成PRM验证多模态推理

Peng Kuang, Xiangxiang Wang, Wentao Liu, Jian Dong, Kaidi Xu

机构 * Zhejiang University(浙江大学) iFLYTEK AI Research Institute(iFLYTEK人工智能研究院) City University of Hong Kong(香港城市大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 TIM-PRM通过工具集成PRM验证多模态推理,有效解决视觉幻觉和逻辑不一致问题,实验表明其在性能和可解释性上优于现有模型。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02002 2026-01-01 cs.MA 50%

Dynamic Strategy Adaptation in Multi-Agent Environments with Large Language Models

多智能体环境中基于大语言模型的动态策略适应

Shaurya Mallampati, Rashed Shelim, Walid Saad, Naren Ramakrishnan

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出基于大语言模型和博弈论的动态策略适应框架,提升多智能体协作效率和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏