arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-16 至 2026-01-16 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2410.10336 2026-01-16 cs.AI cs.CL cs.LG cs.SC 87%

CoMAT: Chain of Mathematically Annotated Thought Improves Mathematical Reasoning

CoMAT:数学注释的思维链提升数学推理

Joshua Ong Jun Leang, Aryo Pradipta Gema, Shay B. Cohen

机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学) Imperial College London(伦敦帝国学院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CoMAT通过符号转换和推理执行两个阶段提升数学推理能力,在多个基准测试中超越传统CoT方法。

Comments 9 pages, 12 figures

Journal ref Proc. EMNLP 2025, pp. 20245-20274

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09667 2026-01-16 cs.AI cs.CL 81%

Collaborative Multi-Agent Test-Time Reinforcement Learning for Reasoning

协同多智能体测试时间强化学习用于推理

Zhiyuan Hu, Yunhai Hu, Juncheng Liu, Shuyue Stella Li, Yucheng Wang, Zhen Xu, See-Kiong Ng, Anh Tuan Luu, Xinxing Xu, Bryan Hooi, Cynthia Breazeal, Hae Won Park

机构 * MIT(麻省理工学院) NUS(新加坡国立大学) NYU(纽约大学) Microsoft(微软) Columbia(哥伦比亚大学) NTU(国立科技大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MATTRL通过在推理阶段注入结构化文本经验,提升多智能体在医学、数学和教育等领域的推理准确性,比多智能体基线提升3.67%,比单智能体基线提升8.67%。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10094 2026-01-16 cs.CV cs.AI cs.LG 81%

V-Zero: Self-Improving Multimodal Reasoning with Zero Annotation

V-Zero:基于零标注的自改进多模态推理

Han Wang, Yi Yang, Jingyuan Hu, Minfeng Zhu, Wei Chen

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室) Zhejiang University(浙江大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 V-Zero通过自改进机制在无需人工标注的情况下提升多模态模型的视觉数学推理和通用视觉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10064 2026-01-16 cs.CL 79%

Long-Chain Reasoning Distillation via Adaptive Prefix Alignment

通过自适应前缀对齐实现长链推理蒸馏

Zhenghao Liu, Zhuoyang Wu, Xinze Li, Yukun Yan, Shuo Wang, Zulong Chen, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学计算机科学与技术系) Alibaba Group, China(阿里巴巴集团)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 通过自适应前缀对齐方法提升学生模型的推理能力,有效蒸馏教师生成的长推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10349 2026-01-16 cs.LG cs.AI cs.CL cs.GT 67%

SuS: Strategy-aware Surprise for Intrinsic Exploration

SuS:基于策略的惊喜用于内在探索

Mark Kashirskiy, Ilya Makarov

机构 * Higher School of Economics(俄罗斯高等经济学院) AI Talent Hub(人工智能人才中心) ITMO University(ITMO大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SuS通过结合策略稳定性与策略惊喜,提升强化学习中探索的准确性和多样性,实现显著性能提升。

Comments 8 pages, 7 figures, 3 tables. Code available at https://github.com/mariklolik/sus

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23281 2026-01-16 cs.AI cs.CL 62%

MathArena: Evaluating LLMs on Uncontaminated Math Competitions

MathArena: 在无污染数学竞赛中评估大语言模型

Mislav Balunović, Jasper Dekoninck, Ivo Petrov, Nikola Jovanović, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院) INSAIT

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MathArena通过评估数学竞赛中的LLM,揭示了模型在推理和证明写作上的能力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏