arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-06 至 2026-01-06 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 7 篇

2601.01714 2026-01-06 cs.LG cs.CL 81%

Entropy-Aligned Decoding of LMs for Better Writing and Reasoning

基于熵对齐的语言模型解码以提升写作与推理能力

Kareem Ahmed, Sameer Singh

机构 * Department of Computer Science University of California, Irvine(计算机科学系加州大学伊维特分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 EPIC通过将未来轨迹的熵纳入语言模型解码,提升写作与推理能力,生成更多样且忠实的内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06065 2026-01-06 cs.AI cs.CL 73%

ScRPO: From Errors to Insights

ScRPO:从错误到洞察

Lianrui Li, Dakuan Lu, Jiawei Shao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI))

专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 ScRPO通过自我反思和错误纠正机制,提升大语言模型的数学推理能力,在多个基准测试中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20578 2026-01-06 cs.CL 70%

Can LLMs Predict Their Own Failures? Self-Awareness via Internal Circuits

LLMs能否预测自身失败?通过内部电路实现自感知

Amirhosein Ghasemabadi, Di Niu

机构 * University of Alberta(阿尔伯塔大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 Gnosis通过分析LLM内部状态实现自我验证,有效提升生成过程的准确性和校准性,无需外部监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01931 2026-01-06 cs.LG cs.AI 62%

DéjàQ: Open-Ended Evolution of Diverse, Learnable and Verifiable Problems

DéjàQ:开放性进化多样化、可学习且可验证的问题

Willem Röpke, Samuel Coward, Andrei Lupu, Thomas Foster, Tim Rocktäschel, Jakob Foerster

机构 * Willem Röpke AI Lab, Vrije Universiteit Brussel Belgium(维尔姆·罗普克人工智能实验室,布鲁塞尔自由大学) FLAIR, University of Oxford United Kingdom(FLAIR,牛津大学) University College London United Kingdom(伦敦大学学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DéjàQ通过大语言模型驱动的突变策略动态进化多样化数学问题,提升模型的可学习性和推理能力,开源代码支持其应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00942 2026-01-06 cs.LG cs.CL 62%

Reliability Under Randomness: An Empirical Analysis of Sparse and Dense Language Models Across Decoding Temperatures

可靠性与随机性:在解码温度下对稀疏和密集语言模型的实证分析

Kabir Grover

机构 * Kabir Grover(独立研究者)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了稀疏和密集语言模型在不同解码温度下的可靠性,发现指令微调比架构稀疏性对稳定性影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00874 2026-01-06 cs.LG cs.AI physics.comp-ph 62%

LLMize: A Framework for Large Language Model-Based Numerical Optimization

LLMize: 一种基于大语言模型的数值优化框架

M. Rizki Oktavian

机构 * Blue Wave AI Labs(蓝波人工智能实验室) School of Nuclear Engineering, Purdue University(核工程学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LLMize是一种基于大语言模型的数值优化框架,通过自然语言描述注入约束和领域知识,适用于复杂领域特定任务的优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00885 2026-01-06 cs.AI 57%

Counterfactual Self-Questioning for Stable Policy Optimization in Language Models

反事实自问法用于语言模型中的稳定策略优化

Mandar Parab

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 反事实自问法通过内部生成的监督提升语言模型的推理准确性和训练稳定性,实现自我改进。

详情

展开后加载摘要…

URL PDF HTML 收藏