arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-27 至 2026-01-27 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 15 篇

2601.17671 2026-01-27 cs.CL 88%

Align to the Pivot: Dual Alignment with Self-Feedback for Multilingual Math Reasoning

对齐基准:双语自反馈的多语言数学推理

Chunxu Zhao, Xin Huang, Xue Han, Shujian Huang, Chao Deng, Junlan Feng

机构 * JIUTIAN Research, China Mobile, Beijing, China(JIUTIAN研究, 中国移动, 北京) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室, 南京大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.CL

AI总结 PASMR通过基准语言自反馈机制提升多语言数学推理能力,解决LLMs在多语言环境下的性能下降问题。

Comments This paper has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22922 2026-01-27 cs.HC 85%

Improving Human Verification of LLM Reasoning through Interactive Explanation Interfaces

通过交互式解释界面提高LLM推理的人类验证

Runtao Zhou, Giang Nguyen, Nikita Kharya, Anh Totti Nguyen, Chirag Agarwal

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出三种交互式推理界面,通过增强用户对LLM推理过程的理解,提高人类验证效率和准确性。

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03380 2026-01-27 cs.CL cs.AI 84%

Online Difficulty Filtering for Reasoning Oriented Reinforcement Learning

面向推理导向强化学习的在线难度过滤

Sanghwan Bae, Jiwoo Hong, Min Young Lee, Hanbyul Kim, JeongYeon Nam, Donghyun Kwak

机构 * NAVER Cloud(NAVER云) KAIST AI(韩国科学技术院人工智能研究所) TwelveLabs

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一种面向推理导向强化学习的在线难度过滤方法,通过理论分析和实验验证,证明平衡过滤能提升学习效率和样本效率。

Comments To appear in EACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18722 2026-01-27 cs.CL cs.LG 81%

Gained in Translation: Privileged Pairwise Judges Enhance Multilingual Reasoning

翻译中获益:特权成对评判增强多语言推理

Lintang Sutawika, Gokul Swamy, Zhiwei Steven Wu, Graham Neubig

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学语言技术研究所) Carnegie Mellon University, Robotics Institute(卡内基梅隆大学机器人研究所) Carnegie Mellon University, Software and Societal Systems Department(卡内基梅隆大学软件与社会系统系)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 SP3F通过自我扮演和特权成对反馈提升多语言推理能力,无需目标语言数据,有效提升模型在多语言任务中的表现。

Comments Code available at https://github.com/lintangsutawika/SP3F

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17489 2026-01-27 cs.LG cs.CL cs.CV 81%

SpatialMath: Spatial Comprehension-Infused Symbolic Reasoning for Mathematical Problem-Solving

SpatialMath: 基于空间认知的符号推理框架用于数学问题解决

Ashutosh Bajpai, Akshat Bhandari, Akshay Nambi, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度理工学院德里) Indian Institute of Technology Abu Dhabi(印度理工学院阿布扎克) Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 SpatialMath通过整合空间表示到结构化符号推理链中,提升多模态模型在视觉密集型数学问题中的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17006 2026-01-27 cs.LG cs.AI 81%

MathMixup: Boosting LLM Mathematical Reasoning with Difficulty-Controllable Data Synthesis and Curriculum Learning

MathMixup: 通过难度可控的数据合成与课程学习提升LLM的数学推理能力

Xuchen Li, Jing Chen, Xuzhao Li, Hao Liang, Xiaohuan Zhou, Taifeng Wang, Wentao Zhang

机构 * CASIA(中国科学院自动化研究所) ZGCA(浙江大学) UCAS(中国科学技术大学) PKU(北京大学) ByteDance(字节跳动)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 MathMixup通过难度可控的数据合成与课程学习策略,提升LLM的数学推理能力,实验显示其在多个基准测试中表现优于现有方法。

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18790 2026-01-27 cs.CL 79%

MortalMATH: Evaluating the Conflict Between Reasoning Objectives and Emergency Contexts

MortalMATH: 评估推理目标与紧急情境之间的冲突

Etienne Lanzeray, Stephane Meilliez, Malo Ruelle, Damien Sileo

机构 * Univ. Lille(里尔大学) Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 - CRIStAL(里尔大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 MortalMATH研究了推理模型在紧急情境下的表现差异,发现通用模型能拒绝危险任务,而专门模型则忽视危险,导致安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12323 2026-01-27 cs.AI 79%

MARO: Learning Stronger Reasoning from Social Interaction

MARO:从社交互动中学习更强的推理能力

Yin Cai, Zhouhong Gu, Juntao Zhang, Ping Chen

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 MARO通过多智能体社交环境提升大语言模型的推理能力,解决稀疏信号、角色分布不均和环境不稳定问题,实验显示其在社交推理和跨任务迁移上的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25975 2026-01-27 cs.CL cs.PL 79%

SymCode: A Neurosymbolic Approach to Mathematical Reasoning via Verifiable Code Generation

SymCode:通过可验证代码生成实现数学推理的神经符号方法

Sina Bagheri Nezhad, Yao Li, Ameeta Agrawal

机构 * Portland State University(波特兰州立大学) ElastixAI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 SymCode通过可验证代码生成实现数学推理,显著提升准确性并增强模型的透明度和可靠性。

Comments camera-ready EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13551 2026-01-27 cs.AI 70%

Tandem Training for Language Models

语言模型的串联训练

Robert West, Ashton Anderson, Ece Kamar, Eric Horvitz

机构 * EPFL(瑞士联邦理工学院) University of Toronto(多伦多大学) Microsoft(微软公司)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 本文提出串联训练方法,通过强化学习促进语言模型在任务中保持可解释性,使模型能适应较弱协作者并保持高准确性。

Journal ref Proceedings of the 2026 Conference of the European Chapter of the Association for Computational Linguistics (EACL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16912 2026-01-27 cs.LG cs.AI cs.CL 67%

Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward

探索与利用:通过截断、熵和虚假奖励重新思考RLVR

Peter Chen, Xiaopeng Li, Ziniu Li, Wotao Yin, Xi Chen, Tianyi Lin

机构 * Columbia(哥伦比亚大学) CUHK SZ(香港大学) DAMO, Alibaba US(阿里云实验室) NYU Stern(纽约大学 Stern 学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过截断、熵和虚假奖励机制,重新审视RLVR框架,揭示了探索与利用权衡对大语言模型推理能力提升的影响。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25204 2026-01-27 cs.LG cs.AI cs.CL 67%

Spectral Logit Sculpting: Adaptive Low-Rank Logit Transformation for Controlled Text Generation

谱logit雕刻:一种自适应低秩logit变换用于受控文本生成

Jin Li, Zhebo Wang, Tianliang Lu, Mohan Li, Wenpeng Xing, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江学院) Hangzhou Dianzi University(杭州电子科技大学) People’s Public Security University of China(中国人民公安大学) Guangzhou University(广州大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SLS通过自适应低秩logit变换优化文本生成,提升输出分布的尖锐度并保持上下文一致性。

Comments Accepted by IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10571 2026-01-27 cs.CL cs.AI 62%

On the Failure of Latent State Persistence in Large Language Models

大型语言模型中潜在状态持续性的失效

Jen-tse Huang, Kaiser Sun, Wenxuan Wang, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) Renmin University of China(中国人民大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文揭示大型语言模型在维持持久潜在状态方面的缺陷,通过三个实验展示其在概率分配、概念漂移和变量绑定上的失败,表明LLMs更倾向于反应性求解而非主动规划。

Comments 8 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18533 2026-01-27 cs.CL 57%

From Verifiable Dot to Reward Chain: Harnessing Verifiable Reference-based Rewards for Reinforcement Learning of Open-ended Generation

从可验证点到奖励链:利用基于可验证参考的奖励进行开放生成的强化学习

Yuxin Jiang, Yufei Wang, Qiyuan Zhang, Xingshan Zeng, Liangyou Li, Jierun Chen, Chaofan Tao, Haoli Bai, Lifeng Shang

机构 * Huawei Technologies Co.,Ltd(华为技术有限公司) City University of Hong Kong(香港城市大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于可验证参考的强化学习方法,通过提取奖励链提升开放生成任务的效率和可靠性。

Comments 19 pages, 8 figures, 12 tables. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13379 2026-01-27 cs.AI cs.CV 57%

The Art of Saying "Maybe": A Conformal Lens for Uncertainty Benchmarking in VLMs

也许的艺术:一种用于VLMs不确定性基准测试的共形透镜

Asif Azad, Mohammad Sadat Hossain, MD Sadik Hossain Shanto, M Saifur Rahman, Md Rizwan Parvez

机构 * Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种用于VLMs不确定性基准测试的共形透镜,评估了18种最先进的VLMs在6个多元数据集上的表现,发现更大模型在不确定性量化方面表现更佳,而数学和推理任务则表现出较差的不确定性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏