arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-21 至 2026-01-21 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 12 篇

2505.11574 2026-01-21 cs.LG cs.AI 86%

Quantization Meets Reasoning: Exploring and Mitigating Degradation of Low-Bit LLMs in Mathematical Reasoning

量化与推理:探索和缓解低比特LLM在数学推理中的退化

Zhen Li, Yupeng Su, Songmiao Wang, Runming Yang, Congkai Xie, Aofan Liu, Ming Li, Jiannong Cao, Yuan Xie, Ngai Wong, Hongxia Yang

机构 * The Hong Kong Polytechnic University(香港理工大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) Peking University(北京大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种轻量级方法,通过定位和恢复量化模型中最早出现的故障步骤,有效缓解低比特LLM在数学推理中的退化问题。

Comments 27pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13308 2026-01-21 cs.LG cs.AI cs.CL 85%

Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space

在黑暗中寻求:通过测试时实例级策略梯度进行潜在空间推理

Hengli Li, Chenxi Li, Tong Wu, Xuekai Zhu, Yuxuan Wang, Zhaoxin Yu, Eric Hanchen Jiang, Song-Chun Zhu, Zixia Jia, Ying Nian Wu, Zilong Zheng

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) NLCo Lab, Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院NLCo实验室) Department of Automation, Tsinghua University(清华大学自动化系) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LatentSeek通过测试时实例级策略梯度在潜在空间中提升LLM推理能力,展现高效且可扩展的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14209 2026-01-21 cs.LG cs.AI cs.CL 82%

InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning

InT:自我提出干预使LLM推理中的信用分配成为可能

Matthew Y. R. Yang, Hao Bai, Ian Wu, Gene Yang, Amrith Setlur, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 InT通过自我提出干预实现LLM推理中的细粒度信用分配,提升模型在数学推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16219 2026-01-21 cs.LG cs.CL 81%

Reinforcement Learning for Reasoning in Small LLMs: What Works and What Doesn't

用于小型大语言模型推理的强化学习:什么有效,什么无效

Quy-Anh Dang, Chris Ngo

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究通过强化学习提升小型LLM的推理能力,展示了在有限资源下实现显著性能提升的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18760 2026-01-21 cs.AI cs.CL 81%

Answering the Unanswerable Is to Err Knowingly: Analyzing and Mitigating Abstention Failures in Large Reasoning Models

回答不可回答的问题是明知其错:分析和缓解大推理模型中的回避失败

Yi Liu, Xiangyu Liu, Zequn Sun, Wei Hu

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文针对大推理模型在面对不可回答问题时的回避失败问题,提出一种轻量级两阶段方法,通过认知监控与推理干预提升回避率并保持推理性能。

Comments Accepted in the 39th AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11979 2026-01-21 cs.AI cs.LG 81%

Process In-Context Learning: Enhancing Mathematical Reasoning via Dynamic Demonstration Insertion

过程在上下文学习:通过动态演示插入增强数学推理

Ang Gao, Changshuo Zhang, Xiao Zhang, Deyang Li, Minjun Zhao, Fangchao Liu, Xinyu Zhang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Huawei Poisson Lab, China(华为Poisson实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 PICL通过动态插入相关演示来提升数学推理能力,有效缓解推理过程中的困惑问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13244 2026-01-21 cs.LG 70%

Do Instruction-Tuned Models Always Perform Better Than Base Models? Evidence from Math and Domain-Shifted Benchmarks

指令微调模型是否总是比基模型表现更好?数学和领域转移基准的证据

Prateek Munjal, Clement Christophe, Ronnie Rajan, Praveenkumar Kanithi

机构 * M42, Abu Dhabi, UAE(阿布扎希德)

专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.LG

AI总结 研究通过数学和领域转移基准验证指令微调模型在不同设置下的表现差异,发现其性能依赖于提示模式而非内在推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14175 2026-01-21 cs.LG cs.AI cs.CL hep-th 67%

A model of errors in transformers

Transformer 中的错误模型

Suvrat Raju, Praneeth Netrapalli

机构 * International Centre for Theoretical Sciences, Tata Institute of Fundamental Research, Bengaluru, India(理论科学国际研究中心,印度塔塔基础研究研究所,班加罗尔) Google Deepmind, Bengaluru, India(谷歌DeepMind,班加罗尔)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种Transformer错误模型,通过双参数关系解释任务复杂度与准确性的关系,并展示了如何通过提示减少错误率。

Comments 8+17pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04419 2026-01-21 cs.LG cs.AI cs.CL 67%

Towards a Unified View of Large Language Model Post-Training

迈向大规模语言模型后训练的统一视角

Xingtai Lv, Yuxin Zuo, Youbang Sun, Hongyi Liu, Yuntian Wei, Zhekai Chen, Xuekai Zhu, Kaiyan Zhang, Bingning Wang, Ning Ding, Bowen Zhou

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) WeChat AI Code(微信AI代码)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出混合后训练算法,通过统一的优化过程整合在线与离线数据,实现稳定探索与有效利用演示,提升大规模语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02076 2026-01-21 cs.CL cs.AI 62%

Deferred Commitment Decoding for Diffusion Language Models

延迟承诺解码用于扩散语言模型

Yingte Shu, Yuchuan Tian, Chao Xu, Yunhe Wang, Hanting Chen

机构 * Peking University(北京大学) Huawei Technologies(华为技术)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出延迟承诺解码方法,通过基于不确定性的策略提升扩散语言模型解码质量和效率,实验显示在多个模型和基准测试中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12711 2026-01-21 cs.AI cs.LG cs.SC 62%

Neurosymbolic LoRA: Why and When to Tune Weights vs. Rewrite Prompts

神经符号LoRA:为何以及何时调整权重 versus 重写提示

Kevin Wang, Neel P. Bhatt, Cong Liu, Junbo Li, Runjin Chen, Yihan Xi, Timothy Barclay, Alvaro Velasquez, Ufuk Topcu, Zhangyang Wang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 神经符号LoRA结合数值和符号更新,提升语言模型微调的适应性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04700 2026-01-21 cs.CL 57%

PRISM: A Unified Framework for Post-Training LLMs Without Verifiable Rewards

PRISM: 一种无需可验证奖励的统一后训练LLM框架

Mukesh Ghimire, Aosong Feng, Liwen You, Youzhi Luo, Fang Liu, Xuan Zhu

机构 * Arizona State University(亚利桑那州立大学) Amazon Web Services(亚马逊网络服务)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 PRISM通过结合过程奖励模型与自我确定性,实现无需真实标签的稳定训练和提升LLM测试性能。

Comments Added open-sourced github url

详情

展开后加载摘要…

URL PDF HTML 收藏