arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-22 至 2026-01-22 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 5 篇

2601.14716 2026-01-22 cs.LG cs.AI cs.CL 88%

PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning

PCL-Reasoner-V1.5:通过离线强化学习推进数学推理

Yao Lu, Dengdong Fan, Jianzheng Nie, Fan Xu, Jie Chen, Bin Zhou, Yonghong Tian

机构 * Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 PCL-Reasoner-V1.5通过离线强化学习方法,在数学推理任务中达到新高度,实现90.9%和85.6%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14888 2026-01-22 cs.LG cs.AI cs.CL 82%

What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study

是什么使低比特量化感知训练在推理大语言模型中有效?一项系统研究

Keyu Lv, Manyi Zhang, Xiaobo Xia, Jingchen Ni, Shannan Yan, Xianzhi Yu, Lu Hou, Chun Yuan, Haoli Bai

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Huawei Technologies(华为技术有限公司) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过系统分析揭示了低比特量化感知训练在推理大语言模型中的有效性,提出优化工作流Reasoning-QAT,显著提升精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06052 2026-01-22 cs.CL cs.AI cs.LG 80%

Reinforcement Learning for Chain of Thought Compression with One-Domain-to-All Generalization

基于单领域到全领域泛化的强化学习进行思维链压缩

Hanyu Li, Jiangshan Duo, Bofei Gao, Hailin Zhang, Sujian Li, Xiaotie Deng, Liang Zhao

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) LLM-Core Xiaomi(小米LLM-Core)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于单领域到全领域泛化的强化学习方法,通过样本级软强化学习压缩思维链推理,有效减少响应长度并提升跨领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14280 2026-01-22 cs.CL cs.AI 79%

Hallucination-Free Automatic Question & Answer Generation for Intuitive Learning

无幻觉的自动问答生成用于直观学习

Nicholas X. Wang, Aggelos K. Katsaggelos

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出无幻觉的多代理生成框架,通过结构化协作减少教育内容中的幻觉,提升问答生成的准确性与教育价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14566 2026-01-22 cs.HC 67%

SCSimulator: An Exploratory Visual Analytics Framework for Partner Selection in Supply Chains through LLM-driven Multi-Agent Simulation

SCSimulator: 一种基于LLM驱动多智能体模拟的供应链伙伴选择探索性可视化分析框架

Shenghan Gao, Junye Wang, Junjie Xiong, Yun Jiang, Yun Fang, Qifan Hu, Baolong Liu, Quan Li

专题命中 数学推理 :reasoning(abstract);CoT(abstract)

AI总结 SCSimulator通过LLM驱动的多智能体模拟与人机协作,探索供应链伙伴选择的动态博弈,提供透明的决策解释和可交互的分析工具。

Comments ACM IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏