arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-30 至 2026-01-30 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2601.21711 2026-01-30 cs.CL cs.AI 86%

TACLer: Tailored Curriculum Reinforcement Learning for Efficient Reasoning

TACLer: 针对高效推理的定制课程强化学习

Huiyuan Lai, Malvina Nissim

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) Center for Language and Cognition (CLCG), University of Groningen, The Netherlands(语言与认知中心(CLCG),格罗宁根大学,荷兰)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 TACLer通过定制课程强化学习提升推理效率,减少计算成本并提高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18196 2026-01-30 cs.CL 83%

LogicReward: Incentivizing LLM Reasoning via Step-Wise Logical Supervision

LogicReward: 通过逐步逻辑监督激励大语言模型推理

Jundong Xu, Hao Fei, Huichi Zhou, Xin Quan, Qijun Huang, Shengqiong Wu, William Yang Wang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University College London(伦敦大学学院) University of Manchester(曼彻斯特大学) University of Melbourne(墨尔本大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 LogicReward通过逐步逻辑监督提升大语言模型的推理能力,有效增强推理可信度和泛化能力,实验显示其在自然语言推理和逻辑推理任务中优于GPT-4o和o4-mini。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21051 2026-01-30 cs.AI cs.CR cs.LG 81%

Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B Technical Report

Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B 技术报告

Zhuoran Yang, Ed Li, Jianliang He, Aman Priyanshu, Baturay Saglam, Paul Kassianik, Sajana Weerawardhena, Anu Vellore, Blaine Nelson, Neusha Javidnia, Arthur Goldblatt, Fraser Burch, Avi Zohary, Assaf Eisenman, Mahdi Sabbaghi, Supriti Vijay, Rahim Dharssi, Dhruv Kedia, Kojin Oshiba, Yaron Singer, Amin Karbasi

机构 * Foundation AI–Cisco Systems Inc.(Foundation AI–Cisco系统公司) Yale University(耶鲁大学) University of California, San Diego(加州大学圣地亚哥分校) University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 Llama-3.1-FoundationAI-SecurityLLM-Reasoning-8B 是首个开源的网络安全专用推理模型,通过结合监督微调和强化学习训练,实现了在网络安全任务上的高性能表现。

Comments 31 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21414 2026-01-30 cs.AI cs.CL 62%

System 1&2 Synergy via Dynamic Model Interpolation

系统1与2的协同通过动态模型插值

Chenxu Yang, Qingyi Si, Chong Tian, Xiyu Liu, Dingyu Yao, Chuanyu Qin, Zheng Lin, Weiping Wang, Jiaqi Wang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DAMI通过动态参数插值调节模型认知深度,实现系统1的效率与系统2的推理能力的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22132 2026-01-30 cs.LG 57%

Pay for Hints, Not Answers: LLM Shepherding for Cost-Efficient Inference

为提示付费,而非答案:用于高效推断的LLM牧师

Ziming Dong, Hardik Sharma, Evan O'Toole, Jaya Prakash Champati, Kui Wu

机构 * Department of Computer Science, University of Victoria, Victoria, Canada(维多利亚大学计算机科学系) Department Of Information Technology, Manipal University, Manipal, India(马那尔大学信息科技系)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 LLM牧师通过请求LLM的短提示来提高SLM的准确性,显著降低推断成本,同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20901 2026-01-30 cs.CR 50%

Towards Sensitivity-Aware Language Models

面向敏感性感知的语言模型

Dren Fazlija, Iyiola E. Olatunji, Daniel Kudenko, Sandipan Sikdar

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出了一种方法,通过监督微调提升四比特量化LLMs的敏感性感知能力,使其在隐私保护方面表现更优,同时保持其他任务性能。

Comments 11 pages, 3 figures, 2 tables, AISTATS 2026; Project Page: https://drenfazlija.github.io/towards-sa-llms/

详情

展开后加载摘要…

URL PDF HTML 收藏