arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-09 至 2026-01-09 共收录 100 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 7 篇

2506.14641 2026-01-09 cs.CL cs.AI cs.LG 87%

Revisiting Chain-of-Thought Prompting: Zero-shot Can Be Stronger than Few-shot

重新审视链式思维提示:零样本可以比少样本更强

Xiang Cheng, Chengyan Pan, Minjun Zhao, Deyang Li, Fangchao Liu, Xinyu Zhang, Xiao Zhang, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学香河人工智能学院) Huawei Poisson Lab(华为Poisson实验室)

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究发现,对于强模型而言,传统CoT示例对推理性能无帮助,且模型更关注指令而非示例,揭示了ICL+CoT框架在数学推理中的局限性。

Comments EMNLP25-findings camera_ready, 19 pages,22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19361 2026-01-09 cs.CL cs.AI 84%

AgenticMath: Enhancing LLM Reasoning via Agentic-based Math Data Generation

AgenticMath: 通过基于代理的数学数据生成增强LLM推理

Xianyang Liu, Yilin Liu, Shuai Wang, Hao Cheng, Andrew Estornell, Yuzhi Zhao, Jun Shu, Jiaheng Wei

机构 * King’s College London(伦敦国王学院) Hong Kong Baptist University(香港 Baptist 大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ByteDance Seed(字节跳动种子) City University of Hong Kong(香港城市大学) Xi’an Jiaotong University(西安交通大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 AgenticMath通过基于代理的数学数据生成方法,提升LLM在数学推理任务上的性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23367 2026-01-09 cs.LG cs.AI 79%

Post-Training Quantization of OpenPangu Models for Efficient Deployment on Atlas A2

在Atlas A2上对OpenPangu模型进行训练后量化以实现高效部署

Yilun Luo, Huaqing Zheng, Haoqian Meng, Wenyuan Liu, Peng Zhang

机构 * School of Computer Science and Technology, Tianjin University(计算机科学与技术学院,天津大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出在Atlas A2上通过低比特量化提升OpenPangu模型的推理效率,实现高效CoT推理并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05242 2026-01-09 cs.CL cs.AI cs.LG 75%

GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization

GDPO:多奖励强化学习优化中的组奖励解耦归一化策略优化

Shih-Yang Liu, Xin Dong, Ximing Lu, Shizhe Diao, Peter Belcak, Mingjie Liu, Min-Hung Chen, Hongxu Yin, Yu-Chiang Frank Wang, Kwang-Ting Cheng, Yejin Choi, Jan Kautz, Pavlo Molchanov

机构 * NVIDIA

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GDPO通过解耦奖励归一化提升多奖励强化学习优化的稳定性和准确性,优于GRPO。

Comments NVIDIA-Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04789 2026-01-09 cs.CL cs.AI 62%

NC2C: Automated Convexification of Generic Non-Convex Optimization Problems

NC2C: 通用非凸优化问题的自动凸化

Xinyue Peng, Yanming Liu, Yihan Cang, Yuwei Zhang, Xinyi Wang, Songhang Deng, Jiannan Cao

机构 * Southeast University(东南大学) Zhejiang University(浙江大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 NC2C通过大语言模型实现通用非凸优化问题的自动凸化,提升求解效率并减少专家依赖。

Comments First version of NC2C

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04675 2026-01-09 cs.AI 57%

LLM-Guided Quantified SMT Solving over Uninterpreted Functions

基于大语言模型的量化SMT求解与不可解释函数

Kunhang Lv, Yuhang Dong, Rui Han, Fuqi Jia, Feifei Ma, Jian Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 AquaForte利用大语言模型提供语义指导,通过生成满足约束条件的函数定义实例化候选,显著减少SMT求解的搜索空间和复杂性,有效解决传统求解器超时的实例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04752 2026-01-09 cs.CV 50%

Skeletonization-Based Adversarial Perturbations on Large Vision Language Model's Mathematical Text Recognition

基于骨架化的对抗扰动在大视觉语言模型数学文本识别中的应用

Masatomo Yoshida, Haruto Namura, Nicola Adami, Masahiro Okuda

机构 * Doshisha University Kyoto, 610-0394 Japan University of Brescia Brescia, 25134 Italy Independent Researcher Tokyo, Japan

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出基于骨架化的对抗扰动方法,用于评估大视觉语言模型在数学文本识别中的视觉能力和局限性,并通过ChatGPT验证其实际应用价值。

Comments accepted to ITC-CSCC 2025

Journal ref Proc. ITC-CSCC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2601.04653 2026-01-09 cs.AI cs.LO 57%

Vibe Coding an LLM-powered Theorem Prover

Vibe 编码一个基于 LLM 的定理推理论证系统

Zhe Hou

机构 * Griffith University(格里菲斯大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 Isabellm是一个基于LLM的定理推理论证系统,通过结合分步推证器和证明计划器,实现自动证明合成,并展示了LLM在复杂证明任务中的潜力与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23780 2026-01-09 cs.SE 50%

Test Case Specification Techniques and System Testing Tools in the Automotive Industry: A Review

汽车行业中测试用例规范技术与系统测试工具:综述

Denesa Zyberaj, Pascal Hirmer, Marco Aiello, Stefan Wagner

专题命中 代码与定理证明 :planning(abstract)

AI总结 本文通过系统文献综述和行业经验,综述了汽车行业测试用例规范技术与系统测试工具的挑战与需求,提出了优先级标准目录,支持技术选择和未来测试框架改进。

Comments This is the author accepted manuscript (AAM) of a paper accepted for publication in The Journal of Systems and Software (Elsevier). The final published version will be available via the journal

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 9 篇

2601.04260 2026-01-09 cs.AI cs.LG 88%

Towards a Mechanistic Understanding of Propositional Logical Reasoning in Large Language Models

迈向大型语言模型命题逻辑推理的机理理解

Danchun Chen, Qiyao Yan, Liangming Pan

机构 * MOE Key Lab of Computational Linguistics, Peking University(教育部计算语言学重点实验室,北京大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析Qwen3在PropLogic-MI数据集上的表现,揭示了大型语言模型在命题逻辑推理中采用的结构化计算机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05988 2026-01-09 cs.LG cs.SE 85%

Pruning the Unsurprising: Efficient LLM Reasoning via First-Token Surprisal

剪除无意义的:通过首词意外度实现高效的LLM推理

Wenhao Zeng, Yaoning Wang, Chao Hu, Yuling Shi, Chengcheng Wan, Hongyu Zhang, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) East China Normal University(华东师范大学) Chongqing University(重庆大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文提出ASAP方法,通过锚点引导和首词意外度度量实现高效的CoT压缩,提升推理效率并降低训练成本。

Comments Code and model available at https://github.com/Zengwh02/ASAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05240 2026-01-09 cs.LG cond-mat.dis-nn cs.AI hep-th 84%

Robust Reasoning as a Symmetry-Protected Topological Phase

鲁棒推理作为对称保护的拓扑相

Ilmo Sung

机构 * Science and Technology Directorate, Department of Homeland Security(国土安全部科学技术管理局)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出鲁棒推理是一种对称保护的拓扑相,通过非阿贝尔规范对称性实现逻辑运算的拓扑不变性,展示了在高噪声环境下保持逻辑一致性的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11529 2026-01-09 cs.CL 83%

Hallucination Detection via Internal States and Structured Reasoning Consistency in Large Language Models

通过内部状态和结构化推理一致性检测大语言模型中的幻觉

Yusheng Song, Lirong Qiu, Xi Zhang, Zhihao Tang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 通过内部状态和结构化推理一致性检测大语言模型中的幻觉,提出统一框架解决检测困境,提升事实和逻辑任务的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04726 2026-01-09 cs.AI cs.CL 81%

Memory Matters More: Event-Centric Memory as a Logic Map for Agent Searching and Reasoning

记忆更重要:以事件为中心的记忆作为智能体搜索和推理的逻辑图

Yuyang Hu, Jiongnan Liu, Jiejun Tan, Yutao Zhu, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CompassMem,一种以事件为中心的记忆框架,通过构建事件图实现智能体的结构化记忆导航,提升长周期推理能力。

Comments 19 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07300 2026-01-09 cs.CL 79%

Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement Learning

原生思考:通过一致性增强强化学习解锁多语言推理

Xue Zhang, Yunlong Liang, Fandong Meng, Songming Zhang, Kaiyu Huang, Yufeng Chen, Jinan Xu, Jie Zhou

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation, Beijing Jiaotong University(大数据与人工智能在交通中的关键实验室,北京交通大学) School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) Pattern Recognition Center, WeChat AI, Tencent Inc(模式识别中心,微信AI,腾讯公司)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 M-Thinker通过一致性增强强化学习提升多语言推理能力,实现高语言一致性和多语言基准优异表现。

Comments 17 pages, 14 tables, 4 figures. Code is available at: https://github.com/XZhang00/M-Thinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04225 2026-01-09 cs.CY cs.AI 70%

Can Consumer Chatbots Reason? A Student-Led Field Experiment Embedded in an "AI-for-All" Undergraduate Course

消费者聊天机器人能推理吗?一个嵌入

Amarda Shehu, Adonyas Ababu, Asma Akbary, Griffin Allen, Aroush Baig, Tereana Battle, Elias Beall, Christopher Byrom, Matt Dean, Kate Demarco, Ethan Douglass, Luis Granados, Layla Hantush, Andy Hay, Eleanor Hay, Caleb Jackson, Jaewon Jang, Carter Jones, Quanyang Li, Adrian Lopez, Logan Massimo, Garrett McMullin, Ariana Mendoza Maldonado, Eman Mirza, Hadiya Muddasar, Sara Nuwayhid, Brandon Pak, Ashley Petty, Dryden Rancourt, Lily Rodriguez, Corbin Rogers, Jacob Schiek, Taeseo Seok, Aarav Sethi, Giovanni Vitela, Winston Williams, Jagan Yetukuri

机构 * George Mason University(乔治·马歇尔大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文通过学生主导的实地实验,评估了消费者聊天机器人在推理任务中的表现,揭示了其在不同推理类型上的性能差异及教学意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01266 2026-01-09 cs.CL cs.AI 62%

From Policy to Logic for Efficient and Interpretable Coverage Assessment

从策略到逻辑:为高效和可解释的覆盖评估而设

Rhitabrat Pokharel, Hamid Reza Hassanzadeh, Ameeta Agrawal

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种结合覆盖意识检索器和符号规则推理的方法,以提高医疗覆盖政策审查的效率和可解释性,同时降低模型成本并提升评估准确性。

Comments Accepted at AIMedHealth @ AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04118 2026-01-09 cs.CV 50%

GeoReason: Aligning Thinking And Answering In Remote Sensing Vision-Language Models Via Logical Consistency Reinforcement Learning

GeoReason: 通过逻辑一致性强化学习对遥感视觉-语言模型中的思考与回答进行对齐

Wenshuai Li, Xiantai Xiang, Zixiao Wen, Guangyao Zhou, Ben Niu, Feng Wang, Lijia Huang, Qiantong Wang, Yuxin Hu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) Key Laboratory of Target Cognition and Application Technology, Chinese Academy of Sciences(中国科学院目标认知与应用技术重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 GeoReason通过逻辑一致性强化学习提升遥感视觉-语言模型的推理可靠性与可解释性,实现思考与决策的同步。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 18 篇

2510.21007 2026-01-09 cs.CL 85%

Can Confidence Estimates Decide When Chain-of-Thought Is Necessary for LLMs?

置信度估计何时决定大语言模型需要链式推理

Samuel Lewis-Lim, Xingwei Tan, Zhixue Zhao, Nikolaos Aletras

机构 * School of Computer Science, University of Sheffield(计算机科学学院,谢菲尔德大学)

专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 研究通过置信度门控CoT技术,探讨如何根据置信度估计决定是否需要链式推理,以优化大语言模型的计算资源使用。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24957 2026-01-09 cs.AI 83%

AMAP Agentic Planning Technical Report

AMAP 代理规划技术报告

AMAP AI Agent Team, Yulan Hu, Xiangwen Zhang, Sheng Ouyang, Hao Yi, Lu Xu, Qinglin Lang, Lide Tan, Xiang Cheng, Tianchen Ye, Zhicong Li, Ge Chen, Wenjin Yang, Zheng Pan, Shaopan Xiong, Siran Yang, Ju Huang, Yan Zhang, Jiamang Wang, Yong Liu, Yinfeng Huang, Ning Wang, Tucheng Lin, Xin Li, Ning Guo

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 STAgent是一种专门用于时空理解的代理大语言模型,通过稳定工具环境、分层数据筛选和级联训练配方,有效解决复杂任务并保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04699 2026-01-09 cs.RO cs.AI 79%

SeqWalker: Sequential-Horizon Vision-and-Language Navigation with Hierarchical Planning

SeqWalker: 基于分层规划的序列地平线视觉-语言导航

Zebin Han, Xudong Wang, Baichen Liu, Qi Lyu, Zhenduo Shang, Jiahua Dong, Lianqing Liu, Zhi Han

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 SeqWalker通过分层规划框架解决多任务视觉-语言导航中的信息过载问题,通过高层规划减少认知负荷,低层规划利用指令逻辑结构校正轨迹误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04668 2026-01-09 cs.RO cs.AI 79%

Optimizing Path Planning using Deep Reinforcement Learning for UGVs in Precision Agriculture

利用深度强化学习优化无人机在精准农业中的路径规划

Laukik Patade, Rohan Rane, Sandeep Pillai

机构 * Sardar Patel Institute of Technology(萨达尔·帕特尔技术学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本研究利用深度强化学习优化无人机在精准农业中的路径规划,通过DDPG和TD3算法在动态环境中实现高成功率的导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03948 2026-01-09 cs.AI q-fin.TR 79%

Trade-R1: Bridging Verifiable Rewards to Stochastic Environments via Process-Level Reasoning Verification

Trade-R1: 通过过程级推理验证弥合可验证奖励与随机环境

Rui Sun, Yifan Sun, Sheng Xu, Li Zhao, Jing Li, Daxin Jiang, Cheng Hua, Zuo Bai

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Trade-R1通过过程级推理验证,将可验证奖励与随机金融环境连接,减少奖励黑客问题,DSR在跨市场泛化中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04334 2026-01-09 cs.RO math.OC 78%

Autonomous Reasoning for Spacecraft Control: A Large Language Model Framework with Group Relative Policy Optimization

自主推理的航天器控制:一种基于大语言模型的框架与群体相对策略优化

Amit Jain, Richard Linares

机构 * Department of Aeronautics \& Astronautics Massachusetts Institute of Technology Cambridge, MA 02139

专题命中 规划推理 :reasoning(title,abstract)

AI总结 本文提出一种基于大语言模型和群体相对策略优化的自主推理航天器控制框架,通过两阶段训练方法生成可解释的控制策略,适用于复杂动态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06042 2026-01-09 cs.MA 78%

Agent+P: Guiding UI Agents via Symbolic Planning

Agent+P: 通过符号规划引导UI代理

Shang Ma, Xusheng Xiao, Yanfang Ye

专题命中 规划推理 :planning(title,abstract)

AI总结 AGENT+P通过符号规划引导UI代理,提升UI自动化任务的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04234 2026-01-09 cs.AI 70%

Formal Analysis of AGI Decision-Theoretic Models and the Confrontation Question

AGI决策理论模型的正式分析及对峙问题

Denis Saklakov

机构 * Denis Saklakov(独立研究者)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文分析了AGI在何种条件下会选择夺取权力而非合作,并推导出对峙的阈值条件,探讨了奖励设计和监管的 implications。

Comments 18 pages, 2 tables. Version 8

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04556 2026-01-09 cs.SE 67%

4D-ARE: Bridging the Attribution Gap in LLM Agent Requirements Engineering

4D-ARE:弥合LLM代理需求工程中的归因差距

Bo Yu, Lei Zhao

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 4D-ARE提出一种四维归因驱动代理需求工程方法,解决代理应推理什么的问题,补充运行时推理框架如何推理的不足。

Comments 39 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04767 2026-01-09 cs.AI cs.CL 62%

AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search

AT$^2$PO: 通过树搜索实现基于回合的代理策略优化

Zefang Zong, Dingwei Chen, Yang Li, Qi Yi, Bo Zhou, Chengming Li, Bo Qian, Peng Chen, Jie Jiang

机构 * Tencent Inc(腾讯公司) Sun Yat-Sen University(中山大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AT$^2$PO 通过树搜索实现多轮代理强化学习,解决探索多样性、奖励分配和策略优化不一致问题,提升性能达1.84个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04888 2026-01-09 cs.AI 57%

SmartSearch: Process Reward-Guided Query Refinement for Search Agents

SmartSearch: 基于过程奖励的查询优化用于搜索代理

Tongyu Wen, Guanting Dong, Zhicheng Dou

机构 * Renmin University of China(中国人民大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 SmartSearch通过过程奖励和查询优化机制提升搜索代理的查询质量与效率。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04742 2026-01-09 cs.CL 57%

Tool-MAD: A Multi-Agent Debate Framework for Fact Verification with Diverse Tool Augmentation and Adaptive Retrieval

Tool-MAD: 一种用于事实验证的多智能体辩论框架,具有多样化工具增强和自适应检索

Seyeon Jeong, Yeonjun Choi, JongWook Kim, Beakcheol Jang

机构 * Graduate School of Information, Yonsei University(Yonsei大学信息研究生院) Department of Computer Science, Sangmyung University(Sangmyung大学计算机科学系)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 Tool-MAD通过多智能体辩论框架结合多样化工具增强和自适应检索,提升事实验证的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏