arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-13 至 2026-01-13 共收录 149 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 9 篇

2601.03769 2026-01-13 cs.AI 85%

EntroCoT: Enhancing Chain-of-Thought via Adaptive Entropy-Guided Segmentation

EntroCoT:通过自适应熵引导分割增强链式思考

Zihang Li, Yuhang Wang, Yikun Zong, Wenhan Yu, Xiaokun Yuan, Runhan Jiang, Zirui Liu, Tong Yang, Arthur Jiang

机构 * Peking University(北京大学) IQuest Research(IQuest研究)

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 EntroCoT通过自适应熵引导分割提升链式思考的推理质量,构建高质量数据集以提高大语言模型的数学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06677 2026-01-13 cs.LG cs.AI 84%

Plasticity vs. Rigidity: The Impact of Low-Rank Adapters on Reasoning on a Micro-Budget

可塑性与刚性:低秩适配器对微预算推理的影响

Zohaib Khan, Omer Tafveez, Zoha Hayat Bhatti

机构 * University of Michigan(密歇根大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 研究通过低秩适配器在微预算下提升小型模型推理能力,发现高秩适配器能显著增强模型可塑性,但数学对齐模型性能下降,揭示了预算限制对模型优化的复杂影响。

Comments 9 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23232 2026-01-13 cs.LG cs.AI cs.CL 80%

SPEC-RL: Accelerating On-Policy Reinforcement Learning with Speculative Rollouts

SPEC-RL: 通过推测性回放加速在线策略学习

Bingshuai Liu, Ante Wang, Zijun Min, Liang Yao, Haibo Zhang, Yang Liu, Xu Han, Peng Li, Anxiang Zeng, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) LLM Team, Shopee Pte. Ltd.(Shopee公司语言模型团队) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPEC-RL通过整合推测解码技术,有效减少强化学习回放阶段的计算开销,提升大模型推理能力。

Comments fixed typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07696 2026-01-13 cs.CL 79%

Exploring the Meta-level Reasoning of Large Language Models via a Tool-based Multi-hop Tabular Question Answering Task

通过基于工具的多跳表格问答任务探索大型语言模型的元级推理

Nick Ferguson, Alan Bundy, Kwabena Nuamah

机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过设计基于工具的多跳表格问答任务,探索大型语言模型的元级推理能力,发现其在任务分解和工具选择方面表现良好,但在数学运算和任务理解上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07123 2026-01-13 cs.AI 79%

ENTRA: Entropy-Based Redundancy Avoidance in Large Language Model Reasoning

ENTRA:基于熵的大型语言模型推理中的冗余避免

Ruichu Cai, Haopeng Du, Qingwen Lin, Yutong Chen, Zijian Li, Boyan Xu

机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机科学学院) Peng Cheng Laboratory(鹏城实验室) Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ENTRA通过基于熵的训练框架减少大型语言模型的冗余推理,提升推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07038 2026-01-13 cs.AI 79%

Tool-Augmented Policy Optimization: Synergizing Reasoning and Adaptive Tool Use with Reinforcement Learning

工具增强的策略优化:通过强化学习协同推理与自适应工具使用

Wenxun Wu, Yuanyang Li, Guhan Chen, Linyue Wang, Hongyang Chen

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 TAPO通过强化学习整合多跳推理与自适应工具调用,提升模型在知识密集型和计算密集型任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06786 2026-01-13 cs.CL 79%

EpiCaR: Knowing What You Don't Know Matters for Better Reasoning in LLMs

EpiCaR: 了解未知对提高大语言模型的推理能力至关重要

Jewon Yeom, Jaewon Sok, Seonghyeon Park, Jeongjae Park, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Department of Rural Systems Engineering, Seoul National University(农村系统工程系,首尔国立大学) Department of Aerospace Engineering, Seoul National University(航空航天工程系,首尔国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 EpiCaR通过知识校准推理提升大语言模型的推理准确性和校准性,减少推理计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06911 2026-01-13 cs.CL cs.AI cs.LG 67%

Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language Models

分布清晰度:大型语言模型中RL友好性的隐藏驱动因素

Shaoning Sun, Mingzhu Cai, Huang He, Bingjin Chen, Siqi Bao, Yujiu Yang, Hua Wu, Haifeng Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Baidu Inc(百度公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示了大型语言模型中RL友好性的隐藏驱动因素——分布清晰度,通过量化Silhouette系数并提出Silhouette-aware Reweighting策略,提升了模型在数学基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07264 2026-01-13 cs.CL 57%

The Confidence Dichotomy: Analyzing and Mitigating Miscalibration in Tool-Use Agents

置信二元性:分析和缓解工具使用代理中的校准偏差

Weihao Xuan, Qingcheng Zeng, Heli Qi, Yunze Xiao, Junjue Wang, Naoto Yokoya

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出强化学习框架,通过优化任务准确性和校准,缓解工具使用代理中的校准偏差,提升其在不同领域和环境中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2507.05558 2026-01-13 cs.CR cs.AI 57%

AI Agent Smart Contract Exploit Generation

AI代理智能合约漏洞生成

Arthur Gervais, Liyi Zhou

机构 * University College London(伦敦大学学院) The University of Sydney(悉尼大学) Decentralized Intelligence AG(去中心化智能有限公司) UC Berkeley RDI(伯克利大学RDI)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 A1通过代理系统结合大语言模型,实现智能合约漏洞的高效生成与验证,成功率达63%,并揭示了攻击与防御在经济上的不对称性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 7 篇

2601.07464 2026-01-13 cs.AI 90%

IFDNS: An Iterative Feedback-Driven Neuro-Symbolic Method for Faithful Logical Reasoning

IFDNS: 一种迭代反馈驱动的神经符号方法用于忠实的逻辑推理

Xiaoheng Wang, Tongxuan Liu, Zi Gong, Xianzhe Dong, Yuting Zeng, Minhan Hu, Weizhe Huang, Jing Li

机构 * College of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 IFDNS通过迭代反馈机制提升LLM逻辑推理的忠实性,有效缓解信息丢失问题,显著提高CoT和CoT-SC的性能。

Comments 13 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07754 2026-01-13 cs.CL 83%

Structure First, Reason Next: Enhancing a Large Language Model using Knowledge Graph for Numerical Reasoning in Financial Documents

先结构,再推理:利用知识图谱增强大型语言模型进行财务文档中的数值推理

Aryan Mishra, Akash Anil

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 本文提出利用知识图谱增强大型语言模型,以提高财务文档中的数值推理能力,实验表明该方法在准确性上提升了约12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07690 2026-01-13 cs.LO 67%

On Angels and Demons: Strategic (De)Construction of Dynamic Models

关于天使与恶魔:动态模型的战略(破坏)构建

Davide Catta, Rustam Galimullin, Munyque Mittelmann

专题命中 逻辑推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出三种逻辑用于研究动态图拓扑中策略的构建与破坏,探讨了其表达能力和模型检查复杂性。

Comments This is an extended version of the paper with the same title that will appear in the proceedings of AAMAS 2026. This version contains a technical appendix with proof details

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06181 2026-01-13 cs.AI cs.FL cs.LG cs.LO 62%

Neuro-Symbolic Compliance: Integrating LLMs and SMT Solvers for Automated Financial Legal Analysis

神经符号合规:整合大语言模型与SMT求解器用于自动化金融法律分析

Yung-Shen Hsia, Fang Yu, Jie-Hong Roland Jiang

机构 * Department of Management Information Systems, National ChengChi University, Taipei, Taiwan(管理信息系,中华大学,台北,台湾) Department of Electrical Engineering, National Taiwan University, Taipei, Taiwan(电子工程系,台湾大学,台北,台湾)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究整合大语言模型与SMT求解器,提出神经符号合规框架,用于自动化金融法律分析,实现形式可验证性和基于优化的合规修正。

Comments 10 pages, 6 tables, 3 figures, accepted by the 2nd ACM AIware Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17198 2026-01-13 cs.AI cs.LG 62%

Towards Symbolic XAI -- Explanation Through Human Understandable Logical Relationships Between Features

迈向符号化XAI——通过人类可理解的特征间逻辑关系进行解释

Thomas Schnake, Farnoush Rezaei Jafari, Jonas Lederer, Ping Xiong, Shinichi Nakajima, Stefan Gugler, Grégoire Montavon, Klaus-Robert Müller

机构 * Berlin Institute for the Foundations of Learning(柏林学习与数据基础研究所) Machine Learning Group, Technical University of Berlin(柏林技术大学机器学习组) Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Department of Mathematics and Computer Science, Free University of Berlin(柏林自由大学数学与计算机科学系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出符号化XAI框架,通过人类可理解的逻辑关系解释模型决策,提升AI透明度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06097 2026-01-13 cs.CV cs.AI 57%

Semantic Event Graphs for Long-Form Video Question Answering

语义事件图用于长视频问答

Aradhya Dixit, Tianxi Liang

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 语义事件图通过轻量级符号接口提升长视频问答效率,减少令牌使用并保持推理能力。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05774 2026-01-13 cs.AI 57%

ConstraintLLM: A Neuro-Symbolic Framework for Industrial-Level Constraint Programming

ConstraintLLM: 一种用于工业级约束编程的神经符号框架

Weichun Shi, Minghao Liu, Wanting Zhang, Langchen Shi, Fuqi Jia, Feifei Ma, Jian Zhang

机构 * Hangzhou Institute for Advanced Study, UCAS, Hangzhou, China(杭州高等研究院,UCAS,杭州,中国) University of Oxford, Oxford, UK(牛津大学,牛津,英国) University of Science and Technology Beijing, Beijing, China(北京科技大学,北京,中国) SKLCS and Key Laboratory of System Software, ISCAS, Beijing, China(SKLCS和系统软件重点实验室,ISCAS,北京,中国) Laboratory of Parallel Software and Computational Science, ISCAS, Beijing, China(并行软件与计算科学实验室,ISCAS,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 逻辑推理 :self-correction(abstract);分类 cs.AI

AI总结 ConstraintLLM是一种专为约束编程设计的神经符号框架,通过引入Constraint-Aware Retrieval Module和Tree-of-Thoughts框架,实现了在工业级约束编程基准上的高性能求解。

Comments Accepted to the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), Main Conference

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 15999-16019

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 27 篇

2601.06176 2026-01-13 cs.CV 87%

TIR-Flow: Active Video Search and Reasoning with Frozen VLMs

TIR-Flow:基于冻结视频语言模型的主动视频搜索与推理

Hongbo Jin, Siyi Xie, Jiayu Ding, Kuanwei Lin, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

AI总结 TIR-Flow通过三个协同模块实现冻结视频语言模型的主动视频搜索与推理,显著提升性能并拓展长视界视频推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04632 2026-01-13 cs.AI cs.LG 84%

Can Prompt Difficulty be Online Predicted for Accelerating RL Finetuning of Reasoning Models?

能否在线预测提示难度以加速推理模型的强化学习微调?

Yun Qu, Qi Wang, Yixiu Mao, Vincent Tao Hu, Björn Ommer, Xiangyang Ji

机构 * Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出MoPPS框架,通过贝叶斯方法在线预测提示难度,从而加速推理模型的强化学习微调过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07577 2026-01-13 cs.AI 83%

Beyond Entangled Planning: Task-Decoupled Planning for Long-Horizon Agents

超越纠缠规划:面向长时间 horizon 的任务解耦规划

Yunfan Li, Bingbing Xu, Xueyun Tian, Xiucheng Xu, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室、计算技术研究所、中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出任务解耦规划(TDP)方法,通过将任务分解为子目标图,减少长horizon智能体的规划误差传播,提升鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14656 2026-01-13 cs.AI 83%

Cost-Awareness in Tree-Search LLM Planning: A Systematic Study

树搜索LLM规划中的成本意识:系统研究

Zihao Zhang, Hui Wei, Kenan Jiang, Shijia Pan, Shu Kai, Fei Liu

机构 * Emory University(埃默里大学) University of California, Merced(加州大学默塞德分校)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文研究了树搜索LLM规划器在资源受限下的成本意识问题,发现现有方法难以找到最优计划,双向搜索表现最佳,MCTS在短时间任务中最优,表明需新算法而非单纯增加计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11890 2026-01-13 cs.RO cs.AI 83%

Integrating Symbolic RL Planning into a BDI-based Autonomous UAV Framework: System Integration and SIL Validation

将符号RL规划整合到基于BDI的自主无人机框架中:系统集成与SIL验证

Sangwoo Jeon, Juchul Shin, YeonJe Cho, Gyeong-Tae Kim, Seongwoo Kim

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本研究提出AMAD-SRL框架,整合符号RL与BDI方法,通过SIL验证提升无人机任务效率75%。

Comments This submission has been withdrawn by the authors due to institutional and contractual requirements related to security and export-control review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06102 2026-01-13 cs.AI cs.LG 82%

Dynamic Intelligence Ceilings: Measuring Long-Horizon Limits of Planning and Creativity in Artificial Systems

动态智能上限:测量人工智能系统长期规划和创造力的长期限制

Truong Xuan Khanh, Truong Quynh Hoa

机构 * H&K Research Studio, Clevix LLC(Clevix LLC 研究室)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出动态智能上限概念,通过轨迹导向评估框架量化人工智能系统长期规划与创造力的限制,揭示智能上限的动态性与轨迹依赖性。

Comments This paper introduces a trajectory-centric evaluation framework for analyzing long-horizon intelligence limits in artificial systems, focusing on developmental behavior, planning, and structural creativity rather than proposing new learning algorithms. 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07782 2026-01-13 cs.CL cs.AI cs.IR 81%

Beyond Single-Shot: Multi-step Tool Retrieval via Query Planning

超越单次检索:通过查询规划实现多步工具检索

Wei Fang, James Glass

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出TOOLQP框架,通过迭代查询规划解决多步工具检索问题,实现更高效的检索和执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07296 2026-01-13 cs.AI cs.CL 81%

LRAS: Advanced Legal Reasoning with Agentic Search

LRAS: 基于代理搜索的先进法律推理

Yujin Zhou, Chuxue Cao, Jinluan Yang, Lijun Wu, Conghui He, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 LRAS通过整合反思模仿学习和难度感知强化学习,使大推理模型能够识别知识边界并处理法律推理的复杂性,从而在法律领域取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12626 2026-01-13 cs.AI cs.DC 80%

Automated Planning for Optimal Data Pipeline Instantiation

最优数据管道实例化的自动化规划

Leonardo Rosa Amado, Adriano Vogel, Dalvan Griebler, Gabriel Paludo Licks, Eric Simon, Felipe Meneguzzi

机构 * Pontifical Catholic University of Rio Grande do Sul, Brazil(里约格朗德杜斯鲁斯天主教大学) Johannes Kepler University Linz, Austria(林茨约翰·凯撒大学) Sapienza University of Rome, Italy(罗马萨皮恩扎大学) SAP Labs, France(SAP实验室) University of Aberdeen, Scotland(阿伯丁大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于动作成本的规划方法,用于优化数据管道实例化,通过启发式算法减少总执行时间,并在实验中验证了其有效性。

Journal ref Proceedings of the ECAI Workshop on AI-based Planning for Complex Real-World Applications (CAIPI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06562 2026-01-13 cs.LG 79%

Mosaic: Unlocking Long-Context Inference for Diffusion LLMs via Global Memory Planning and Dynamic Peak Taming

Mosaic: 通过全局内存规划和动态峰值镇压解锁扩散语言模型的长上下文推理

Liang Zheng, Bowen Shi, Yitao Hu, Jiawei Zhang, Ruofan Li, Sheng Chen, Wenxin Li, Keqiu Li

机构 * Tianjin University, China(天津大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 Mosaic通过全局内存规划和动态峰值镇压,提升扩散语言模型的长上下文推理能力,实现内存效率和推理长度的显著提升。

Comments 11 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06164 2026-01-13 cs.SE cs.AI 79%

Contract2Plan: Verified Contract-Grounded Retrieval-Augmented Optimization for BOM-Aware Procurement and Multi-Echelon Inventory Planning

Contract2Plan: 一种基于合同的验证性检索增强优化方法用于BOM感知采购和多层级库存规划

Sahil Agarwal

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 Contract2Plan通过验证性检索增强优化方法,解决合同条款与BOM耦合导致的采购和库存规划问题,确保计划的可行性与合规性。

Comments 22 pages, 5 figures, 4 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06062 2026-01-13 cs.CY cs.AI cs.HC 79%

From Values to Frameworks: A Qualitative Study of Ethical Reasoning in Agentic AI Practitioners

从价值到框架:关于代理AI从业者伦理推理的定性研究

Theodore Roberts, Bahram Zarrin

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过定性研究揭示代理AI从业者在伦理推理中的三种框架:用户、设计和伦理,强调需管理这些框架以确保伦理结果。

Comments 10 pages, 2 charts, 1 heatmap

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07186 2026-01-13 cs.RO 78%

PROTEA: Securing Robot Task Planning and Execution

PROTEA:保障机器人任务规划与执行的安全性

Zainab Altaweel, Mohaiminul Al Nahian, Jake Juettner, Adnan Siraj Rakin, Shiqi Zhang

专题命中 规划推理 :planning(title,abstract)

AI总结 PROTEA通过LLM-as-a-Judge机制评估机器人任务计划的安全性,解决维度和历史挑战,提升任务规划系统的鲁棒性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏