arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-08 至 2026-01-08 共收录 99 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 9 篇

2511.08525 2026-01-08 cs.CL 89%

Investigating CoT Monitorability in Large Reasoning Models

探究大型推理模型中的CoT可监控性

Shu Yang, Junchao Wu, Xilin Gong, Xuansheng Wu, Derek Wong, Ninghao Liu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证明负责任的人工智能与数据分析师实验室) King Abdullah University of Science and Technology(卡布斯大学) University of Georgia(佐治亚大学) University of Macau(澳门大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文探讨了大型推理模型中CoT可监控性的挑战与潜力,提出MoME范式以通过CoT监控其他模型的误行并提供结构化判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19640 2026-01-08 cs.CL 87%

Interleaved Reasoning for Large Language Models via Reinforcement Learning

通过强化学习实现大型语言模型的交错推理

Roy Xie, David Qiu, Deepak Gopinath, Dong Lin, Yanchao Sun, Chong Wang, Saloni Potdar, Bhuwan Dhingra

机构 * Apple(苹果公司) Duke University(杜克大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

AI总结 通过强化学习实现大型语言模型的交错推理,提升推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21318 2026-01-08 cs.AI 85%

Beyond Chemical QA: Evaluating LLM's Chemical Reasoning with Modular Chemical Operations

超越化学问答:利用模块化化学操作评估LLM的化学推理

Hao Li, He Cao, Bin Feng, Yanjun Shao, Xiangru Tang, Zhiyuan Yan, Li Yuan, Yonghong Tian, Yu Li

机构 * Pengcheng Laboratory(鹏城实验室) International Digital Economy Academy(国际数字经济学院) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) School of AI for Science, Peking University(北京大学科学人工智能学院) Yale University(耶鲁大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出ChemCoTBench框架,通过模块化化学操作评估LLM在化学推理中的能力,解决分子优化和反应预测等复杂任务。

Comments Accepted by NeurIPS 2025 Dataset Track, 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03823 2026-01-08 cs.CL 83%

Step Potential Advantage Estimation: Harnessing Intermediate Confidence and Correctness for Efficient Mathematical Reasoning

阶梯势能优势估计:利用中间置信度和正确性以实现高效的数学推理

Fei Wu, Zhenrong Zhang, Qikai Chang, Jianshu Zhang, Quan Liu, Jun Du

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出阶梯势能优势估计(SPAE)方法,通过提取中间置信度和正确性,实现高效数学推理的细粒度信用分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03822 2026-01-08 cs.AI 79%

ROI-Reasoning: Rational Optimization for Inference via Pre-Computation Meta-Cognition

ROI-Reasoning: 为推理的理性优化 via 预计算元认知

Muyang Zhao, Qi Qi, Hao Sun

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ROI-Reasoning通过预计算元认知,为LLMs提供预算感知的理性优化,提升推理性能并减少计算资源浪费。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03661 2026-01-08 cs.LG cs.AI 62%

AMIR-GRPO: Inducing Implicit Preference Signals into GRPO

AMIR-GRPO:将隐式偏好信号引入GRPO

Amir Hossein Yari, Fajri Koto

机构 * Department of Natural Language Processing, MBZUAI(自然语言处理系,MBZUAI)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AMIR-GRPO通过隐式对比正则化器提升GRPO性能,增强低奖励轨迹抑制,减少长度偏差,实现更密集的监督约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03320 2026-01-08 cs.LG cs.AI 62%

Ratio-Variance Regularized Policy Optimization for Efficient LLM Fine-tuning

基于比率方差正则化的策略优化用于高效的LLM微调

Yu Luo, Shuo Han, Yihan Hu, Dong Li, Jianye Hao

机构 * Department of Foundation Model, 2012 Labs, Huawei(华为2012实验室基础模型部门) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 R²VPO通过正则化策略比率的方差,提升LLM微调的稳定性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11184 2026-01-08 cs.LG cs.CL 62%

Reinforcement Learning for Tool-Integrated Interleaved Thinking towards Cross-Domain Generalization

强化学习用于工具集成的交叉领域泛化思考

Zhengyu Chen, Jinluan Yang, Teng Xiao, Ruochen Zhou, Luan Zhang, Xiangyu Xi, Xiaowei Shi, Wei Wang, Jinggang Wang

机构 * Meituan(美团) Zhejiang University(浙江大学) Allen Institute for Artificial Intelligence(人工智能算法研究所) City University of Hong Kong(香港城市大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出RITE方法,通过强化学习和交叉领域工具执行,提升LLM在跨领域推理中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03723 2026-01-08 cs.LG 57%

ETR: Outcome-Guided Elastic Trust Regions for Policy Optimization

ETR: 以结果为导向的弹性信任区域用于策略优化

Shijie Zhang, Kevin Zhang, Zheyuan Gu, Xiang Guo, Rujun Guo, Shaoyu Liu, Guanjun Jiang, Xiaozhao Wang

机构 * Alibaba Group(阿里巴巴集团) Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 ETR通过动态信任区域机制,提升策略优化的信号利用效率和探索稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 3 篇

2601.03287 2026-01-08 cs.CR cs.AI 57%

Automated Post-Incident Policy Gap Analysis via Threat-Informed Evidence Mapping using Large Language Models

通过大语言模型进行威胁感知证据映射的自动事后政策差距分析

Huan Lin Oh, Jay Yong Jun Jie, Mandy Lee Ling Siu, Jonathan Pan

机构 * Nanyang Technological University, Singapore(南洋理工大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型进行威胁感知证据映射,实现自动事后政策差距分析,提升网络安全事件审查的效率与可审计性。

Comments 5 pages, 1 figure. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03923 2026-01-08 cs.CR 50%

Human Challenge Oracle: Designing AI-Resistant, Identity-Bound, Time-Limited Tasks for Sybil-Resistant Consensus

人类挑战Oracle:设计抗AI、身份绑定、时间限制的任务以实现抗Sybil共识

Homayoun Maleki, Nekane Sainz, Jon Legarda

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出HCO,一种通过时间限制、身份绑定挑战来对抗Sybil攻击的新型安全机制,旨在提升共识系统的抗AI能力。

Comments 21 pages, 4 tables. Initial preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03768 2026-01-08 cs.PL 50%

Agentic Proof Automation: A Case Study

代理证明自动化:一个案例研究

Yichen Xu, Martin Odersky

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本研究提出代理证明自动化方案,利用LLM代理高效完成证明工程任务,通过案例研究展示其在形式化系统中的应用与成效。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 10 篇

2601.03550 2026-01-08 cs.AI 85%

ReEfBench: Quantifying the Reasoning Efficiency of LLMs

ReEfBench: 量化大语言模型的推理效率

Zhizhang Fu, Yuancheng Gu, Chenkai Hu, Hanmeng Liu, Yue Zhang

机构 * Westlake University(西湖大学) Imperial College London(帝国理工学院) New York University(纽约大学) Hainan University(海南大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 ReEfBench通过神经符号框架量化LLM推理效率,揭示推理性能提升源于真实推理而非冗长性,并指出训练中混合长短CoT数据的风险及蒸馏模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14540 2026-01-08 cs.AI 83%

VERUS-LM: a Versatile Framework for Combining LLMs with Symbolic Reasoning

VERUS-LM:一种结合大语言模型与符号推理的多功能框架

Benjamin Callewaert, Simon Vandevelde, Joost Vennekens

机构 * Leuven.AI -- KU Leuven Institute for AI(Leuven.AI — 哥伦比亚大学莱顿人工智能研究所)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 VERUS-LM通过结合大语言模型与符号推理,提升复杂推理任务的适应性与效率,实现更广泛的推理能力。

Comments In Proceedings ICLP 2025, arXiv:2601.00047

Journal ref EPTCS 439, 2026, pp. 47-62

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11830 2026-01-08 cs.CV cs.AI 79%

VISTA: Mitigating Semantic Inertia in Video-LLMs via Training-Free Dynamic Chain-of-Thought Routing

VISTA: 通过无训练动态推理路由缓解视频大语言模型中的语义惯性

Hongbo Jin, Jiayu Ding, Siyi Xie, Guibo Luo, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 逻辑推理 :chain-of-thought(title);reasoning(abstract);分类 cs.AI

AI总结 VISTA通过动态推理路由和潜在推理共识机制,缓解视频大语言模型中的语义惯性问题,提升视频理解性能。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08930 2026-01-08 cs.GR 78%

How Does a Virtual Agent Decide Where to Look? Symbolic Cognitive Reasoning for Embodied Head Rotation

虚拟代理如何决定看向何处?基于具身头部旋转的符号认知推理

Juyeong Hwang, Seong-Eun Hong, JaeYoung Seon, Hyeongyeop Kang

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文提出SCORE框架,通过符号认知推理实现具身头部旋转,结合视觉-语言模型和大语言模型,使虚拟代理能合理预测头部运动及背后动机。

Comments 13 pages, 8 figures. Accepted to SIGGRAPH Asia Conference Papers '25

Journal ref SIGGRAPH Asia Conference Papers '25, December 15-18, 2025, Hongkong

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03261 2026-01-08 cs.CL cs.AI 62%

DeepResearch-Slice: Bridging the Retrieval-Utilization Gap via Explicit Text Slicing

DeepResearch-Slice: 通过显式文本切片弥合检索-利用差距

Shuo Lu, Yinuo Xu, Jianjie Cheng, Lingxiao He, Meng Wang, Jian Liang

机构 * NLPR & MAIS CASIA(CASIA NLPR与MAIS) School of AI UCAS(UCAS人工智能学院) Meituan Inc.(美团公司)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DeepResearch-Slice通过显式文本切片技术,有效解决检索与利用之间的差距问题,提升模型在嘈杂环境中的鲁棒性。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05509 2026-01-08 cs.CL cs.AI 62%

LAG: Logic-Augmented Generation from a Cartesian Perspective

LAG: 从笛卡尔视角出发的逻辑增强生成

Yilin Xiao, Chuang Zhou, Yujing Zhang, Qinggang Zhang, Su Dong, Shengyuan Chen, Chang Yang, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LAG通过系统的问题分解、原子记忆库和逻辑感知推理,提升知识密集型任务的准确性和减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03560 2026-01-08 cs.AI 57%

FÆRDXEL: An Expert System for Danish Traffic Law

FÆRDXEL:丹尼亚交通法专家系统

Luís Cruz-Filipe, Jonas Vistrup

机构 * IT University of Copenhagen(哥本哈根IT大学) University of Southern Denmark(南丹麦大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 FÆRDXEL通过结合逻辑编程与可解释性界面,为丹麦交通法提供符号推理工具,并通过实证和专家评估验证其在法律领域的应用潜力。

Comments In Proceedings ICLP 2025, arXiv:2601.00047

Journal ref EPTCS 439, 2026, pp. 383-396

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16203 2026-01-08 cs.MA cs.AI 57%

Computing Universal Plans for Partially Observable Multi-Agent Routing Using Answer Set Programming

使用答案集编程计算部分可观测多智能体路由的通用计划

Fengming Zhu, Fangzhen Lin

机构 * Department of Computer Science(计算机科学系) Engineering Hong Kong University of Science(工程 香港理工大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出基于答案集编程的系统,用于计算部分可观测多智能体路由问题的通用计划,通过自定义动作偏好实现高效策略。

Comments In Proceedings ICLP 2025, arXiv:2601.00047

Journal ref EPTCS 439, 2026, pp. 143-166

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03417 2026-01-08 cs.CL 57%

Implicit Graph, Explicit Retrieval: Towards Efficient and Interpretable Long-horizon Memory for Large Language Models

隐式图,显式检索:迈向高效且可解释的长周期记忆 для 大语言模型

Xin Zhang, Kailai Yang, Hao Li, Chenyue Li, Qiyu Wei, Sophia Ananiadou

机构 * University of Manchester(曼彻斯特大学) Imperial College London(伦敦帝国学院) Stanford University(斯坦福大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 LatentGraphMem结合隐式图记忆与显式子图检索,实现高效且可解释的长周期记忆,提升大语言模型的推理能力与可解释性。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03781 2026-01-08 cs.CV 50%

MVP: Enhancing Video Large Language Models via Self-supervised Masked Video Prediction

MVP: 通过自监督掩码视频预测增强视频大型语言模型

Xiaokun Sun, Zezhong Wu, Zewen Ding, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 MVP通过自监督掩码视频预测提升视频大语言模型的时间推理和因果理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 18 篇

2601.03164 2026-01-08 cs.CL 88%

WebAnchor: Anchoring Agent Planning to Stabilize Long-Horizon Web Reasoning

WebAnchor: 通过锚定代理规划稳定长周期网络推理

Xinmiao Yu, Liwen Zhang, Xiaocheng Feng, Yong Jiang, Bing Qin, Pengjun Xie, Jingren Zhou

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL

AI总结 WebAnchor通过两阶段强化学习框架,解决长周期网络推理中规划不稳定的问题,提升任务成功率和工具效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23412 2026-01-08 cs.AI 85%

MindWatcher: Toward Smarter Multimodal Tool-Integrated Reasoning

MindWatcher:迈向更智能的多模态工具集成推理

Jiawei Chen, Xintian Shen, Lihao Zheng, Zhenwei Shao, Handong Cui, Chaoqun Du, Li Gong, Feng Gu, Xuefeng Hao, Wei He, Jiabang He, Yi Hu, Bin Huang, Shanshan Li, Qizhen Li, Jing Luo, Zide Liu, Xiaobo Liu, Ning Mao, Lifu Mu, Xuhao Pan, Zhiheng Qu, Chang Ren, Xudong Rao, Haoyi Sun, Qian Wang, Shuai Wang, Zhichao Wang, Wei Wang, Lian Wen, Jiqing Zhan, Hongfu Yang, Sheng Yang, Jiajun Yang, Pengfei Yu, Hongyuan Zhang, Bin Zhang, Chunpeng Zhou, Zheng Zhou, Shucheng Zhou, Shuo Xie, Yun Zhu, Hao Ma, Tao Wei, Pan Zhou, Wei Chen

机构 * Li Auto Inc(力汽车公司)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 MindWatcher是一种能够自主调用工具并进行多模态推理的智能体,通过高效训练和高质量数据集提升了多步骤决策任务的性能。

Comments Technique Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23314 2026-01-08 cs.AI cs.CL cs.LG cs.MA 85%

SPIO: Ensemble and Selective Strategies via LLM-Based Multi-Agent Planning in Automated Data Science

SPIO:基于LLM的多智能体规划的集成与选择策略在自动化数据科学中的应用

Wonduk Seo, Juhyeon Lee, Yanjun Shao, Qingshan Zhou, Seunghyun Lee, Yi Bu

机构 * Enhans Peking University(北京大学) Yale University(耶鲁大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPIO通过基于LLM的多智能体规划,在自动化数据科学中实现了集成与选择策略,提升了流程的灵活性和准确性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00088 2026-01-08 cs.RO cs.AI cs.LG 84%

Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail

Alpamayo-R1: 联结推理与动作预测以实现通用的自动驾驶在长尾场景

NVIDIA, :, Yan Wang, Wenjie Luo, Junjie Bai, Yulong Cao, Tong Che, Ke Chen, Yuxiao Chen, Jenna Diamond, Yifan Ding, Wenhao Ding, Liang Feng, Greg Heinrich, Jack Huang, Peter Karkus, Boyi Li, Pinyi Li, Tsung-Yi Lin, Dongran Liu, Ming-Yu Liu, Langechuan Liu, Zhijian Liu, Jason Lu, Yunxiang Mao, Pavlo Molchanov, Lindsey Pavao, Zhenghao Peng, Mike Ranzinger, Ed Schmerling, Shida Shen, Yunfei Shi, Sarah Tariq, Ran Tian, Tilman Wekel, Xinshuo Weng, Tianjun Xiao, Eric Yang, Xiaodong Yang, Yurong You, Xiaohui Zeng, Wenyuan Zhang, Boris Ivanovic, Marco Pavone

机构 * NVIDIA

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 Alpamayo-R1通过整合因果推理与轨迹规划,提升了自动驾驶在长尾场景中的规划准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14211 2026-01-08 cs.CL cs.AI 81%

LiteStage: Latency-aware Layer Skipping for Multi-stage Reasoning

LiteStage: 低延迟层跳过用于多阶段推理

Beomseok Kang, Jiwon Song, Jae-Joon Kim

机构 * Seoul National University(首尔国立大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 LiteStage通过低延迟层跳过框架提升多阶段推理效率,有效解决阶段间跳过敏感性和冗余输出问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03687 2026-01-08 cs.AI 79%

Personalized Medication Planning via Direct Domain Modeling and LLM-Generated Heuristics

通过直接领域建模和LLM生成的启发式方法实现个性化药物规划

Yonatan Vernik, Alexander Tuisov, David Izhaki, Hana Weitman, Gal A. Kaminka, Alexander Shleyfman

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文通过直接领域建模和LLM生成的启发式方法,提升了个性化药物规划的规模和效率,支持更接近临床应用的实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03398 2026-01-08 cs.RO 78%

Towards Zero-Knowledge Task Planning via a Language-based Approach

通过语言方法实现零知识任务规划

Liam Merz Hoffmeister, Brian Scassellati, Daniel Rakita

机构 * Department of Computer Science, Yale University(计算机科学系,耶鲁大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出利用大型语言模型实现零知识任务规划,通过分解自然语言指令生成行为树并实时调整,提升任务执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02144 2026-01-08 cs.LO 71%

VECSR: Virtually Embodied Common Sense Reasoning System

VECSR:虚拟具身常识推理系统

Alexis R. Tudor, Joaquín Arias, Gopal Gupta

专题命中 规划推理 :reasoning(title)

AI总结 本文提出VECSR系统,通过基于答案集编程的s(CASP)推理器,将自主代理任务分解为中层指令并解释选择,提升家庭环境中的可信度与可解释性。

Comments In Proceedings ICLP 2025, arXiv:2601.00047

Journal ref EPTCS 439, 2026, pp. 76-88

详情

展开后加载摘要…

URL PDF HTML 收藏