arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-20 至 2026-02-20 共收录 55 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 5 篇

2602.16839 2026-02-20 cs.LG cs.CL 81%

Training Large Reasoning Models Efficiently via Progressive Thought Encoding

通过渐进性思维编码高效训练大型推理模型

Zeliang Zhang, Xiaodong Liu, Hao Cheng, Hao Sun, Chenliang Xu, Jianfeng Gao

机构 * University of Rochester(罗切斯特大学) Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 通过渐进性思维编码方法,提升大型推理模型在有限内存下的推理效率和准确性。

Comments ICLR 2026, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02377 2026-02-20 cs.CL 70%

Proof-RM: A Scalable and Generalizable Reward Model for Math Proof

Proof-RM: 一种可扩展且通用的数学证明奖励模型

Haotong Yang, Zitong Wang, Shijia Kang, Siqi Yang, Wenkai Yu, Xu Niu, Yike Sun, Yi Hu, Zhouchen Lin, Muhan Zhang

机构 * Peking University, Beijing, China(北京大学,北京,中国)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

AI总结 Proof-RM通过构建可扩展的数据管道和训练证明检查奖励模型,提升LLM在数学证明验证中的准确性和泛化能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17288 2026-02-20 cs.AI cs.CL 62%

ArXiv-to-Model: A Practical Study of Scientific LM Training

ArXiv-to-Model:科学语言模型训练的实践研究

Anuj Gupta

机构 * Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过从arXiv LaTeX源数据直接训练科学语言模型,探讨了预处理、分词和计算资源对模型训练的影响,提供了工程层面的训练实践与透明分析。

Comments 15 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00794 2026-02-20 cs.LG cs.AI 62%

Efficient Reinforcement Learning for Large Language Models with Intrinsic Exploration

为大语言模型高效强化学习引入内在探索

Yan Sun, Jia Guo, Stanley Kok, Zihao Wang, Zujie Wen, Zhiqiang Zhang

机构 * National University of Singapore(新加坡国立大学) Ant Group(蚂蚁集团)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 PREPO通过利用内在数据属性提升大语言模型强化学习的数据效率,减少回放需求同时保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17100 2026-02-20 cs.MA 50%

AgentConductor: Topology Evolution for Multi-Agent Competition-Level Code Generation

AgentConductor: 多智能体竞争级代码生成中的拓扑演化

Siyu Wang, Ruotian Lu, Zhihao Yang, Yuchao Wang, Yanzhou Zhang, Lei Xu, Qimin Xu, Guojun Yin, Cailian Chen, Xinping Guan

专题命中 数学推理 :reasoning(abstract)

AI总结 AgentConductor通过动态拓扑生成和强化学习优化,提升多智能体系统在竞争级代码生成中的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2602.16873 2026-02-20 cs.MA cs.AI 57%

AdaptOrch: Task-Adaptive Multi-Agent Orchestration in the Era of LLM Performance Convergence

AdaptOrch:在LLM性能收敛时代的任务自适应多智能体协调

Geunbin Yu

机构 * Department of Artificial Intelligence, Korea National Open University(人工智能系,韩国国立开放大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 AdaptOrch通过动态选择多智能体协调拓扑,提升任务性能,证明协调设计优于模型选择。

Comments 21 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 2 篇

2506.20642 2026-02-20 cs.CL 89%

$π$-CoT: Prolog-Initialized Chain-of-Thought Prompting for Multi-Hop Question-Answering

$π$-CoT:基于Prolog初始化的多跳问答链式思维提示法

Chao Wan, Albert Gong, Mihir Mishra, Carl-Leander Henneking, Claas Beger, Kilian Q. Weinberger

机构 * cornell(康奈尔大学)

专题命中 逻辑推理 :chain-of-thought(title,abstract);CoT(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 $π$-CoT通过结合逻辑编程与语言模型,提升多跳问答性能,优于传统RAG和CoT方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17256 2026-02-20 physics.soc-ph physics.app-ph physics.comp-ph 50%

On the Concept of Violence: A Comparative Study of Human and AI Judgments

关于暴力概念的观念:人类与AI判断的比较研究

Mariachiara Stellato, Francesco Lancia, Chiara Galeazzi, Nico Curti

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文通过比较人类与AI对暴力的判断,探讨了AI如何处理模糊的道德概念及人类解释的转化。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 15 篇

2602.17022 2026-02-20 cs.CL cs.AI 81%

ReIn: Conversational Error Recovery with Reasoning Inception

ReIn:基于推理 inception 的对话错误恢复

Takyoung Kim, Jinseok Nam, Chandrayee Basu, Xing Fan, Chengyuan Ma, Heng Ji, Gokhan Tur, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ReIn通过推理inception方法实现对话错误恢复,无需修改模型参数或提示,提升任务成功率并泛化到未见错误类型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23029 2026-02-20 cs.LG cs.SY eess.SY 79%

Risk-Aware Decision Making in Restless Bandits: Theory and Algorithms for Planning and Learning

在 restless bandits 中的风险意识决策:用于规划和学习的理论与算法

Nima Akbarzadeh, Yossiri Adulyasak, Erick Delage

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 本文提出了一种风险意识的 restless bandits 决策方法,结合理论与算法,用于规划和学习场景中降低风险暴露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15733 2026-02-20 cs.AI cs.CL cs.LG 75%

$\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts

SPECS:通过推测草案实现更快的测试时间扩展

Mert Cemri, Nived Rajaraman, Rishabh Tiwari, Xiaoxuan Liu, Kurt Keutzer, Ion Stoica, Kannan Ramchandran, Ahmad Beirami, Ziteng Sun

专题命中 规划推理 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPECS通过推测草案方法在提升测试时间扩展效率的同时减少延迟,实现更优的推理性能与用户体验。

Comments 28 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17365 2026-02-20 cs.SE 67%

Computer-Using World Model

计算机使用世界模型

Yiming Guan, Rui Yu, John Zhang, Lu Wang, Chaoyun Zhang, Liqun Li, Bo Qiao, Si Qin, He Huang, Fangkai Yang, Pu Zhao, Lukas Wutschitz, Samuel Kessler, Huseyin A Inan, Robert Sim, Saravan Rajmohan, Qingwei Lin, Dongmei Zhang

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 CUWM是一种用于桌面软件的世界模型,通过两阶段分解预测UI状态变化,提升测试时动作决策的质量和鲁棒性。

Comments 35 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16072 2026-02-20 cs.RO 67%

I-FailSense: Towards General Robotic Failure Detection with Vision-Language Models

I-FailSense:面向通用机器人故障检测的视觉-语言模型

Clemence Grislain, Hamed Rahimi, Olivier Sigaud, Mohamed Chetouani

机构 * ISIR, Sorbonne Université, CNRS(ISIR,索邦大学,国家科学研究中心)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 I-FailSense通过构建专门用于检测语义错位故障的数据集,提出了一种开源视觉-语言模型框架,有效提升机器人故障检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17308 2026-02-20 cs.AI cs.LG 62%

MedClarify: An information-seeking AI agent for medical diagnosis with case-specific follow-up questions

MedClarify:一种用于医学诊断的信息寻求AI代理,具有病例特定的后续问题

Hui Min Wong, Philip Heesen, Pascal Janetzky, Martin Bendszus, Stefan Feuerriegel

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MedClarify通过生成病例特定的后续问题,提升医学诊断的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17345 2026-02-20 cs.CR cs.AI 57%

What Breaks Embodied AI Security:LLM Vulnerabilities, CPS Flaws,or Something Else?

使具身AI安全破裂的因素:大语言模型漏洞、CPS缺陷还是其他东西?

Boyang Ma, Hechuan Guo, Peizhuo Lv, Minghui Xu, Xuelong Dai, YeChao Zhang, Yijun Yang, Yue Zhang

机构 * Shandong University(山东大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了具身AI安全问题的根源,指出系统级不匹配而非孤立模型缺陷或传统CPS攻击是主要因素,并提出了四个核心见解以解释其安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17096 2026-02-20 cs.AI 57%

Agentic Wireless Communication for 6G: Intent-Aware and Continuously Evolving Physical-Layer Intelligence

面向6G的代理无线通信:意图感知与持续演化的物理层智能

Zhaoyang Li, Xingzhi Jin, Junyu Pan, Qianqian Yang, Zhiguo Shi

机构 * College of Information Science and Electronic Engineering, Zhejiang University(信息科学与电子工程学院,浙江大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于LLM的代理AI用于6G物理层,通过意图感知和持续演进实现自主通信决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00307 2026-02-20 cs.AI cs.DB cs.MA 57%

Autonomous Data Processing using Meta-Agents

使用元代理的自主数据处理

Udayan Khurana

机构 * IBM T.J. Watson Research Center(IBM T.J. Watson 研究中心)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 ADP-MA通过元代理实现自主数据处理,动态构建和优化数据管道,提升适应性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00167 2026-02-20 cs.AI cs.CR cs.RO 57%

Drones that Think on their Feet: Sudden Landing Decisions with Embodied AI

能自主决策的无人机:基于具身AI的突发着陆决策

Diego Ortiz Barbosa, Mohit Agrawal, Yash Malegaonkar, Luis Burbano, Axel Andersson, György Dán, Henrik Sandberg, Alvaro A. Cardenas

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究利用具身AI实现无人机在突发情况下的自主决策与安全着陆,展示了新的适应性恢复管道,提升了自主空中系统的安全性和韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17622 2026-02-20 cs.CR cs.SE 50%

What Makes a Good LLM Agent for Real-world Penetration Testing?

什么样的LLM代理适合现实中的渗透测试?

Gelei Deng, Yi Liu, Yuekang Li, Ruozhao Yang, Xiaofei Xie, Jie Zhang, Han Qiu, Tianwei Zhang

专题命中 规划推理 :planning(abstract)

AI总结 Excalibur通过结合强大工具和难度感知计划,提高了渗透测试代理在复杂任务中的表现和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17518 2026-02-20 cs.IR 50%

A Picture of Agentic Search

代理搜索的图景

Francesca Pezzuti, Ophir Frieder, Fabrizio Silvestri, Sean MacAvaney, Nicola Tonellotto

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出了一种收集代理检索增强系统生成和消耗数据的方法,并发布了一个包含多代理和检索流程的数据集,以应对IR在代理用户需求下的适应性挑战。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17415 2026-02-20 cs.RO cs.SY eess.SY 50%

Distributed Virtual Model Control for Scalable Human-Robot Collaboration in Shared Workspace

分布式虚拟模型控制用于可扩展的人机协作在共享工作空间

Yi Zhang, Omar Faris, Chapa Sirithunge, Kai-Fung Chu, Fumiya Iida, Fulvio Forni

机构 * Department of Engineering, University of Cambridge(工程系,剑桥大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种分布式虚拟模型控制框架,通过去中心化方法实现安全的人机协作,有效解决死锁问题并提升协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.08298 2026-02-20 cs.CV 50%

Knowledge driven Description Synthesis for Floor Plan Interpretation

基于知识的描述合成用于平面图解释

Shreya Goyal, Chiranjoy Chattopadhyay, Gaurav Bhatnagar

专题命中 规划推理 :planning(abstract)

AI总结 本文提出DSIC和TBDG两个模型,利用深度神经网络提升平面图图像到文本的生成能力,增强描述的鲁棒性和灵活性。

Comments 19 pages, 18 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16964 2026-02-20 cs.IR 50%

SAGE: Structure Aware Graph Expansion for Retrieval of Heterogeneous Data

SAGE:面向异构数据检索的结构感知图扩展

Prasham Titiya, Rohit Khoja, Tomer Wolfson, Vivek Gupta, Dan Roth

专题命中 规划推理 :planning(abstract)

AI总结 SAGE通过构建结构感知的图扩展框架,在异构数据检索中提升召回率,采用混合检索与代理策略实现多模态证据链检索。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 3 篇

2602.16826 2026-02-20 cs.LG cs.AI 62%

HiVAE: Hierarchical Latent Variables for Scalable Theory of Mind

HiVAE:用于可扩展理论之心的层次潜在变量

Nigel Doering, Rahath Malladi, Arshia Sangwan, David Danks, Tauhidur Rahman

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 HiVAE通过层次化变分架构提升理论之心推理能力,解决现实时空领域中的心理状态推断问题,并提出自监督对齐策略以增强潜在表示的参照性。

Comments Accepted at the Workshop on Theory of Mind for AI (ToM4AI) at the 40th AAAI Conference on Artificial Intelligence (AAAI-26), Singapore, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17116 2026-02-20 cs.AI 57%

Epistemology of Generative AI: The Geometry of Knowing

生成AI的形而上学:认知的几何学

Ilya Levin

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于高维几何空间的指涉认识论,重新定义生成模型为流形导航者,引入导航知识作为知识生产的第三种模式。

Comments 27

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07825 2026-02-20 cs.CV 50%

Point Linguist Model: Segment Any Object via Bridged Large 3D-Language Model

点语言模型:通过桥接大型3D语言模型实现任意对象分割

Zhuoxu Huang, Mingqi Gao, Jungong Han

机构 * Department of Computer Science, Aberystwyth University(计算机科学系,阿伯里斯特维斯大学) School of Computer Science, University of Sheffield(计算机科学学院,谢菲尔德大学) Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 点语言模型通过桥接大型3D语言模型与密集3D点云,解决表示不一致问题,提升3D对象分割的准确性和鲁棒性。

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 4 篇

2602.17633 2026-02-20 cs.LG cs.AI stat.ML 84%

When to Trust the Cheap Check: Weak and Strong Verification for Reasoning

何时相信廉价检查:弱验证与强验证用于推理

Shayan Kiyani, Sima Noorani, George Pappas, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出弱-强验证策略,通过两个阈值结构控制接受和拒绝错误,以提高LLM推理的可靠性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16833 2026-02-20 cs.LG cs.AI 62%

VAM: Verbalized Action Masking for Controllable Exploration in RL Post-Training -- A Chess Case Study

VAM:在RL后训练中可控探索的可言行动屏蔽——国际象棋案例研究

Zhicheng Zhang, Ziyan Wang, Yali Du, Fei Fang

机构 * Carnegie Mellon University(卡内基梅隆大学) King's College London(国王学院伦敦)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 VAM通过可言化动作屏蔽提升LLM后训练强化学习的探索效率,在国际象棋中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16787 2026-02-20 cs.LG cs.CL 62%

Better Think Thrice: Learning to Reason Causally with Double Counterfactual Consistency

三思而后行:通过双重反事实一致性学习因果推理

Victoria Lin, Xinnuo Xu, Rachel Lawrence, Risa Ueno, Amit Sharma, Javier Gonzalez, Niranjani Prasad

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research Cambridge(微软研究院剑桥分部) Microsoft Research India(微软研究院印度分部)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出双重反事实一致性方法,用于评估和提升大型语言模型的因果推理能力,无需标注数据,通过因果干预和反事实预测验证模型能力,并在多种任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06275 2026-02-20 cs.CL 57%

RoPE-LIME: RoPE-Space Locality + Sparse-K Sampling for Efficient LLM Attribution

RoPE-LIME: RoPE空间局部性 + 稀疏K采样用于高效的LLM归因

Isaac Picov, Ritesh Goru

机构 * University of Toronto(多伦多大学) DevRev

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 RoPE-LIME通过RoPE空间局部性和稀疏K采样,高效实现LLM归因,减少API调用并提升归因信息质量。

详情

展开后加载摘要…

URL PDF HTML 收藏