arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-23 至 2026-02-23 共收录 48 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 2 篇

2602.18232 2026-02-23 cs.CL cs.AI 81%

Thinking by Subtraction: Confidence-Driven Contrastive Decoding for LLM Reasoning

通过减法思考:基于置信度的对比解码用于大语言模型推理

Lexiang Tang, Weihao Gao, Bingchen Zhao, Lu Ma, Qiao jin, Bang Yang, Yuexian Zou

机构 * Peking University, Beijing, China(北京大学) University of Edinburgh, Edinburgh, UK(爱丁堡大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过置信度驱动的对比解码方法提升大语言模型推理可靠性,减少输出长度并提高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17826 2026-02-23 cs.AI cs.LG cs.SC 62%

Ontology-Guided Neuro-Symbolic Inference: Grounding Language Models with Mathematical Domain Knowledge

本体引导的神经符号推理:通过数学领域知识 grounding 语言模型

Marcelo Labre

机构 * Advanced Institute for Artificial Intelligence (AI2)(人工智能研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过引入形式化数学本体,提升语言模型在数学推理任务中的可靠性,验证了神经符号方法在增强形式化 grounding 方面的潜力与挑战。

Comments Submitted to NeuS 2026. Supplementary materials and code: https://doi.org/10.5281/zenodo.18665030

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2602.18346 2026-02-23 cs.CL cs.AI 62%

Vichara: Appellate Judgment Prediction and Explanation for the Indian Judicial System

Vichara:印度司法系统上诉判决预测与解释

Pavithra PM Nair, Preethu Rose Anish

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Vichara通过结构化方法预测和解释印度司法系统中的上诉判决,利用大型语言模型在两个数据集上取得优异表现,尤其在可解释性方面表现突出。

Journal ref AI and Law @ AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 9 篇

2602.17680 2026-02-23 cs.LG 86%

BioBridge: Bridging Proteins and Language for Enhanced Biological Reasoning with LLMs

BioBridge: 蛋白质与语言的桥梁:利用大语言模型增强生物推理

Yujia Wang, Jihong Guan, Wengen Li, Shuigeng Zhou, Xuhong Wang

机构 * School of Computer Science and Technology(计算机科学与技术学院) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title);分类 cs.LG

AI总结 BioBridge结合蛋白质领域知识与通用语言能力,通过领域自适应持续预训练框架提升生物推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18429 2026-02-23 cs.CL cs.IR 85%

VIRAASAT: Traversing Novel Paths for Indian Cultural Reasoning

VIRAASAT:为印度文化推理开辟新路径

Harshul Raj Surana, Arijit Maji, Aryan Vats, Akash Ghosh, Sriparna Saha, Amit Sheth

机构 * AI Institute, University of South Carolina(AI研究所,南卡罗来纳大学) Indian Institute of Technology Patna(帕纳大学印度理工学院)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 VIRAASAT通过半自动化多跳方法生成印度文化多跳问题-答案数据集,提出SCoM框架提升文化推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18095 2026-02-23 cs.AI 83%

Neurosymbolic Language Reasoning as Satisfiability Modulo Theory

神经符号语言推理作为可满足性模理论

Hyunseok Oh, Sam Stern, Youngki Lee, Matthai Philipose

机构 * Seoul National University(首尔国立大学) U. Mass. Amherst(马萨诸塞大学阿姆赫斯特分校) Microsoft(微软公司)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 Logitext通过结合LLM和SMT求解,实现自然语言与逻辑推理的联合处理,提升内容审核和法律任务的准确性和覆盖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04108 2026-02-23 cs.CL 83%

Batch Prompting Suppresses Overthinking Reasoning Under Constraint: How Batch Prompting Suppresses Overthinking in Reasoning Models

批量提示抑制约束下的过度推理:如何通过批量提示抑制推理模型中的过度推理

Saurabh Srivastava, Janit Bidhan, Hao Yan, Abhishek Dey, Tanu Kansal, Paras Kath, Sina Mansouri, Mohit Marvania, Vamsi Shankar Simhadri, Gaurav Singh

机构 * George Mason University(乔治·马歇尔大学) Google(谷歌) eBay

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 批量提示通过减少推理标记和抑制过度推理行为,提升推理模型的效率和可靠性。

Comments New version with updated author list

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17693 2026-02-23 cs.LG cs.AI cs.CL 82%

A Case Study of Selected PTQ Baselines for Reasoning LLMs on Ascend NPU

在Ascend NPU上对推理LLM的选定PTQ基线进行案例研究

Yuchen Luo, Fangyue Zhu, Ruining Zhou, Mingzhe Huang, Jian Zhu, Fanyu Fan, Wei Shao

机构 * School of Mathematics and Statistics, Wuhan University(武汉大学数学与统计学院) Huawei(华为公司)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了在Ascend NPU上不同PTQ方法对推理LLM的影响,发现4位权重量化在大模型中可行,但激进方案存在稳定性问题,而8位量化更稳定,实际部署中动态量化开销限制了加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18351 2026-02-23 cs.CL cs.AI 62%

Validating Political Position Predictions of Arguments

验证论证中政治立场预测的准确性

Jordan Robinson, Angus R. Williams, Katie Atkinson, Anthony G. Cohn

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出双尺度验证框架,通过点评和成对验证方法验证论证中政治立场预测的准确性,构建了大规模政治立场知识库,提升了政治领域知识表示能力。

Comments 13 pages, 6 figures, 6 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17999 2026-02-23 cs.HC cs.AI 57%

Aurora: Neuro-Symbolic AI Driven Advising Agent

Aurora:神经符号AI驱动的建议代理

Lorena Amanda Quincoso Lugones, Christopher Kverne, Nityam Sharadkumar Bhimani, Ana Carolina Oliveira, Agoritsa Polyzou, Christine Lisetti, Janki Bhimani

机构 * Florida International University(佛罗里达国际大学) Northeastern University(东北大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 Aurora通过神经符号AI结合检索增强生成、符号推理和课程数据库,实现大规模、可验证的学术建议,提升推荐准确性和效率。

Comments Accepted to 41st ACM/SIGAPP Symposium On Applied Computing. 8 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17688 2026-02-23 cs.LG cs.PL 57%

AnCoder: Anchored Code Generation via Discrete Diffusion Models

AnCoder:通过离散扩散模型实现锚定代码生成

Anton Xue, Litu Rout, Constantine Caramanis, Sanjay Shakkottai

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 逻辑推理 :planning(abstract);分类 cs.LG

AI总结 AnCoder通过结构化锚定扩散模型实现高质量代码生成,解决了传统方法无法尊重编程语言结构的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13567 2026-02-23 cs.AI 57%

On the Value of Labeled Data and Symbolic Methods for Hidden Neuron Activation Analysis

关于标记数据和符号方法在隐藏神经元激活分析中的价值

Abhilekha Dalal, Rushrukh Rayan, Adrita Barua, Eugene Y. Vasserman, Md Kamruzzaman Sarker, Pascal Hitzler

机构 * Kansas State University(堪萨斯州立大学) Bowie State University(比弗州立大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于符号方法和背景知识的可解释人工智能方法,能够为卷积神经网络中的神经元提供有意义的解释,并在定量和定性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 10 篇

2505.11409 2026-02-23 cs.LG cs.AI cs.CL cs.CV 85%

Visual Planning: Let's Think Only with Images

视觉规划:只用图像来思考

Yi Xu, Chengzu Li, Han Zhou, Xingchen Wan, Caiqi Zhang, Anna Korhonen, Ivan Vulić

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Google(谷歌公司)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出视觉规划范式,通过图像进行推理,优于纯文本推理,在视觉导航任务中表现更优。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18260 2026-02-23 cs.RO 78%

Role-Adaptive Collaborative Formation Planning for Team of Quadruped Robots in Cluttered Environments

面向 cluttered 环境的四足机器人团队角色自适应协作形成规划

Magnus Norén, Marios-Nektarios Stamatopoulos, Avijit Banerjee, George Nikolakopoulos

机构 * Robotics and Artificial Intelligence Group, Department of Computer, Electrical and Space Engineering, Lulea University of Technology(机器人与人工智能小组,计算机、电气与航天工程系,卢莱亚理工大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出了一种适用于 cluttered 环境的四足机器人团队角色自适应协作形成规划方法,通过动态角色分配和 FM2 算法实现灵活导航与稳定形成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17885 2026-02-23 math.OC 78%

Multi-agent path-planning in a moving medium via Wasserstein Hamiltonian Flow

通过Wasserstein哈密顿流实现移动介质中的多智能体路径规划

Christina Frederick, Haomin Zhou

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出了一种基于Wasserstein哈密顿流的有限维变分模型,用于在移动介质中实现多智能体路径规划,通过优化运行成本和初始速度来解决智能体位置与目标分布的不匹配问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17734 2026-02-23 cs.SE cs.AI 57%

Five Fatal Assumptions: Why T-Shirt Sizing Systematically Fails for AI Projects

五项致命假设:为何T恤 sizing 系统性地失败于AI项目

Raja Soundaramourty, Ozkan Kilic, Ramu Chenchaiah

机构 * Cisco Systems, Inc.(思科系统公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文指出T恤 sizing在AI项目中失效的五项致命假设,并提出Checkpoint Sizing作为更人性化的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06500 2026-02-23 cs.AI cs.CY 57%

The AI Pyramid A Conceptual Framework for Workforce Capability in the Age of AI

人工智能金字塔:人工智能时代人力能力的概念框架

Alok Khatri, Bishesh Khanal

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出人工智能金字塔框架,旨在构建人类在AI时代的能力体系,强调能力形成应作为基础设施,通过问题导向学习和动态技能本体提升AI劳动力的适应性与竞争力。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10134 2026-02-23 cs.AI 57%

FRSICL: LLM-Enabled In-Context Learning Flight Resource Allocation for Fresh Data Collection in UAV-Assisted Wildfire Monitoring

FRSICL: 基于大语言模型的上下文学习飞行资源分配用于无人机辅助 wildfire 监测中的新鲜数据采集

Yousef Emami, Hao Zhou, Miguel Gutierrez Gaitan, Kai Li, Luis Almeida

机构 * Real-Time and Embedded Computing Systems Research Centre (CISTER)(实时嵌入式计算系统研究中心) Carnegie Mellon University(卡内基梅隆大学) Pontificia Universidad Católica de Chile(天主教智利大学) Instituto de Telecomunicações(电信研究院) Faculdade de Engenharia, Universidade do Porto(工程学院,葡萄牙里斯本大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的上下文学习飞行资源分配方法,用于无人机辅助森林火灾监测中的实时数据采集优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14434 2026-02-23 cs.SE 50%

CMind: An AI Agent for Localizing C Memory Bugs

CMind:一种用于定位C内存错误的人工智能代理

Chia-Yi Su, Collin McMillan

专题命中 规划推理 :reasoning(abstract)

AI总结 CMind通过模拟人类程序员行为,利用大语言模型和引导决策方法,定位C程序中的内存错误。

Comments 4 pages, 2 figures. To be published in 34th IEEE/ACM International Conference on Program Comprehension (ICPC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17813 2026-02-23 eess.IV cs.CV 50%

Promptable segmentation with region exploration enables minimal-effort expert-level prostate cancer delineation

可提示分割与区域探索实现最小努力的专家级前列腺癌勾勒

Junqing Yang, Natasha Thorley, Ahmed Nadeem Abbasi, Shonit Punwani, Zion Tse, Yipeng Hu, Shaheer U. Saeed

机构 * UCL Hawkes Institute(UCL Hawkes Institute;医学物理与生物医学工程系) Department of Medical Physics and Biomedical Engineering(大学学院伦敦) University College London(医学成像中心) Centre of Medical Imaging(肿瘤学系) Department of Oncology(阿迦·柯尔大学医院) Aga Khan University Hospital(生物工程中心;工程与材料科学学院) Centre for Bioengineering School of Engineering and Materials Science

专题命中 规划推理 :planning(abstract)

AI总结 本研究提出基于用户提示和强化学习的框架,实现最小标注努力的专家级前列腺癌分割,优于现有自动化方法并减少标注时间。

Comments Accepted at IPCAI 2026 (IJCARS - IPCAI 2026 Special Issue)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05208 2026-02-23 eess.IV cs.CV 50%

Context-Aware Asymmetric Ensembling for Interpretable Retinopathy of Prematurity Screening via Active Query and Vascular Attention

具备上下文感知的非对称集成用于通过主动查询和血管注意力的可解释早产视网膜病变筛查

Md. Mehedi Hassan, Taufiq Hasan

机构 * m-Health Lab, Department of Biomedical Engineering, Bangladesh University of Engineering(m-Health实验室,生物医学工程系,孟加拉国工程大学) Center for Bioengineering Innovation(生物工程创新中心) Design, Department of Biomedical Engineering, Johns Hopkins University, Baltimore, MD, USA(设计,生物医学工程系,约翰霍普金斯大学,巴尔的摩,MD,美国)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出具备上下文感知的非对称集成模型,通过主动查询和血管注意力技术,实现早产视网膜病变筛查的高准确率和可解释性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15605 2026-02-23 cs.CV 50%

GIFT: A Framework Towards Global Interpretable Faithful Textual Explanations of Vision Classifiers

GIFT: 一种面向视觉分类器全局可解释忠实文本解释的框架

Éloi Zablocki, Valentin Gerard, Amaia Cardiel, Eric Gaussier, Matthieu Cord, Eduardo Valle

机构 * Université Grenoble Alpes(法国格勒诺布尔大学) Sorbonne Université(巴黎索邦大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 GIFT提出一种框架,通过生成局部反事实并转化为文本解释,实现视觉分类器的全局可解释和忠实性。

Comments TMLR 2026 (featured certification)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 2 篇

2602.17871 2026-02-23 cs.CV cs.AI cs.LG cs.MM 62%

Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models

理解视觉语言模型的细粒度知识能力

Dhruba Ghosh, Yuhui Zhang, Ludwig Schmidt

机构 * Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了视觉语言模型在细粒度知识任务中的表现,发现更好的语言模型和视觉编码器对细粒度分类性能有显著影响,预训练阶段也至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18424 2026-02-23 cs.CV cs.RO 50%

CapNav: Benchmarking Vision Language Models on Capability-conditioned Indoor Navigation

CapNav:基于能力条件的室内导航基准测试

Xia Su, Ruiqi Chen, Benlin Liu, Jingwei Ma, Zonglin Di, Ranjay Krishna, Jon Froehlich

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 CapNav基准测试评估VLMs在不同移动约束下室内导航能力,发现其性能随约束增加而下降,且先进模型仍难以处理空间推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 3 篇

2602.17691 2026-02-23 cs.LG cs.CL 76%

Tethered Reasoning: Decoupling Entropy from Hallucination in Quantized LLMs via Manifold Steering

tethered Reasoning: 通过流形引导解耦熵与幻觉在量化大语言模型中

Craig Atkinson

专题命中 测试时计算 :reasoning(title);分类 cs.CL、cs.LG

AI总结 HELIX 通过几何引导解耦量化大语言模型中的熵与幻觉,通过引导隐藏状态轨迹到预计算的诚实性流形,提高高温度下的输出质量与多样性。

Comments 16 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25860 2026-02-23 cs.AI cs.CL cs.HC 62%

Through the Judge's Eyes: Inferred Thinking Traces Improve Reliability of LLM Raters

通过裁判之眼:推断的思考轨迹提升LLM评分器的可靠性

Xingjian Zhang, Tianhong Gao, Suliang Jin, Tianhao Wang, Teng Ye, Eytan Adar, Qiaozhu Mei

机构 * University of Michigan(密歇根大学) University of California, San Diego(加州大学圣地亚哥分校) University of Minnesota(明尼苏达大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过人与LLM协作框架推断思考轨迹,提升LLM评分器的可靠性及人类与LLM之间的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14556 2026-02-23 cs.AI cs.ET cs.LG cs.RO 62%

LLM-Enabled In-Context Learning for Data Collection Scheduling in UAV-assisted Sensor Networks

基于大语言模型的上下文学习用于无人机辅助传感器网络中的数据采集调度

Yousef Emami, Hao Zhou, SeyedSina Nabavirazani, Luis Almeida

机构 * Real-Time and Embedded Computing Systems Research Centre (CISTER)(实时与嵌入式计算系统研究中心(CISTER)) Faculdade de Engenharia da Universidade do Porto(葡萄牙波尔图大学工程学院) School of Computer Science, McGill University(麦吉尔大学计算机科学学院) Knight Foundation School of Computing and Information Sciences, Florida International University(国际大学计算与信息科学学院(Knight基金会))

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于大语言模型的上下文学习数据采集调度系统,用于解决无人机辅助传感器网络中的紧急调度问题,通过自然语言任务描述和安全验证机制提升调度效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 复杂问题求解 9 篇

2602.02437 2026-02-23 cs.CV cs.AI 83%

UniReason 1.0: A Unified Reasoning Framework for World Knowledge Aligned Image Generation and Editing

UniReason 1.0: 一个统一的推理框架,用于世界知识对齐的图像生成与编辑

Dianyi Wang, Chaofan Ma, Feng Han, Size Wu, Wei Song, Yibin Wang, Zhixiong Zhang, Tianhang Wang, Siyuan Wang, Zhongyu Wei, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) University of Southern California(美国南加州大学)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 UniReason 1.0通过统一推理框架整合图像生成与编辑,利用世界知识增强文本推理和视觉优化,提升复杂合成任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08364 2026-02-23 cs.CL 79%

Structure-Augmented Reasoning Generation

结构增强的推理生成

Jash Rajesh Parekh, Pengcheng Jiang, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 结构增强的推理生成通过显式推理结构提升多跳查询的准确性和连贯性,兼容现有RAG流程,无需定制检索器或微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17941 2026-02-23 cs.LG cs.AI 62%

Optimizing Graph Causal Classification Models: Estimating Causal Effects and Addressing Confounders

优化图因果分类模型:估计因果效应并处理混杂因素

Simi Job, Xiaohui Tao, Taotao Cai, Haoran Xie, Jianming Yong, Xin Wang

机构 * School of Mathematics, Physics, and Computing, University of Southern Queensland(数学、物理与计算学院,南方昆士兰大学) School of Data Science, Lingnan University(数据科学学院,岭南大学) School of Business, University of Southern Queensland(商学院,南方昆士兰大学) Schulich School of Engineering, University of Calgary(Schulich工程学院,卡尔加里大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CCAGNN,一种结合因果推理的图神经网络框架,旨在通过处理混杂因素和估计因果效应,提升图分类模型的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏