arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-03 至 2026-03-03 共收录 259 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 34 篇

2507.07634 2026-03-03 cs.CL 57%

FrugalRAG: Less is More in RL Finetuning for Multi-Hop Question Answering

FrugalRAG: 在多跳问答中少即是多

Abhinav Java, Srivathsan Koundinyan, Nagarajan Natarajan, Amit Sharma

机构 * Microsoft Research India(微软印度研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 FrugalRAG通过强化学习减少检索步骤,实现多跳问答任务的高效准确权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12664 2026-03-03 cs.AI cs.SY eess.SY 57%

Behavioral Generative Agents for Energy Operations

行为生成代理在能源运营中的应用

Cong Chen, Omer Karaduman, Xu Kuang

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯学院泰勒工程学院) Graduate School of Business, Stanford University(斯坦福大学商学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出利用生成代理模拟客户决策,揭示能源运营中消费者行为模式,提升能源管理系统设计和政策分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23348 2026-03-03 cs.RO cs.CV 50%

Physically Ground Commonsense Knowledge for Articulated Object Manipulation with Analytic Concepts

为拟合物体操纵的物理常识知识而引入分析概念

Jiude Wei, Yuxuan Li, Cewu Lu, Jianhua Sun

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出通过引入分析概念,将语义级常识知识接地到物理世界,以提升机器人对关节物体的通用精确操纵能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14362 2026-03-03 cs.CV 50%

DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning

DeepEyes: 通过强化学习激励'图像思考'

Ziwei Zheng, Michael Yang, Jack Hong, Chenxiao Zhao, Guohai Xu, Le Yang, Chao Shen, Xing Yu

机构 * Xiaohongshu Inc.(小红书公司) Xi’an Jiaotong University(西安交通大学)

专题命中 数学推理 :reasoning(abstract)

AI总结 DeepEyes通过强化学习实现图像引导的推理,无需预训练数据,提升多模态任务性能。

Comments Accepted by ICLR2026. Ziwei, Michael, Jack, and Chenxiao are equal-contribution. The list order is random

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 5 篇

2506.20666 2026-03-03 cs.CL cs.AI 62%

Cognitive models can reveal interpretable value trade-offs in language models

认知模型可以揭示语言模型中的可解释价值权衡

Sonia K. Murthy, Rosie Zhao, Jennifer Hu, Sham Kakade, Markus Wulfmeier, Peng Qian, Tomer Ullman

机构 * Kempner Institute for Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究所) Google DeepMind(谷歌DeepMind) Department of Psychology, Harvard University(哈佛大学心理学系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用认知模型评估语言模型中的价值权衡,揭示其行为特征变化及对社会行为的影响。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01407 2026-03-03 cs.AI cs.MA cs.SI 57%

The Observer-Situation Lattice: A Unified Formal Basis for Perspective-Aware Cognition

观察者-情境格:一种面向视角感知认知的统一基础

Saad Alqithami

机构 * Computer Science Department, Al-Baha University(阿尔巴大学计算机科学系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出观察者-情境格(OSL),一种统一的数学结构,用于支持面向视角的认知推理,通过两个关键算法实现信念管理和矛盾分解,提升多智能体环境中的推理效率和鲁棒性。

Comments Extended version of the AAMAS 2026 paper with the same title

Journal ref 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25-29, 2026, IFAAMAS, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01170 2026-03-03 cs.CR cs.AI 57%

ATLAS: AI-Assisted Threat-to-Assertion Learning for System-on-Chip Security Verification

ATLAS:基于人工智能的威胁到断言学习用于片上系统安全验证

Ishraq Tashdid, Kimia Tasnia, Alexander Garcia, Jonathan Valamehr, Sazadur Rahman

机构 * Department of Electrical and Computer Engineering, University of Central Florida(电子与计算机工程系,中央佛罗里达大学) Intel Corporation(英特尔公司)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 ATLAS通过结合人工智能和形式验证技术,实现了基于漏洞知识的自动化SoC安全验证,提高了安全设计的可靠性。

Comments Accepted at the 63rd Design Automation Conference (DAC 2026), Long Beach, CA, USA (July, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23239 2026-03-03 cs.AI cs.CY 57%

Agency and Architectural Limits: Why Optimization-Based Systems Cannot Be Norm-Responsive

代理与架构限制:为何基于优化的系统无法回应规范

Radha Sarma

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文指出基于优化的系统无法回应规范,提出真正的代理性需要不可比较的边界和否定性回应机制,揭示了优化与规范治理的不兼容性及由此引发的收敛危机。

Comments About 10,600 words in all (includes ~1000 words of literature and ~2400 words of Appendices). Under journal review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00617 2026-03-03 cs.CY 50%

Dial E for Ethical Enforcement: institutional VETO power as a governance primitive

为伦理执行而 Dial E:作为治理原语的机构 veto 权力

Subramanyam Sahoo, Vinija Jain, Aman Chadha, Divya Chaudhary

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出机构 veto 权力作为治理原语,旨在通过正式权威阻止潜在武器化风险,推动模型去武装和伦理执行。

Comments Accepted at the AI for Peace Workshop at ICLR 2026.32 Pages and 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 14 篇

2603.02208 2026-03-03 cs.CL 84%

Reasoning Core: A Scalable Procedural Data Generation Suite for Symbolic Pre-training and Post-Training

Reasoning Core:一个可扩展的程序化数据生成套件,用于符号预训练和后训练

Valentin Lacombe, Valentin Quesnel, Damien Sileo

机构 * Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 - CRIStAL(里尔大学、法国国家信息与自动化研究所、法国国家科学研究中心、中央理工大学、UMR 9189 - CRIStAL)

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 Reasoning Core 提出了一种可扩展的程序化数据生成套件,用于符号预训练和后训练,通过生成多样化的符号推理数据提升语言模型的推理能力。

Comments Keywords: LLMs, NLP, Dataset, Corpus, Procedural Pre-training, Reasoning, Logic, Formal Semantics https://github.com/sileod/reasoning_core

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01241 2026-03-03 cs.IR cs.AI 83%

TARSE: Test-Time Adaptation via Retrieval of Skills and Experience for Reasoning Agents

TARSE: 通过检索技能和经验进行测试时适应以实现推理代理

Junda Wang, Zonghai Tao, Hansi Zeng, Zhichao Yang, Hamed Zamani, Hong Yu

机构 * University of Massachusetts Amherst, MA, USA(马萨诸塞大学阿姆赫斯特分校) University of Massachusetts Lowell, MA, USA(马萨诸塞大学洛厄尔分校)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 TARSE通过检索技能和经验实现测试时适应,提升医疗推理代理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01190 2026-03-03 cs.CL 83%

Reasoning or Rationalization? The Role of Justifications in Masked Diffusion Models for Fact Verification

推理还是合理化?在事实验证中的掩码扩散模型中合理化的作用

Jacob Devasier

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 研究发现,掩码扩散模型在事实验证中,早期结论易受合理化过程影响,导致准确性下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12563 2026-03-03 cs.AI 83%

HardcoreLogic: Challenging Large Reasoning Models with Long-tail Logic Puzzle Games

HardcoreLogic: 用长尾逻辑谜题游戏挑战大型推理模型

Jingcong Liang, Shijun Wan, Xuehai Wu, Yitong Li, Qianglong Chen, Duyu Tang, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) University of Southern California(南加州大学) Huawei Technologies Ltd(华为技术有限公司) Shanghai Innovation Institute(上海创新研究院)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 HardcoreLogic通过长尾逻辑谜题挑战大型推理模型,揭示其在复杂规则和非标准变体上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10045 2026-03-03 cs.RO cs.AI cs.LG 81%

Neuro-Symbolic Skill Discovery for Conditional Multi-Level Planning

神经符号技能发现用于条件多级规划

Hakan Aktas, Yigit Yildirim, Ahmet Firat Gamsiz, Deniz Bilge Akkoc, Erhan Oztop, Emre Ugur

机构 * Department of Computer Science and Technology The University of Cambridge(计算机科学与技术系 剑桥大学) Department of Computer Engineering Bogazici University(计算机工程系 boazici大学) SISREC Osaka University(Osaka大学SISREC)

专题命中 逻辑推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种神经符号学习架构,通过少量演示获取可推广的高级符号技能,并在多级规划中实现复杂任务的执行。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01104 2026-03-03 cs.HC cs.AI cs.CV cs.CY 70%

Egocentric Co-Pilot: Web-Native Smart-Glasses Agents for Assistive Egocentric AI

第一人称共驾:面向辅助第一人称AI的网页原生智能眼镜代理

Sicheng Yang, Yukai Huang, Weitong Cai, Shitong Sun, Fengyi Fang, You He, Yiqiao Xie, Jiankang Deng, Hang Zhang, Jifei Song, Zhensong Zhang

机构 * Shenzhen International Graduate School Tsinghua University Shenzhen China(深圳国际研究生院清华大学深圳中国) Independent Researcher London United Kingdom(独立研究者伦敦英国) Queen Mary University of London London United Kingdom(女王玛丽大学伦敦英国) Imperial College London London United Kingdom(帝国理工学院伦敦英国) University Of Surrey Guildford United Kingdom(Surrey大学Guildford英国)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 Egocentric Co-Pilot通过网页原生智能眼镜代理实现第一人称AI的持续辅助,结合神经符号框架和多模态意图层,展示了在日常生活中提升可及性和情境感知的实用路径。

Comments 14 pages, 6 figures, WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00808 2026-03-03 cs.AI 70%

MetaMind: General and Cognitive World Models in Multi-Agent Systems by Meta-Theory of Mind

MetaMind: 多智能体系统中通过元理论思维实现通用和认知世界模型

Lingyi Wang, Rashed Shelim, Walid Saad, Naren Ramakrishna

机构 * Department of Electrical(电气工程系) Department of Computer Science, Virginia Tech, USA(计算机科学系,弗吉尼亚理工学院)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 MetaMind通过元理论思维框架,使多智能体系统中的智能体能够自主推理他人目标与信念,实现零样本泛化与自监督学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03152 2026-03-03 cs.CL 70%

FASA: Frequency-aware Sparse Attention

FASA: 基于频率的稀疏注意力

Yifei Wang, Yueqi Wang, Zhenrui Yue, Huimin Zeng, Yong Wang, Ismini Lourentzou, Zhengzhong Tu, Xiangxiang Chu, Julian McAuley

机构 * AMAP, Alibaba Group(阿里巴巴集团AMAP) UCSD(加州大学圣迭戈分校) UIUC(伊利诺伊大学香槟分校) Texas A&M University(德克萨斯农工大学)

专题命中 逻辑推理 :reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 FASA通过动态预测令牌重要性,实现基于频率块的稀疏注意力机制,在长上下文任务中表现出色,达到接近全缓存性能且显著提升效率。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00142 2026-03-03 cs.MA cs.AI 70%

Evaluating Theory of Mind and Internal Beliefs in LLM-Based Multi-Agent Systems

评估基于大语言模型的多智能体系统中的理论心和内部信念

Adam Kostka, Jarosław A. Chudziak

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种整合理论心、BDI内部信念和符号求解器的多智能体架构,评估其在资源分配问题中提升协作智能的效果。

Journal ref 17th International Conference on Computational Collective Intelligence (ICCCI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07233 2026-03-03 cs.CL 57%

LAD-RAG: Layout-aware Dynamic RAG for Visually-Rich Document Understanding

LAD-RAG:面向视觉丰富文档的布局感知动态RAG

Zhivar Sourati, Zheng Wang, Marianne Menglin Liu, Yazhe Hu, Mengqing Guo, Sujeeth Bharadwaj, Kyu Han, Tao Sheng, Sujith Ravi, Morteza Dehghani, Dan Roth

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 LAD-RAG通过构建布局感知的文档图和动态检索机制,提升视觉丰富文档的检索与问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10085 2026-03-03 cs.CV cs.AI 57%

VITA: Zero-Shot Value Functions via Test-Time Adaptation of Vision-Language Models

VITA:通过视觉语言模型的测试时间适应实现零样本价值函数

Christos Ziakas, Alessandra Russo

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 VITA通过测试时间适应提升视觉语言模型的零样本价值估计能力,实现跨任务和环境的泛化,优于现有方法。

Comments International Conference on Learning Representations, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01460 2026-03-03 cs.SE 50%

Production-Grade AI Coding System for Client-Side Development

面向客户端开发的生产级AI编码系统

Ruihan Wang, Chencheng Guo, Guangjing Wang

专题命中 逻辑推理 :planning(abstract)

AI总结 本文提出了一种面向客户端开发的生产级AI编码系统,通过结构化多阶段流程整合Figma设计、PRD和领域知识,提升代码生成与产品需求的对齐性。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01272 2026-03-03 cs.SE 50%

NeuroSCA: Neuro-Symbolic Constraint Abstraction for Smart Contract Hybrid Fuzzing

NeuroSCA:面向智能合约混合模糊测试的神经符号约束抽象

Haochen Liang, Jiawei Chen, Hideya Ochiai

专题命中 逻辑推理 :verifier(abstract)

AI总结 NeuroSCA通过神经符号约束抽象技术,提升智能合约混合模糊测试的效率和效果。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17371 2026-03-03 cs.SE 50%

GraphCue for SDN Configuration Code Synthesis

基于图的SDN配置代码合成

Haomin Qi, Fengfei Yu, Chengbo Huang

专题命中 逻辑推理 :verifier(abstract)

AI总结 GraphCue通过拓扑感知检索和约束条件生成,实现了SDN配置代码合成的高通过率和高效验证。

Comments 2 pages, 2 figures

Journal ref IEEE Consumer Communications & Networking Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 58 篇

2508.05606 2026-03-03 cs.CV cs.CL 92%

Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision

Uni-cot: 向跨文本和视觉的统一链式推理迈进

Luozheng Qin, Jia Gong, Yuqing Sun, Tianjiao Li, Mengping Yang, Xiaomeng Yang, Chao Qu, Zhiyu Tan, Hao Li

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 规划推理 :CoT(title,abstract);reasoning(title,abstract);chain-of-thought(title,abstract);planning(abstract)

AI总结 Uni-CoT通过统一的链式推理框架实现跨文本和视觉的连贯多模态推理,采用宏级和微级推理范式,提升多模态推理的效率和性能。

Comments Accepted by ICLR 2026, Project Page: https://sais-fuxi.github.io/projects/uni-cot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01357 2026-03-03 cs.AI 88%

ASTRA-bench: Evaluating Tool-Use Agent Reasoning and Action Planning with Personal User Context

ASTRA-bench: 通过个人用户上下文评估工具使用代理的推理与行动规划

Zidi Xiu, David Q. Sun, Kevin Cheng, Maitrik Patel, Josh Date, Yizhe Zhang, Jiarui Lu, Omar Attia, Raviteja Vemulapalli, Oncel Tuzel, Meng Cao, Samy Bengio

机构 * Apple(苹果公司)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 ASTRA-bench通过模拟真实用户情境,评估AI代理在复杂个人上下文中进行推理与多步骤计划的能力,揭示当前模型在处理高复杂度任务时的性能瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24378 2026-03-03 cs.AI 88%

ACPBench Hard: Unrestrained Reasoning about Action, Change, and Planning

ACPBench Hard: 关于行动、变化和规划的无约束推理

Harsha Kokel, Michael Katz, Kavitha Srinivas, Shirin Sohrabi

机构 * IBM Research San Jose(IBM桑 Jose 研究所) IBM Thomas J. Watson Research Center(IBM 托马斯·J·沃森研究中心)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 ACPBench Hard通过开放性问题测试模型在行动、变化和规划上的推理能力,发现现有模型在复杂任务上表现有限。

Comments Accepted at Proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026), see https://openreview.net/forum?id=WIXohR7mEo

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05669 2026-03-03 cs.AI 88%

ACPBench: Reasoning about Action, Change, and Planning

ACPBench: 关于行动、变化和规划的推理

Harsha Kokel, Michael Katz, Kavitha Srinivas, Shirin Sohrabi

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 ACPBench是一个用于评估规划领域推理能力的基准,包含7个推理任务和13个规划领域,评估了多种LLM和推理模型的性能差异。

Comments In Proceedings of the AAAI Conference on Artificial Intelligence (AAAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01124 2026-03-03 cs.CV cs.AI 85%

ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models

ClinCoT:面向医学视觉语言模型的临床感知视觉推理链

Xiwei Liu, Yulong Li, Xinlin Zhuang, Xuhui Li, Jianxu Chen, Haolin Yang, Imran Razzak, Yutong Xie

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) East China Normal University(东华大学)

专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 ClinCoT通过引入临床感知的视觉推理链框架,提升医学视觉语言模型在临床决策中的事实性支撑与多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05069 2026-03-03 cs.CL cs.AI 84%

SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs

SwiReasoning: 在潜在空间和显式空间中切换以实现帕累托更优推理的LLM

Dachuan Shi, Abedelkadir Asi, Keying Li, Xiangchi Yuan, Leyan Pan, Wenke Lee, Wen Xiao

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 SwiReasoning通过在潜在空间和显式空间之间切换,提升推理LLMs的准确率和令牌效率。

Comments ICLR 2026. Code: https://github.com/sdc17/SwiReasoning, Website: https://swireasoning.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00873 2026-03-03 cs.AI 83%

MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains

MC-Search:基于结构化长推理链评估和增强多模态代理搜索

Xuying Ning, Dongqi Fu, Tianxin Wei, Mengting Ai, Jiaru Zou, Ting-Wei Li, Hanghang Tong, Yada Zhu, Hendrik Hamann, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta IBM Research(IBM研究院) Stony Brook University(石溪大学)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 MC-Search是首个针对代理MM-RAG的基准,通过结构化长推理链评估和增强多模态代理搜索,揭示了系统性问题并改进了模型的规划和检索能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏