arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45259 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3043 篇

1010.6234 2010-11-01 cs.AI cs.LG cs.MA 62%

Analysing the behaviour of robot teams through relational sequential pattern mining

Grazia Bombini, Raquel Ros, Stefano Ferilli, Ramon Lopez de Mantaras

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01479 2026-08-25 cs.LO cs.AI 版本更新 61%

An Information-Flow Perspective on Explainability Requirements: Specification and Verification

可解释性需求的信息流视角:规范与验证

Bernd Finkbeiner, Hadar Frenkel, Julian Siber

机构 * CISPA Helmholtz Center for Information Security(信息安全研究中心)

专题命中 逻辑推理 :reasoning(abstract,comments);分类 cs.AI

AI总结 该研究从信息流视角,采用扩展反事实因量化的认知时态逻辑,提出可解释性需求的规范与验证方法,实现有限状态模型的可解释性检查,可区分可解释与不可解释系统并支持隐私需求设定。

Comments This is an extended and corrected version of the paper presented at the 22nd International Conference on Principles of Knowledge Representation and Reasoning (KR 2025); see the appendix for details

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05097 2026-08-06 cs.CL 新提交 61%

Same Formulas, Different Semantics: Do Language Models Follow Modal Logic Specifications?

相同公式,不同语义:语言模型是否遵循模态逻辑规范?

Réemi Andrieu, Damien Sileo

机构 * Univ. Lille(里尔大学) Inria(法国国家信息与自动化研究所) CNRS(法国国家科学研究中心) Centrale Lille(里尔中央理工学院) UMR 9189 - CRIStAL(UMR 9189 - CRIStAL(法国国家科研中心联合研究机构))

专题命中 逻辑推理 :reasoning(abstract,comments);分类 cs.CL

AI总结 该研究探究语言模型是否遵循模态逻辑规范,构建成对模态问题测试五款模型,发现遵循规定模态语义依赖推理模式与模型身份,发布相关产物。

Comments 9 pages. Code: https://github.com/sileod/modal-semantics-reasoning. Data and artifacts: https://huggingface.co/datasets/sileod/modal-semantics-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23672 2026-07-24 cs.AI 版本更新 61%

Teaching LLMs String Matching, Backtracking, and Error Recovery to Deduce Bases and Truth Tables for the Combinatorially Exploding Bit Manipulation Puzzles

教LLM字符串匹配、回溯与错误恢复:为组合爆炸的位操作谜题推导基和真值表

Prateek Agnihotri, Sanchit Jain, Prabhat Agnihotri, Aditya Prasad, Shubham Jain

机构 * NVIDIA

专题命中 逻辑推理 :reasoning(abstract,comments);分类 cs.AI

AI总结 提出一种新方法,通过字符串相似性、结构化搜索和自主错误恢复,避免复杂布尔逻辑,解决位操作谜题中的组合爆炸问题,实现96%以上验证准确率。

Comments 22 pages, 4 figures, 2 tables. 7th Place Solution for the NVIDIA Nemotron Model Reasoning Challenge (Kaggle)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03274 2025-07-30 cs.AI 61%

A Scalable Approach to Probabilistic Neuro-Symbolic Robustness Verification

Vasileios Manginas, Nikolaos Manginas, Edward Stevinson, Sherwin Varghese, Nikos Katzouris, Georgios Paliouras, Alessio Lomuscio

机构 * Department of Computer Science and Leuven.AI KU Leuven Belgium(比利时列日大学计算机科学系) Department of Computing Imperial College London UK(伦敦帝国学院计算机系)

专题命中 逻辑推理 :reasoning(abstract,comments);分类 cs.AI

Comments 19th Conference on Neurosymbolic Learning and Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08916 2023-06-16 cs.LO cs.AI 61%

Counterfactuals Modulo Temporal Logics

Bernd Finkbeiner, Julian Siber

专题命中 逻辑推理 :reasoning(abstract,comments);分类 cs.AI

Comments 24th International Conference on Logic for Programming, Artificial Intelligence and Reasoning (LPAR-23)

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.08733 2020-11-18 cs.AI 61%

Using Explainable Scheduling for the Mars 2020 Rover Mission

Jagriti Agrawal, Amruta Yelamanchili, Steve Chien

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI;planning(comments)

Comments Submitted to the International Workshop of Explainable AI Planning (XAIP) at the International Conference on Automated Planning and Scheduling (ICAPS) 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.03472 2020-06-08 cs.AI cs.LO stat.ML 61%

Analyzing Differentiable Fuzzy Implications

Emile van Krieken, Erman Acar, Frank van Harmelen

专题命中 逻辑推理 :reasoning(abstract,comments);分类 cs.AI

Comments 10 pages, 10 figures, accepted to 17th International Conference on Principles of Knowledge Representation and Reasoning (KR 2020). arXiv admin note: substantial text overlap with arXiv:2002.06100

详情

展开后加载摘要…

URL PDF HTML 收藏
cs/0405107 2009-12-01 cs.AI cs.SC 61%

A Framework for Combining Defeasible Argumentation with Labeled Deduction

Carlos Iván Chesñevar, Guillermo Ricardo Simari

专题命中 逻辑推理 :reasoning(abstract,journal_ref);分类 cs.AI

Comments 15 pages, presented at CMSRA Workshop 2003. Buenos Aires, Argentina

Journal ref In "Computer Modeling of Scientific Reasoning" (C.Delrieux, J.Legris, Eds.). Pp. 43-56, Ed. Ediuns, Argentina, 2003. ISBN 987-89281-89-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23543 2026-08-25 cs.AI 新提交 57%

How AI Assistance Affects Human Skill Development: A Study of Learning with Logic Puzzles

AI辅助如何影响人类技能发展:一项基于逻辑谜题学习的研究

Shang Wu, Catarina G Belem, Shuyuan Fu, Mark Steyvers, Padhraic Smyth

机构 * University of California, Irvine(加利福尼亚大学欧文分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究通过逻辑谜题实验发现,AI辅助会削弱人类长期技能发展,独立问题解决努力对技能提升更关键,低AI请求成本会增加AI使用频率且降低后续无辅助表现。

Comments Accepted at Human-AI Complementarity and Alignment (HCOMP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21827 2026-08-25 cs.CL 新提交 57%

Do Large Language Models Perform Well on Comprehending Poetic Logic in Modern Chinese Poetry?

大型语言模型在理解现代汉诗的诗意逻辑方面表现良好吗?

Tian Lan, Shanshan Wang, Zehua Duo, Jiang Li, Guanglai Gao, Derek F. Wong, Xiangdong Su

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究科) University of Macau(澳门大学) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对当前LLMs在现代汉诗诗意逻辑理解评估上的缺口,构建首个基准Peony,评估发现主流LLMs存在相关理解局限,验证了Peony的有效性与必要性。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21796 2026-08-25 cs.CV cs.AI 新提交 57%

SAFE-G: Structure-aware Faithful Evidence-guided Generation for Knowledge-based Visual Question Answering

SAFE-G:面向基于知识的视觉问答的结构感知忠实证据引导生成

Long Shu, Shuochen Liu, Wei Chen, Junda Lin, Zhi Zheng, Huijun Hou, Tong Xu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) NIO(蔚来)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 针对KB-VQA现有方法难以捕捉结构关联、推理不忠实的问题,提出SAFE-G框架,通过混合搜索、图检索与证据对齐RL策略,在两个基准上准确率优于现有方法8.9%、3.5%。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20201 2026-08-21 cs.AI cs.SE 新提交 57%

The Third Restructuring of Software Form: From the Three-Tier Architecture to Storage, Models, and Agents

软件形态的第三次重构:从三层架构到存储、模型与智能体

Wei Lin, Tao Zhou, Zhaofei Xie, Changgui Hong

机构 * Nanjing Liancheng Intelligent Technology Group(南京连城智能科技集团)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出软件形态正经历第三次范式转变Software 3.0,其核心为存储、大模型与智能体的架构,将重塑开发者、数据库行业及软件工程的角色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18165 2026-08-20 cs.AI cs.FL cs.LO 新提交 57%

RDFdL: Integrating RDF with Differential Dynamic Logic

RDFdL:将RDF与微分动态逻辑(Differential Dynamic Logic)集成

Yuyang Li, Lukas Kubelka, Julia Butte, Tobias Käfer

机构 * Institute AIFB, Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院AIFB研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 针对RDF知识图谱无法推理物理系统动态行为的问题,提出将RDF与微分动态逻辑集成的RDFdL框架,实现静态与动态知识的统一表示推理,可用于制造业相关场景。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15041 2026-08-18 cs.AI 新提交 57%

LLM-Based Hierarchical Coordinated Control with Continuation-Aware Policy Learning

基于大语言模型的分层协调控制与感知延续性的策略学习

Changhong He, Jinda Gao, Xinkuan Liu, Le Zhang, Xizi Luo, Yu Mei

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 针对复杂工程系统多单元协调难题,提出基于LLM的分层框架,结合感知延续性的GRPO,在多匝道交通控制和VPP能源管理中,性能优于多种对比方法。

Comments 30 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14585 2026-08-18 cs.AI 新提交 57%

Euclid-Omni : A Unified Neuro-Symbolic Framework for Plane Geometry

Euclid-Omni:面向平面几何的统一神经符号框架

Zhaoyu Li, Hangrui Bi, Youyuan Zhang, Wenjie Ma, Zenan Li, Zhaolei Zhang, Xujie Si, Kaiyu Yang

机构 * Apodex University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校) ETH Zürich(苏黎世联邦理工学院) Meta FAIR

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Euclid-Omni统一神经符号框架,结合形式几何系统与LLMs、VLMs,核心为符号几何求解器Euclidea,生成合成数据训练模型,在竞赛级几何问题上性能优异且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10813 2026-08-18 cs.AI cs.GT 版本更新 57%

The Fragility of Strategic Thinking in Large Language Models

大型语言模型战略思维的脆弱性

Enric Junque de Fortuny, Veronica Roberta Cappelli

机构 * IESE(IESE商学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究开发框架拆解博弈中信念形成等环节,发现前沿LLMs的战略思维存在但具脆弱性,随复杂性提升会出现逻辑转变与启发式规则,警示其作为战略主体应用需谨慎。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13958 2026-08-17 cs.AI cs.CY cs.LO 新提交 57%

Implementing Computational Law in Wolfram Language for the Governance of Artificial Intelligence

用Wolfram语言实现计算法以用于人工智能治理

James K. Wiles

机构 * Wolfram Institute for Computational Foundations of Science(沃尔夫勒姆计算基础科学研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文在Wolfram语言中实现Reified Input/Output Logic,测试GPT-4转换英文法律陈述的情况,通过AI看门狗案例展示计算法可作为AI治理工具,理想目标是形式化可编程执行的法律。

Comments 25 pages, 1 figure, 2 tables, 12 code listings. Wolfram Language implementation and verification script (31 assertions) available at https://github.com/Zaffer/research-computational-law

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13450 2026-08-14 cs.SE cs.CR cs.LG 新提交 57%

LLM-Assisted Dynamic Threat Analysis for Attacker-Reachable Software Weaknesses in Autonomous Vehicles

大语言模型辅助的自动驾驶车辆中攻击者可及软件弱点的动态威胁分析

Md Wasiul Haque, Sagar Dasgupta, Mizanur Rahman, Md Rayhanur Rahman

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究针对自动驾驶车辆软件弱点的动态威胁分析难题,探究LLM辅助Autoware的自动化测试工件生成,发现构建集成是核心障碍,推理模型编译测试用例的表现优于代码专用模型。

Comments 17 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11344 2026-08-14 cs.CY cs.AI q-fin.RM 版本更新 57%

Governing Agentic AI in FinTech

金融科技中智能体人工智能的治理

Henry Han

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI

AI总结 针对金融科技中智能体AI治理研究不足的问题,构建多层次治理理论,通过三项研究验证其机制,发现可验证性缺口是核心约束,该框架可扩展至其他高风险领域。

Comments 58 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12304 2026-08-13 cs.AI 新提交 57%

Constructing Dynamic Master Logic Models as Knowledge Graphs for Complex System Diagnostics Using Retrieval-Augmented Large Language Models

构建动态主逻辑模型作为知识图谱,用于使用检索增强大语言模型的复杂系统诊断

Saman Marandi, Yu-Shu Hu, Mohammad Modarres

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于检索增强大语言模型的KG-DML框架,实现了复杂系统动态主逻辑模型的自动化构建,经低压冷却剂注入系统验证,可转化技术文档为可执行功能模型用于诊断分析。

Comments 36 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11340 2026-08-13 cs.NI cs.AI 新提交 57%

Self-evolving network verifiers

自演进网络验证器

Ioannis Protogeros, Tibor Schneider, Laurent Vanbever

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI

AI总结 该研究提出一种自动演进的网络验证器,通过编码智能体与可信预言机的反例引导循环,让基于SMT的验证器自主学习新网络功能,解决手动维护模型的难题。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27143 2026-08-13 cs.CR cs.AI 版本更新 57%

Enhancing Linux Privilege Escalation Attack Capabilities of Local LLM Agents

增强本地大语言模型代理的Linux提权攻击能力

Benjamin Probst, Andreas Happe, Jürgen Cito

机构 * TU Wien(维也纳技术大学)

专题命中 逻辑推理 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文研究通过系统性实验验证针对性干预能否提升本地开源模型在Linux提权中的性能,发现开源模型可匹配甚至超越云模型,且反思类干预效果最佳,但漏洞发现仍是本地模型的瓶颈。

Comments Accepted at RAISE workshop (https://raise-workshop.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13252 2026-08-13 cs.CL 版本更新 57%

A Reality Check of Language Models as Formalizers on Constraint Satisfaction Problems

语言模型作为形式化工具在约束满足问题上的现实检验

Rikhil Amonkar, Ceyhun Efe Kayan, Qimei Lai, Ronan Le Bras, Li Zhang

机构 * Drexel University(德雷塞尔大学) University of Pennsylvania(宾夕法尼亚大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 研究评估了语言模型作为形式化工具在约束满足问题中的表现,发现其在15种模型-数据集组合中表现劣于作为求解器,尽管形式化更具可验证性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16481 2026-08-12 cs.AI 版本更新 57%

Leveraging Large Language Models for Causal Discovery: a Constraint-based, Argumentation-driven Approach

利用大语言模型进行因果发现:一种基于约束和论证的方法

Zihao Li, Fabrizio Russo

机构 * Department of Computing(计算系) Imperial College London(帝国理工学院伦敦分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型作为不完美的专家,结合语义结构先验和条件独立性证据,实现因果发现的先进方法。

Comments Accepted at UAI 2026. 37 pages, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08240 2026-08-12 cs.CV cs.AI 版本更新 57%

Hybrid Token Compression for Vision-Language Models

HybridToken-VLM:用于视觉-语言模型的混合令牌压缩

Jusheng Zhang, Xiaoyang Guo, Tongyu Mo, Qinhan Lv, Wenhao Chai, Jian Wang, Keze Wang, Liang Lin

机构 * Sun Yat-sen University(中山大学) Princeton University(普林斯顿大学) Snap Inc(Snap公司)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 HybridToken-VLM通过混合令牌压缩技术,在保持性能的同时显著提升视觉-语言模型的效率

Comments Accepted at CVPR 2026. Code available at https://github.com/jushengzhang/HybridToken-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07965 2026-08-11 cs.AI 新提交 57%

CyberAGENTS: Structured Autonomy for Agentic Gamified Learning in Cybersecurity

CyberAGENTS:面向网络安全领域智能体游戏化学习的结构化自主机制

Ivan Hornung, Deepthi Marasinghe Arachchige, Tharindu Kumarage, Garima Agrawal, Yuli Deng, Ying-Chih Chen, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) Amazon AGI(亚马逊AGI)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出CyberAGENTS框架,通过结构化自主机制实现游戏化网络安全学习,经课堂评估验证其可提升学习者参与度与对AI响应的信任度,为相关系统设计提供蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00326 2026-08-11 cs.AI 版本更新 57%

Learning to Coordinate Symbolic Tools: LLM Agents for Verified Sum-of-Squares Certificates

学习协调符号工具:用于验证平方和(SOS)证书的大语言模型(LLM)智能体

Bohan Chen, Shivam N. Patel, Richard Hoffmann, Sam Looi, Tony Yue Yu

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI

AI总结 该研究开发结合领域训练、符号工具和验证反馈的LLM智能体,在加权SOS验证任务上达到78.96%成功率,为可精确检查输出领域的工具调用智能体设计提供案例。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22758 2026-08-11 cs.AI 版本更新 57%

AutoRefine: Compiling Trajectories into Validated Typed Agent Artifacts

AutoRefine: 从轨迹到可重用的专业知识为连续LLM代理优化

Libin Qiu, Zhirong Gao, Junfu Chen, Yuhang Ye, Liangyu Li, Weizhi Huang, Xiaobo Xue, Wenkai Qiu, Shuo Tang

机构 * alibaba(阿里巴巴集团)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 AutoRefine通过提取和维护双重形式的经验模式,提升连续LLM代理的知识积累与维护效率,实现98.4%的准确率提升。

Comments 7 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17162 2026-08-11 cs.AI 版本更新 57%

The Belief-Desire-Intention Ontology for modelling mental reality and agency

信念-愿望-意图本体用于建模心理现实与代理

Sara Zuppiroli, Carmelo Fabio Longo, Anna Sofia Lippolis, Rocco Paolillo, Lorenzo Giammei, Miguel Ceriani, Francesco Poggi, Antonio Zinilli, Andrea Giovanni Nuzzolese

机构 * CNR - Institute of Cognitive Sciences and Technologies(CNR认知科学与技术研究所) CNR - Institute for Research on Population and Social Policies(CNR人口与社会政策研究所) CNR - Research Institute on Sustainable Economic Growth(CNR可持续经济增长研究所) University of Bologna - Department of Philosophy(博洛尼亚大学哲学系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种形式化的BDI本体,通过模块化设计模式实现信念、愿望、意图及其动态关系,结合LLMs和Semas平台验证其在认知基础和语义可互操作性中的应用。

Journal ref Journal of Web Semantics (2026) 90:100885

详情

展开后加载摘要…

URL PDF HTML 收藏