arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3056 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3056 篇

2608.24824 2026-08-26 cs.AI 新提交 57%

Constrained Entity Selection under Partial Knowledge for LLM-Based Knowledge Graph QA

基于部分知识的约束实体选择:面向大语言模型的知识图谱问答

Emanuel Kitzelmann

机构 * Brandenburg University of Applied Sciences(勃兰登堡应用技术大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 针对现有大语言模型知识图谱问答方法的缺陷,提出CES-PK方法,通过轻量符号约束验证LLM生成的候选答案,在Hetionet上验证,实现精确率提升且保持召回率。

Comments 8 pages, 2 tables. Submitted manuscript. Revised version published in KI 2026: Advances in Artificial Intelligence, LNCS 16830

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17170 2026-08-26 cs.CR cs.AI cs.PL 版本更新 57%

Beyond OAuth: Task-Scoped Authorization for AI Agents via Natural Language Slices

PAuth - 精确任务范围授权 for 代理

Reshabh K Sharma, Linxi Jiang, Shuo Chen, Zhiqiang Lin

机构 * University of Washington(华盛顿大学) The Ohio State University(俄亥俄州立大学) Microsoft Research(微软研究院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 PAuth通过隐式授权模型精确控制代理执行任务所需的操作权限,通过NL切片和信封结构确保操作合法性,实验表明其在安全和性能上均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14069 2026-08-26 cs.CL 版本更新 57%

Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric

开放评分系统:通过成对自适应评分表扩展强化学习

Ruipeng Jia, Yunyi Yang, Wen Wang, Yuxin Wu, Yongbo Gai, Siyuan Tao, Mengyu Zhou, Jianhe Lin, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴文勤大模型应用团队) Beijing University Of Posts and Telecommunications(北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 开放评分系统通过成对自适应评分表和可验证评分表实现强化学习的稳健对齐,提升开放性任务的辨别力和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23543 2026-08-25 cs.AI 新提交 57%

How AI Assistance Affects Human Skill Development: A Study of Learning with Logic Puzzles

AI辅助如何影响人类技能发展:一项基于逻辑谜题学习的研究

Shang Wu, Catarina G Belem, Shuyuan Fu, Mark Steyvers, Padhraic Smyth

机构 * University of California, Irvine(加利福尼亚大学欧文分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究通过逻辑谜题实验发现,AI辅助会削弱人类长期技能发展,独立问题解决努力对技能提升更关键,低AI请求成本会增加AI使用频率且降低后续无辅助表现。

Comments Accepted at Human-AI Complementarity and Alignment (HCOMP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21827 2026-08-25 cs.CL 新提交 57%

Do Large Language Models Perform Well on Comprehending Poetic Logic in Modern Chinese Poetry?

大型语言模型在理解现代汉诗的诗意逻辑方面表现良好吗?

Tian Lan, Shanshan Wang, Zehua Duo, Jiang Li, Guanglai Gao, Derek F. Wong, Xiangdong Su

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究科) University of Macau(澳门大学) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对当前LLMs在现代汉诗诗意逻辑理解评估上的缺口,构建首个基准Peony,评估发现主流LLMs存在相关理解局限,验证了Peony的有效性与必要性。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21796 2026-08-25 cs.CV cs.AI 新提交 57%

SAFE-G: Structure-aware Faithful Evidence-guided Generation for Knowledge-based Visual Question Answering

SAFE-G:面向基于知识的视觉问答的结构感知忠实证据引导生成

Long Shu, Shuochen Liu, Wei Chen, Junda Lin, Zhi Zheng, Huijun Hou, Tong Xu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) NIO(蔚来)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 针对KB-VQA现有方法难以捕捉结构关联、推理不忠实的问题,提出SAFE-G框架,通过混合搜索、图检索与证据对齐RL策略,在两个基准上准确率优于现有方法8.9%、3.5%。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20201 2026-08-21 cs.AI cs.SE 新提交 57%

The Third Restructuring of Software Form: From the Three-Tier Architecture to Storage, Models, and Agents

软件形态的第三次重构:从三层架构到存储、模型与智能体

Wei Lin, Tao Zhou, Zhaofei Xie, Changgui Hong

机构 * Nanjing Liancheng Intelligent Technology Group(南京连城智能科技集团)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出软件形态正经历第三次范式转变Software 3.0,其核心为存储、大模型与智能体的架构,将重塑开发者、数据库行业及软件工程的角色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18165 2026-08-20 cs.AI cs.FL cs.LO 新提交 57%

RDFdL: Integrating RDF with Differential Dynamic Logic

RDFdL:将RDF与微分动态逻辑(Differential Dynamic Logic)集成

Yuyang Li, Lukas Kubelka, Julia Butte, Tobias Käfer

机构 * Institute AIFB, Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院AIFB研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 针对RDF知识图谱无法推理物理系统动态行为的问题,提出将RDF与微分动态逻辑集成的RDFdL框架,实现静态与动态知识的统一表示推理,可用于制造业相关场景。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15041 2026-08-18 cs.AI 新提交 57%

LLM-Based Hierarchical Coordinated Control with Continuation-Aware Policy Learning

基于大语言模型的分层协调控制与感知延续性的策略学习

Changhong He, Jinda Gao, Xinkuan Liu, Le Zhang, Xizi Luo, Yu Mei

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 针对复杂工程系统多单元协调难题,提出基于LLM的分层框架,结合感知延续性的GRPO,在多匝道交通控制和VPP能源管理中,性能优于多种对比方法。

Comments 30 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14585 2026-08-18 cs.AI 新提交 57%

Euclid-Omni : A Unified Neuro-Symbolic Framework for Plane Geometry

Euclid-Omni:面向平面几何的统一神经符号框架

Zhaoyu Li, Hangrui Bi, Youyuan Zhang, Wenjie Ma, Zenan Li, Zhaolei Zhang, Xujie Si, Kaiyu Yang

机构 * Apodex University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校) ETH Zürich(苏黎世联邦理工学院) Meta FAIR

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Euclid-Omni统一神经符号框架,结合形式几何系统与LLMs、VLMs,核心为符号几何求解器Euclidea,生成合成数据训练模型,在竞赛级几何问题上性能优异且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10813 2026-08-18 cs.AI cs.GT 版本更新 57%

The Fragility of Strategic Thinking in Large Language Models

大型语言模型战略思维的脆弱性

Enric Junque de Fortuny, Veronica Roberta Cappelli

机构 * IESE(IESE商学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究开发框架拆解博弈中信念形成等环节,发现前沿LLMs的战略思维存在但具脆弱性,随复杂性提升会出现逻辑转变与启发式规则,警示其作为战略主体应用需谨慎。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13958 2026-08-17 cs.AI cs.CY cs.LO 新提交 57%

Implementing Computational Law in Wolfram Language for the Governance of Artificial Intelligence

用Wolfram语言实现计算法以用于人工智能治理

James K. Wiles

机构 * Wolfram Institute for Computational Foundations of Science(沃尔夫勒姆计算基础科学研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文在Wolfram语言中实现Reified Input/Output Logic,测试GPT-4转换英文法律陈述的情况,通过AI看门狗案例展示计算法可作为AI治理工具,理想目标是形式化可编程执行的法律。

Comments 25 pages, 1 figure, 2 tables, 12 code listings. Wolfram Language implementation and verification script (31 assertions) available at https://github.com/Zaffer/research-computational-law

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13450 2026-08-14 cs.SE cs.CR cs.LG 新提交 57%

LLM-Assisted Dynamic Threat Analysis for Attacker-Reachable Software Weaknesses in Autonomous Vehicles

大语言模型辅助的自动驾驶车辆中攻击者可及软件弱点的动态威胁分析

Md Wasiul Haque, Sagar Dasgupta, Mizanur Rahman, Md Rayhanur Rahman

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究针对自动驾驶车辆软件弱点的动态威胁分析难题,探究LLM辅助Autoware的自动化测试工件生成,发现构建集成是核心障碍,推理模型编译测试用例的表现优于代码专用模型。

Comments 17 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11344 2026-08-14 cs.CY cs.AI q-fin.RM 版本更新 57%

Governing Agentic AI in FinTech

金融科技中智能体人工智能的治理

Henry Han

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI

AI总结 针对金融科技中智能体AI治理研究不足的问题,构建多层次治理理论,通过三项研究验证其机制,发现可验证性缺口是核心约束,该框架可扩展至其他高风险领域。

Comments 58 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12304 2026-08-13 cs.AI 新提交 57%

Constructing Dynamic Master Logic Models as Knowledge Graphs for Complex System Diagnostics Using Retrieval-Augmented Large Language Models

构建动态主逻辑模型作为知识图谱,用于使用检索增强大语言模型的复杂系统诊断

Saman Marandi, Yu-Shu Hu, Mohammad Modarres

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于检索增强大语言模型的KG-DML框架,实现了复杂系统动态主逻辑模型的自动化构建,经低压冷却剂注入系统验证,可转化技术文档为可执行功能模型用于诊断分析。

Comments 36 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11340 2026-08-13 cs.NI cs.AI 新提交 57%

Self-evolving network verifiers

自演进网络验证器

Ioannis Protogeros, Tibor Schneider, Laurent Vanbever

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI

AI总结 该研究提出一种自动演进的网络验证器,通过编码智能体与可信预言机的反例引导循环,让基于SMT的验证器自主学习新网络功能,解决手动维护模型的难题。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27143 2026-08-13 cs.CR cs.AI 版本更新 57%

Enhancing Linux Privilege Escalation Attack Capabilities of Local LLM Agents

增强本地大语言模型代理的Linux提权攻击能力

Benjamin Probst, Andreas Happe, Jürgen Cito

机构 * TU Wien(维也纳技术大学)

专题命中 逻辑推理 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文研究通过系统性实验验证针对性干预能否提升本地开源模型在Linux提权中的性能,发现开源模型可匹配甚至超越云模型,且反思类干预效果最佳,但漏洞发现仍是本地模型的瓶颈。

Comments Accepted at RAISE workshop (https://raise-workshop.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13252 2026-08-13 cs.CL 版本更新 57%

A Reality Check of Language Models as Formalizers on Constraint Satisfaction Problems

语言模型作为形式化工具在约束满足问题上的现实检验

Rikhil Amonkar, Ceyhun Efe Kayan, Qimei Lai, Ronan Le Bras, Li Zhang

机构 * Drexel University(德雷塞尔大学) University of Pennsylvania(宾夕法尼亚大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 研究评估了语言模型作为形式化工具在约束满足问题中的表现,发现其在15种模型-数据集组合中表现劣于作为求解器,尽管形式化更具可验证性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16481 2026-08-12 cs.AI 版本更新 57%

Leveraging Large Language Models for Causal Discovery: a Constraint-based, Argumentation-driven Approach

利用大语言模型进行因果发现:一种基于约束和论证的方法

Zihao Li, Fabrizio Russo

机构 * Department of Computing(计算系) Imperial College London(帝国理工学院伦敦分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型作为不完美的专家,结合语义结构先验和条件独立性证据,实现因果发现的先进方法。

Comments Accepted at UAI 2026. 37 pages, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08240 2026-08-12 cs.CV cs.AI 版本更新 57%

Hybrid Token Compression for Vision-Language Models

HybridToken-VLM:用于视觉-语言模型的混合令牌压缩

Jusheng Zhang, Xiaoyang Guo, Tongyu Mo, Qinhan Lv, Wenhao Chai, Jian Wang, Keze Wang, Liang Lin

机构 * Sun Yat-sen University(中山大学) Princeton University(普林斯顿大学) Snap Inc(Snap公司)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 HybridToken-VLM通过混合令牌压缩技术,在保持性能的同时显著提升视觉-语言模型的效率

Comments Accepted at CVPR 2026. Code available at https://github.com/jushengzhang/HybridToken-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07965 2026-08-11 cs.AI 新提交 57%

CyberAGENTS: Structured Autonomy for Agentic Gamified Learning in Cybersecurity

CyberAGENTS:面向网络安全领域智能体游戏化学习的结构化自主机制

Ivan Hornung, Deepthi Marasinghe Arachchige, Tharindu Kumarage, Garima Agrawal, Yuli Deng, Ying-Chih Chen, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) Amazon AGI(亚马逊AGI)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出CyberAGENTS框架,通过结构化自主机制实现游戏化网络安全学习,经课堂评估验证其可提升学习者参与度与对AI响应的信任度,为相关系统设计提供蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00326 2026-08-11 cs.AI 版本更新 57%

Learning to Coordinate Symbolic Tools: LLM Agents for Verified Sum-of-Squares Certificates

学习协调符号工具:用于验证平方和(SOS)证书的大语言模型(LLM)智能体

Bohan Chen, Shivam N. Patel, Richard Hoffmann, Sam Looi, Tony Yue Yu

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI

AI总结 该研究开发结合领域训练、符号工具和验证反馈的LLM智能体,在加权SOS验证任务上达到78.96%成功率,为可精确检查输出领域的工具调用智能体设计提供案例。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22758 2026-08-11 cs.AI 版本更新 57%

AutoRefine: Compiling Trajectories into Validated Typed Agent Artifacts

AutoRefine: 从轨迹到可重用的专业知识为连续LLM代理优化

Libin Qiu, Zhirong Gao, Junfu Chen, Yuhang Ye, Liangyu Li, Weizhi Huang, Xiaobo Xue, Wenkai Qiu, Shuo Tang

机构 * alibaba(阿里巴巴集团)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 AutoRefine通过提取和维护双重形式的经验模式,提升连续LLM代理的知识积累与维护效率,实现98.4%的准确率提升。

Comments 7 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17162 2026-08-11 cs.AI 版本更新 57%

The Belief-Desire-Intention Ontology for modelling mental reality and agency

信念-愿望-意图本体用于建模心理现实与代理

Sara Zuppiroli, Carmelo Fabio Longo, Anna Sofia Lippolis, Rocco Paolillo, Lorenzo Giammei, Miguel Ceriani, Francesco Poggi, Antonio Zinilli, Andrea Giovanni Nuzzolese

机构 * CNR - Institute of Cognitive Sciences and Technologies(CNR认知科学与技术研究所) CNR - Institute for Research on Population and Social Policies(CNR人口与社会政策研究所) CNR - Research Institute on Sustainable Economic Growth(CNR可持续经济增长研究所) University of Bologna - Department of Philosophy(博洛尼亚大学哲学系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种形式化的BDI本体,通过模块化设计模式实现信念、愿望、意图及其动态关系,结合LLMs和Semas平台验证其在认知基础和语义可互操作性中的应用。

Journal ref Journal of Web Semantics (2026) 90:100885

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06292 2026-08-07 cs.CL cs.SC 新提交 57%

NeSy-RAG: Neuro-Symbolic RAG for Explainable Question Answering

NeSy-RAG:用于可解释问答的神经符号检索增强生成框架

Jonas Gann, Michael Gertz

机构 * Heidelberg University(海德堡大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 NeSy-RAG是一种模块化神经符号RAG框架,可生成透明推理轨迹,在ShARC基准上以61.1%的准确率优于同模型RAG基线,实现可解释问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05864 2026-08-07 cs.AI 新提交 57%

Seeing Is Not Deciding: Can Multimodal LLMs Act as Effective CEOs?

视觉感知不等于决策:多模态大语言模型能成为有效的首席执行官吗?

Yuyang Dai, Xueqing Peng, Yuxia Wang, Preslav Nakov, Zhuohan Xie

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究构建C-SUITEBENCH多模态基准,评估9个前沿模型作为CEO的决策能力,发现多模态输入可提升证据推理但会损害受限资源分配,揭示多模态智能体的视觉感知与受限行动是可分离瓶颈。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05205 2026-08-07 cs.AI 新提交 57%

Abstract Event Causal Rules: Induction and Application

抽象事件因果规则:归纳与应用

Ziwei Zheng, Peiqiong Chen, Bang Wang

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对现有实例级因果对泛化缺陷,提出抽象事件因果规则(AECR)及相关归纳系统,构建知识库并设计 AR-GCAE 模型注入 AECR,在 CGEP 任务中提升了事件因果推理与预测性能,尤其对稀有未见样本效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05169 2026-08-07 cs.CL 新提交 57%

ConWriter: Transition-Constrained Stateful Long-Form Story Generation with Lightweight Neuro-Symbolic Consistency Control

ConWriter:基于轻量级神经符号一致性控制的带状态长文本故事生成,受过渡约束

Jindong Li, Yang Yang, Zihao Liu, Yutao Yue, Menglin Yang

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 针对现有长故事生成方法易累积各类错误的问题,提出无训练框架ConWriter,通过维护故事状态、验证叙事过渡并结合风险信号实现一致性控制,在ConStory-Bench上完成多模型多任务评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03154 2026-08-05 cs.CL 新提交 57%

ANCHOR-RE: An Agentic Neuro-Symbolic Framework for Grounded Biomedical Relation Extraction

ANCHOR-RE:用于接地生物医学关系抽取的智能体神经符号框架

Shufan Ming, Yikun Han, Gibong Hong, Rui Zhang, Halil Kilicoglu

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究提出ANCHOR-RE框架,将本体引导推理等集成到LLM推理中,在多个BioRE基准及2026年生物医学文章数据集上,该框架性能优于直接LLM提示及部分现有方法,是实用的无训练生物医学文献挖掘方法。

Comments Submitted to Journal of Biomedical Informatics (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03137 2026-08-05 cs.AI 新提交 57%

Verifiable Memory: Learning Unified Memory Management with Local and Global Verifiers for Large Language Model Agents

可验证记忆:为大语言模型智能体学习结合局部与全局验证器的统一记忆管理

Xiaolong Sun, Qichao Wang, Hangyu Li, Liang Chen

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI

AI总结 提出VerMem框架,用含七个原子操作的统一策略管理LTM等状态,结合局部与全局验证器训练,在多基准测试中性能与效率均优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏