arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-21 至 2026-01-21 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 14 篇

2601.10101 2026-01-21 cs.AI cs.CL 91%

Matrix as Plan: Structured Logical Reasoning with Feedback-Driven Replanning

矩阵作为计划:基于反馈驱动的重计划的结构化逻辑推理

Ke Chen, Jiandian Zeng, Zihao Peng, Guo Li, Guangxue Zhang, Tian Wang

机构 * Faculty of Arts and Sciences(艺术与科学学院) Beijing Normal University(北京师范大学) Institute of Artificial Intelligence and Future Networks(人工智能与未来网络研究所) Engineering Research Center of Cloud-Edge Intelligent Collaboration on Big Data, Ministry of Education(教育部云-边智能协同大数据工程研究中心)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 MatrixCoT通过引入矩阵基础计划和反馈驱动重计划机制,提升LLM在复杂符号推理任务中的鲁棒性和可解释性。

Comments 12 pages, 5 figures, 2 tables. Accepted at The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12995 2026-01-21 cs.CL 83%

Graph Reasoning Paradigm: Structured and Symbolic Reasoning with Topology-Aware Reinforcement Learning for Large Language Models

图推理范式:基于拓扑感知强化学习的结构化和符号推理用于大语言模型

Runxuan Liu, Xianhao Ou, Xinyan Ma, Jiyuan Wang, Jiafeng Liang, Jiaqi Li, Tao He, Zheng Chu, Rongchuan Mu, Zekun Wang, Baoxin Wang, Dayong Wu, Ming Liu, Shijin Wang, Guoping Hu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) Tianjin Normal University(天津师范大学) Pengcheng Laboratory(鹏城实验室)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 图推理范式通过拓扑感知强化学习实现结构化和符号推理,提升大语言模型的数学推理和代码生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13387 2026-01-21 cs.CL cs.LG 81%

Confidence over Time: Confidence Calibration with Temporal Logic for Large Language Model Reasoning

时间上的信心:基于时序逻辑的大型语言模型推理信心校准

Zhenjiang Mao, Anirudhh Venkat, Artem Bisliouk, Akshat Kothiyal, Sindhura Kumbakonam Subramanian, Saithej Singhu, Ivan Ruchkin

机构 * University of Florida(佛罗里达大学) University of Mannheim(曼海姆大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于时序逻辑的大型语言模型推理信心校准方法,通过STL挖掘和参数超网络提升信心评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12019 2026-01-21 cs.CL cs.AI 81%

Acting Flatterers via LLMs Sycophancy: Combating Clickbait with LLMs Opposing-Stance Reasoning

通过LLMs的趋炎附势行为进行煽动性行为:用LLMs的对立立场推理对抗软文

Chaowei Zhang, Xiansheng Luo, Zewei Zhang, Yi Zhu, Jipeng Qiang, Longwei Wang

机构 * Yangzhou University(扬州大学) Auburn University(亚伯拉罕大学) University of South Dakota(南达科他大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗quentourt研究所) Rajiv Gandhi University(拉贾夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用LLMs的趋炎附势行为生成对立立场推理,以提升软文检测的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12822 2026-01-21 cs.AI 79%

MirrorGuard: Toward Secure Computer-Use Agents via Simulation-to-Real Reasoning Correction

MirrorGuard:通过模拟到现实推理校正实现安全的计算机使用代理

Wenqi Zhang, Yulin Shen, Changyue Jiang, Jiarun Dai, Geng Hong, Xudong Pan

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 MirrorGuard通过模拟到现实推理校正提升计算机使用代理的安全性,有效降低系统风险并保持代理实用性

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13671 2026-01-21 cs.MA cs.AI 70%

The Orchestration of Multi-Agent Systems: Architectures, Protocols, and Enterprise Adoption

多智能体系统的编排:架构、协议与企业采纳

Apoorva Adimulam, Rajesh Gupta, Sumit Kumar

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出了一种统一架构框架和两种互补通信协议,旨在提升多智能体系统在企业级AI生态系统中的可扩展性和合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13096 2026-01-21 cs.RO cs.CV 67%

LLM-VLM Fusion Framework for Autonomous Maritime Port Inspection using a Heterogeneous UAV-USV System

基于异构无人机-水下机器人系统的LLM-VLM融合框架用于自主港口检测

Muhayy Ud Din, Waseem Akram, Ahsan B. Bakht, Irfan Hussain

机构 * Khalifa University Center for Autonomous Robotic Systems (KUCARS)(卡利法大学自主机器人系统中心(KUCARS)) Khalifa University(卡利法大学)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出基于LLM和VLM的融合框架,利用异构无人机-水下机器人系统实现自主港口检测,通过符号规划与语义检测提升检测效率和安全性。

Comments submitted in AEJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12442 2026-01-21 cs.LG cs.AI cs.CV 62%

Constraint-Aware Neurosymbolic Uncertainty Quantification with Bayesian Deep Learning for Scientific Discovery

具有贝叶斯深度学习的约束感知神经符号不确定性量化框架用于科学发现

Shahnawaz Alam, Mohammed Mudassir Uddin, Mohammed Kaif Pasha

机构 * Department of Computer Science and Engineering Muffakham Jah College of Engineering and Technology (MJCET)(计算机科学与工程系穆法卡姆·贾赫工程与技术学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CANUF通过结合贝叶斯深度学习与可微符号推理,首次实现科学预测中的不确定性量化、约束满足和可解释性解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13162 2026-01-21 cs.LG cs.ET 57%

NeuroShield: A Neuro-Symbolic Framework for Adversarial Robustness

NeuroShield:一种用于对抗鲁棒性的神经符号框架

Ali Shafiee Sarvestani, Jason Schmidt, Arman Roohi

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校) Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Computer Science(计算机科学系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 NeuroShield通过整合符号规则监督提升深度神经网络的对抗鲁棒性和可解释性,其方法在对抗攻击测试中表现出显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08581 2026-01-21 cs.AI 57%

DeepProofLog: Efficient Proving in Deep Stochastic Logic Programs

DeepProofLog: 在深度随机逻辑程序中实现高效的证明

Ying Jiao, Rodrigo Castellano Ontiveros, Luc De Raedt, Marco Gori, Francesco Giannini, Michelangelo Diligenti, Giuseppe Marra

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 DeepProofLog通过引入深度随机逻辑程序和马尔可夫决策过程的映射,提升了神经符号AI在复杂证明空间和大规模知识库中的可扩展性。

Comments Accepted as an Oral at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13556 2026-01-21 cs.RO 50%

LogicEnvGen: Task-Logic Driven Generation of Diverse Simulated Environments for Embodied AI

LogicEnvGen: 基于任务逻辑的多样化模拟环境生成用于具身AI

Jianan Wang, Siyang Zhang, Bin Li, Juan Chen, Jingtao Qi, Zhuo Zhang, Chen Qian

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Intelligent Game and Decision Lab (IGDL)(智能游戏与决策实验室) School of Artifical Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 逻辑推理 :planning(abstract)

AI总结 LogicEnvGen通过任务逻辑驱动生成多样化模拟环境,提升智能体在不同环境中的适应性和鲁棒性评估性能。

Comments 19 pages, 15 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09550 2026-01-21 cs.SE 50%

Integrating Symbolic Execution with LLMs for Automated Generation of Program Specifications

将符号执行与LLMs结合以实现程序规范的自动化生成

Fanpeng Yang, Xu Ma, Shuling Wang, Xiong Xu, Qinxiang Cao, Naijun Zhan, Xiaofeng Li, Bin Gu

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出一种结合符号执行与LLMs的方法,自动生成形式化程序规范,提升程序理解与验证的精度和适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12274 2026-01-21 cs.SE 50%

Hybrid Concolic Testing with Large Language Models for Guided Path Exploration

基于大语言模型的混合协同测试用于引导路径探索

Mahdi Eslamimehr

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出一种结合大语言模型与协同执行的混合测试方法,通过引导路径探索提升程序状态空间探索效率和缺陷检测能力。

Comments 12 pages, 2 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11968 2026-01-21 cs.MM cs.SD eess.AS 50%

MuseAgent-1: Interactive Grounded Multimodal Understanding of Music Scores and Performance Audio

MuseAgent-1: 交互式 grounded 多模态理解音乐谱面与表演音频

Qihao Zhao, Yunqi Cao, Yangyu Huang, Hui Yi Leong, Fan Zhang, Kim-Hui Yap, Wei Hu

机构 * Nanyang Technological University(南洋理工大学) Beijing University of Chemical Technology(北京化工大学) Microsoft(微软公司) University of Chicago(芝加哥大学)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 MuseAgent-1 是一个专注于音乐的多模态代理,通过结构化符号表示和多步骤推理,提升对音乐谱面和表演音频的交互式理解能力。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏