arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45051 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3033 篇

2002.10149 2020-02-25 cs.AI 70%

Cognitive Argumentation and the Suppression Task

Emmanuelle-Anna Dietz Saldanha, Antonis Kakas

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.06241 2020-02-19 cs.CV cs.LG cs.MA cs.RO 70%

Social-WaGDAT: Interaction-aware Trajectory Prediction via Wasserstein Graph Double-Attention Network

Jiachen Li, Hengbo Ma, Zhihao Zhang, Masayoshi Tomizuka

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.00668 2019-09-15 cs.LG cs.LO stat.ML 70%

Logic and the $2$-Simplicial Transformer

James Clift, Dmitry Doryn, Daniel Murfet, James Wallbridge

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.00120 2019-02-04 cs.AI 70%

Learning to Make Analogies by Contrasting Abstract Relational Structure

Felix Hill, Adam Santoro, David G. T. Barrett, Ari S. Morcos, Timothy Lillicrap

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.10561 2018-06-29 cs.AI 70%

Knowledge Compilation in Multi-Agent Epistemic Logics

Liangda Fang, Kewen Wang, Zhe Wang, Ximing Wen

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.10247 2018-04-30 cs.AI 70%

Experimenting with robotic intra-logistics domains

Martin Gebser, Philipp Obermeier, Thomas Otto, Torsten Schaub, Orkunt Sabuncu, Van Nguyen, Tran Cao Son

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments Paper presented at the 34nd International Conference on Logic Programming (ICLP 2018), Oxford, UK, July 14 to July 17, 2018 18 pages, LaTeX, 8 PDF figures (arXiv:YYMM.NNNNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.08922 2017-07-19 cs.AI cs.LO cs.RO 70%

On Automating the Doctrine of Double Effect

Naveen Sundar Govindarajulu, Selmer Bringsjord

专题命中 逻辑推理 :planning(abstract);verifier(abstract);分类 cs.AI

Comments 26th International Joint Conference on Artificial Intelligence 2017; Special Track on AI & Autonomy

详情

展开后加载摘要…

URL PDF HTML 收藏
1702.01601 2017-02-07 cs.AI cs.LO 70%

Exploring the bidimensional space: A dynamic logic point of view

Philippe Balbiani, David Fernández-Duque, Emiliano Lorini

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1505.06651 2015-07-10 cs.AI cs.LO 70%

A Logic of Knowing How

Yanjing Wang

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments 14 pages, a 12-page version accepted by LORI V

详情

展开后加载摘要…

URL PDF HTML 收藏
1007.3700 2010-07-22 cs.AI cs.LO 70%

Logic Programming for Finding Models in the Logics of Knowledge and its Applications: A Case Study

Chitta Baral, Gregory Gelfond, Enrico Pontelli, Tran Cao Son

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments 16 pages, 1 figure, International Conference on Logic Programming 2010

Journal ref Theory and Practice of Logic Programming, Volume 10, Special Issue 4-6, July 2010, pages 675-690

详情

展开后加载摘要…

URL PDF HTML 收藏
cs/0108008 2009-11-30 cs.MA cs.AI 70%

Using Methods of Declarative Logic Programming for Intelligent Information Agents

T. Eiter, M. Fink, G. Sabbatini, H. Tompits

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments 66 pages, 1 figure, to be published in "Theory and Practice of Logic Programming"

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14771 2026-08-18 cs.AI cs.CL cs.LG cs.LO cs.PL cs.SC math.OC 新提交 69%

From Errors to Proofs: Minimal-Core-Guided Repair for Neuro-Symbolic Constraint Solving

从错误到证明:最小核心引导的神经符号约束求解修复

Dipankar Sarkar

专题命中 逻辑推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG;reasoning(comments)

AI总结 该研究提出最小核心引导的修复方法,将语言模型生成的不可满足程序的错误消息替换为最小不可满足核心,在77个问题的基准上使弱模型编造不可行问题解的比例从79%降至7%,核心价值是提供证书并拒绝编造解。

Comments 7 pages, 2 figures. Accepted at the IJCAI-ECAI 2026 Workshop on Logic and Symbolic Reasoning (LogiSymb), poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19880 2026-08-21 cs.AI cs.CL cs.LG 新提交 67%

EnvHarness: Awakening Static Worlds for Agent Learning

EnvHarness:为智能体学习唤醒静态环境

Chengsong Huang, Zifeng Wang, Rujun Han, Jun Yan, Yanfei Chen, Zoey CuiZhu, Ke Jiang, Peng Xia, Han Yu, Yufan Zhuang, Yifei Ming, Jiaqi Pan, Bhavana Dalvi Mishra, Jiaxin Huang, Burak Gokturk, Tomas Pfister, Chen-Yu Lee

专题命中 逻辑推理 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EnvHarness是包裹静态环境的可编程插件层,结合EnvRigger自动合成组件,在多领域基准测试中提升智能体学习性能,减少执行步骤并支持策略与环境协同进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18105 2026-08-20 cs.CL cs.AI cs.LG 新提交 67%

StocksTalk: A Voice-Enabled Conversational Agent for Structured Query Generation over Web Data

StocksTalk:一种面向网络数据结构化查询生成的语音赋能对话智能体

Akshat Parmar, Vikranth Udandarao, Abhay Shakya, Tanmay Hire, Avinash Anand, Rajiv Ratn Shah, Daniel Wang Zhengkui

机构 * IIIT-Delhi(德里印度信息技术学院) Singapore Institute of Technology(新加坡理工学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 StocksTalk是一种语音赋能对话系统,可将口语化金融请求转为结构化查询,通过多模块提升准确性,为股票筛选决策提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17146 2026-08-19 cs.RO 新提交 67%

PDDL-ART: Autonomous Symbolic Abstraction From Demonstration For Long-Horizon Robotic Manipulation Using Vision-Language Models

PDDL-ART:基于演示的自主符号抽象方法,用于使用视觉语言模型的长时程机器人操纵

Disha Kamale, Dmitry Berenson

机构 * University of Michigan(密歇根大学)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract)

AI总结 PDDL-ART是一种基于VLM的框架,可自主从演示生成PDDL描述,经多阶段校正确保语义对齐,在发动机维护和家庭操纵任务上平均成功率达93.3%,优于基线规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14375 2026-08-17 cs.AI cs.CL cs.LG 新提交 67%

Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages

错误但有用:多智能体消息中超越答案正确性的轨迹价值

Chih-Hsuan Yang, Anjir Ahmed Chowdhury, Cheng-Hau Yang, Weijian Zheng, Fernando Llorente, Xiaolong Ma, Xinyang Li, Eliu A. Huerta, Ian T. Foster, Rajeev Thakur

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出DHD协议,发现多智能体错误消息含有用信息,错误但有帮助的消息普遍存在,其轨迹价值可辅助决策,答案正确性不决定轨迹价值。

Comments 24 pages, 9 figures. Includes an appendix and an ancillary reproducibility artifact

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09931 2026-08-11 cs.CV 新提交 67%

Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots

监督之前的感知:来自反事实盲区的自包含视觉蒸馏

Shravan Venkatraman, Omkar Thawakar, Ritesh Thawkar, Abdelrahman Shaker, Rao Muhammad Anwer

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Aalto University(阿尔托大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 该研究提出首个完全自包含的视觉自蒸馏框架 CVPD,通过识别模型视觉盲区生成密集对比监督,在 Qwen3-VL-8B-Instruct 上的 12 个基准中优于 6 个自进化基线,取得多项指标提升且无性能倒退。

Comments BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02582 2026-08-05 cs.SE 版本更新 67%

ACEM: A Cost Estimation Model for Agentic Software Engineering

ACEM:面向智能体软件工程的成本估算模型

Mohammad El-Ramly

专题命中 逻辑推理 :reasoning(abstract);planning(abstract)

AI总结 针对智能体软件工程成本估算问题,本文提出ACEM模型,分解成本为LLM、HITL、基础设施三类,引入RF、CF、HIS构念并映射传统度量,为智能体开发成本估算提供早期方案。

Comments 27 pages, under journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17535 2026-08-05 cs.SE 版本更新 67%

AgentModernize: Preserving Business Logic in Legacy Modernization with Multi-Agent LLMs and Behavioral Specification Graphs

AgentModernize: 通过多智能体LLM和行为规范图在遗留系统现代化中保留业务逻辑

Sheikh Nazib Ahmed, Marnim Galib

专题命中 逻辑推理 :CoT(abstract,abstract_cn)

AI总结 本文提出AgentModernize框架,通过多智能体系统和行为规范图来保留业务逻辑,解决传统方法在遗留系统现代化中丢失隐含规则和交叉模块约束的问题,实验表明该方法在多个场景中表现优异。

Comments 10 pages, 8 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06393 2026-07-21 cs.AI cs.CL cs.LG cs.LO 67%

Conflict-Aware Fusion: Mitigating Logic Inertia in Large Language Models via Structured Cognitive Priors

冲突感知融合:通过结构化认知先验缓解大语言模型中的逻辑惯性

Qiming Bao, Xiaoxuan Fu, Michael Witbrock

机构 * Xtracta & Strong AI Lab, University of Auckland(Xtracta与强人工智能实验室,奥克兰大学) School of Humanities, China University of Political Science and Law(人文学院,中国政法大学) Strong AI Lab, University of Auckland(强人工智能实验室,奥克兰大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型在规则系统结构扰动下表现脆弱的问题,提出冲突感知融合训练流程,通过验证-演绎结构先验和符号推理奖励,在多个压力测试中实现鲁棒性饱和。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12281 2026-07-21 cs.CV 版本更新 67%

Cognitive-YOLO: LLM-Driven Architecture Synthesis from First Principles of Data for Object Detection

认知YOLO:基于数据第一性原理的大语言模型驱动的架构合成用于目标检测

Jiahao Zhao

机构 * Xi’an University of Posts and Telecommunications(西安邮电大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 针对通用目标检测算法在垂直场景的问题,认知YOLO利用大语言模型与自主智能体协作,构建“分析-合成-编译”管道,合成轻量级模型,显著压缩参数数量,在mAP@0.5:0.95上表现良好,平衡了模型紧凑性和特征表示能力。

Comments 11 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09054 2026-07-13 cs.SE 新提交 67%

Automating Just-In-Time Python Type Annotation Updating

自动化即时Python类型注释更新

Zhipeng Xue, Zhipeng Gao, Xing Hu, Jingyuan Chen, Xin Xia, Shanping Li

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 研究Python项目中类型注释易过时问题,提出基于大语言模型的TypeUp方法自动更新类型注释,能依据旧注释和代码更改生成新注释,性能优于现有方法,在实际项目评估中展现实用价值。

Comments 12 pages, accepted by ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00924 2026-07-02 cs.AI cond-mat.mtrl-sci cs.CL cs.LG 新提交 67%

Graph-Native Reinforcement Learning Enables Traceable Scientific Hypothesis Generation through Conceptual Recombination

图原生强化学习通过概念重组实现可追溯的科学假设生成

Subhadeep Pal, Shashwat Sourav, Tirthankar Ghosal, Markus J. Buehler

机构 * Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出图原生推理模型Graph-PRefLexOR,结合GRPO强化学习将推理组织为显式阶段,在材料科学100个开放问题上推理可追溯性提升40-65%,语义多样性增加2-3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25013 2026-06-30 cs.CL cs.AI cs.LG 67%

Emergence of Minimal Circuits for Indirect Object Identification in Attention-Only Transformers

注意力-only变换器中间接对象识别最小电路的涌现

Rabin Adhikari

机构 * Saarland University(萨尔大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过从头训练小型注意力-only变换器,在符号化的间接对象识别任务中发现,单层模型仅需两个注意力头即可实现完美准确率,揭示了任务特定训练如何诱导可解释的最小电路。

Comments Published at ACL (Volume 4: Student Research Workshop) ISBN: 979-8-89176-393-7 URL: https://aclanthology.org/2026.acl-srw.4

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11061 2026-06-23 cs.CV 版本更新 67%

VDAWorld: World Modelling via VLM-Directed Abstraction and Simulation

VDAWorld: 通过VLM导向的抽象与模拟进行世界建模

Felix O'Mahony, Roberto Cipolla, Ayush Tewari

机构 * University of Cambridge(剑桥大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 提出VDAWorld框架,利用视觉语言模型自主构建场景表示并选择物理模拟器,通过抽象与自适应模拟实现高质量世界建模,在交互控制、反事实生成和物理逻辑推理任务上取得最优结果。

Comments Website: https://felixomahony.github.io/vdaworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17389 2026-06-17 cs.CV cs.AI cs.CL cs.LG 新提交 67%

Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models

视觉会撒谎,一致性说话:在视觉-语言模型中解耦空间注意力与可靠性

Logan Mann, Yi Xia, Ajit Saravanan, Ishan Dave, Saadullah Ismail, Shikhar Shiromani, Emily Huang, Ruizhe Li, Kevin Zhu

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Algoverse AI Research(Algoverse AI研究) University of California, Berkeley(加州大学伯克利分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出VLM可靠性探针(VRP),通过结构注意力指标和生成动态分析,发现空间注意力与准确性几乎无关(R≈0.001),而自一致性是可靠性的主要预测因子(R=0.429),揭示了视觉特征与最终生成之间的符号脱离现象。

Comments 16 pages. Accepted to the ICLR 2026 Workshop on Multimodal Intelligence. Code: https://github.com/itsloganmann/VLM-Reliability-Probe

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12900 2026-06-12 cs.AI cs.CL cs.LG 新提交 67%

Zero-source LLM Hallucination Detection with Human-like Criteria Probing

零源大语言模型幻觉检测:类人类标准探测

Jiahao Yang, Shuhai Zhang, Hailong Kang, Feng Liu, Qi Chen, Mingkui Tan

机构 * South China University of Technology(华南理工大学) The University of Melbourne(墨尔本大学) Pazhou Laboratory(帕乔实验室) Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出HCPD范式,通过类人类标准探测机制模拟人类评估者的多面推理,结合奖励对齐和多样本聚合,实现零源条件下的有效可解释幻觉检测。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15165 2026-06-09 cs.CL cs.AI cs.LG 版本更新 67%

The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models

灵活性陷阱:重新思考扩散语言模型中任意顺序的价值

Zanlin Ni, Shenzhi Wang, Yang Yue, Tianyu Yu, Weilin Zhao, Yeguo Hua, Tianyi Chen, Jun Song, Cheng Yu, Bo Zheng, Gao Huang

机构 * LeapLab, Tsinghua University(清华大学Leap实验室) NLPLab, Tsinghua University(清华大学自然语言处理实验室) Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) BNRist, Tsinghua University(清华大学北京研究院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文发现,尽管扩散语言模型(dLLMs)允许任意生成顺序,但这种灵活性可能限制其推理能力,通过采用标准的Group Relative Policy Optimization(GRPO)方法,即JustGRPO,在保持并行解码能力的同时提升了推理性能。

Comments Code and pre-trained models: https://github.com/LeapLabTHU/JustGRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06741 2026-06-08 cs.AI cs.CL cs.LG 新提交 67%

OpenSkill: Open-World Self-Evolution for LLM Agents

OpenSkill: 面向LLM智能体的开放世界自我进化

Zhiling Yan, Dingjie Song, Hanrong Zhang, Wei Liang, Yuxuan Zhang, Yutong Dai, Lifang He, Philip S. Yu, Ran Xu, Xiang Li, Lichao Sun

机构 * Lehigh University(莱维大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Salesforce AI Research(Salesforce人工智能研究) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院)

专题命中 逻辑推理 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出OpenSkill框架,使智能体在无目标任务监督下,利用开放世界资源自举构建技能和验证信号,实现自我进化,在多个基准上取得最佳自动通过率。

Comments 20 pages, 4 figures and 8 tables. Code is avalable at https://github.com/OpenLAIR/OpenSkill

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05929 2026-06-05 cs.CY 67%

Securing the Sandbox: A Rootless Containerized Framework for Process-Oriented Monitoring in Computer Graphics Education

保护沙箱:计算机图形学教育中面向过程监控的无根容器化框架

Germán Arroyo, Luis López, Juan Carlos Torres

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 提出VISMATIC框架,通过无根容器隔离和API级用户交互追踪,在计算机科学教育中实现过程监控的同时保障基础设施安全。

Comments 13 pages, 7 figures. Source code: https://github.com/german-arroyo-moreno/VISMATIC

详情

展开后加载摘要…

URL PDF HTML 收藏