arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3043 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3043 篇

2601.03808 2026-08-06 cs.CV cs.LG 版本更新 77%

From Brute Force to Semantic Insight: Performance-Guided Data Transformation Design with LLMs

从暴力到语义洞察:基于LLM的性能引导数据转换设计

Usha Shrestha, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg(计算机视觉实验室、CAIDAS与IFI、乌尔姆大学)

专题命中 逻辑推理 :chain-of-thought(abstract,abstract_cn);reasoning(abstract);分类 cs.LG

AI总结 本文提出了一种基于LLM的性能引导数据转换设计方法,通过经验反馈实现闭环优化,减少穷举搜索需求,提升代码生成的准确性与任务对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14095 2026-07-07 cs.AI cs.CR 版本更新 77%

NEST: Nascent Encoded Steganographic Thoughts

NEST:新生编码隐写思想

Artem Karpov

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 探讨模型在无害文本中隐藏秘密推理的隐写思维链,通过分类系统评估34个模型的隐写能力极限,测量相关指标并与基线比较,发现前沿模型无法联合推理嵌入,编码能力已达标,强调持续评估隐写风险的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20811 2026-04-23 cs.AI 77%

Diagnosing CFG Interpretation in LLMs

在LLM中诊断CFG解释

Hanqi Li, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院X-LANCE实验室) AISpeech Co., Ltd., Suzhou, China(上海AI语音有限公司) Shanghai Innovation Institution, Shanghai, China(上海创新研究所) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室) Suzhou Laboratory, Suzhou, China(苏州实验室)

专题命中 逻辑推理 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 研究LLM在处理新上下文无关文法时能否生成语法正确、行为功能和语义忠实的输出,揭示LLM在语法、行为和语义层面的层次退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02304 2026-04-22 cs.CL 77%

When Does Verification Pay Off? A Closer Look at LLMs as Solution Verifiers

验证何时有效?对LLM作为解决方案验证器的深入探讨

Jack Lu, Ryan Teehan, Jinran Jin, Mengye Ren

机构 * Agentic Learning AI Lab, New York University(代理学习人工智能实验室,纽约大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 研究探讨了在何种条件下验证有效,通过分析37个模型在9个基准测试中的表现,发现跨模型家族验证效果优于自验证,且验证收益随模型相似性增加而降低。

Comments Accepted at ICLR 2026 AI with Recursive Self-Improvement workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17225 2026-04-21 cs.CL 77%

A Multi-Agent Approach for Claim Verification from Tabular Data Documents

从表格数据文档中验证声明的多智能体方法

Rudra Ranajee Saha, Laks V. S. Lakshmanan, Raymond T. Ng

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出多智能体框架MACE,通过规划器、执行器和验证器三个智能体,实现可解释的表格数据验证,实验显示其在多个数据集上达到SOTA性能,且在参数较少时仍表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04869 2026-04-07 cs.LG 77%

Optimizing LLM Prompt Engineering with DSPy Based Declarative Learning

基于DSPy的声明式学习优化大语言模型提示工程

Shiek Ruksana, Sailesh Kiran Kurra, Thipparthi Sanjay Baradwaj

机构 * Vasavi College of Engineering(瓦萨维工程学院) Amazon(亚马逊) Texas(德克萨斯州)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出基于DSPy的声明式学习方法,通过符号规划、无梯度优化和自动模块重写提升提示优化的可靠性、效率和泛化能力,实验显示事实准确率提升30-45%,幻觉率降低25%。

Comments Best paper Award ,IEEE International Conference on Emerging Smart Computing and Informatics (ESCI) Pune, India. Mar 11-13, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25498 2026-03-27 cs.AI 77%

EcoThink: A Green Adaptive Inference Framework for Sustainable and Accessible Agents

EcoThink: 一种绿色自适应推理框架,用于可持续和可及的智能体

Linxiao Li, Zhixiang Lu

机构 * The University of Sydney(悉尼大学) University of Liverpool(利物浦大学)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出EcoThink框架,通过轻量级路由器动态评估查询复杂度,减少推理能耗40.4%,提升AI可持续性和可及性。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07885 2026-03-05 cs.RO cs.AI 77%

Safety Guardrails for LLM-Enabled Robots

LLM赋能机器人中的安全护栏

Zachary Ravichandran, Alexander Robey, Vijay Kumar, George J. Pappas, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 RoboGuard通过两阶段护栏架构,利用根信任LLM和链式推理生成上下文安全规范,有效降低LLM赋能机器人在对抗攻击下的不安全计划执行率,提升系统安全性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17789 2026-01-27 cs.AI 77%

Neuro-Symbolic Verification on Instruction Following of LLMs

神经符号验证在大语言模型指令遵循上的应用

Yiming Su, Kunzhao Xu, Yanjie Gao, Fan Yang, Cheng Li, Mao Yang, Tianyin Xu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Science and Technology of China(中国科学技术大学) Microsoft Research(微软研究院)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出NSVIF框架,通过神经符号方法验证大语言模型是否遵循指令,实验表明其在指令遵循验证中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18839 2026-01-12 cs.CL 77%

Detect, Explain, Escalate: Sustainable Dialogue Breakdown Management for LLM Agents

检测、解释、升级:面向LLM代理的可持续对话破裂管理

Abdellah Ghassel, Xianzhi Li, Xiaodan Zhu

机构 * Department of Electrical and Computer Engineering and Ingenuity Labs Research Institute, Queen’s University(电气与计算机工程系和Ingenuity Labs研究研究所,皇后大学)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种可持续对话破裂管理框架,通过高效检测器和升级架构,在LLM代理中实现资源高效的对话破裂管理,提升对话AI的可靠性和成本效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19405 2025-11-11 cs.AI 77%

Logic Distillation: Learning from Code Function by Function for Decision-making Tasks

Dong Chen, Shilin Zhang, Fei Gao, Yueting Zhuang, Siliang Tang, Qidong Liu, Mingliang Xu

机构 * The School of Computer and Artificial Intelligence of Zhengzhou University(郑州大学计算机与人工智能学院) Engineering Research Center of Intelligent Swarm Systems, Ministry of Education(教育部智能群体系统工程研究中心) National Supercomputing Center In Zhengzhou(郑州国家超级计算中心) Zhejiang University(浙江大学)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.AI

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17377 2025-11-11 cs.CL 77%

Robustness of Neurosymbolic Reasoners on First-Order Logic Problems

Hannah Bansal, Kemal Kurniawan, Lea Frermann

机构 * RMIT University(皇家墨尔本理工大学) The University of Melbourne(墨尔本大学)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Accepted to ALA Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08970 2025-10-06 cs.AI 77%

Gala: Global LLM Agents for Text-to-Model Translation

Junyang Cai, Serdar Kadioglu, Bistra Dilkina

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) AI Center of Excellence, Fidelity Investments(富达投资人工智能卓越中心) Department of Computer Science, Brown University(布朗大学计算机科学系)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11127 2025-09-16 cs.CL 77%

Joint Effects of Argumentation Theory, Audio Modality and Data Enrichment on LLM-Based Fallacy Classification

Hongxu Zhou, Hylke Westerdijk, Khondoker Ittehadul Islam

机构 * University of Groningen(格罗宁根大学)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20960 2025-07-29 cs.AI 77%

On the Limits of Hierarchically Embedded Logic in Classical Neural Networks

Bill Cochran

机构 * Bill Cochran

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.AI

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06178 2025-07-22 cs.LG 77%

A Large Language Model-Enhanced Q-learning for Capacitated Vehicle Routing Problem with Time Windows

Linjiang Cao, Maonan Wang, Xi Xiong

专题命中 逻辑推理 :chain-of-thought(abstract);CoT(abstract);self-correction(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11477 2025-04-17 cs.CV cs.AI 77%

SDIGLM: Leveraging Large Language Models and Multi-Modal Chain of Thought for Structural Damage Identification

Yunkai Zhang, Shiyin Wei, Yong Huang, Yawu Su, Shanshan Lu, Hui Li

专题命中 逻辑推理 :reasoning(abstract);CoT(abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02760 2025-03-05 cs.CL 77%

From Metaphor to Mechanism: How LLMs Decode Traditional Chinese Medicine Symbolic Language for Modern Clinical Relevance

Jiacheng Tang, Nankai Wu, Fan Gao, Chengxiao Dai, Mengyao Zhao, Xinjie Zhao

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09589 2025-02-18 cs.CL cs.LO 77%

Logical forms complement probability in understanding language model (and human) performance

Yixuan Wang, Freda Shi

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10869 2024-11-19 cs.CL cs.CE cs.CY cs.HC 77%

Large Language Models (LLMs) as Traffic Control Systems at Urban Intersections: A New Paradigm

Sari Masri, Huthaifa I. Ashqar, Mohammed Elhenawy

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL

Comments The data and code that support the findings of this study are openly available in Zenodo at https://doi.org/10.5281/zenodo.14171745, reference number 14171745

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10730 2024-11-19 cs.CL cs.CR 77%

Comparison of Multilingual and Bilingual Models for Satirical News Detection of Arabic and English

Omar W. Abdalla, Aditya Joshi, Rahat Masood, Salil S. Kanhere

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments ALTA 2024 (Selected for publication)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07387 2024-11-08 cs.CL 77%

Assessing Logical Puzzle Solving in Large Language Models: Insights from a Minesweeper Case Study

Yinghao Li, Haorui Wang, Chao Zhang

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.CL

Comments 23 pages, 5 figures, 4 tables, in NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21779 2024-10-30 cs.CL 77%

Leveraging LLMs for Hypothetical Deduction in Logical Inference: A Neuro-Symbolic Approach

Qingchuan Li, Jiatong Li, Tongxuan Liu, Yuting Zeng, Mingyue Cheng, Weizhe Huang, Qi Liu

专题命中 逻辑推理 :reasoning(abstract);CoT(abstract);logical reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16461 2024-09-26 cs.CL 77%

Strategies for Improving NL-to-FOL Translation with LLMs: Data Generation, Incremental Fine-Tuning, and Verification

Ramya Keerthy Thatikonda, Jiuzhou Han, Wray Buntine, Ehsan Shareghi

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);verifier(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00745 2024-02-02 cs.CL 77%

Enhancing Ethical Explanations of Large Language Models through Iterative Symbolic Refinement

Xin Quan, Marco Valentino, Louise A. Dennis, André Freitas

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Camera-ready for EACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07850 2023-12-14 cs.AI 77%

Large Language Model Enhanced Multi-Agent Systems for 6G Communications

Feibo Jiang, Li Dong, Yubo Peng, Kezhi Wang, Kun Yang, Cunhua Pan, Dusit Niyato, Octavia A. Dobre

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.AI

Comments Submitted for possible journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02144 2023-09-06 cs.CL cs.AI cs.LG 76%

Making Large Language Models Better Reasoners with Alignment

Peiyi Wang, Lei Li, Liang Chen, Feifan Song, Binghuai Lin, Yunbo Cao, Tianyu Liu, Zhifang Sui

专题命中 逻辑推理 :reasoning(abstract,comments);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Large Language Models; Reasoning; Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07395 2026-07-29 cs.CV cs.AI cs.LG 版本更新 76%

When Prompts Ignore Structure: Graph-Based Attribute Reasoning for Calibrated VLMs

当提示忽略结构时:基于图的属性推理用于校准视觉语言模型

Tanay Sodha, Aditya Sharma, Ramya Hebbalaguppe, Vinti Agarwal, Pranav Murthy Yeluripaty

机构 * Birla Institute of Technology and Science, Pilani(贝拉科技与科学学院皮拉尼分校) TCS Research(塔塔咨询服务公司研究院)

专题命中 逻辑推理 :reasoning(title);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型测试时自适应中可靠置信度估计问题,提出ARGTCA方法,将(类,属性)对表示为符号属性图节点,用对比目标训练图注意力网络,引入两种属性选择策略,实验证明该方法能有效降低校准误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02023 2026-07-16 cs.CL cs.AI 版本更新 76%

Not All Needles Are Found: How Fact Distribution and Don't Make It Up Prompts Shape Retrieval, Reasoning, and Hallucination in Long-Context LLMs

并非所有线索都能被发现:事实分布和“不要编造”提示如何影响长上下文语言模型中的检索、推理和幻觉

Amirali Ebrahimzadeh, Seyyed M. Salili

机构 * Department of Electrical Engineering & Computer Science University of Michigan(电气工程与计算机科学系 密歇根大学)

专题命中 逻辑推理 :reasoning(title);分类 cs.CL、cs.AI

AI总结 研究大语言模型中事实分布和反幻觉提示对检索、推理及幻觉的影响,通过扩展基准评估多个模型,识别出分布崩溃和安全代价两种失败模式,发现许多失败源于无效上下文利用,强调特定模型稳健性和上下文管理的重要性。

Comments 16 pages, 8 figures, 2 tables. Accepted at the FAGEN Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08960 2026-07-13 cs.LG cs.AI 新提交 76%

Eluna: An Agentic LLM System for Automating Warehouse Operations with Reasoning and Task Execution

Eluna:一个用于通过推理和任务执行实现仓库运营自动化的智能语言模型系统

Ning Liu, Kalle Kujanpää, Zhaoxuan Zhu, P Aditya Sreekar, Kaiwen Liu, Chuanneng Sun, Jorge Marchena Menendez, Matthew Bales, Tianyu Yang, Shahnawaz Alam, Rose Yu, Baoyuan Liu, Kristina Klinkner, Shervin Malmasi

机构 * Amazon.com, Inc. Fulfillment Technologies and Robotics(亚马逊公司履约技术与机器人部门)

专题命中 逻辑推理 :reasoning(title);分类 cs.AI、cs.LG

AI总结 研究针对仓库运营中SOP执行问题,提出Eluna智能体系统,它是图形引导多智能体框架,采用非对称情节蒸馏方法,在基准测试和生产应用中,微调模型表现出色,匹配或超教师模型,击败基线,在票务处理应用达94%专家一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏