arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-02 至 2026-02-02 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 6 篇

2506.04575 2026-02-02 cs.CL 88%

Are LLMs Stable Formal Logic Translators in Logical Reasoning Across Linguistically Diversified Texts?

LLMs是否在跨语言多样化文本中的逻辑推理中是稳定的正式逻辑翻译器?

Qingchuan Li, Jiatong Li, Zirui Liu, Mingyue Cheng, Yuting Zeng, Qi Liu, Tongxuan Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL

AI总结 本文提出SoLT基准测试和MenTaL方法,揭示LLMs在跨语言多样化文本中存在符号映射不一致问题,并通过增强语言多样性提升推理稳定性。

Comments Accepted by WWW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23085 2026-02-02 cs.IR cs.AI 83%

OrLog: Resolving Complex Queries with LLMs and Probabilistic Reasoning

OrLog:利用LLM和概率推理解决复杂查询

Mohanna Hoveyda, Jelle Piepenbrock, Arjen P de Vries, Maarten de Rijke, Faegheh Hasibi

机构 * Radboud University(拉德堡德大学) Eindhoven University of Technology(埃因霍温理工大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 OrLog通过结合LLM和概率推理,实现约束感知的高效检索,提升查询精度并减少token消耗。

Comments Accepted to ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22312 2026-02-02 cs.LG cond-mat.mtrl-sci cs.CE 83%

SCALAR: Quantifying Structural Hallucination, Consistency, and Reasoning Gaps in Materials Foundation Models

SCALAR:量化材料基础模型中的结构幻觉、一致性和推理差距

Can Polat, Erchin Serpedin, Mustafa Kurban, Hasan Kurban

机构 * Texas A\&M University, College Station, TX, USA(德克萨斯A&M大学) Ankara University, Ankara, Turkey(安卡拉大学) Texas A\&M University at Qatar, Doha, Qatar(德克萨斯A&M大学多哈分校) Hamad Bin Khalifa University, Doha, Qatar(哈马德·本·卡西姆大学)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 SCALAR基准通过评估几何尺度泛化与材料基础模型中结构幻觉、一致性和推理的关系,揭示了大语言模型在材料科学推理中的性能局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21981 2026-02-02 cs.AI cs.MA 83%

Collaborative Belief Reasoning with LLMs for Efficient Multi-Agent Collaboration

基于LLM的协同信念推理用于高效多智能体协作

Zhimin Wang, Duo Wu, Shaokang He, Jinghe Wang, Linjia Kang, Jing Yu, Kai Zhu, Jiawei Li, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Huawei Tenchnologies Co., Ltd.(华为技术有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 CoBel-World通过协同信念世界框架,提升LLM多智能体协作的效率和人类化表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25497 2026-02-02 cs.LG 79%

Right for the Right Reasons: Avoiding Reasoning Shortcuts via Prototypical Neurosymbolic AI

为正确的理由而正确:通过原型神经符号AI避免推理捷径

Luca Andolfi, Eleonora Giunchiglia

机构 * Imperial College London(帝国理工学院伦敦分校) Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出原型神经符号架构,通过学习正确基本概念避免推理捷径,提升神经符号学习的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22645 2026-02-02 cs.AI 57%

Beyond Medical Chatbots: Meddollina and the Rise of Continuous Clinical Intelligence

超越医疗聊天机器人:Meddollina与持续临床智能的兴起

Vaibhav Ram S. V. N. S, Swetanshu Agrawal, Samudra Banerjee, Abdul Muhsin

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 Meddollina是一种以治理优先的临床智能系统,通过约束推断和保持临床适当性,解决生成模型在临床部署中的不足,推动持续临床智能的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏