arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-18 至 2025-12-18 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 5 篇

2512.14709 2025-12-18 cs.AI cs.LG 84%

Attention as Binding: A Vector-Symbolic Perspective on Transformer Reasoning

注意力作为绑定:一种向量符号视角下的Transformer推理

Sahil Rajesh Dhayalkar

机构 * Sahil Rajesh Dhayalkar(独立研究者)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出将Transformer的注意力机制视为软向量符号计算,通过向量符号架构视角解释其推理行为,并提出改进架构和训练目标以提升逻辑可靠性和可解释性。

Comments 12 pages with references. Submitted to 'Logical and Symbolic Reasoning in Language Models @ AAAI 2026' conference and is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14989 2025-12-18 cs.CL cs.AI cs.CV 73%

Evaluating Large Language Models on Multimodal Chemistry Olympiad Exams

评估大型语言模型在多模态化学奥林匹克考试中的表现

Yiming Cui, Xin Yao, Yuxuan Qin, Xin Li, Shijin Wang, Guoping Hu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) iFLYTEK AI Research(iFLYTEK人工智能研究院)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了多种多模态LLM在化学奥林匹克考试中的表现,发现其在多模态融合和科学推理方面存在显著局限,提出通过链式思维提示提升模型性能的方法。

Comments Published at Communications Chemistry

Journal ref Commun. Chem. 8 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15298 2025-12-18 cs.AI cs.CL cs.CY 62%

ChatGPT and Gemini participated in the Korean College Scholastic Ability Test -- Earth Science I

ChatGPT 和 Gemini 参与韩国大学入学考试——地球科学I

Seok-Hyun Ga, Chun-Yen Chang

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究分析了ChatGPT和Gemini在地球科学I考试中的多模态推理能力,发现模型在感知与认知之间存在差距,揭示了AI在科学评估中的局限性。

Comments 23 pages, 9 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01398 2025-12-18 cs.AI 57%

The Need for Verification in AI-Driven Scientific Discovery

人工智能驱动科学发现中的验证需求

Cristina Cornelio, Takuya Ito, Ryan Cory-Wright, Sanjeeb Dash, Lior Horesh

机构 * Samsung AI, Cambridge, UK(三星人工智能,英国坎布里奇) IBM Research, Yorktown Heights, USA(IBM研究院,美国尤里茨山) Imperial Business School, London, UK(帝国商业学院,英国伦敦)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了人工智能驱动科学发现中验证的重要性,指出验证机制是确保科学进步的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04642 2025-12-18 math.LO 50%

Tableaux for epistemic Gödel logic

表格用于知识 Gödel 逻辑

Marta Bílková, Thomas Ferguson, Daniil Kozhemiachenko

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出了一种多智能体知识 Gödel 逻辑,利用表格计算方法解决有效性问题,证明其在不同智能体数量下的复杂性为 PSpace 或 coNP 完全。

详情

展开后加载摘要…

URL PDF HTML 收藏