arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-10-14 至 2025-10-14 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 5 篇

2504.14119 2025-10-14 cs.AI cs.SE 83%

CodeCrash: Exposing LLM Fragility to Misleading Natural Language in Code Reasoning

Man Ho Lam, Chaozheng Wang, Jen-tse Huang, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 代码与定理证明 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

Comments NeurIPS 2025; 10 pages of main text; 25 pages of appendices. Website - https://cuhk-arise.github.io/CodeCrash/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11004 2025-10-14 cs.MA cs.AI cs.CE cs.CL 73%

Automating Structural Engineering Workflows with Large Language Model Agents

Haoran Liang, Yufa Zhou, Mohammad Talebi Kalaleh, Qipei Mei

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

Comments Code: https://github.com/DelosLiang/masse

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15507 2025-10-14 cs.LG cs.AI cs.CL 67%

Steering LLMs for Formal Theorem Proving

Shashank Kirtania, Arun Iyer

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01346 2025-10-14 cs.AI cs.CL 62%

Aristotle: IMO-level Automated Theorem Proving

Tudor Achim, Alex Best, Alberto Bietti, Kevin Der, Mathïs Fédérico, Sergei Gukov, Daniel Halpern-Leistner, Kirsten Henningsgard, Yury Kudryashov, Alexander Meiburg, Martin Michelsen, Riley Patterson, Eric Rodriguez, Laura Scharff, Vikram Shanker, Vladmir Sicca, Hari Sowrirajan, Aidan Swope, Matyas Tamas, Vlad Tenev, Jonathan Thomm, Harold Williams, Lawrence Wu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10148 2025-10-14 cs.SE 50%

A Systematic Study on Generating Web Vulnerability Proof-of-Concepts Using Large Language Models

Mengyao Zhao, Kaixuan Li, Lyuye Zhang, Wenjing Dang, Chenggong Ding, Sen Chen, Zheli Liu

专题命中 代码与定理证明 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏