arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1129 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1129 篇

2511.17473 2025-11-24 cs.CL cs.AI cs.LG 67%

Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards

基于掩码与重排的自监督学习用于可验证奖励的强化学习

Zhen Wang, Zhifeng Gao, Guolin Ke

机构 * DP Technology(DP技术)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MR-RLVR方法,通过掩码与重排自监督学习提升RLVR在仅结果可验证场景下的可扩展性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12829 2025-11-07 cs.CL cs.AI cs.LG cs.LO 67%

Mathematics with large language models as provers and verifiers

Hieu Le Duc, Leo Liberti

机构 * CNRS LIX Ecole Polytechnique, Institut Polytechnique de Paris(高等理工学院巴黎理工研究所)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15507 2025-10-14 cs.LG cs.AI cs.CL 67%

Steering LLMs for Formal Theorem Proving

Shashank Kirtania, Arun Iyer

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18604 2025-09-24 cond-mat.mtrl-sci 67%

A closed-loop AI framework for hypothesis-driven and interpretable materials design

Kangyu Ji, Tianran Liu, Fang Sheng, Shaun Tan, Moungi Bawendi, Tonio Buonassisi

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08641 2025-08-13 cs.LG cs.AI cs.CL 67%

MiGrATe: Mixed-Policy GRPO for Adaptation at Test-Time

Peter Phan, Dhruv Agarwal, Kavitha Srinivas, Horst Samulowitz, Pavan Kapanipathi, Andrew McCallum

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13158 2025-07-18 cs.LG cs.AI cs.CL 67%

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities

Hao Sun, Mihaela van der Schaar

机构 * Department of Applied Mathematics and Theoretical Physics(应用数学与理论物理系) University of Cambridge(剑桥大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06742 2025-07-10 cs.CR 67%

PenTest2.0: Towards Autonomous Privilege Escalation Using GenAI

Haitham S. Al-Sinani, Chris J. Mitchell

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract)

Comments 45 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12927 2025-06-17 cs.AI cs.CL cs.LG 67%

Sectoral Coupling in Linguistic State Space

Sebastian Dumbrava

机构 * Sebastian Dumbrava(独立研究者)

专题命中 代码与定理证明 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 56 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19188 2025-04-29 cs.LG cs.AI cs.CL cs.LO 67%

Hierarchical Attention Generates Better Proofs

Jianlong Chen, Chao Li, Yang Yuan, Andrew C Yao

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Qi Zhi Institute(上海启智研究院) IIIS, Tsinghua University(清华大学智能技术学院长)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages with 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15929 2025-04-23 cs.AI cs.CL cs.LG 67%

Certifying Knowledge Comprehension in LLMs

Isha Chaudhary, Vedaant V. Jain, Gagandeep Singh

机构 * Siebel School of Computing and Data Science University of Illinois, Urbana-Champaign(计算机与数据科学学院 伊利诺伊大学厄巴纳-香槟分校)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10144 2025-04-09 cs.CL cs.AI cs.LG cs.LO cs.PL 67%

NLP Verification: Towards a General Methodology for Certifying Robustness

Marco Casadio, Tanvi Dinkar, Ekaterina Komendantskaya, Luca Arnaboldi, Matthew L. Daggitt, Omri Isac, Guy Katz, Verena Rieser, Oliver Lemon

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10878 2025-02-28 cs.CL cs.AI cs.LG cs.LO 67%

Herald: A Natural Language Annotated Lean 4 Dataset

Guoxiong Gao, Yutong Wang, Jiedong Jiang, Qi Gao, Zihan Qin, Tianyi Xu, Bin Dong

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10949 2025-02-13 cs.CL cs.AI cs.LG 67%

Representing Rule-based Chatbots with Transformers

Dan Friedman, Abhishek Panigrahi, Danqi Chen

专题命中 代码与定理证明 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NAACL 2025. Code and data are available at https://github.com/princeton-nlp/ELIZA-Transformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04485 2025-02-10 cs.CL cs.AI cs.LG 67%

Active Task Disambiguation with LLMs

Katarzyna Kobalczyk, Nicolas Astorga, Tennison Liu, Mihaela van der Schaar

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13952 2024-12-19 cs.CL cs.AI cs.LG 67%

Prompting Strategies for Enabling Large Language Models to Infer Causation from Correlation

Eleni Sgouritsa, Virginia Aglietti, Yee Whye Teh, Arnaud Doucet, Arthur Gretton, Silvia Chiappa

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10665 2024-11-19 cs.CR 67%

AutoIoT: Automated IoT Platform Using Large Language Models

Ye Cheng, Minghui Xu, Yue Zhang, Kun Li, Ruoxi Wang, Lian Yang

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract)

Comments 12 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11172 2024-08-22 cs.LG cs.AI cs.CL cs.LO 67%

SubgoalXL: Subgoal-based Expert Learning for Theorem Proving

Xueliang Zhao, Lin Zheng, Haige Bo, Changran Hu, Urmish Thakker, Lingpeng Kong

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09199 2024-08-20 cs.IR 67%

TC-RAG:Turing-Complete RAG's Case study on Medical LLM Systems

Xinke Jiang, Yue Fang, Rihong Qiu, Haoyu Zhang, Yongxin Xu, Hao Chen, Wentao Zhang, Ruizhe Zhang, Yuchen Fang, Xu Chu, Junfeng Zhao, Yasha Wang

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract)

Comments version 1.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00798 2024-08-13 cs.LG cs.AI cs.CL cs.FL 67%

Formal-LLM: Integrating Formal Language and Natural Language for Controllable LLM-based Agents

Zelong Li, Wenyue Hua, Hao Wang, He Zhu, Yongfeng Zhang

专题命中 代码与定理证明 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09629 2024-03-19 cs.CL cs.AI cs.LG 67%

Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking

Eric Zelikman, Georges Harik, Yijia Shao, Varuna Jayasiri, Nick Haber, Noah D. Goodman

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19791 2024-03-18 cs.CL cs.AI cs.LG cs.PL 67%

LILO: Learning Interpretable Libraries by Compressing and Documenting Code

Gabriel Grand, Lionel Wong, Maddy Bowers, Theo X. Olausson, Muxin Liu, Joshua B. Tenenbaum, Jacob Andreas

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2024 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07744 2024-02-15 cs.AI cs.CL cs.LG 67%

Towards Unified Alignment Between Agents, Humans, and Environment

Zonghan Yang, An Liu, Zijun Liu, Kaiming Liu, Fangzhou Xiong, Yile Wang, Zeyuan Yang, Qingyuan Hu, Xinrui Chen, Zhenhe Zhang, Fuwen Luo, Zhicheng Guo, Peng Li, Yang Liu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project webpage: https://agent-force.github.io/unified-alignment-for-agents.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07062 2023-09-14 cs.PL cs.AI cs.CL cs.LG 67%

Large Language Models for Compiler Optimization

Chris Cummins, Volker Seeker, Dejan Grubisic, Mostafa Elhoushi, Youwei Liang, Baptiste Roziere, Jonas Gehring, Fabian Gloeckle, Kim Hazelwood, Gabriel Synnaeve, Hugh Leather

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.06970 2019-08-21 cs.CR cs.MA 67%

Agent-based (BDI) modeling for automation of penetration testing

Ge Chu, Alexei Lisitsa

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17017 2025-10-02 cs.AI cs.FL cs.LG cs.LO 66%

Neural Theorem Proving: Generating and Structuring Proofs for Formal Verification

Balaji Rao, William Eiers, Carlo Lipizzi

专题命中 代码与定理证明 :reasoning(abstract,comments);分类 cs.AI、cs.LG

Comments Accepted to the Proceedings of the 19th Conference on Neurosymbolic Learning and Reasoning (NeSy 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
1701.06972 2017-05-10 cs.AI cs.LG cs.LO 66%

Deep Network Guided Proof Search

Sarah Loos, Geoffrey Irving, Christian Szegedy, Cezary Kaliszyk

专题命中 代码与定理证明 :reasoning(abstract,journal_ref);分类 cs.AI、cs.LG

Journal ref In Thomas Eiter and David Sands, editors, 21st International Conference on Logic for Programming, Artificial Intelligence and Reasoning (LPAR-21). EPiC Series in Computing, vol. 46, pages 85-105, EasyChair, 2017. ISSN 2398-7340

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02763 2026-08-18 cs.CL cs.AI cs.CY 版本更新 62%

Bye-bye, Bluebook? Automating Legal Drudgery With AI-Augmented Rule Following

再见,蓝皮书?用AI辅助规则遵循实现法律苦差事自动化

Matthew Dahl, Eric Martínez

机构 * Yale Law School(耶鲁法学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对法律AI在《蓝皮书》引文格式任务的表现,构建了新基准,提出神经符号系统方法使准确率提升32.4个百分点至最高85.5%,指出AI与符号规则引擎结合是可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09538 2026-08-14 cs.CL cs.AI 版本更新 62%

TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability

TCS-BENCH:评估最先进生成式AI理论计算机科学研究能力的基准

Vincent Cohen-Addad, Dimitris Paparas, Ernest van Wijland, Max Springer, Julien Canitrot-Paradis, Honghao Lin, David Woodruff, Adarsh Kumarappan, Rajesh Jayaram, Rudrajit Das, Lalit Jain, Ola Svensson, Silvio Lattanzi, Mislav Balunovic, Theophane Weber, Vahab Mirrokni

专题命中 代码与定理证明 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 研究人员推出TCS-Bench基准,基于STOC、FOCS、SODA论文的定理证明任务评估LLMs,结合验证智能体,参考验证器在专家标注集准确率超90%,为评估生成式AI的TCS研究能力提供工具

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06402 2026-08-10 cs.AI cs.LG 新提交 62%

Interpretable Unsupervised Community Detection with LLM-Symbolized Structured Processes

基于LLM符号化结构化过程的可解释无监督社区检测

Aoting Zeng, Kai Wang, Jianwei Wang, Yuxiang Sun, Yizhang He, Wenjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of New South Wales(新南威尔士大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出LLM引导的无监督社区检测方法LUCID,通过四阶段流程结合LLM生成规则实现可解释性,在真实数据集上性能优于主流无监督与半监督基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22944 2026-07-28 cs.NI cs.AI cs.LG cs.SC 新提交 62%

Invariant Discovery for Networked Systems

网络系统的不变量发现

Hongyu Hè, Alexander Krentsel, Sylvia Ratnasamy, Maria Apostolaki

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究网络系统不变量发现问题,核心方法是将其分为人工智能驱动的语法“发现”与统计驱动的“搜索”问题,设计实现Autogram系统,贡献是能在多种数据上高覆盖率、低误报地恢复专家不变量并讨论开放问题。

Comments 8 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏