arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-09 至 2026-02-09 共收录 3 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 3 篇

2602.06176 2026-02-09 cs.AI cs.CL cs.LG 83%

Large Language Model Reasoning Failures

大语言模型推理失败

Peiyang Song, Pengrui Han, Noah Goodman

机构 * California Institute of Technology(加州理工学院) Stanford University(斯坦福大学) Carleton College(卡尔顿学院)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文首次系统调查大语言模型推理失败问题,提出分类框架并分析其根本原因,旨在提升模型的推理能力与鲁棒性。

Comments Repository: https://github.com/Peiyang-Song/Awesome-LLM-Reasoning-Failures. Published at TMLR 2026 with Survey Certification

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06232 2026-02-09 cs.LG cs.AI cs.GT cs.MA 62%

RuleSmith: Multi-Agent LLMs for Automated Game Balancing

RuleSmith:多智能体LLM用于自动化游戏平衡

Ziyao Zeng, Chen Liu, Tianyu Liu, Hao Wang, Xiatao Sun, Fengyu Yang, Xiaofeng Liu, Zhiwen Fan

机构 * Yale University(耶鲁大学) Texas A\&M University(德克萨斯农工大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 RuleSmith利用多智能体LLM实现自动化游戏平衡,通过贝叶斯优化和自适应采样高效搜索参数空间,实现高平衡配置和可解释规则调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10216 2026-02-09 cs.PL cs.AI cs.SE 57%

Learning to Guarantee Type Correctness in Code Generation through Type-Guided Program Synthesis

通过类型引导的程序合成学习保证类型正确性

Zhechong Huang, Zhao Zhang, Ruyi Ji, Tingxuan Xia, Qihao Zhu, Qinxiang Cao, Zeyu Sun, Wiggin Zhou, Yingfei Xiong

机构 * Peking University(北京大学) University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Tencent(腾讯)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 TyFlow 通过内部化类型推理,提升代码生成的类型正确性与功能正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏