arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-23 至 2026-01-23 共收录 2 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 2 篇

2601.06795 2026-01-23 cs.AI 70%

GDEPO: Group Dual-dynamic and Equal-right Advantage Policy Optimization with Enhanced Training Data Utilization for Sample-Constrained Reinforcement Learning

GDEPO:基于增强训练数据利用的群体双动态和等权优势策略优化

Zhengqing Yan, Xinyang Liu, Yi Zhang, Fan Guo, ChengXun Jia, Junchen Wan, Yao Liu, Qi Liu, Jihao Huang, Kang Song

机构 * State Key Laboratory of Engines, Tianjin University(发动机国家重点实验室,天津大学) Artificial Intelligence Center, Cylingo Group(Cylingo集团人工智能中心)

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 GDEPO通过动态补充采样、等权优势和动态补充迭代机制,提升ATP中强化学习的数据利用效率和优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15737 2026-01-23 cs.AI cs.CL 62%

PhysProver: Advancing Automatic Theorem Proving for Physics

PhysProver: 推动物理领域自动定理证明的发展

Hanning Zhang, Ruida Wang, Rui Pan, Wenyuan Wang, Bingxu Meng, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Rutgers University(罗格斯大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PhysProver通过结合可验证语言和强化学习,提升物理领域形式化定理证明的效率和效果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏