Proof-RM: A Scalable and Generalizable Reward Model for Math Proof
Proof-RM: 一种可扩展且通用的数学证明奖励模型
机构 * Peking University, Beijing, China(北京大学,北京,中国)
AI总结 Proof-RM通过构建可扩展的数据管道和训练证明检查奖励模型,提升LLM在数学证明验证中的准确性和泛化能力。
Comments Under review
高校专区
Proof-RM: 一种可扩展且通用的数学证明奖励模型
机构 * Peking University, Beijing, China(北京大学,北京,中国)
AI总结 Proof-RM通过构建可扩展的数据管道和训练证明检查奖励模型,提升LLM在数学证明验证中的准确性和泛化能力。
Comments Under review
DeepQuark: 一种用于多夸克束缚态的深度神经网络方法
机构 * School of Physics, Peking University, Beijing 100871, China(北京大学物理系) ; School of Physics, Southeast University, Nanjing 211189, China(东南大学物理系) ; School of Physics(物理系) ; Center of High Energy Physics, Peking University, Beijing 100871, China(北京大学高能物理中心)
AI总结 DeepQuark通过深度神经网络方法高效处理多夸克束缚态,展现出在核子、四夸克和五夸克系统中的优越性能,为探索非微扰QCD提供了新工具。
Comments 17 pages, 7 figures, 9 tables. Version published in PRL
Journal ref Phys. Rev. Lett. 136, 071901 (2026)
PartRAG:基于检索的分层3D生成与编辑
机构 * King’s College London(伦敦国王学院) ; Peking University(北京大学)
AI总结 PartRAG通过整合外部部分数据库和扩散变换器,实现基于检索的分层3D生成与编辑,提升多视角一致性和局部编辑能力。
M2F:大规模数学文献的自动化形式化
机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) ; Huawei Technologies(华为技术有限公司) ; Center for Machine Learning Research, Peking University(北京大学机器学习研究中心)
AI总结 M2F通过端到端自动化形式化框架,在三周内将教科书转化为Lean库,实现96%的证明成功率。
StereoAdapter-2: 基于全局结构一致性的水下立体深度估计
机构 * The University of Melbourne(墨尔本大学) ; Peking University(北京大学) ; Australian Centre for Robotics(澳大利亚机器人中心)
AI总结 StereoAdapter-2通过引入基于选择性状态空间模型的ConvSS2D操作符,实现了高效的水下立体深度估计,提升了水下基准测试的性能。
RoboGene: 通过多样性驱动的代理框架提升VLA预训练以生成现实任务
机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) ; The School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) ; Beijing Institute of Technology(北京理工大学) ; The School of Mechanical Engineering and Automation, Beihang University(北航机械工程与自动化学院) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室)
AI总结 RoboGene通过多样性驱动的代理框架生成多样化、物理合理的机器人操作任务,提升VLA预训练效果。