arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-09 至 2025-12-09 共收录 3 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 3 篇

2504.16828 2025-12-09 cs.LG cs.AI cs.CL 86%

Process Reward Models That Think

能够思考的过程奖励模型

Muhammad Khalifa, Rishabh Agarwal, Lajanugen Logeswaran, Jaekyeom Kim, Hao Peng, Moontae Lee, Honglak Lee, Lu Wang

机构 * University of Michigan(密歇根大学) Mila LG AI Research(LG人工智能研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Equal supervision(共同监督)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);test-time compute(abstract)

AI总结 ThinkPRM通过生成长CoT验证链实现高效过程奖励模型,以更少的监督标签在多个基准测试中超越现有方法。

Comments Add new ablation and minor writing fixes

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07710 2025-12-09 cs.AI cs.LG 62%

Each Prompt Matters: Scaling Reinforcement Learning Without Wasting Rollouts on Hundred-Billion-Scale MoE

每个提示都重要:在百亿规模MoE上扩展强化学习而不浪费回放

Anxiang Zeng, Haibo Zhang, Hailing Zhang, Kaixiang Mo, Liang Yao, Ling Hu, Long Zhang, Shuman Liu, Shuyi Xie, Yanshi Li, Yizhang Chen, Yuepeng Sheng, Yuwei Huang, Zhaochen Xu, Zhiqiang Zhou, Ziqin Liew

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出了一种百亿规模MoE模型的强化学习方法,通过消除无效提示、优化重要性采样和提升回放效率,实现了高效稳定的训练流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06017 2025-12-09 cs.RO eess.IV 50%

Training-Free Robot Pose Estimation using Off-the-Shelf Foundational Models

无需训练的机器人姿态估计使用现成的基础模型

Laurence Liang

机构 * McGill University(麦吉尔大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 本文提出利用现成的基础模型无需训练即可估计机器人关节角度,通过实验验证了模型性能基准及测试扩展对预测效果的影响。

Comments Accepted at CVIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏