arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-03 至 2025-12-03 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 4 篇

2512.02217 2025-12-03 cs.LG physics.app-ph 79%

Uncertainty Reasoning with Photonic Bayesian Machines

基于光子贝叶斯机器的不确定性推理

F. Brückerhoff-Plückelmann, H. Borras, S. U. Hulyal, L. Meyer, X. Ji, J. Hu, J. Sun, B. Klein, F. Ebert, J. Dijkstra, L. McRae, P. Schmidt, T. J. Kippenberg, H. Fröning, W. Pernice

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本研究提出一种基于光子技术的贝叶斯机器,利用混沌光源实现高速不确定性推理,应用于血细胞图像分类与域外检测,提升可信AI系统的效率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02882 2025-12-03 cs.LG cs.AI cs.CL 67%

OptPO: Optimal Rollout Allocation for Test-time Policy Optimization

OptPO:测试时间策略优化的最优回放分配

Youkang Wang, Jian Wang, Rubing Chen, Tianyi Zeng, Xiao-Yong Wei, Qing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Department of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OptPO通过自适应分配推理预算,结合贝叶斯序列概率比率检验实现测试时间策略优化,减少回放开销并提高准确性。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02710 2025-12-03 cs.CE 67%

Beyond N-grams: A Hierarchical Reward Learning Framework for Clinically-Aware Medical Report Generation

超越n-gram:一种面向临床意识的医疗报告生成层次奖励学习框架

Yuan Wang, Shujian Gao, Jiaxiang Liu, Songtao Jiang, Haoxiang Xia, Xiaotian Zhang, Zhaolu Kang, Yemin Wang, Zuozhu Liu

专题命中 测试时计算 :reasoning(abstract);verifier(abstract)

AI总结 本文提出HiMed-RL框架,通过层次化奖励学习提升医疗报告生成的临床质量与事实准确性。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02807 2025-12-03 cs.CL 57%

SR-GRPO: Stable Rank as an Intrinsic Geometric Reward for Large Language Model Alignment

SR-GRPO:稳定秩作为大语言模型对齐的内在几何奖励

Yixuan Tang, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港理工大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 SR-GRPO通过稳定秩作为内在几何奖励信号,无需外部监督提升大语言模型对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏