arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-16 至 2026-02-16 共收录 1 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1 篇

2602.13035 2026-02-16 cs.LG cs.AI cs.CL 67%

Look Inward to Explore Outward: Learning Temperature Policy from LLM Internal States via Hierarchical RL

向内看,向外探:通过分层强化学习从LLM内部状态学习温度策略

Yixiao Zhou, Yang Li, Dongzhou Cheng, Hehe Fan, Yu Cheng

机构 * Zhejiang University(浙江大学) Southeast University(东南大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Introspective LLM通过分层强化学习从LLM内部状态学习温度策略,提升数学推理任务中的探索效率与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏