arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-08-07 至 2025-08-07 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 4 篇

2508.04204 2025-08-07 cs.CL cs.AI 81%

ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments

Yuquan Wang, Mi Zhang, Yining Wang, Geng Hong, Xiaoyu You, Min Yang

机构 * Fudan University(复旦大学) Shanghai University of Electric Power(上海电力大学) East China University of Science and Technology(东华大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20840 2025-08-07 cs.AI cs.CL cs.LG cs.SE 67%

CodeTool: Enhancing Programmatic Tool Invocation of LLMs via Process Supervision

Yifei Lu, Fanghua Ye, Jian Li, Qiang Gao, Cheng Liu, Haibo Luo, Nan Du, Xiaolong Li, Feiliang Ren

机构 * Northeastern University(东北大学) Hunyuan AI Digital Human(文英AI数字人)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14448 2025-08-07 cs.CL 57%

How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison

Jiayin Wang, Zhiquang Guo, Weizhi Ma, Min Zhang

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15299 2025-08-07 cs.CL 57%

Inside-Out: Hidden Factual Knowledge in LLMs

Zorik Gekhman, Eyal Ben David, Hadas Orgad, Eran Ofek, Yonatan Belinkov, Idan Szpektor, Jonathan Herzig, Roi Reichart

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏