arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-10-16 至 2025-10-16 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 4 篇

2510.13804 2025-10-16 cs.CV cs.AI cs.CL 84%

Generative Universal Verifier as Multimodal Meta-Reasoner

Xinchen Zhang, Xiaoying Zhang, Youbin Wu, Yanbin Cao, Renrui Zhang, Ruihang Chu, Ling Yang, Yujiu Yang

机构 * Tsinghua University(清华大学) ByteDance Seed(字节跳动种子) Princeton University(普林斯顿大学)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22637 2025-10-16 cs.CL cs.AI cs.LG 82%

Variational Reasoning for Language Models

Xiangxin Zhou, Zichen Liu, Haonan Wang, Chao Du, Min Lin, Chongxuan Li, Liang Wang, Tianyu Pang

机构 * Sea AI Lab(海智实验室) UCAS(中国科学院大学) CASIA(中国科学院自动化研究所) NUS(新加坡国立大学) RUC(哈尔滨工业大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13651 2025-10-16 cs.LG math.OC 74%

What is the objective of reasoning with reinforcement learning?

Damek Davis, Benjamin Recht

机构 * Department of Statistics and Data Science, The Wharton School, University of Pennsylvania(统计与数据科学系,沃森商学院,宾夕法尼亚大学) Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(电气工程与计算机科学系,加州大学伯克利分校)

专题命中 测试时计算 :reasoning(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10425 2025-10-16 cs.LG 57%

Learning to Think: Information-Theoretic Reinforcement Fine-Tuning for LLMs

Jingyao Wang, Wenwen Qiang, Zeen Song, Changwen Zheng, Hui Xiong

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

Comments Accepted by NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏