arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-10-03 至 2025-10-03 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 7 篇

2510.01459 2025-10-03 cs.LG cs.CL 81%

LSPO: Length-aware Dynamic Sampling for Policy Optimization in LLM Reasoning

Weizhe Chen, Sven Koenig, Bistra Dilkina

机构 * University of Southern California(南加州大学) University of California, Irvine(加州大学尔湾分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00768 2025-10-03 cs.AI cond-mat.mtrl-sci cs.CL 81%

Aligning Reasoning LLMs for Materials Discovery with Physics-aware Rejection Sampling

Lee Hyun, Sohee Yoon, Jinwoo Park, Sue In Chae, Seongeon Park, Jooyeon Ahn, Yebin Jung, Youjung Chung, Hogeun Chang, Sujin Park, Myeonginn Kang, Jina Kim, Ho-Gyeong Kim, Myeonghun Jeong

机构 * Materials AI Lab (AI Center), Samsung Electronics(材料AI实验室(AI中心),三星电子) Samsung Advanced Institute of Technology (SAIT)(三星先进技术研究所(SAIT))

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01591 2025-10-03 cs.CL 70%

CLUE: Non-parametric Verification from Experience via Hidden-State Clustering

Zhenwen Liang, Ruosen Li, Yujun Zhou, Linfeng Song, Dian Yu, Xinya Du, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Notre Dame(诺丁汉大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22558 2025-10-03 cs.AI 70%

StepORLM: A Self-Evolving Framework With Generative Process Supervision For Operations Research Language Models

Chenyu Zhou, Tianyi Xu, Jianghao Lin, Dongdong Ge

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01670 2025-10-03 cs.AI cs.CL cs.CR cs.CY cs.LG 67%

Just Do It!? Computer-Use Agents Exhibit Blind Goal-Directedness

Erfan Shayegani, Keegan Hines, Yue Dong, Nael Abu-Ghazaleh, Roman Lutz, Spencer Whitehead, Vidhisha Balachandran, Besmira Nushi, Vibhav Vineet

机构 * Microsoft Research AI Frontiers(微软研究院人工智能前沿) Microsoft AI Red Team(微软AI红色团队) University of California, Riverside(加州大学河滨分校) NVIDIA(英伟达)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01218 2025-10-03 cs.LG cs.AI cs.CL 67%

Control the Temperature: Selective Sampling for Diverse and High-Quality LLM Outputs

Sergey Troshin, Wafaa Mohammed, Yan Meng, Christof Monz, Antske Fokkens, Vlad Niculae

机构 * Language Technology Lab, University of Amsterdam(阿姆斯特丹大学语言技术实验室) Computational Linguistics and Text Mining Lab, Vrije Universiteit Amsterdam(阿姆斯特丹自由大学计算语言学与文本挖掘实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Second Conference on Language Modeling, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01101 2025-10-03 cs.CL 57%

Self-Consistency Falls Short! The Adverse Effects of Positional Bias on Long-Context Problems

Adam Byerly, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

Comments 25 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏