arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-02 至 2025-12-02 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 7 篇

2512.02008 2025-12-02 cs.CL 79%

The Art of Scaling Test-Time Compute for Large Language Models

为大语言模型扩展推理时的计算艺术

Aradhye Agarwal, Ayan Sengupta, Tanmoy Chakraborty

机构 * Microsoft Research(微软研究院) Indian Institute of Technology Delhi(印度德里理工学院)

专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.CL

AI总结 本文研究了大语言模型推理时计算扩展策略的优化,发现不同模型类型和问题难度对性能有显著影响,并提出了基于计算预算的选择策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08364 2025-12-02 cs.CL cs.AI 73%

DPRM: A Dual Implicit Process Reward Model in Multi-Hop Question Answering

DPRM: 多跳问答任务中的双隐式过程奖励模型

Xinyi Wang, Yiping Song, Zhiliang Tian, Bo Liu, Tingjin Luo, Minlie Huang

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 DPRM通过双隐式过程奖励模型提升多跳问答任务的推理准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17989 2025-12-02 cs.LG cs.AI 62%

Outcome-based Reinforcement Learning to Predict the Future

基于结果的强化学习用于预测未来

Benjamin Turtel, Danny Franklin, Kris Skotheim, Luke Hewitt, Philipp Schoenegger

机构 * Lightning Rod Labs Stanford University(斯坦福大学) London School of Economics and Political Science(伦敦政治经济学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于结果的强化学习方法,通过训练紧凑模型提升预测准确性并增强概率校准,实验证明其在预测市场中的实际应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01187 2025-12-02 cs.LG cs.AI 62%

Teaching by Failure: Counter-Example-Driven Curricula for Transformer Self-Improvement

通过失败教学:基于反例的课程学习以提升Transformer自改进能力

Harshil Vejendla

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于反例的课程学习方法CEDC,通过迭代聚焦模型自身失败来提升Transformer模型在复杂输入下的鲁棒性和外推能力。

Comments AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00789 2025-12-02 cs.CL 57%

Auxiliary-Hyperparameter-Free Sampling: Entropy Equilibrium for Text Generation

辅助超参数-free采样:信息论视角下的文本生成熵平衡

Xiaodong Cai, Hai Lin, Shaoxiong Zhan, Weiqi Luo, Hong-Gee Kim, Hongyan Hao, Yu Yang, Hai-Tao Zheng

机构 * Meituan(美团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出熵平衡采样方法,通过信息论原理实现无超参数调优的文本生成,提升生成质量和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00670 2025-12-02 cs.AI 57%

EDIT: Early Diffusion Inference Termination for dLLMs Based on Dynamics of Training Gradients

EDIT:基于训练梯度动态的早期扩散推理终止用于dLLMs

He-Yen Hsieh, Hong Wang, H. T. Kung

机构 * CISPA Harvard University(哈佛大学) Intel Corporation(英特尔公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 EDIT通过利用训练梯度动态,在保持准确性的同时减少dLLM推理步骤,提升效率。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18624 2025-12-02 cs.CL 57%

Checklists Are Better Than Reward Models For Aligning Language Models

检查表比奖励模型更能对齐语言模型

Vijay Viswanathan, Yanchao Sun, Shuang Ma, Xiang Kong, Meng Cao, Graham Neubig, Tongshuang Wu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 本文提出基于检查表反馈的强化学习方法,通过灵活的指令特定准则提升语言模型的指令遵循能力,在多个基准测试中均取得性能提升。

Comments Presented at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏