arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-05 至 2025-12-05 共收录 2 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2 篇

2512.04558 2025-12-05 cs.LG 79%

On the Limits of Test-Time Compute: Sequential Reward Filtering for Better Inference

在测试时间计算的极限:用于更好推理的顺序奖励过滤

Yue Yu, Qiwei Di, Quanquan Gu, Dongruo Zhou

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.LG

AI总结 本文提出顺序奖励过滤方法,通过选择高奖励生成物优化测试时间计算,提升大语言模型的推理性能。

Comments 45 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04555 2025-12-05 cs.CL 57%

ADAPT: Learning Task Mixtures for Budget-Constrained Instruction Tuning

ADAPT:为预算受限的指令微调学习任务混合

Pritam Kadasi, Abhishek Upperwal, Mayank SIngh

机构 * Lingo Research Group, Indian Institute of Technology Gandhinagar(林戈研究组,印度理工学院冈德hinagar分校) Soket AI(Soket人工智能)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 ADAPT通过学习任务采样比例优化预算受限的指令微调,提升下游任务性能并更高效地分配训练资源。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏