arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

Meta&普林斯顿提出Gambit:大模型推理少用68.5% Token,准确率反升6.7%

arXiv 2608.08020 cs.AI

Meta AI、普林斯顿和MIT提出Gambit,把大模型的测试时推理改成“思维层面的束搜索”。它不再让大量推理轨迹各自跑到底,而是周期性砍掉低质量路径,把释放的算力立即用来复制更好的思路前缀。

在相同硬件约束下,Gambit在HMMT-24上相对剪枝基线最高增加6.7个准确率百分点,AIME-25提高3.3个百分点;完成轨迹的吞吐量超过2倍,相对标准平行采样最多节省68.5%的Token。

平行采样会把算力浪费在已经跑偏的思路上

传统方案同时采样几十或几百条完整推理轨迹,最后再投票。问题是,一条轨迹在中途出现明显错误后,仍会占用KV缓存和解码时间。剪枝方法可以提前终止差轨迹,但释放的GPU容量常常空着,并没有生成更好的替代路径。

平行采样、剪枝与Gambit分支机制的对比

Gambit从高分前缀分出新路径,在相同容量下把Pass@1从6.2%提高到87.5%的案例。

每轮淘汰K条,也立即补回K条

Gambit先以固定容量并行启动轨迹,轻量评分器通过模型隐状态判断局部思路。每隔一段步数,系统举行一次排位:删除K条最低分轨迹,从高分前缀分支出K条新续写,始终保持GPU上的活跃轨迹数不变。

新分支共享父路径的KV缓存,不需要从题目开始重新生成。因此它既能向高潜力路径集中计算,又能维持硬件并行度。轨迹完成后,答案按评分加权投票。

Gambit在AIME题目上的完整计算分配流程

Gambit把低分轨迹替换为高分前缀的新分支,活跃并发容量保持不变。

节省Token和提高准确率同时出现

论文在多个数学推理基准和不同模型上比较了平行采样、只剪枝的STEP和Gambit。平行采样在批量轨迹较大时耗尽KV缓存,延迟约膨胀3倍;STEP降低了排队,但并发度持续下降;Gambit的延迟约为1.1倍并保持高利用率。

Gambit的延迟、Token用量与准确率前沿

Gambit在多个基准上位于更高准确率、更低Token用量的效率前沿。

分析显示,从高质量前缀采样的新轨迹可以继承已经验证过的推理步骤,同时在后半段探索多种解法。这也解释了为什么新增轨迹的中位新Token数明显下降,但还能保持较深推理。

一个AIME 2025难题案例将这种差异表现得很直观。独立采样64条完整轨迹时,Pass@1为6.2%;从评分最高的中间前缀分出64个续写后,Pass@1达到87.5%。因为所有续写共享父前缀缓存,该设置的内存占用也比从头开始的独立采样更低。

评分器不需要读完整条推理。实验逐步截断轨迹,测量只用前若干比例思维Token时的成功与失败排序准确率。随着前缀变长,评分器区分能力增强,但Gambit在较早阶段就能获得可用信号,因此不必等到大量Token已经生成才重分配算力。

团队还更换了基础模型和评分器架构。Gambit在这些组合中持续高于只剪枝的STEP,说明关键不是某一个奖励模型特别准,而是系统把评分信号转成了新的采样机会。单纯停止差轨迹只能节省计算,重新分支才能主动改变最终答案分布。

下一步将动态算力分配扩展到更多任务

在服务系统中,固定活跃容量还有一个直接好处:调度器可以预先知道每批始终保持多少条轨迹,不会像剪枝法那样在生成过程中逐渐变成低并发小批量。这也是Gambit能将算法收益转成GPU利用率,而不只是纸面Token节省的原因。

当前结果聚焦AIME、HMMT等可自动核对答案的数学题,评分器也需要能在中间步区分有潜力与已跑偏的轨迹。不同类型任务能否稳定获得68.5%的Token节省,还需要单独验证。

Gambit在推理过程中保持更高的轨迹完成吞吐

轨迹完成率实验中,Gambit通过持续补充高潜力分支保持吞吐。

更直接的下一步是把这种调度机制用到代码生成、科学探索和Agent规划:这些任务同样存在大量长轨迹,也同样需要将有限算力留给更可能成功的中间状态。

参考资料

https://arxiv.org/abs/2608.08020

https://github.com/Dao-AILab/Gambit