arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

阿里&浙大提出TTPO:无标签测试时训练让Qwen3-1.7B从38.0%升至45.2%

作者:arXivDaily编辑部 arXiv 2608.27448 cs · cs.CL

模型遇到新题时,通常只能多采样几次再投票,不能在没有标准答案的情况下可靠更新参数。浙江大学、阿里巴巴提出测试时策略优化TTPO,让模型把自己的多次解答分成“同意多数结果”和“反对多数结果”两组,用不同目标继续学习。

在Qwen3-1.7B上,TTPO把测试时训练准确率从38.0%提高到45.2%。论文还报告,无思考设置下,不同任务提升25.2至36.4个百分点;在五个竞赛级数学基准上,无标签TTPO达到有真实标签的在线自蒸馏方案水平。

多数投票会把一次误判扩散到所有Token

测试时训练的难点不在生成答案,而在缺少可以核对的真值。最自然的办法是让模型生成多条推理轨迹,以多数答案作为伪标签,再把它当教师信号。只要多数票投错,原本正确的少数解答会被惩罚,错误答案反而会被强化。

团队观察到一个不对称现象:即使多数票本身错误,与多数票不一致的轨迹也大多确实是错的。以论文展示的训练阶段为例,不同意伪标签的轨迹占比较高,其中错误轨迹持续占主导。TTPO据此保留了可用的负向信号,同时避免把伪标签当成绝对真值。

图1:TTPO利用“不一致轨迹多数仍错误”的现象,分别处理同意与反对伪标签的样本。

同意样本做蒸馏,反对样本做强化学习

对于同意多数票的轨迹,TTPO采用在线策略自蒸馏,把较稳定的解答压回当前策略;对于反对多数票的轨迹,它不要求模型模仿某个标准答案,而是通过分组强化学习降低这些轨迹的概率。

两条分支还加入Token级筛选。蒸馏分支降低已经收敛位置的权重,把更新集中到仍有分歧的Token;强化学习分支只惩罚高置信度错误,减少对探索空间的过度压缩。多数投票随着模型变强而更新,伪标签质量也会同步变化。

图2:多数投票将轨迹分组后,同意组接受蒸馏,不同意组接受分组强化学习。

45.2%来自测试时更新,不是简单多投几票

论文在AIME 2026、HMMT 2026、BRUMO 2025等竞赛数学任务上测试。Qwen3-1.7B的平均成绩从基础设置的38.0%提高到45.2%,超过只做分组强化学习、真实标签路由和有监督在线蒸馏等对照设置。

跨任务实验中,在一个竞赛基准上完成测试时训练,也能带动其他数学基准成绩上升。这个结果说明更新没有完全记住单一题集,但仍属于基准内实验。测试时更新需要额外采样和反向传播,不能直接等同于普通一次推理的成本。

图3:在一个竞赛数学基准上训练后,其他基准的成绩也出现提升。

图4:AIME 2026训练过程中,TTPO伪标签路由最终超过真实标签路由和监督蒸馏对照。

下一步要核算每道题的学习成本

TTPO为没有人工标签的新任务提供了一条自适应路径,适合答案可多次采样、结果能形成一定共识的推理场景。项目已经公开代码,研究者可以复核不同模型规模、采样数和更新步数的收益。

落地时需要同时报告准确率、采样次数、显存占用和响应时间。多数投票若长期集中在同一类系统性错误上,不对称训练也无法凭空得到正确知识;如何识别这类错误,并决定何时停止测试时更新,是后续部署必须补上的判断层。

另一个待验证方向是非数学任务。代码生成可以运行测试,科学问答可以检索证据,二者都能提供比多数票更强的外部反馈。TTPO若能把这些反馈与不对称更新结合,伪标签错误率可能进一步下降。对于开放式写作等缺少可验证答案的任务,当前证据还不足以支持同样结论。

不同模型规模是否保持同样收益,也需要独立复现实验。

参考资料

https://zju-real.github.io/TTPO

https://arxiv.org/abs/2608.27448

https://github.com/ZJU-REAL/TTPO