论文导读
香港科技大学、牛津大学联合检验一种省推理成本的做法:模型连续给出同一答案,就提前停止。团队预注册并回放3520条自共识规则,没有一条通过三项安全与节省门槛;在仍节省32% token的规则上,约九次停止有一次会截断模型后续改答。结论只针对单轨迹自共识,不否定其他早停信号。
答案重复十次,后面仍可能自己改对
推理模型常生成很长的思考过程。为了省token,一种直观方案是在中途反复加上“最终答案”提示,观察模型此刻会报什么;如果最近几次答案一致,就认定推理已经收敛并停止。它只需要读取同一条尚未完成的轨迹,比同时采样多条回答更便宜。
论文给出的案例很刺眼:在一道MATH 500题上,模型连续十次报出错误答案37。三次一致的规则会在第256个token触发,把37当作最终结果;若让原轨迹继续,模型后来会把答案改成46。重复只能证明固定问法下的当前答案很稳定,不能证明推理真的结束。
图1:同一错误答案连续出现后触发早停,而完整轨迹随后改为正确答案。
3520条规则同时接受三道门槛检验
团队先冻结两种模型在三个基准上的推理轨迹,再预注册3520条规则,改变探测间隔、观察窗口、所需一致比例和置信条件。每条规则都要同时满足三项要求:准确率损失足够小、扣除额外探测token后仍有实际节省,而且这套选择能从开发集迁移到留出数据。
整个规则空间里,没有自共识方案通过预先确定的三项门槛。热力图显示,提高一致窗口确实能减少部分错误停止,但节省也随之消失。窗口继续扩大后,非终止停止的比例仍在约7%附近徘徊,此时token节省只剩8%。
图2:不同窗口和阈值组合下,安全且节省token的区域仍为空。
省32% token时,约九次停止有一次会截断改答
在一条仍可节省32% token的规则上,约九次停止中有一次发生在模型后来会放弃的答案上,而且多数情况截断的是原轨迹本来能够完成的纠错。团队更换探测措辞并人工分类后发现,重复答案经常只是模型被迫提前作答时给出的占位符。
作为对照,论文把基于边界置信度的DEER放进同一评测流程,它通过了三道门槛。开发集上选出的点在留出分割、四倍规模和另一种模型架构上仍位于保守安全区域;自共识规则则没有得到同样的可复用选择。
图3:DEER选择在四个模型上保持门槛内,自共识规则没有形成可迁移的安全选择。
未来部署早停系统要测“是否结束”,不能只测“是否一致”
论文否定的是把单轨迹答案一致直接当作停止信号,并未证明所有推理压缩都不安全。部署者仍可以把一致性当作必要条件,再结合边界置信度、可验证答案、外部检查器或任务特定终止状态。下一步还要在更多模型、开放式任务和真实服务成本上检验这些组合,并把探测本身消耗的token和延迟算进账。只看生成变短多少,会漏掉提前锁死错误答案的代价。
参考资料
https://arxiv.org/abs/2609.09989
https://arxiv.org/html/2609.09989
https://github.com/Antony-zdh/stable-answers-unfinished-reasoning