arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

一个冻结的12B模型考了180/180满分:零token、位精确、永远如此

作者:arXivDaily编辑部 arXiv 2607.23806 cs · cs.AI · cs.CL · cs.IR · cs.LG · cs.PF

Corbenic AI发表了一份行业经验报告,描述了一套与主流路线相反的系统:模型保持冻结,一旁的持久记忆存储已验证的解法。问题族一旦被解决并通过不接触答案密钥的独立验证,该族每个新实例都由记忆直接应答——零生成token、位精确、确定性。跨9个问题族180个新实例,四个厂商四种架构的开源模型(稠密与MoE)全部拿到180/180。论文公开页面披露,报告作者Sietse Schelpe来自Corbenic AI。

两条应答路径

报告把求解一个已解决问题的方式分成两条路径。前沿API每次查询都付一次完整的生成:几百到几千token,非确定输出,毫秒到秒级往返。Galahad系统走另一条:精确寻址用1.4微秒选中已验证记忆,冻结模型执行存储的验证方法,返回的答案零token、位精确、6到23毫秒。存入(solve一次、verify一次、存store)按问题族只发生一次,且验证环节从不接触答案密钥。

这套设计把「能力」从参数里搬进了记忆。一份阴性对照实验佐证了归因:把记忆清空,系统什么也解不了。生成路径负责出题一次,复用路径负责此后永远。

180/180与三种延伸

核心测量覆盖9个问题族180个全新实例。四个模型——Gemma-4-12B、Qwen3-14B、DeepSeek-Coder-V2-Lite、Phi-4——核心已验证复用全部180/180,一致性门控的开放推理88/88,推理方法迁移77/80。记忆选择耗时1.4微秒(第95百分位9微秒),完整复用链路6毫秒,全程零寻址碰撞。

摊销的账也算了:按调用定价的前沿API成本随查询数线性上升,Galahad的17到34次查询即过盈亏平衡点,此后边际成本为零。

图:摊销分析。按调用计费的成本线性上升,Galahad一次存入后保持平坦,盈亏平衡在17到34次查询(论文Figure 3)。

36毫瓦时与94.3%两个数字

能耗是实测的:一次完整180题复用电池每模型6.32到6.54瓦时,折合每答案约36毫瓦时——一支LED灯泡亮十三秒;一次性求解加验证的自源问题族总投入81.1瓦时。能耗不对称本身就是论点:验证按次付清,此后每次应答接近免费。

另一组数字是给整个行业的检索警告。在4500条的已验证存储上,业界默认的近似相似度检索有94.3%的比例选错条目,而精确内容寻址零错误。对可验证可执行的知识,向量式检索不是「够用且有噪声」,是灾难性的——每条链路的精确性必须被设计进系统。

图:4500条存储上的错误检索率。精确内容寻址零碰撞,有损相似度匹配选错94.3%(论文Figure 8)。

图:四种架构、四个厂商的模型在同一记忆验证复用机制下行为一致(论文Figure 4)。

600万token工作窗口与边界

记忆库还能当工作上下文用:单张46GB GPU上承载600万token的可移动窗口且显存平稳,对照组里vLLM在30399 token停止,SGLang在约3.2万token后静默截断。

边界需要读清楚。这份报告是输入输出层面的系统测量,不含架构与算法细节,可验证性靠公开测试台和NDA下的哈希锚定工件;前沿模型在从零推理的公开基准上仍远超任何12B。这个系统的主张是条件性的:凡是本系统已解决并验证过的问题,对比反转。对合规审计、回归测试、批量表单处理这类答案必须逐位一致的场景,这个条件性主张恰好击中要害。

图:前沿模型逐次生成与Galahad已验证复用两条应答路径的对比(论文Figure 1)。

下一步:从私有系统到公开测试台

Corbenic AI开放了一个免费的限流公开测试台,标题行为可以直接复现;原始工件在NDA下提供并附SHA-256来源清单。可验证复用的思路对行业是可迁移的:把确定性要求高的执行环节与概率生成解耦,用验证而非重训换取可靠性。记忆每存入一个族,系统的领地就扩大一块,且永不回缩——这是与参数缩放完全不同的增长曲线。

参考资料

https://arxiv.org/abs/2607.23806

https://corbenic-galahad-bench.hf.space

https://github.com/corbenicai/galahad