论文导读
亚马逊团队开源Mitra-v2,一款7700万参数的表格基础模型。在TabArena协议下,它达到16亿参数TabFM的同级表现,参数量约为后者5%;预训练只用合成数据,再在300多个真实数据集上评估。结论限定于表格分类与回归基准,医疗等示例不意味着可直接部署。
表格不是文本,列与行都有自己的规律
企业数据常由连续数值、类别、缺失项和不同尺度的列组成。把每个单元格直接转成文本交给大语言模型,序列很长,也容易丢失列类型与行内关系。专用表格模型能利用这些结构,但近期基础模型不断扩大到十亿参数,训练、微调和本地部署成本随之上升。
Mitra-v2选择更紧凑的路线:先编码每列的数值或类别特征,再让行内和跨样本信息交互,最后为分类或回归任务输出预测。模型仓库提供分类器、回归器和微调入口,目标是让普通GPU也能使用,而不是依赖大型推理服务。
图:Hugging Face模型仓库展示Mitra-v2微调版本及公开使用入口。
预训练数据全是合成的,评测数据却来自现实
真实表格很难统一授权,且可能含隐私。团队用结构因果模型生成表格,随机组合连续、离散、非线性、缺失和噪声关系,让模型学习多种数据生成机制。合成预训练避免直接记忆公开基准,也让研究者可控制数据分布的难度与多样性。
随后,Mitra-v2在TabArena与TALENT覆盖的300多个真实分类和回归数据集上测试。统一协议控制训练预算、超参数搜索和数据切分,减少“某个模型得到更多调参机会”的偏差。重点是跨数据集平均排名与胜负关系,而非挑一个最有利案例。
图:论文UMAP图展示多种结构因果生成机制在特征空间中的覆盖,反映合成预训练的多样性。
7700万参数做到16亿参数模型同级
论文报告,7700万参数Mitra-v2在TabArena上达到16亿参数TabFM的同级表现,参数量约为5%。它还与梯度提升树、神经网络和其他表格基础模型比较,在分类和回归任务上保持竞争力。更小模型意味着训练显存、保存体积和批量推理成本更低,也更适合在数据不能离开本地时部署。
“追平”描述的是论文规定的聚合基准,不是每个数据集都相同。不同任务上,CatBoost、XGBoost或其他基础模型仍可能领先;如果数据量很小、类别极不平衡或存在时间漂移,平均榜单也不能替代单项验证。
图:第二组UMAP结果补充展示其余生成机制,说明预训练分布并非单一模板。
下一步:让表格基础能力成为部署组件
当参数降到7700万,团队可以为不同业务快速微调多个版本,并在CPU或较小GPU上做低延迟推理。它适合成为AutoML流程中的一个候选,与树模型共同竞争,而不是强迫所有表格都换成神经网络。
上线前仍需按业务切分复测校准、群体差异、缺失模式与概念漂移;涉及医疗、信贷等高风险场景,还要解释预测和进行人工复核。Mitra-v2证明合成预训练与紧凑架构能缩小参数差距,是否优于成熟树模型仍应由具体数据决定。