arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

别急着用LLM做表格预测:只用约6%标签,经典模型就能反超

作者:arXivDaily编辑部 arXiv 2609.20218 cs · cs.AI · cs.LG

论文导读

宾夕法尼亚大学研究者把“直接提示冻结小型GPT”与“收集标签训练经典模型”放到18个表格数据集上比较。观察到的性能交叉点中位数约为完整训练集的6%;在86%的案例里,手头已有标签量就足以让经典模型胜出,为企业表格预测给出一条可量化的选型线。

不训练的LLM,优势是一开始就能用

把一行客户、交易或设备数据改写成自然语言,冻结LLM无需训练就能返回分类或数值预测。对于没有标签的新任务,这条路径启动快;训练经典模型则要先收集并核对答案,再拟合梯度提升树、随机森林或线性模型。

研究用“交叉点N*”回答何时应该切换:随着标签增加,经典模型误差通常沿学习曲线下降;冻结LLM如果提示不变,误差近似保持平坦。两条曲线相交时的标签数量,就是训练开始更划算的位置。

图1:热图按分类与回归数据集列出六类经典模型相对冻结LLM的交叉位置。

126次独立评估,不只挑最好看的提示

实验汇总126次独立学生评估,覆盖18个表格数据集、八种提示配置和六类经典模型。提示包括不同模型、字段表达方式和零样本或少样本设置;经典模型使用已有的幂律学习曲线估计不同标签规模下的误差。

即使给LLM一个“预言机”,事后从八种设置里挑最好结果,经典模型仍在86%的案例中用不超过现有标签量胜出;40%的案例在研究评估的最小标签子集上就已经超过LLM。实际观察到的N*中位数约为训练集6%。

图2:箱线图比较模型大小、字段格式和零样本/五样本提示下的分类与回归误差。

给几个例子,不等于真的训练了一遍

上下文少样本提示会让LLM看到若干示例,但论文发现误差随示例数量的变化不符合训练模型常见的幂律学习曲线。由不同实施者重复同一协议,结果变异系数为0.148,说明提示模板和执行细节也会带来波动。

图3:论文分析不同提示样例数下的分类与回归误差走势。

受控探针还显示,LLM会利用可读字段名的语义。字段被改成不透明名称后,优势可能缩小。作者没有把这一现象写成训练数据记忆,而是把它作为交叉点可能偏保守的原因。

下一步把标签账和模型账一起算

这项结果比较的是小型冻结GPT模型,不覆盖所有前沿LLM,也不代表每个表格任务都该放弃提示。标签昂贵、任务变化快且容错要求不高时,LLM仍适合快速建立基线;如果企业已有数百条可靠标签,论文结果支持优先试一轮梯度提升模型。

下一步可以把更大的LLM、微调、检索增强、类别不平衡和时间漂移纳入同一成本曲线,同时计算标注、推理、维护与审计费用。对团队最实用的做法,是在自己的表格上画出N*,让模型选择跟真实标签预算一起变化。

参考资料

https://arxiv.org/abs/2609.20218

https://arxiv.org/html/2609.20218

https://github.com/dingkaihua/prompt_or_train