arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

Google让Agent自己改数据流水线,51个表格任务直接包揽前五

作者:arXivDaily编辑部 arXiv 2609.37989 cs · cs.LG

论文导读

Google Research、南加州大学、Google DeepMind、哈佛大学等机构联合提出TabFM-Auto,让Agent围绕冻结的表格基础模型自动修改数据流水线。它在TabArena的51个数据集上由五种配置包揽总榜前五,最佳方案还把基础模型从1785 Elo提升到2013 Elo。

表格模型常看不懂表外信息

表格基础模型擅长从数值和类别列做零样本预测,却常忽略列名、任务说明和随数据附带的文件。另一类机器学习Agent会针对每个数据集从头搜索特征、模型和超参数,空间太大时容易追着验证集波动走。TabFM-Auto把两条路线合并:保留已经预训练好的TabFM,只让语言模型Agent改造输入和输出流水线。

图:总榜中五条红色柱标出五种TabFM-Auto配置的领先位置。

Agent读取元数据和验证反馈,迭代决定清洗方式、特征工程、上下文选择与后处理。每次修改都围绕同一个冻结模型进行,搜索目标更集中,也能把“这列名字暗示什么”转成模型可用的结构。

Agent进化的是流程而非权重

系统先运行当前流水线,查看验证误差,再提出代码或配置修改并重新评估。它可以修正缺失值、组合特征、选择相关上下文,也可以在输出端做校准。基础模型权重始终不变,因此发现的流程更容易迁移到别的表格模型。

图:搜索轨迹展示Agent迭代流水线时验证成绩的变化。

论文报告,搜索得到的流水线直接迁移到其他冻结表格基础模型后,无需再次搜索仍增加69至143 Elo。这说明Agent找到的不只是针对单一模型的偶然补丁,其中一部分确实捕捉了数据集语义。

51个数据集包揽前五

在覆盖51个数据集的TabArena中,使用不同Agent和语言模型的五种TabFM-Auto配置占据总榜前五;最佳配置把TabFM从1785 Elo推到2013 Elo。在MLE-Bench的8个表格竞赛上,它在机器学习工程Agent中排名第一。

图:分类、回归分榜分别比较自动流水线与多种表格模型。

这些名次依赖论文采用的基准、预算和验证协议,不代表企业里任何表格都能自动拿到最好结果。真实业务还会遇到时间穿越、权限字段、标签泄漏和口径变化,Agent生成的清洗与特征代码需要审计。

未来自动化数据工程要带护栏

落地时可以把候选流水线放进隔离环境,自动检查训练集与测试集边界、特征来源和运行成本,再由人工批准进入生产。每次迭代还应保存代码差异、验证结果和随机种子,避免排行榜提升无法复现。

TabFM-Auto的启发是让通用模型承担预测,让Agent专注理解数据语义和组织工具。未来若加入数据质量报警、因果时间检查和成本约束,这类系统有机会把一次性的竞赛搜索变成可维护的表格建模工作流。上线前还应在时间外样本上复测,确认自动特征没有偷看未来信息,也没有把敏感字段带入模型。

参考资料

https://arxiv.org/abs/2609.37989

↑