谷歌研究团队在 Hugging Face 上发布了 TabFM 1.1.0 的 PyTorch 权重,这是一个面向表格数据的零样本基础模型,支持分类与回归任务,无需针对特定数据集进行微调或超参数搜索。该模型通过将训练样本作为上下文传入,在一次前向传播中即可完成预测,这标志着基础模型在结构化数据领域的又一进展。
TabFM 由谷歌研究团队开发,其架构采用交替的行和列注意力机制,以捕捉特征交互和行级模式。具体而言,模型使用列注意力(基于 Set Transformer)嵌入每个单元格,并通过归纳自注意力聚合行信息;行压缩模块利用 CLS 标记和旋转位置编码(RoPE)将每行压缩为稠密向量;随后一个 24 层的因果 Transformer 对这些压缩向量进行处理,将训练行作为上下文,为测试行输出预测。模型的关键超参数包括嵌入维度 256、列注意力块 3 个(4 头)、行注意力块 3 个(8 头)、ICL Transformer 块 24 个(8 头)、最大类别数 10、激活函数 SwiGLU 以及 32 个傅里叶特征。
训练数据方面,TabFM 使用结构因果模型(SCM)动态生成的数亿个合成数据集进行训练。选择合成数据的原因在于开源表格数据集缺乏多样性且质量参差不齐,同时可避免真实工业数据带来的隐私和许可问题。SCM 先验编码了表格任务中常见的因果结构和特征关系的归纳偏置。
在性能评估上,TabFM 在 TabArena 基准的 51 个数据集(38 个分类、13 个回归)上进行了测试。在零样本模式下(单次前向传播,无超参数搜索),TabFM 的表现优于经过重度调优的监督基线,包括梯度提升树。此外,TabFMClassifier 的集成预设(结合特征交叉、SVD 特征和 NNLS 混合)可进一步提升性能。
值得注意的是,TabFM 的许可条款限制其用于商业用途,权重采用 TabFM 非商业许可 v1.0,而源代码则遵循 Apache 2.0 许可。模型存在硬性限制,例如分类任务最多支持 10 个类别,且内存使用量随训练行数增加而增长,优化目标为不超过 500 个特征的表。谷歌研究团队也提醒,由于模型完全基于合成数据训练,在特定真实世界领域或边缘分布上的性能尚未完全表征,用户在高风险场景部署前应使用代表性数据评估模型。
TabFM 的发布为表格数据建模提供了新的思路,尤其对于缺乏标注数据或需要快速部署的场景,零样本能力可能降低机器学习应用的门槛。然而,非商业许可限制了其在企业环境中的直接使用,未来是否会开放商业授权值得关注。对于 AI 产业而言,表格数据是金融、医疗、制造等领域的常见数据类型,基础模型在该领域的进展可能推动 AutoML 和预测性分析工具的革新。