谷歌研究團隊在 Hugging Face 上釋出了 TabFM 1.1.0PyTorch 權重,這是一個面向表格資料的零樣本基礎模型,支援分類與迴歸任務,無需針對特定資料集進行微調或超引數搜尋。該模型通過將訓練樣本作為上下文傳入,在一次前向傳播中即可完成預測,這標誌著基礎模型在結構化資料領域的又一進展。

TabFM 由谷歌研究團隊開發,其架構採用交替的行和列注意力機制,以捕捉特徵互動和行級模式。具體而言,模型使用列注意力(基於 Set Transformer)嵌入每個單元格,並通過歸納自注意力聚合行資訊;行壓縮模組利用 CLS 標記和旋轉位置編碼(RoPE)將每行壓縮為稠密向量;隨後一個 24 層的因果 Transformer 對這些壓縮向量進行處理,將訓練行作為上下文,為測試行輸出預測。模型的關鍵超引數包括嵌入維度 256、列注意力塊 3 個(4 頭)、行注意力塊 3 個(8 頭)、ICL Transformer 塊 24 個(8 頭)、最大類別數 10、啟用函式 SwiGLU 以及 32 個傅立葉特徵。

訓練資料方面,TabFM 使用結構因果模型(SCM)動態生成的數億個合成數據集進行訓練。選擇合成數據的原因在於開源表格資料集缺乏多樣性且質量參差不齊,同時可避免真實工業資料帶來的隱私和許可問題。SCM 先驗編碼了表格任務中常見的因果結構和特徵關係的歸納偏置。

在效能評估上,TabFM 在 TabArena 基準的 51 個數據集(38 個分類、13 個迴歸)上進行了測試。在零樣本模式下(單次前向傳播,無超引數搜尋),TabFM 的表現優於經過重度調優的監督基線,包括梯度提升樹。此外,TabFMClassifier 的整合預設(結合特徵交叉、SVD 特徵和 NNLS 混合)可進一步提升效能。

值得注意的是,TabFM 的許可條款限制其用於商業用途,權重採用 TabFM 非商業許可 v1.0,而原始碼則遵循 Apache 2.0 許可。模型存在硬性限制,例如分類任務最多支援 10 個類別,且記憶體使用量隨訓練行數增加而增長,最佳化目標為不超過 500 個特徵的表。谷歌研究團隊也提醒,由於模型完全基於合成數據訓練,在特定真實世界領域或邊緣分佈上的效能尚未完全表徵,使用者在高風險場景部署前應使用代表性資料評估模型。

TabFM 的釋出為表格資料建模提供了新的思路,尤其對於缺乏標註資料或需要快速部署的場景,零樣本能力可能降低機器學習應用的門檻。然而,非商業許可限制了其在企業環境中的直接使用,未來是否會開放商業授權值得關注。對於 AI 產業而言,表格資料是金融、醫療、製造等領域的常見資料型別,基礎模型在該領域的進展可能推動 AutoML 和預測性分析工具的革新。