Google 發表 TabFM:表格資料不必訓練就能預測,數週內 BigQuery 一行 SQL 就能用
2026 年 6 月 30 日,Google Research 發表表格資料基礎模型 TabFM,把表格預測重構為情境學習:整份表格一次前向傳遞、權重凍結、不必訓練調參,即可完成分類與回歸。在 TabArena 的 38 個分類與 13 個回歸資料集上名列頂尖,權重上 Hugging Face(非商業授權)、程式碼上 GitHub(Apache 2.0),並宣告數週內併入 BigQuery,一行 AI.PREDICT SQL 即可使用。
2026 年 6 月 30 日,Google Research 在官方部落格發表 TabFM(Tabular Foundation Model),一個專門處理表格資料的基礎模型,由 Google Research 團隊發表。訴求很單純:面對一份試算表或資料庫表格,不必為它訓練模型、不必調參數,直接把整份表格交給模型,就能回傳分類(這位客戶會不會流失)或回歸(下個月營收多少)的預測。
把表格預測改寫成「情境學習」
核心設計是把表格預測重構為情境學習(in-context learning)。傳統流程是「一份資料集訓練一個模型」;TabFM 則把歷史資料列與待預測資料列合併成單一 context,在權重完全凍結(frozen weights)的狀態下做一次前向傳遞,答案就出來了。架構上有三個關鍵:
- 列與欄交替注意力(alternating row and column attention):既看同一列裡各欄位的關係,也看同一欄位在不同列之間的分布。
- 列壓縮(row compression):把大量資料列壓成模型吃得下的表示,整份表格才塞得進 context。
- 情境學習機制:範例即訓練,不再有針對單一資料集的梯度更新。
訓練資料來源值得注意:訓練集是由結構因果模型(structural causal models)生成的數億份合成資料集,全程未使用真實企業資料,對重視資料治理的企業是加分項。
基準成績與釋出界線
Google 在公開基準 TabArena 上評測,涵蓋 38 個分類資料集與 13 個回歸資料集,base 模型與 TabFM-Ensemble(加入交叉特徵、SVD 特徵與機率校準)皆名列頂尖。釋出分成兩塊,界線要看清楚:模型權重放上 Hugging Face,採非商業授權(non-commercial license);使用程式碼與範例放上 GitHub,採 Apache 2.0。可以研究、可以試,但不能拿權重直接做商業產品。
真正會改變企業日常的,是同日宣告的整合計畫:TabFM 正在併入 Google BigQuery,官方說法是數週之內,使用者將可用一行 AI.PREDICT SQL 完成進階的回歸與分類。資料已經在倉儲裡,預測就在倉儲裡完成,不必再導出資料、再開 notebook。
和 XGBoost 的差別,以及對管理者的意義
過去表格預測的主力是 XGBoost 與 Random Forest,效果好,但每換一份資料集就要重新訓練、調參、驗證,這些工作需要資料科學人力,人力就是排隊與週期。TabFM 在 TabArena 上與現有頂尖方法同列前段,它改變的是「要花多久、要誰做」:零訓練意味著預測從一個專案,變成一次查詢。企業手上最多的資料型態從來不是文章與圖片,而是表格——銷售明細、客戶流失名單、應收帳齡、庫存週轉、出勤紀錄。過去門檻不在資料而在人,多數中型企業因此停在「看報表」。若整合如期上線,主管能自己問出「哪些客戶下季可能不續約」。
現在可以做的準備有兩件:
- 盤點自家哪三張表格最值得預測,並確認欄位品質與歷史長度足夠。
- 記住授權界線:要在商業情境使用,請等 BigQuery 正式整合,而不是先把 Hugging Face 的權重搬進生產環境。
技術門檻正在降下來,剩下的是管理者願不願意先想清楚要問什麼問題。