Google 发布 TabFM:表格数据不用训练就能预测,数周内 BigQuery 一行 SQL 就能用
2026 年 6 月 30 日,Google Research 发布表格数据基础模型 TabFM,把表格预测重构为上下文学习:整份表格一次前向传递、权重冻结、无需训练调参即可完成分类与回归。在 TabArena 的 38 个分类与 13 个回归数据集上名列前茅,权重在 Hugging Face(非商业许可)、代码在 GitHub(Apache 2.0),并宣布数周内并入 BigQuery,一行 AI.PREDICT SQL 即可使用。
2026 年 6 月 30 日,Google Research 在官方博客发布 TabFM(Tabular Foundation Model),一个专门处理表格数据的基础模型,由 Google Research 团队发布。它的诉求很直接:面对一份电子表格或数据库表,不必为它训练模型、不必调参数,直接把整份表格交给模型,就能返回分类(这位客户会不会流失)或回归(下个月营收多少)的预测。
把表格预测改写成「上下文学习」
核心设计是把表格预测重构为上下文学习(in-context learning)。传统流程是「一份数据集训练一个模型」;TabFM 则把历史数据行与待预测行合并成单一 context,在权重完全冻结(frozen weights)的状态下做一次前向传递,结果就出来了。架构上有三个关键:
- 行列交替注意力(alternating row and column attention):既看同一行内各字段的关系,也看同一字段在不同行之间的分布。
- 行压缩(row compression):把大量数据行压缩成模型能承载的表示,整份表格才塞得进 context。
- 上下文学习机制:样例即训练,不再有针对单一数据集的梯度更新。
训练数据来源值得注意:训练集是由结构因果模型(structural causal models)生成的数亿份合成数据集,全程未使用真实企业数据,对重视数据治理的企业是加分项。
基准成绩与发布边界
Google 在公开基准 TabArena 上评测,涵盖 38 个分类数据集与 13 个回归数据集,base 模型与 TabFM-Ensemble(加入交叉特征、SVD 特征与概率校准)均名列前茅。发布分成两块,边界要看清楚:模型权重放在 Hugging Face,采用非商业许可(non-commercial license);使用代码与示例放在 GitHub,采用 Apache 2.0。可以研究、可以试,但不能拿权重直接做商业产品。
真正会改变企业日常的,是同日宣布的整合计划:TabFM 正在并入 Google BigQuery,官方说法是数周之内,用户将可以用一行 AI.PREDICT SQL 完成进阶的回归与分类。数据已经在数仓里,预测就在数仓里完成,不必再导出数据、再开 notebook。
和 XGBoost 的差别,以及对管理者的意义
过去表格预测的主力是 XGBoost 与 Random Forest,效果好,但每换一份数据集就要重新训练、调参、验证,这些工作需要数据科学人力,人力就意味着排队与周期。TabFM 在 TabArena 上与现有顶尖方法同列前段,它改变的是「要花多久、要谁做」:零训练意味着预测从一个项目,变成一次查询。企业手上最多的数据类型从来不是文章与图片,而是表格——销售明细、客户流失名单、应收账龄、库存周转、出勤记录。过去门槛不在数据而在人,多数中型企业因此停在「看报表」。若整合如期上线,主管能自己问出「哪些客户下季可能不续约」。
现在可以做的准备有两件:
- 盘点自家哪三张表格最值得预测,并确认字段质量与历史长度足够。
- 记住许可边界:要在商业场景使用,请等 BigQuery 正式整合,而不是先把 Hugging Face 的权重搬进生产环境。
技术门槛正在降下来,剩下的是管理者愿不愿意先想清楚要问什么问题。