专栏 AI 管理编年史 第 197/217 讲 查看课程目录

Google 发布 TabFM:表格数据不用训练就能预测,数周内 BigQuery 一行 SQL 就能用

30/06/2026 77
4:34
Google 发布 TabFM:表格数据不用训练就能预测,数周内 BigQuery 一行 SQL 就能用

2026 年 6 月 30 日,Google Research 发布表格数据基础模型 TabFM,把表格预测重构为上下文学习:整份表格一次前向传递、权重冻结、无需训练调参即可完成分类与回归。在 TabArena 的 38 个分类与 13 个回归数据集上名列前茅,权重在 Hugging Face(非商业许可)、代码在 GitHub(Apache 2.0),并宣布数周内并入 BigQuery,一行 AI.PREDICT SQL 即可使用。

2026 年 6 月 30 日,Google Research 在官方博客发布 TabFM(Tabular Foundation Model),一个专门处理表格数据的基础模型,由 Google Research 团队发布。它的诉求很直接:面对一份电子表格或数据库表,不必为它训练模型、不必调参数,直接把整份表格交给模型,就能返回分类(这位客户会不会流失)或回归(下个月营收多少)的预测。

把表格预测改写成「上下文学习」

核心设计是把表格预测重构为上下文学习(in-context learning)。传统流程是「一份数据集训练一个模型」;TabFM 则把历史数据行与待预测行合并成单一 context,在权重完全冻结(frozen weights)的状态下做一次前向传递,结果就出来了。架构上有三个关键:

  • 行列交替注意力(alternating row and column attention):既看同一行内各字段的关系,也看同一字段在不同行之间的分布。
  • 行压缩(row compression):把大量数据行压缩成模型能承载的表示,整份表格才塞得进 context。
  • 上下文学习机制:样例即训练,不再有针对单一数据集的梯度更新。

训练数据来源值得注意:训练集是由结构因果模型(structural causal models)生成的数亿份合成数据集,全程未使用真实企业数据,对重视数据治理的企业是加分项。

基准成绩与发布边界

Google 在公开基准 TabArena 上评测,涵盖 38 个分类数据集与 13 个回归数据集,base 模型与 TabFM-Ensemble(加入交叉特征、SVD 特征与概率校准)均名列前茅。发布分成两块,边界要看清楚:模型权重放在 Hugging Face,采用非商业许可(non-commercial license);使用代码与示例放在 GitHub,采用 Apache 2.0。可以研究、可以试,但不能拿权重直接做商业产品。

真正会改变企业日常的,是同日宣布的整合计划:TabFM 正在并入 Google BigQuery,官方说法是数周之内,用户将可以用一行 AI.PREDICT SQL 完成进阶的回归与分类。数据已经在数仓里,预测就在数仓里完成,不必再导出数据、再开 notebook。

和 XGBoost 的差别,以及对管理者的意义

过去表格预测的主力是 XGBoost 与 Random Forest,效果好,但每换一份数据集就要重新训练、调参、验证,这些工作需要数据科学人力,人力就意味着排队与周期。TabFM 在 TabArena 上与现有顶尖方法同列前段,它改变的是「要花多久、要谁做」:零训练意味着预测从一个项目,变成一次查询。企业手上最多的数据类型从来不是文章与图片,而是表格——销售明细、客户流失名单、应收账龄、库存周转、出勤记录。过去门槛不在数据而在人,多数中型企业因此停在「看报表」。若整合如期上线,主管能自己问出「哪些客户下季可能不续约」。

现在可以做的准备有两件:

  1. 盘点自家哪三张表格最值得预测,并确认字段质量与历史长度足够。
  2. 记住许可边界:要在商业场景使用,请等 BigQuery 正式整合,而不是先把 Hugging Face 的权重搬进生产环境。

技术门槛正在降下来,剩下的是管理者愿不愿意先想清楚要问什么问题。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 Claude Code与Claude Cowork进驻Claude for Government Desktop公开测试版

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策