马斯克说到做到:xAI 开源3140亿参数模型Grok-1
xAI 以 Apache 2.0 许可证释出 Grok-1 模型权重与架构,3140亿参数的混合专家(MoE)模型成为当时公开释出中最大的开源MoE模型,但释出版本未经对话微调。
Elon Musk 旗下 AI 公司 xAI 于2024年3月17日按照此前承诺,将旗下大型语言模型 Grok-1 的模型权重与网络架构,以 Apache 2.0 许可证完整开源释出,任何人都可以自由下载、使用、修改甚至商业化。根据 xAI 官方公告,Grok-1 是一个拥有3140亿参数的混合专家(Mixture-of-Experts, MoE)架构模型,是当时公开释出的模型中规模最大的开源 MoE 模型。需要特别说明的是,此次释出的是2023年10月完成预训练的原始基础模型(base model)checkpoint,并未经过针对对话、指令遵循等特定任务的微调(fine-tuning),因此开发者若要直接拿来当聊天机器人使用,还需要自行进行后续调校。
技术意义:MoE架构的公开里程碑
混合专家(MoE)架构的核心思路,是把模型拆分成多个“专家”子网络,每次推理时只激活其中一小部分专家参与运算,而非让全部参数同时运作。这种设计能在保持庞大总参数量、保留模型知识容量的同时,控制实际运算成本。Grok-1 以3140亿参数的规模开源,相当于把一个业界罕见的超大型 MoE 架构完整公开,让研究社区第一次能够实际查看、拆解这类架构在工程实现上的细节,这对学术界与开源社区理解“如何训练与部署超大规模稀疏模型”具有标志性意义。
与竞品对比:开源姿态的分水岭
相较于 OpenAI 的 GPT-4、Google 的 Gemini 等完全闭源路线的顶尖模型,xAI 选择把接近同等级规模的基础模型公开,呼应了 Meta 以 Llama 系列推动开源生态的路线,但 Grok-1 的3140亿参数规模又远超当时多数开源模型(如 Llama 2 最大仅700亿参数级别)。这使得 Grok-1 成为开源与闭源阵营之间规模差距明显缩小的一个信号,也让“开源大模型能否追上闭源旗舰模型”的讨论有了新的参照点。
业界反应:话题与务实并存
由于释出版本未经对话微调,且模型体积庞大(权重文件高达数百GB),多数开发者实际上难以直接在消费级硬件上运行或微调,业界反应呈现“话题度高于即用性”的态势——一方面肯定 xAI 兑现开源承诺、提升透明度,另一方面也指出真正要让 Grok-1 变得“好用”,仍需要大量算力与工程投入进行后续微调。
对管理者而言,这则新闻的启示在于:AI基础模型的竞争格局正在快速变化,开源与闭源的界限不再绝对,企业在评估导入AI能力时,除了关注封闭式API服务,也可以留意开源模型生态的发展速度,作为未来技术选型与人才布局的参考指标。