Meta发布Llama 4:开源模型首次引入混合专家架构
Meta发布新一代开源模型Llama 4 Scout与Maverick,首次采用混合专家(MoE)架构,Scout上下文窗口达1000万token且可单卡运行,Maverick宣称性能超越GPT-4o与Gemini 2.0 Flash。
美国当地时间2025年4月5日,Meta发布新一代开源模型家族Llama 4,同时开放下载两款模型:Llama 4 Scout与Llama 4 Maverick。这是Llama系列首次采用混合专家(Mixture-of-Experts,MoE)架构,也是Meta在开源大语言模型竞赛中迈出的最新一步。
根据官方博客公告,Llama 4 Scout拥有170亿活跃参数、16个专家模块,官方称其为同量级中最佳的多模态模型,性能超越此前所有Llama模型。Scout最受关注的规格是上下文窗口达到1000万token,号称业界领先,且模型仍可在单张NVIDIA H100显卡上运行。另一款Llama 4 Maverick同样是170亿活跃参数,但扩大到128个专家,Meta宣称其在多项广泛采用的基准测试中超越OpenAI的GPT-4o与Google的Gemini 2.0 Flash。Meta同时预告规模更大的Llama 4 Behemoth,目前仍在训练中,将作为“教师模型”用于训练其他Llama 4模型。Scout与Maverick已在Llama官网及Hugging Face等合作平台开放下载。
技术意义:MoE架构与超长上下文的双重跃进
混合专家架构的核心思路是模型内部包含多组“专家”子网络,每次推理只激活其中一部分(Scout从16个专家中启动一部分、Maverick则从128个专家中挑选),因此总参数量远大于“活跃参数量”,却能维持相对较低的运算成本。这是目前主流大模型(包括DeepSeek-V3等)共同采用的路线,Meta这次跟进,说明MoE已从实验性技术变成开源旗舰模型的标准配置。而1000万token的上下文窗口如果能够稳定支撑,理论上可一次读入数千页文档或整个代码库,这对需要处理大量长文档的应用场景是重要突破。
与前代及竞品的对比
相较于前代Llama 3系列,Llama 4从“单一稠密模型”转向“稀疏混合专家”,是架构层面的改变而非单纯扩大参数规模。Meta直接点名GPT-4o与Gemini 2.0 Flash作为Maverick的基准对照,说明这次发布的定位不只是“开源社区的选项”,而是正面挑战两大闭源巨头在多模态任务上的表现。Scout能在单张H100上运行,也是刻意针对“部署门槛”做的优化——相比需要多卡集群的超大模型,这让中小团队自建、私有化部署变得可行。
业界反应
开源社区普遍关注Scout与Maverick发布后在Hugging Face上的实测基准能否对应官方宣称的成绩,以及超长上下文窗口在实际任务中的稳定性与延迟表现,这些通常要等第三方测试与社区实际部署一段时间后才会逐渐明朗。无论如何,Meta持续投入开源大模型,也让依赖开源生态的企业与开发者多了一个可自行部署、定制化的选项。
对管理者而言,这则新闻的意义不在于立即导入哪个模型,而在于留意“开源模型可自建部署”与“超长上下文可处理大量文档”这两个趋势正在快速成熟——未来评估内部知识库、合同审阅或客服系统的AI方案时,除了付费API,开源自建也会是需要纳入比较清单的选项。