Meta 發表 Llama 4:開源模型首度導入混合專家架構
Meta 發表新一代開源模型 Llama 4 Scout 與 Maverick,首度採用混合專家(MoE)架構,Scout 上下文窗口達1000萬token且可單卡運行,Maverick 宣稱效能超越 GPT-4o 與 Gemini 2.0 Flash。
Meta 於美國時間 2025 年 4 月 5 日發表新一代開源模型家族 Llama 4,同時釋出兩款可下載模型:Llama 4 Scout 與 Llama 4 Maverick。這是 Llama 系列首度採用混合專家(Mixture-of-Experts,MoE)架構,也是 Meta 在開源大型語言模型競賽中的最新一步。
根據官方部落格公告,Llama 4 Scout 擁有 170 億活躍參數、16 個專家模組,官方稱其為同量級中最佳的多模態模型,效能超越前幾代所有 Llama 模型。Scout 最受矚目的規格是上下文窗口達 1000 萬 token,號稱業界領先,且模型仍可塞進單張 NVIDIA H100 GPU 運行。另一款 Llama 4 Maverick 同樣是 170 億活躍參數,但擴大到 128 個專家,Meta 宣稱其在多項廣泛採用的基準測試上超越 OpenAI 的 GPT-4o 與 Google 的 Gemini 2.0 Flash。Meta 同時預告規模更大的 Llama 4 Behemoth,目前仍在訓練中,將作為「教師模型」用來訓練其他 Llama 4 模型。Scout 與 Maverick 已開放在 Llama 官網及 Hugging Face 等合作平台下載。
技術意義:MoE 架構與超長上下文的雙重跳躍
混合專家架構的核心概念是模型內部包含多組「專家」子網路,每次推論只啟動其中一部分(Scout 啟動 16 個專家中的一部分、Maverick 則從 128 個專家中挑選),因此總參數量遠大於「活躍參數量」,卻能維持相對較低的運算成本。這是目前主流大型模型(包括 DeepSeek-V3 等)共同採用的路線,Meta 這次跟進,代表 MoE 已從實驗性技術變成開源旗艦模型的標準配置。而 1000 萬 token 的上下文窗口若能穩定支撐,理論上可一次讀入數千頁文件或整個程式碼庫,這對需要處理大量長文件的應用場景是重要突破。
與前代及競品的比較
相較於前代 Llama 3 系列,Llama 4 從「單一稠密模型」轉向「稀疏混合專家」,是架構層級的改變而非單純擴大參數。Meta 直接點名 GPT-4o 與 Gemini 2.0 Flash 作為 Maverick 的基準對照,顯示這次發表的定位不只是「開源社群的選項」,而是正面挑戰兩大閉源龍頭在多模態任務上的表現。Scout 能在單張 H100 運行,也是刻意針對「部署門檻」下的優化——比起需要多卡叢集的超大模型,這讓中小型團隊自建、私有化部署變得可行。
業界反應
開源社群普遍關注 Scout 與 Maverick 釋出後在 Hugging Face 上的實測基準能否對應官方宣稱的成績,以及超長上下文窗口在實際任務中的穩定度與延遲表現,這些通常要等第三方測試與社群實際部署一段時間後才會逐漸明朗。無論如何,Meta 持續投入開源大模型,也讓依賴開源生態的企業與開發者多了一個可自行部署、客製化的選項。
對管理者而言,這則新聞的意義不在於立即導入哪個模型,而在於留意「開源模型可自建部署」與「超長上下文可處理大量文件」這兩個趨勢正在快速成熟——未來評估內部知識庫、合約審閱或客服系統的 AI 方案時,除了付費 API,開源自架也會是需要放入比較清單的選項。