專欄 AI 管理編年史 第 37/217 講 查看課程目錄

馬斯克說到做到:xAI 開源3140億參數模型Grok-1

17/03/2024 257
3:43
馬斯克說到做到:xAI 開源3140億參數模型Grok-1

xAI 以 Apache 2.0 授權釋出 Grok-1 模型權重與架構,3140億參數的混合專家(MoE)模型成為當時公開釋出中最大的開源MoE模型,但釋出版本未經對話微調。

Elon Musk 旗下 AI 公司 xAI 於2024年3月17日依照先前承諾,將旗下大型語言模型 Grok-1 的模型權重與網路架構,以 Apache 2.0 授權完整開源釋出,任何人皆可自由下載、使用、修改甚至商業化。根據 xAI 官方公告,Grok-1 是一個擁有3140億參數的混合專家(Mixture-of-Experts, MoE)架構模型,是當時公開釋出的模型中規模最大的開源 MoE 模型。需要特別說明的是,這次釋出的是2023年10月完成預訓練的原始基礎模型(base model)checkpoint,並未經過針對對話、指令遵循等特定任務的微調(fine-tuning),因此開發者若要拿來直接當聊天機器人使用,還需要自行進行後續調校。

技術意義:MoE架構的公開里程碑

混合專家(MoE)架構的核心概念,是把模型拆成多個「專家」子網路,每次推論時只啟動其中一小部分專家參與運算,而非讓全部參數同時運作。這種設計能在維持龐大總參數量、保留模型知識容量的同時,控制實際運算成本。Grok-1 以3140億參數的規模開源,等於把一個目前業界少見的超大型 MoE 架構完整攤在陽光下,讓研究社群第一次能實際檢視、拆解這類架構在工程實作上的細節,這對學術界與開源社群理解「如何訓練與部署超大規模稀疏模型」具有指標意義。

與競品比較:開源姿態的分水嶺

相較於 OpenAI 的 GPT-4、Google 的 Gemini 等走完全閉源路線的頂尖模型,xAI 選擇把接近同等級規模的基礎模型公開,呼應了 Meta 以 Llama 系列推動開源生態的路線,但 Grok-1 的3140億參數規模又遠超當時多數開源模型(如 Llama 2 最大僅700億參數等級)。這使得 Grok-1 成為開源與閉源陣營之間規模差距顯著縮小的一個訊號,也讓「開源大模型能否追上閉源旗艦模型」的討論有了新的參照點。

業界反應:話題與務實並存

由於釋出版本未經對話微調,且模型體積龐大(權重檔案高達數百GB),多數開發者實務上難以直接在消費級硬體上運行或微調,業界反應呈現「話題度高於立即可用性」的態勢——一方面肯定 xAI 兌現開源承諾、提升透明度,一方面也指出真正要讓 Grok-1 變得「好用」,仍需要大量算力與工程投入進行後續微調。

對管理者而言,這則新聞的啟示在於:AI 基礎模型的競爭版圖正在快速變化,開源與閉源的界線不再絕對,企業在評估導入AI能力時,除了關注封閉式API服務,也可以留意開源模型生態的發展速度,作為未來技術選型與人才布局的參考指標。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 NVIDIA發表Blackwell架構:兆級AI模型運算成本降25倍、推論提速30倍

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策