專欄 AI 管理編年史 第 42/217 講 查看課程目錄

Meta 發表 Llama 3:8B/70B 開源模型上線五大雲端平台

18/04/2024 257
4:08
Meta 發表 Llama 3:8B/70B 開源模型上線五大雲端平台

Meta 於 4 月 18 日發表新一代開源模型 Llama 3,提供 8B、70B 兩種規模,訓練資料達 15 兆 token,並同步登陸 AWS、Google Cloud、Azure、Hugging Face、NVIDIA NIM 五大平台,官方宣稱多項基準測試表現領先業界。

Meta 於 2024 年 4 月 18 日正式發表新一代開源大型語言模型 Llama 3,同步推出 80 億參數(8B)與 700 億參數(70B)兩種規模,並各自提供「預訓練版」與「指令微調版」(Instruct)供不同用途選用。根據 Meta AI 官方部落格公告,Llama 3 使用約 15 兆 token 的訓練資料,資料來源全部取自公開網路內容,訓練規模較前一代 Llama 2 大幅提升。

官方宣稱,Llama 3 在多項業界標準基準測試(包括推理、程式撰寫、常識問答等評測集)上取得同量級模型中的領先成績,並特別強調模型的推理能力與指令理解能力較前代有明顯進步。與此同時,Meta 也將 Llama 3 同步上架至 AWS、Google Cloud、Microsoft Azure、Hugging Face 與 NVIDIA NIM 等主要雲端與開發平台,讓全球開發者可以直接透過既有雲端帳號取用、部署與微調模型。值得留意的是,Llama 3 仍採用 Meta 自訂的社群授權條款(Llama 3 Community License),開發者使用前須接受該授權,且月活躍用戶超過 7 億的企業需另向 Meta 申請授權,並非完全無授權限制。

技術意義:開源陣營首次追平閉源模型水準

Llama 3 的發表之所以受到高度關注,關鍵在於這是開源模型陣營首次在多項基準測試上宣稱追平甚至超越同期部分閉源商用模型的表現。過去開源模型普遍被認為在推理與複雜指令遵循能力上落後於封閉模型,Llama 3 的成績等於向市場宣告「開源不等於次等」,也讓企業在選擇 AI 供應商時多了一個可自行部署、無需按 token 付費給第三方 API 的選項。

與前代比較:訓練資料量大幅擴增

相較 Llama 2 的訓練資料規模,Llama 3 的 15 兆 token 是明顯的跳躍式成長,這也解釋了為何官方特別強調推理能力的提升——更大量、更乾淨的公開資料,通常能讓模型在語言理解與邏輯推演上有感提升。不過 Meta 並未於本次公告中揭露資料集的詳細組成與品質篩選方式,市場對於「業界領先」的評測結果仍需持續觀察第三方實測驗證。

業界反應:五大平台同步上架,企業採用門檻降低

相較於過去許多開源模型發表後仍需經過數週才能在主要雲端平台部署,Llama 3 選擇在發表當天即同步登陸 AWS、Google Cloud、Azure、Hugging Face、NVIDIA NIM,等於是把「發表」與「可用」畫上等號。這對企業 IT 部門而言意義重大:不必等待內部團隊自行架設推論環境,即可透過既有雲端合約直接測試甚至上線,大幅縮短導入評估的時間成本。

對管理者而言,Llama 3 的發表代表企業導入生成式 AI 的選項再度增加:除了向現有供應商按用量付費之外,現在也能考慮以開源模型自建內部工具(例如客服問答、內部知識庫檢索),換取資料留在企業內部、長期成本更可控的彈性。若企業已有雲端 IT 資源,不妨請技術團隊先用 8B 版本做小規模概念驗證,評估是否足以取代部分現有付費 API 使用情境。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 OpenAI發表GPT-4o 語音視覺即時全能

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策