專欄 AI 管理編年史 第 52/217 講 查看課程目錄

Mistral AI攜手NVIDIA發表開源模型Mistral NeMo 12B

18/07/2024 145
3:20
Mistral AI攜手NVIDIA發表開源模型Mistral NeMo 12B

Mistral AI與NVIDIA聯合發表120億參數開源模型Mistral NeMo,支援128K上下文窗口,採Apache 2.0授權釋出,並搭載全新多語言分詞器Tekken。

2024年7月18日,法國AI新創Mistral AI與NVIDIA共同發表最新開源大型語言模型「Mistral NeMo」,參數規模120億(12B)。官方宣稱在同尺寸模型中,Mistral NeMo的推理能力、世界知識與程式碼準確度皆達到業界頂尖水準。模型支援最長128,000 token的上下文窗口,可一次處理長篇文件、大型程式碼庫或長時間對話紀錄。Mistral AI同時釋出模型的預訓練基礎版(base)與指令微調版(instruct),兩者皆採用Apache 2.0授權,允許研究者與企業自由下載、修改與商用,不受限制條款束縛。

值得注意的是,Mistral NeMo搭配一款全新分詞器(tokenizer)「Tekken」,以Tiktoken為基礎打造,訓練資料涵蓋超過100種語言,官方表示其對多語言文字與程式碼的壓縮效率優於前代分詞器,尤其在非英語語系(如中文、韓文、阿拉伯文、印度語系)上表現更佳。

技術意義:與NVIDIA深度合作的訊號

此次發表由Mistral AI與NVIDIA聯合掛名,屬於NVIDIA近年積極布局「開源模型生態系」的一環——NVIDIA提供運算基礎設施與模型優化(包含針對NVIDIA GPU的推論加速),Mistral AI則貢獻模型架構與訓練資料。128K的上下文窗口在12B這個「中小尺寸」模型上並不常見,意味著企業無需選擇數百億以上參數的巨型模型,也能取得長文本處理能力,大幅降低部署與推論成本。

與同尺寸模型的比較

12B參數屬於「可在單張高階GPU上部署」的甜蜜點——比起同期其他開源模型,Mistral NeMo以更大的上下文窗口與新分詞器作為差異化賣點。而Apache 2.0授權(相較部分同業採用較多限制的授權條款)也讓企業在商用部署時法遵疑慮更低,是Mistral NeMo被視為「對企業友善」的關鍵原因之一。

業界反應

開源社群對Tekken分詞器的多語言壓縮效率評價正面,開發者社群迅速將模型上架供下載測試;同時也有評論指出,這是Mistral AI在數月前接受策略投資後,與NVIDIA合作具體落地的第一個公開產品,被視為新創與科技巨頭合作模式的觀察指標。

對管理者而言,Mistral NeMo這類「可自行部署、授權寬鬆」的開源模型,代表企業若對資料隱私或客製化有特殊需求(例如不希望客戶對話資料上傳至第三方雲端),現在多了一個可自建、可微調的選項,而非只能依賴付費API。管理者可請IT或資料團隊評估:公司內部是否有適合用開源模型自建的場景(如客服知識庫問答、內部文件摘要),以降低長期AI導入的邊際成本。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 Meta發表Llama 3.1 405B:號稱首個對標頂級閉源模型的開源模型

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策