Meta 發表 Llama 3.2:首款具備視覺能力的開源模型登場
Meta 在 Meta Connect 2024 大會上由執行長 Mark Zuckerberg 親自發表 Llama 3.2,首度推出具備影像理解能力的 11B 與 90B 視覺模型,並同步釋出可跑在手機、邊緣裝置上的 1B、3B 輕量純文字模型。
2024 年 9 月 25 日,Meta 在年度開發者大會 Meta Connect 2024 上,由執行長 Mark Zuckerberg 親自發表最新一代開源模型 Llama 3.2。這次發表最受矚目的重點,是 Llama 系列首度出現具備「視覺能力」的版本——11B 與 90B 兩款中大型視覺語言模型,能夠理解並回答關於圖片內容的問題。同時,Meta 也釋出兩款專為手機與邊緣裝置設計的輕量純文字模型:1B 與 3B 參數版本,鎖定裝置端運算與低延遲應用場景。
技術意義:不是重練模型,而是「加裝」視覺能力
值得注意的是,Meta 並未為了加入影像理解而從零打造全新模型架構。11B 與 90B 版本是在既有的 Llama 3.1 純文字模型基礎上,額外訓練並加入「視覺轉接層」(adapter weights),把影像編碼器的輸出接進語言模型的推理流程中。這種做法讓 Meta 能夠保留原本純文字模型的語言能力,同時用相對較低的訓練成本疊加視覺理解,而不必重新從頭訓練一個多模態大模型。對開發者而言,這也代表未來的視覺能力有機會以「插件式」方式持續疊代,而不必每次都等待整個模型世代更新。
與前代及市場的比較
在此之前,Llama 3 與 3.1 系列都僅支援純文字輸入輸出,若要處理圖片,開發者得自行串接第三方視覺模型或雲端 API。Llama 3.2 的推出,等於讓 Meta 首次在開源陣營中補齊了「看得懂圖片」這塊拼圖,與 OpenAI、Google 等廠商的多模態模型站上同一個能力量級的競技場。另一方面,1B、3B 這兩款輕量模型鎖定手機與邊緣裝置離線運算,反映出 Meta 對「AI 不必事事上雲」這條路線的持續投入,與同期業界推出的小型高效模型(如 Gemma 2、GPT-4o mini)方向一致,都在爭奪「裝置端 AI」這個新戰場。
業界關注焦點
開發者社群對本次發表的討論,多集中在授權條款與商用限制是否會隨模型能力擴大而收緊,以及視覺版本的實際辨識準確度能否達到可商用門檻。由於 Llama 系列長期是企業自建 AI 系統時最常見的開源選擇之一,這次是否維持開放、可自行部署的特性,將直接影響到已經圍繞 Llama 生態系統打造工具鏈的中小型技術團隊。
對管理者的意義
對管理者而言,這則新聞的重點不在於技術細節,而在於「圖片理解」這項能力正快速從雲端大廠專屬功能,變成可自行部署、成本可控的開源選項——這意味著門市巡檢照片辨識、商品陳列稽核、客服上傳圖片分類等場景,未來有機會用內部自建系統處理,而不必完全依賴外部 AI 服務的按次計費。