NVIDIA 發表 Llama-3.1-Nemotron-70B-Instruct:不重新訓練也能讓開源模型更聽話
NVIDIA 於2024年10月中旬發表 Llama-3.1-Nemotron-70B-Instruct,以Meta的Llama 3.1 70B為底、透過自家對齊技術微調,宣稱在指令遵循類評測上超越原始模型甚至部分更大型模型,展示「微調既有模型」也是提升AI能力的可行路線。
NVIDIA 在2024年10月中旬發表新模型「Llama-3.1-Nemotron-70B-Instruct」,並同步在 Hugging Face 平台上架釋出權重供研究與商用測試。這個模型並非從零訓練,而是以 Meta 稍早釋出的 Llama 3.1 70B 為基礎架構,NVIDIA 團隊在其上套用自家研發的對齊(Alignment)技術,針對「人類偏好優化」進行微調,目標是讓模型更精準地理解並遵循使用者下達的指令。根據 NVIDIA 官方公布的評測數據,這個微調後的版本在多項需要嚴格遵循指令格式與內容要求的評測基準上,表現優於原始的 Llama 3.1 70B,在部分項目甚至超越參數規模更大的模型。
技術意義:微調也能是一條路
這則新聞值得留意的重點,不在於模型本身的參數量或架構有多創新,而在於它示範了另一種提升AI表現的技術路線。過去一年業界的主旋律多半是「把模型做得更大」,但NVIDIA這次站在Meta已訓練好的Llama 3.1 70B之上,僅透過對齊微調就讓表現明顯提升,代表對齊技術的投資報酬率可能相當高:不必從頭燒算力訓練新的基礎模型,用精心設計的人類偏好資料微調既有開源模型,就能榨出額外效能。
與原版及同業比較
對照原始的 Llama 3.1 70B,Nemotron版本在「指令遵循」這個維度上的提升尤其明顯——模型不是「不會」而是「沒有被教會怎麼聽懂人類真正想要什麼」。NVIDIA宣稱部分評測結果甚至優於參數規模更大的模型,等於是用巧勁而非蠻力取勝,也呼應了近期業界「小而精」與「大而全」路線並行發展的觀察。
業界反應
由於Nemotron是建立在Meta開源的Llama 3.1之上,這次發表也再度凸顯開源生態系的價值:任何有能力做微調技術的團隊,都能在別人開源的基礎模型上「加值」,推出自己的優化版本,讓開源社群裡愈來愈多針對特定能力(如指令遵循、程式碼生成)做垂直優化的衍生模型出現。對管理者而言,這提醒評估AI模型時除了看「參數規模」,更該關注模型在「聽懂並確實執行指令」上的實測表現——畢竟企業內部AI助理多半用來執行明確任務(整理報告、回覆制式問題、依格式產出文件),對齊優化後的模型往往比單純更大的模型更貼近實際需求。