xAI「Colossus」超級電腦上線:10萬張GPU的訓練基地
Elon Musk旗下xAI宣布完成組裝並啟用Colossus超級電腦,搭載10萬張NVIDIA GPU,號稱全球最強AI訓練系統,未來數月將擴增至20萬張晶片,用於訓練下一代Grok模型。
2024年9月3日,Elon Musk旗下的AI新創公司xAI宣布,其代號「Colossus」的AI訓練超級電腦已完成組裝並正式啟用。這套系統搭載10萬張NVIDIA GPU,Musk本人在社群媒體上稱它為「全球最強大的AI訓練系統」。xAI同時透露,計畫在未來數月內將晶片數量擴增到20萬張,其中5萬張將採用NVIDIA新一代H200晶片。Colossus的建置目的十分明確:為xAI後續訓練規模更大、能力更強的Grok模型提供算力基礎。
規模有多驚人
10萬張GPU的訓練叢集,在當時是業界公開規模數一數二的AI訓練系統。相較之下,多數大型語言模型的訓練叢集規模落在數千到兩三萬張GPU之間。xAI選擇一次性堆疊到10萬張,且明確表態要再翻倍到20萬張,等於是用「算力優先」的策略正面對決OpenAI、Google、Meta等長期投入AI研發的巨頭。這也反映出xAI雖然成立時間較晚,但憑藉Musk在資金調度與供應鏈(包含特斯拉、SpaceX的基礎設施經驗)上的能力,試圖用硬體規模彌補時間落差。
與競品的算力軍備競賽
Colossus的上線,等於是把「AI競賽」的戰場從模型演算法延伸到「誰能更快取得、部署更多GPU」。這也呼應近期業界對NVIDIA晶片供不應求的普遍反應——各家公司搶購H100、H200晶片以擴充訓練產能。xAI的做法顯示,即便沒有雲端業務或既有龐大現金流的加持,只要能整合資源、快速建置基礎設施,仍可能在算力規模上迅速追上甚至超越先行者,這也讓外界對Grok系列模型的下一步進展有更高期待。
對管理者的意義
Colossus的故事提醒管理者,AI競爭不只是「誰的模型比較聰明」,基礎建設(算力、供應鏈、資金調度)同樣是決勝關鍵;企業評估導入AI工具或供應商時,也可留意背後算力投入的規模與持續性,這往往預示了未來模型迭代的速度。