Google 發表 Gemini 1.5 Pro:百萬 token 上下文窗口是什麼概念
Google 於 2024 年 2 月 15 日發表下一代模型 Gemini 1.5,採用全新 Mixture-of-Experts 架構。旗艦版 Gemini 1.5 Pro 效能追平前代最大模型 1.0 Ultra,最大亮點是可穩定處理長達 100 萬 token 的上下文,相當於一小時影片、11 小時音訊或超過 3 萬行程式碼,目前以有限預覽形式開放給開發者與企業客戶測試。
2024 年 2 月 15 日,Google 發表新一代模型家族 Gemini 1.5,距離 Gemini 1.0 正式發表不到三個月。這次發表的重點是首發旗艦版本 Gemini 1.5 Pro,採用了與前代不同的 Mixture-of-Experts(專家混合,簡稱 MoE)架構——這種架構讓模型在推論時只啟動部分「專家」子網路來處理特定任務,而非每次都動用整個模型,藉此在維持甚至提升效能的同時,大幅降低訓練與運算成本。根據 Google 公布的基準測試,Gemini 1.5 Pro 在多數評測項目上已經超越前代的 1.0 Pro,效能表現接近當時 Google 陣容中最強大的 1.0 Ultra。
但這次發表真正引起業界關注的,並不是基準分數的提升,而是「上下文窗口」的規格。Gemini 1.5 Pro 可以穩定處理長達 100 萬 token 的輸入內容——換算成實際材料,大約等於一小時的影片、11 小時的音訊,或是超過 3 萬行程式碼、逾 70 萬字的文字文件。這個數字在當時是業界公開發表過最長的上下文窗口,遠超過同時期 GPT-4 Turbo 的 12.8 萬 token,也超越 Claude 2.1 的 20 萬 token。目前 Gemini 1.5 Pro 尚未全面開放,而是先以有限預覽(limited preview)形式,透過 Google AI Studio 與 Vertex AI 提供給開發者與企業客戶申請試用。
技術意義:為什麼「上下文長度」是關鍵指標
過去大型語言模型受限於上下文窗口大小,處理長文件或長影片時,往往需要先把內容切成片段、分批餵給模型,再自行拼接回答,這個過程容易漏掉片段之間的關聯資訊。100 萬 token 等級的上下文窗口,代表模型可以一次「讀完」一整份長篇合約、一整場會議錄影,甚至一整套程式碼庫,並在其中準確定位特定細節——Google 在發表時展示的其中一個測試,是要求模型在近 70 萬字的文本中找出一句被刻意藏入的特定句子,模型準確找到並回答。這種能力被稱為「長上下文檢索」(needle-in-a-haystack),是評估超長上下文模型是否真的「有讀進去」而非「隨便應付」的重要指標。
與前代及競品的比較
相較於 Gemini 1.0,1.5 Pro 不只是上下文變長,MoE 架構本身也代表訓練效率的路線轉變——用更少的運算資源達到接近旗艦模型的效果。相較於同期競品,OpenAI 的 GPT-4 Turbo 上下文為 12.8 萬 token、Anthropic 的 Claude 2.1 為 20 萬 token,Gemini 1.5 Pro 的 100 萬 token 是數倍到近十倍的差距,等於是把「模型能一次處理多少內容」這個賽道直接拉開一個量級。不過這也是有限預覽階段的規格展示,實際大規模開放後的穩定性、延遲與費用,仍待後續觀察。
業界反應
發表後,開發者社群與科技媒體的討論焦點集中在「超長上下文是否會取代 RAG(檢索增強生成)架構」——如果模型能直接吞下整份知識庫,還需要額外做向量檢索、切片索引這些工程嗎?多數評論認為兩者短期內會並存:超長上下文適合處理單一大型文件或影音素材的深度分析,RAG 則仍適合面對持續更新、規模遠超過百萬 token 的知識庫。這也讓 Gemini 1.5 Pro 被視為 Google 在「長文件理解」這個應用場景上,向 OpenAI 與 Anthropic 拋出的一記重拳。
對管理者的意義
對管理者而言,這則新聞的重點不在於技術架構,而在於一個具體可能性:未來把一整份年度合約、一整場董事會錄影或一整套內部規章,直接交給 AI 一次讀完並回答問題,不再需要事先拆解摘要,理論上已經可行。企業導入前仍須留意公開預覽階段的穩定性與資安考量,但這代表「文件審閱」「會議記錄整理」這類高工時任務,未來有機會被大幅壓縮。