專欄 AI 管理編年史 第 83/217 講 查看課程目錄

Google 更新 Gemini 2.0 Flash Thinking Experimental:上下文暴增至百萬 token、新增自主寫程式能力

21/01/2025 261
3:00
Google 更新 Gemini 2.0 Flash Thinking Experimental:上下文暴增至百萬 token、新增自主寫程式能力

Google 於 2025 年 1 月 21 日發表代號 0121 的 Gemini 2.0 Flash Thinking Experimental 更新版,上下文窗口從 3.2 萬 token 暴增至 100 萬 token,並新增可自主撰寫並執行程式碼的能力,數學與科學推理測試分數同步提升,目前於 AI Studio 與 API 免費開放測試。

Google 在 2025 年 1 月 21 日發表更新版的 Gemini 2.0 Flash Thinking Experimental 模型,內部代號「0121」,這是繼 2024 年 12 月推出的實驗版之後的第二次迭代更新。此次更新最引人注目的規格變化,是將模型的上下文窗口從原本的 3.2 萬 token,一口氣擴增至 100 萬 token 輸入,最高可支援 6.4 萬 token 輸出。這代表模型單次可處理的資料量從原本大約幾十頁文件,一舉躍升到能一次讀完數百頁的長文件、整份程式碼庫,或大量會議紀錄。

除了容量提升,這次更新也新增了「原生程式碼執行」(code execution)工具。與過去需要外部串接才能執行程式碼不同,新版模型能在回答問題的過程中,自主判斷是否需要撰寫程式碼、直接執行並依據執行結果修正答案,形成一個「思考、寫程式、驗證、再回答」的閉環。這項能力在前一版本模型中尚未提供。

推理能力的實測提升

根據 Google 公布的基準測試數據,新版本在數學競賽題庫 AIME 2024 的準確率達到 73.3%,在研究生等級科學問答基準 GPQA Diamond 上達到 74.2%,相較前一版本均有明顯進步。這類分數的提升說明模型在多步驟邏輯推理與科學知識應用上的穩定性增強,而非單純的表面優化。

與前代版本的差異定位

此次更新延續 Gemini 2.0 Flash Thinking 系列「先思考再回答」的設計邏輯,模型會先產生一段內部推理過程(reasoning trace),再輸出最終答案。新增的程式碼執行工具,讓這個推理過程不再只停留在文字層面的邏輯演繹,而能透過實際運算驗證假設,這被視為從「純語言推理」邁向「可驗證推理」的關鍵一步,也呼應了業界對於 AI 模型需要具備自我校驗能力的討論方向。

目前這個實驗版本於 Google AI Studio 與 API 免費開放測試,尚未列為正式發布(GA)版本,供開發者與研究人員搶先試用並回饋意見。

對管理者的意義

百萬級上下文窗口意味著未來可以把整份年度報告、完整合約檔案或大量客服紀錄一次性交給 AI 分析,不必再拆段餵資料;而自主程式碼執行能力,則讓 AI 在處理數據運算、報表核對這類需要精確計算的任務時更值得信賴,值得留意這類「會自己驗算」的模型未來在營運分析上的應用潛力。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 OpenAI 發表 Operator:能自己動手操作瀏覽器的AI代理研究預覽版

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策