專欄 AI 管理編年史 第 118/217 講 查看課程目錄

Google DeepMind證實:進階版Gemini Deep Think正式達IMO金牌標準

21/07/2025 185
3:57
Google DeepMind證實:進階版Gemini Deep Think正式達IMO金牌標準

Google DeepMind於2025年7月21日正式宣布,搭載Deep Think增強推理模式的進階版Gemini在2025年國際數學奧林匹亞(IMO)取得金牌級成績,解出6題中5題、總分35/42,延後至週一公布是尊重IMO官方驗證流程的請求。

Google DeepMind於2025年7月21日(週一)在官方部落格正式宣布,一款搭載「Deep Think」增強推理模式的進階版Gemini,在2025年國際數學奧林匹亞(IMO)競賽中正式取得金牌級成績。這款系統解出6道賽題中的5題,總分35分(滿分42分),達到官方認定的金牌門檻。

值得注意的是這次公布的時間點。DeepMind執行長Demis Hassabis表示,團隊之所以選擇延後到週一才對外公布結果,是因為尊重國際數學奧林匹亞主辦方的要求——所有參與測試的AI實驗室,都必須等候IMO官方完成成績正式驗證後才能發布。而OpenAI已於前一個週六就搶先公布了自家模型的IMO成果,兩者發布時間差了約兩天,也讓外界看到不同AI實驗室在「搶發新聞」與「遵守主辦方協議」之間的不同選擇。

技術意義:從解題到「深度思考」

Deep Think並非單純把既有的Gemini模型套上新名字,而是一種強化推理的運算模式,讓模型在給出答案前,能進行更長、更深入的內部推演與自我檢驗,類似人類解數學題時反覆演算、驗算的過程。IMO題目以證明題為主,需要嚴謹的邏輯鏈與多步驟推導,而非單純的知識檢索,因此能拿下金牌等級成績,代表的是模型在「多步驟複雜推理」上的實質進展,而非單純記憶題庫或套用公式。

與同業比較:同場競技、各自表態

這是繼OpenAI稍早公布自家模型於IMO 2025取得類似成績後,第二家公開證實旗下AI在該項國際頂尖數學競賽中達到金牌水準的主要實驗室。兩家公司分數與解題數相近,某種程度顯示「頂尖推理能力」在2025年中已成為多家實驗室同步逼近的技術門檻,而非單一公司的獨門優勢。不過DeepMind特別強調自己是在等候官方驗證後才發布,這也被視為對「未經第三方確認就搶先宣傳成績」做法的一種間接對比與立場表態。

業界反應:信任與驗證的拉鋸

AI模型在數學競賽的表現,一直是外界檢視其推理能力是否被「過度包裝」的重要指標,因為題目公開、對錯客觀、無法靠話術模糊。DeepMind選擇等候官方蓋章認證再發布,某種程度上是在為「AI能力宣稱」建立更嚴謹的第三方驗證慣例,這對整個產業如何看待「模型能力評測」的公信力,會是值得持續觀察的訊號。

對管理者而言,這則新聞的意義不在於「AI會不會解數學題」,而在於推理能力已進入可被公開、嚴格檢驗的競賽場域驗證,這代表未來需要多步驟邏輯推導的內部工作(例如複雜合約條款比對、多情境財務試算),值得留意這類「深度推理模式」何時開放給一般用戶使用。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。

大家怎麼說 · 4 則留言

麗華採購經理
Excel 硬算超累,什麼時候能用上啦?
06/05/2026 09:33
夾心餅乾主管採購經理
同行+1,完全有感。
18/08/2026 17:51
家榮
談價格都要一邊看成本、一邊看漲跌、一邊評估產能,有時候要算 3、4 個情境才敢定案。DeepMind 說的『多步驟推理』,老實說正是我們每天在幹的事。
24/09/2025 05:31
職場邊緣人
企劃案也要算好幾套方案,同感!
19/12/2025 10:24
下一講・AI 管理編年史 Anthropic發表Claude Opus 4.1:程式撰寫能力再提升

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策