Google DeepMind證實:進階版Gemini Deep Think正式達IMO金牌標準
Google DeepMind於2025年7月21日正式宣布,搭載Deep Think增強推理模式的進階版Gemini在2025年國際數學奧林匹亞(IMO)取得金牌級成績,解出6題中5題、總分35/42,延後至週一公布是尊重IMO官方驗證流程的請求。
Google DeepMind於2025年7月21日(週一)在官方部落格正式宣布,一款搭載「Deep Think」增強推理模式的進階版Gemini,在2025年國際數學奧林匹亞(IMO)競賽中正式取得金牌級成績。這款系統解出6道賽題中的5題,總分35分(滿分42分),達到官方認定的金牌門檻。
值得注意的是這次公布的時間點。DeepMind執行長Demis Hassabis表示,團隊之所以選擇延後到週一才對外公布結果,是因為尊重國際數學奧林匹亞主辦方的要求——所有參與測試的AI實驗室,都必須等候IMO官方完成成績正式驗證後才能發布。而OpenAI已於前一個週六就搶先公布了自家模型的IMO成果,兩者發布時間差了約兩天,也讓外界看到不同AI實驗室在「搶發新聞」與「遵守主辦方協議」之間的不同選擇。
技術意義:從解題到「深度思考」
Deep Think並非單純把既有的Gemini模型套上新名字,而是一種強化推理的運算模式,讓模型在給出答案前,能進行更長、更深入的內部推演與自我檢驗,類似人類解數學題時反覆演算、驗算的過程。IMO題目以證明題為主,需要嚴謹的邏輯鏈與多步驟推導,而非單純的知識檢索,因此能拿下金牌等級成績,代表的是模型在「多步驟複雜推理」上的實質進展,而非單純記憶題庫或套用公式。
與同業比較:同場競技、各自表態
這是繼OpenAI稍早公布自家模型於IMO 2025取得類似成績後,第二家公開證實旗下AI在該項國際頂尖數學競賽中達到金牌水準的主要實驗室。兩家公司分數與解題數相近,某種程度顯示「頂尖推理能力」在2025年中已成為多家實驗室同步逼近的技術門檻,而非單一公司的獨門優勢。不過DeepMind特別強調自己是在等候官方驗證後才發布,這也被視為對「未經第三方確認就搶先宣傳成績」做法的一種間接對比與立場表態。
業界反應:信任與驗證的拉鋸
AI模型在數學競賽的表現,一直是外界檢視其推理能力是否被「過度包裝」的重要指標,因為題目公開、對錯客觀、無法靠話術模糊。DeepMind選擇等候官方蓋章認證再發布,某種程度上是在為「AI能力宣稱」建立更嚴謹的第三方驗證慣例,這對整個產業如何看待「模型能力評測」的公信力,會是值得持續觀察的訊號。
對管理者而言,這則新聞的意義不在於「AI會不會解數學題」,而在於推理能力已進入可被公開、嚴格檢驗的競賽場域驗證,這代表未來需要多步驟邏輯推導的內部工作(例如複雜合約條款比對、多情境財務試算),值得留意這類「深度推理模式」何時開放給一般用戶使用。
大家怎麼說 · 4 則留言