專欄 AI 管理編年史 第 117/217 講 查看課程目錄

OpenAI實驗推理模型解出IMO六題中五題 達人類金牌水準

19/07/2025 259
4:16
OpenAI實驗推理模型解出IMO六題中五題 達人類金牌水準

OpenAI於2025年7月19日宣布,一款通用型實驗推理模型在國際數學奧林匹亞(IMO)取得金牌級成績,六題解出五題、總分35分,且全程未使用任何外部工具,純靠語言模型自身推理產生證明過程。

2025年7月19日,OpenAI在其官方X(前Twitter)帳號宣布一項重要成果:一款通用型實驗推理大型語言模型,在2025年國際數學奧林匹亞(IMO)競賽中取得「金牌級」成績。這項競賽是全球高中生數學能力的最高殿堂,題目以證明題為主,難度極高、且每年題目全新設計,考驗的不只是計算能力,更是創造性的邏輯推導。根據OpenAI公布的結果,這款模型在六道世界級難題中成功解出五題,總分達到35分(滿分42分),已達到人類頂尖參賽者的水準。

關鍵在於「完全不用工具」

這則新聞最值得管理者留意的技術細節,是OpenAI特別強調模型在解題過程中「完全未使用任何外部工具」——沒有計算機、沒有程式碼執行環境、沒有搜尋引擎輔助,純粹以語言模型的next-token預測方式,一步步生成具創意的數學證明。這與過去許多AI解數學題的做法不同:先前常見的路徑是讓模型呼叫Python或符號運算工具來輔助計算。而這次的成果顯示,模型本身的推理鏈已經能夠獨立完成高難度、前所未見題目的邏輯建構,而不僅是套用已知公式或檢索記憶中的解法。

與此前的推理模型相比,意義何在

在此之前,業界已有多款強調「推理」能力的模型陸續發布,但多數的公開展示集中在程式能力、一般邏輯題或標準化考試分數上。IMO證明題的特殊之處在於:題目要求的不是找出「正確答案」,而是寫出一段嚴謹、有創意、步驟完整的證明過程,且每年考題全新出題,模型不可能靠訓練資料中「背過類似題目」取巧。這代表模型展現的是接近人類數學家在面對全新問題時的創造性推理能力,而非單純的模式比對,這也是IMO金牌成績在AI研究圈被視為重要里程碑的原因。

業界反應:肯定與保留並存

消息公布後,AI研究社群普遍將此視為推理模型能力邊界的一次顯著突破,尤其是「零工具」這一點被反覆討論,被認為代表模型內部推理機制的成熟度提升。不過也有聲音提醒,這是實驗性模型的競賽成果展示,距離該能力被打包進一般用戶可用的產品、並穩定套用在真實世界的開放性問題上,仍有一段距離;比賽題目雖困難,但終究是「有標準答案可驗證」的封閉式問題,與企業日常面對的模糊、多變數決策情境並不完全相同。

對管理者的意義

這則新聞提醒管理者:AI在「深度邏輯推理與創造性問題拆解」上的能力正快速逼近甚至部分超越人類頂尖水準,未來一段時間值得持續關注這類推理模型何時、以何種形式進入日常可用的產品(例如複雜財務模型驗證、供應鏈排程的多變數推演、產品設計的邏輯論證),並提早思考:當AI能協助團隊處理原本需要頂尖人才才能拆解的難題時,管理者自身該把時間更聚焦在哪些「AI仍難以取代」的判斷與溝通工作上。

適用產業: 製造業 電商社群銷售
測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 Google DeepMind證實:進階版Gemini Deep Think正式達IMO金牌標準

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策