專欄 AI 管理編年史 第 79/217 講 查看課程目錄

OpenAI 預告新一代推理模型 o3/o3-mini:AIME 拿下96.7%高分

20/12/2024 260
4:07
OpenAI 預告新一代推理模型 o3/o3-mini:AIME 拿下96.7%高分

OpenAI 在「12 Days of OpenAI」壓軸活動預告新一代推理模型 o3 與精簡版 o3-mini,命名跳過「o2」以避開商標衝突。官方基準測試顯示 o3 在數學、科學、程式設計三項指標上大幅超越前代 o1,但目前僅開放安全研究人員申請早期存取。

OpenAI 在為期12天的「12 Days of OpenAI」系列活動壓軸(第12天),正式預告下一代推理模型 o3 與其精簡版 o3-mini。值得注意的是,命名直接從 o1 跳到 o3,官方說明是為了避免與英國電信品牌 O2 的商標產生衝突。

根據 OpenAI 公布的基準測試數據,o3 在2024年美國數學邀請賽(AIME)拿下96.7%的高分成績;在研究生等級的科學題目測驗 GPQA Diamond 上達到87.7%;在程式設計基準 SWE-Bench Verified 上,比前代 o1 高出22.8個百分點。這些數字若屬實,代表 o3 在數學推理、科學知識與實際寫程式能力上,都較前代有明顯躍進。

不過需要注意,這次是「預告」而非正式公開上線。OpenAI 目前只開放安全與資安研究人員申請早期存取,用來在正式發布前進行紅隊測試與風險評估。至於精簡版 o3-mini,官方表示要到2025年初才會正式對外釋出,供一般開發者與消費者使用。

為何刻意跳過「o2」這個命名

模型命名看似小事,但反映出 AI 巨頭在全球商標與品牌布局上的謹慎。O2 是英國知名電信業者的註冊商標,OpenAI 選擇直接跳號避免法律糾紛,也顯示大型科技公司在快速迭代產品時,仍必須兼顧智慧財產權的合規成本。

基準分數的意義與侷限

AIME、GPQA Diamond、SWE-Bench Verified 都是業界慣用的推理能力指標,分別對應數學競賽題、研究生科學知識、真實世界程式碼修復任務。o3 在三項測試的表現若成立,代表其「思考鏈」式推理能力持續進化,尤其 SWE-Bench 22.8個百分點的躍進,意味著 AI 在理解複雜程式庫、定位錯誤根因的能力上更接近資深工程師水準。但基準測試終究是官方自行公布的數字,缺乏第三方獨立驗證,實際表現仍待正式開放後由社群檢驗。

為何選擇「預告不公開」的節奏

相較於過去新模型多半直接開放付費使用,o3 這次先只讓安全研究人員申請存取,反映業界對「能力愈強、風險評估愈需要時間」的共識。這也呼應近年 AI 圈對高階推理模型可能被濫用(例如生成攻擊性程式碼、規避安全機制)的持續討論,OpenAI 選擇用先封閉測試、後分階段開放的方式因應。

對管理者的意義

o3-mini 要到2025年初才會正式釋出,意味著現階段管理者不必急著調整技術選型,但可以開始關注:一旦具備研究生級科學推理與更強程式除錯能力的模型進入市場,哪些內部流程(例如品保報告分析、技術文件審閱)有機會率先受益,提前規劃導入評估的時程與預算,才不會在正式開放時措手不及。

適用產業: 製造業 電商社群銷售
測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 NVIDIA CES 2025發表Project DIGITS個人AI超級電腦與Cosmos世界基礎模型

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策