OpenAI 發表 o1-preview 與 o1-mini,首見「先思考再回答」推理模型
OpenAI 發表新一代推理模型 o1-preview 與 o1-mini,首度採用「先內部思考再回答」設計,在數學、科學與程式任務上表現優於 GPT-4o,初期開放 ChatGPT Plus/Team 用戶並設有訊息額度限制。
OpenAI 於2024年9月12日正式發表新一代模型系列「o1」,包含 o1-preview 與 o1-mini 兩個版本,率先開放給 ChatGPT Plus 與 Team 方案用戶使用。這是 OpenAI 首次推出以「先思考再回答」為核心設計的推理模型——與過去 GPT 系列直接生成答案不同,o1 系列會在正式輸出前,先在內部進行一段較長的思考推理過程,官方稱之為「reasoning」,藉此提升模型處理複雜邏輯、科學研究與程式設計任務的準確度。根據官方公布的評測結果,o1-preview 在數學、程式競賽與博士等級科學問題上的表現,明顯優於前代主力模型 GPT-4o。
上線初期,OpenAI 對兩款模型設有嚴格的使用限制:o1-preview 每週僅可傳送30則訊息,o1-mini 則為每週50則。這樣的限制反映出「思考型」模型背後需要更長的運算時間與運算成本,也是本次發表最值得管理者留意的技術特徵。
技術意義:從「直覺反應」到「深思熟慮」
過去的大型語言模型多半採取「一次生成」策略,看到問題立刻輸出答案,遇到需要多步驟推理的題目時容易出錯。o1 系列的核心突破在於引入類似人類「先想清楚再開口」的內部推理鏈,模型會在使用者看不到的階段反覆檢驗、修正自己的推論路徑,再產出最終答案。這種設計讓回應時間變長,但也讓模型在數學證明、程式除錯、邏輯推導等任務上的正確率大幅提升。
與前代模型的差異
相較於 GPT-4o 強調的「快速、多模態」,o1 系列明顯是針對「準確度優先」的場景所設計,暫不支援圖片輸入、瀏覽網頁或檔案上傳等功能,輸出速度也明顯較慢。這代表 OpenAI 目前是以「兩條產品線」並行的方式經營:GPT-4o 系列負責日常對話與多模態互動,o1 系列則專攻高難度分析與推理工作,兩者互補而非取代。
業界反應
o1 的發表被視為 OpenAI 在「推理能力」賽道上搶先卡位的關鍵一步,也讓「模型是否需要花時間思考」成為業界討論焦點。初期嚴格的訊息額度限制,也讓外界更關注「推理模型」背後的算力成本問題,是否會反映在未來的訂閱定價上。
對管理者而言,o1 系列的意義在於:當團隊面對需要多步驟拆解的複雜問題(例如財務模型交叉驗證、複雜排程規劃、程式邏輯除錯),現在多了一個「先深思再作答」的工具選項,適合用來檢驗一份分析報告的推論是否有漏洞,而非取代日常快速溝通的需求。