OpenAI 發表 GPT-5.2:首款在專業任務基準上超越人類專家的模型
OpenAI於2025年12月11日發表GPT-5.2,定位為針對專業工作與長時間代理任務最先進的前沿模型,在涵蓋44種職業的GDPval基準上首度打平或超越人類專家水準,ChatGPT三版本與API同步開放。
OpenAI於2025年12月11日正式發表新一代模型GPT-5.2,官方將其定位為目前針對「專業工作」與「長時間運行代理任務」最先進的前沿模型。發表當天,ChatGPT付費方案用戶即可使用Instant、Thinking、Pro三種版本,API也同步對所有開發者開放。GPT-5.2具備40萬token的上下文窗口,知識截止日為2025年8月31日。
根據官方公布的能力範圍,GPT-5.2在製作試算表、簡報、程式撰寫、圖像理解、長上下文理解與工具調用等多個面向皆有提升,重點在於能處理需要多個步驟才能完成的複雜專案,而不只是單一問答。這意味著模型被設計成能在較長時間內連續執行任務、串接多個工具與資源,而非僅止於一次性回覆。
GDPval基準:首度打平或超越人類專家
本次發表最受矚目的數據,是GPT-5.2 Thinking成為OpenAI首款在GDPval基準上達到或超越人類專家水準的模型。GDPval是一套涵蓋44種職業的知識型工作任務評測,設計初衷是模擬真實職場中的專業任務,而非傳統學術考題。官方數據顯示,GPT-5.2 Thinking在70.9%的比較中,表現打平或超越業界頂尖專業人士。
三版本分工:即時、思考、專業
ChatGPT內的三種版本反映不同使用情境的取捨:Instant適合需要快速回應的日常任務,Thinking版本會投入更多運算進行推理、適合複雜分析與GDPval式的專業任務,Pro版本則鎖定最高強度、最長時間的工作流程。這種分層讓使用者依任務複雜度選擇速度與品質的平衡點,而非單一模型打天下。
與前代的差異:從單次回答到多步驟專案執行
相較於前代模型多聚焦於單題問答準確度,GPT-5.2的重點放在「多步驟專案」的完整執行力,例如一連串試算表整理、簡報製作、程式除錯與工具調用的組合任務。40萬token的上下文窗口也代表模型能一次性處理更龐大的文件或程式碼庫,減少因記憶斷點而需要反覆提醒背景資訊的狀況。
對管理者而言,這則新聞真正的意義不在於「又有一個更強的模型」,而在於AI工具正逐步從回答問題的角色,轉為能承接完整專業任務段落的執行者。GDPval的70.9%打平或超越專家數據,值得管理者親自用團隊真實的一份多步驟工作(例如季度報表整理或簡報草擬)試跑一次GPT-5.2 Thinking,親身感受它與過去模型在「完整任務交付」上的差距,再決定如何調整工作分派方式。