OpenAI发布GPT-5.2:首款在专业任务基准上超越人类专家的模型
OpenAI于2025年12月11日发布GPT-5.2,定位为面向专业工作与长时间代理任务的最先进前沿模型,在涵盖44种职业的GDPval基准上首次打平或超越人类专家水平,ChatGPT三个版本与API同步开放。
OpenAI于2025年12月11日正式发布新一代模型GPT-5.2,官方将其定位为当前针对「专业工作」与「长时间运行代理任务」最先进的前沿模型。发布当天,ChatGPT付费方案用户即可使用Instant、Thinking、Pro三个版本,API也同步对所有开发者开放。GPT-5.2具备40万token的上下文窗口,知识截止日为2025年8月31日。
根据官方公布的能力范围,GPT-5.2在制作电子表格、演示文稿、代码编写、图像理解、长上下文理解与工具调用等多个方面均有提升,重点在于能够处理需要多个步骤才能完成的复杂项目,而不仅仅是单一问答。这意味着模型被设计成能在较长时间内连续执行任务、串联多个工具与资源,而非仅限于一次性回复。
GDPval基准:首次打平或超越人类专家
本次发布最受关注的数据,是GPT-5.2 Thinking成为OpenAI首款在GDPval基准上达到或超越人类专家水平的模型。GDPval是一套涵盖44种职业的知识型工作任务评测,设计初衷是模拟真实职场中的专业任务,而非传统学术考题。官方数据显示,GPT-5.2 Thinking在70.9%的比较中,表现打平或超越业界顶尖专业人士。
三版本分工:即时、思考、专业
ChatGPT内的三种版本反映不同使用场景的取舍:Instant适合需要快速响应的日常任务,Thinking版本会投入更多运算进行推理、适合复杂分析与GDPval式的专业任务,Pro版本则针对最高强度、最长时间的工作流程。这种分层让用户依任务复杂度选择速度与质量的平衡点,而非单一模型包打天下。
与前代的差异:从单次回答到多步骤项目执行
相较于前代模型多聚焦于单题问答准确度,GPT-5.2的重点放在「多步骤项目」的完整执行力,例如一连串电子表格整理、演示文稿制作、代码调试与工具调用的组合任务。40万token的上下文窗口也意味着模型能一次性处理更庞大的文档或代码库,减少因记忆断点而需要反复提醒背景信息的情况。
对管理者而言,这则新闻真正的意义不在于「又出现一个更强的模型」,而在于AI工具正逐步从回答问题的角色,转变为能承接完整专业任务段落的执行者。GDPval中70.9%打平或超越专家的数据,值得管理者亲自用团队真实的一份多步骤工作(例如季度报表整理或演示文稿初稿)试跑一次GPT-5.2 Thinking,亲身感受它与过去模型在「完整任务交付」上的差距,再决定如何调整工作分派方式。