专栏 AI 管理编年史 第 148/217 讲 查看课程目录

OpenAI发布GPT-5.2:首款在专业任务基准上超越人类专家的模型

11/12/2025 75
3:46
OpenAI发布GPT-5.2:首款在专业任务基准上超越人类专家的模型

OpenAI于2025年12月11日发布GPT-5.2,定位为面向专业工作与长时间代理任务的最先进前沿模型,在涵盖44种职业的GDPval基准上首次打平或超越人类专家水平,ChatGPT三个版本与API同步开放。

OpenAI于2025年12月11日正式发布新一代模型GPT-5.2,官方将其定位为当前针对「专业工作」与「长时间运行代理任务」最先进的前沿模型。发布当天,ChatGPT付费方案用户即可使用Instant、Thinking、Pro三个版本,API也同步对所有开发者开放。GPT-5.2具备40万token的上下文窗口,知识截止日为2025年8月31日。

根据官方公布的能力范围,GPT-5.2在制作电子表格、演示文稿、代码编写、图像理解、长上下文理解与工具调用等多个方面均有提升,重点在于能够处理需要多个步骤才能完成的复杂项目,而不仅仅是单一问答。这意味着模型被设计成能在较长时间内连续执行任务、串联多个工具与资源,而非仅限于一次性回复。

GDPval基准:首次打平或超越人类专家

本次发布最受关注的数据,是GPT-5.2 Thinking成为OpenAI首款在GDPval基准上达到或超越人类专家水平的模型。GDPval是一套涵盖44种职业的知识型工作任务评测,设计初衷是模拟真实职场中的专业任务,而非传统学术考题。官方数据显示,GPT-5.2 Thinking在70.9%的比较中,表现打平或超越业界顶尖专业人士。

三版本分工:即时、思考、专业

ChatGPT内的三种版本反映不同使用场景的取舍:Instant适合需要快速响应的日常任务,Thinking版本会投入更多运算进行推理、适合复杂分析与GDPval式的专业任务,Pro版本则针对最高强度、最长时间的工作流程。这种分层让用户依任务复杂度选择速度与质量的平衡点,而非单一模型包打天下。

与前代的差异:从单次回答到多步骤项目执行

相较于前代模型多聚焦于单题问答准确度,GPT-5.2的重点放在「多步骤项目」的完整执行力,例如一连串电子表格整理、演示文稿制作、代码调试与工具调用的组合任务。40万token的上下文窗口也意味着模型能一次性处理更庞大的文档或代码库,减少因记忆断点而需要反复提醒背景信息的情况。

对管理者而言,这则新闻真正的意义不在于「又出现一个更强的模型」,而在于AI工具正逐步从回答问题的角色,转变为能承接完整专业任务段落的执行者。GDPval中70.9%打平或超越专家的数据,值得管理者亲自用团队真实的一份多步骤工作(例如季度报表整理或演示文稿初稿)试跑一次GPT-5.2 Thinking,亲身感受它与过去模型在「完整任务交付」上的差距,再决定如何调整工作分派方式。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 NVIDIA发布Nemotron 3开放模型家族,主打多智能体系统低成本部署

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策