专栏 AI 管理编年史 第 101/217 讲 查看课程目录

OpenAI 发布 o3 与 o4-mini:推理模型首次能自主调用全部工具

16/04/2025 152
3:58
OpenAI 发布 o3 与 o4-mini:推理模型首次能自主调用全部工具

OpenAI 正式发布新一代推理模型 o3 与 o4-mini,登陆 ChatGPT 与 API。o3 被官方称为目前最先进的推理模型,首次能自主判断并组合网页搜索、Python 数据分析、图片深度推理与图片生成等工具,不需用户逐一指定。

OpenAI 于 2025 年 4 月 16 日正式发布新一代推理模型 o3 与 o4-mini,同步登陆 ChatGPT 与 API。官方将 o3 定位为“目前最先进的推理模型”,在数学、编程、复杂推理、科学问题与视觉理解等多项测试上超越前代模型。o4-mini 则是规模较小、面向快速且具成本效益推理场景的版本,在数学与编程任务上表现优异,官方指出它是 AIME 2024 与 AIME 2025 数学竞赛基准测试上表现最好的已知模型之一。

技术意义:从“回答问题”到“自主调度工具”

这次发布最关键的变化,不是单纯的分数提升,而是 o3 与 o4-mini 首次具备“自主调用并组合 ChatGPT 内所有工具”的能力。过去用户若想让 AI 上网查资料、分析上传的文件、或针对图片做深度推理,往往需要手动切换功能或明确指令告诉模型“请用网页搜索”。这一代模型则能在推理过程中自行判断这一步该用哪个工具,包括网页搜索、用 Python 分析上传的数据与文件、对图片进行视觉推理,甚至自主决定生成图片来辅助说明。换句话说,工具的选择与调用本身,也成为了模型“推理”的一部分,而不是用户操作界面的一部分。

与前代模型的差异

在此之前,OpenAI 的推理模型(如 o1 系列)虽然擅长拆解复杂问题、逐步思考,但工具使用仍相对受限或需要额外设置。o3 与 o4-mini 把“多工具协同”正式内建进推理链路,意味着同一个提问,模型可能会先上网查最新数据、再用代码跑一次计算、最后生成图表佐证答案——整个过程用户只需问一个问题。这也呼应近期业界推理模型的共同走向:单纯比拼分数的边际效益正在下降,真正的竞争点转向“模型能不能像一个具备多种技能的助理一样,自己规划该做什么”。

业界反应

o3 与 o4-mini 发布后,普遍被视为 OpenAI 在“智能体化”(agentic)方向上的又一步——与其单纯比拼基准测试分数,更强调模型能否在真实任务中自主串联多个步骤完成工作。这也让 o3/o4-mini 与同期各家厂商力推的“工具调用”“多步骤自主任务”方向更为接近,被视为推理模型从实验室指标走向实际生产力工具的一个信号。

对管理者的意义

这次更新对管理者最直接的启示是:未来交办给 AI 的任务,可以更接近“交办给一个懂得自己找资料、会写代码验算、也能画图说明的助理”,而不是“一问一答的查询工具”。日常若需要快速厘清一份数据、比对市场信息或整理报表逻辑,值得先试着把完整问题一次讲清楚,观察 AI 是否能自己规划出合理的处理步骤,再评估是否放心把类似的重复性分析工作交给它处理。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 NVIDIA NeMo微服务平台正式全面开放,企业打造专属AI代理有了现成积木

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策