OpenAI 预告新一代推理模型 o3/o3-mini:AIME 拿下96.7%高分
OpenAI 在「12 Days of OpenAI」压轴活动预告新一代推理模型 o3 与精简版 o3-mini,命名跳过「o2」以避开商标冲突。官方基准测试显示 o3 在数学、科学、编程三项指标上大幅超越前代 o1,但目前仅开放安全研究人员申请早期访问。
OpenAI 在为期12天的「12 Days of OpenAI」系列活动压轴(第12天),正式预告下一代推理模型 o3 与其精简版 o3-mini。值得注意的是,命名直接从 o1 跳到 o3,官方说明是为了避免与英国电信品牌 O2 的商标产生冲突。
根据 OpenAI 公布的基准测试数据,o3 在2024年美国数学邀请赛(AIME)拿下96.7%的高分成绩;在研究生等级的科学题目测试 GPQA Diamond 上达到87.7%;在编程基准 SWE-Bench Verified 上,比前代 o1 高出22.8个百分点。这些数字若属实,代表 o3 在数学推理、科学知识与实际编程能力上,都较前代有明显跃进。
不过需要注意,这次是「预告」而非正式公开上线。OpenAI 目前只开放安全与信息安全研究人员申请早期访问,用来在正式发布前进行红队测试与风险评估。至于精简版 o3-mini,官方表示要到2025年初才会正式对外发布,供一般开发者与消费者使用。
为何刻意跳过「o2」这个命名
模型命名看似小事,但反映出 AI 巨头在全球商标与品牌布局上的谨慎。O2 是英国知名电信运营商的注册商标,OpenAI 选择直接跳号避免法律纠纷,也显示大型科技公司在快速迭代产品时,仍必须兼顾知识产权的合规成本。
基准分数的意义与局限
AIME、GPQA Diamond、SWE-Bench Verified 都是业界惯用的推理能力指标,分别对应数学竞赛题、研究生科学知识、真实世界代码修复任务。o3 在三项测试的表现若成立,代表其「思维链」式推理能力持续进化,尤其 SWE-Bench 22.8个百分点的跃进,意味着 AI 在理解复杂代码库、定位错误根因的能力上更接近资深工程师水平。但基准测试终究是官方自行公布的数字,缺乏第三方独立验证,实际表现仍待正式开放后由社区检验。
为何选择「预告不公开」的节奏
相较于过去新模型多半直接开放付费使用,o3 这次先只让安全研究人员申请访问,反映业界对「能力越强、风险评估越需要时间」的共识。这也呼应近年 AI 圈对高阶推理模型可能被滥用(例如生成攻击性代码、规避安全机制)的持续讨论,OpenAI 选择用先封闭测试、后分阶段开放的方式应对。
对管理者的意义
o3-mini 要到2025年初才会正式发布,意味着现阶段管理者不必急着调整技术选型,但可以开始关注:一旦具备研究生级科学推理与更强代码调试能力的模型进入市场,哪些内部流程(例如质检报告分析、技术文档审阅)有机会率先受益,提前规划导入评估的时间表与预算,才不会在正式开放时措手不及。