Google DeepMind证实:进阶版Gemini Deep Think正式达IMO金牌标准
Google DeepMind于2025年7月21日正式宣布,搭载Deep Think增强推理模式的进阶版Gemini在2025年国际数学奥林匹克(IMO)取得金牌级成绩,解出6题中5题、总分35/42,延后至周一公布是尊重IMO官方验证流程的请求。
Google DeepMind于2025年7月21日(周一)在官方博客正式宣布,一款搭载“Deep Think”增强推理模式的进阶版Gemini,在2025年国际数学奥林匹克(IMO)竞赛中正式取得金牌级成绩。该系统解出6道赛题中的5题,总分35分(满分42分),达到官方认定的金牌门槛。
值得注意的是这次公布的时间点。DeepMind首席执行官Demis Hassabis表示,团队之所以选择延后到周一才对外公布结果,是出于对国际数学奥林匹克主办方要求的尊重——所有参与测试的AI实验室,都必须等候IMO官方完成成绩正式验证后才能发布。而OpenAI已于前一个周六就抢先公布了自家模型的IMO成果,两者发布时间相差约两天,也让外界看到不同AI实验室在“抢发新闻”与“遵守主办方协议”之间的不同选择。
技术意义:从解题到“深度思考”
Deep Think并非单纯把既有的Gemini模型套上新名字,而是一种强化推理的运算模式,让模型在给出答案前,能进行更长、更深入的内部推演与自我检验,类似人类解数学题时反复演算、验算的过程。IMO题目以证明题为主,需要严谨的逻辑链与多步骤推导,而非单纯的知识检索,因此能拿下金牌级成绩,代表的是模型在“多步骤复杂推理”上的实质进展,而非单纯记忆题库或套用公式。
与同业比较:同场竞技、各自表态
这是继OpenAI稍早公布自家模型于IMO 2025取得类似成绩后,第二家公开证实旗下AI在该项国际顶尖数学竞赛中达到金牌水准的主要实验室。两家公司分数与解题数相近,某种程度显示“顶尖推理能力”在2025年中已成为多家实验室同步逼近的技术门槛,而非单一公司的独门优势。不过DeepMind特别强调自己是在等候官方验证后才发布,这也被视为对“未经第三方确认就抢先宣传成绩”做法的一种间接对比与立场表态。
业界反应:信任与验证的拉锯
AI模型在数学竞赛中的表现,一直是外界检视其推理能力是否被“过度包装”的重要指标,因为题目公开、对错客观、无法靠话术模糊。DeepMind选择等候官方盖章认证再发布,某种程度上是在为“AI能力宣称”建立更严谨的第三方验证惯例,这对整个产业如何看待“模型能力评测”的公信力,会是值得持续观察的信号。
对管理者而言,这则新闻的意义不在于“AI会不会解数学题”,而在于推理能力已进入可被公开、严格检验的竞赛场域验证,这代表未来需要多步骤逻辑推导的内部工作(例如复杂合同条款比对、多情境财务试算),值得留意这类“深度推理模式”何时开放给一般用户使用。