DeepSeek发布DeepSeekMath-V2:数学推理模型拿下普特南竞赛118/120分
DeepSeek于2025年11月27日发布专精数学推理的DeepSeekMath-V2,在威廉·罗威尔·普特南数学竞赛(满分120分)测验中拿下118分,远超官方比较数据中人类代表性高分基准90分,展现AI在高难度数学证明上的突破。
中国AI公司DeepSeek于2025年11月27日发布新模型DeepSeekMath-V2,这是一款专精数学推理与数学证明的模型。官方公布的测试数据显示,DeepSeekMath-V2在被视为全球最难大学数学竞赛之一的“威廉·罗威尔·普特南数学竞赛”(William Lowell Putnam Mathematical Competition)满分120分的测验中,拿下118分的成绩。官方比较数据以90分作为人类参赛者的代表性高分基准(并非普特南竞赛有史以来的最高纪录——该竞赛历史上曾有多次满分纪录),以此对照,DeepSeekMath-V2的118分仍明显展现出远超一般顶尖人类参赛者的推理表现。
为什么普特南竞赛是硬指标
普特南竞赛并非一般计算测验,而是要求严谨的数学证明——考生必须写出完整、逻辑无漏洞的推导过程,而非只给出最终答案。这类题目长期被视为AI模型的弱项,因为证明需要多步骤的逻辑连贯性,任何一步出错整题就不算数,无法靠“蒙对答案”蒙混过关。DeepSeekMath-V2在这样的测验中拿到接近满分的成绩,代表其推理链已能维持长距离的逻辑一致性,而非仅止于模式匹配式的解题。
与先前数学模型的差异
过去一年,OpenAI、Google等公司也陆续展示旗下模型在数学竞赛(如IMO国际数学奥林匹亚)中的优异表现,但多聚焦于“解题答对”而非“证明过程完整性”。DeepSeekMath-V2公布的数据若属实,代表其在证明类任务上的训练方法(可能涉及自我验证、多步骤推理链的强化学习)取得了具体进展,这也呼应了DeepSeek一贯以较低成本追求高阶推理能力的技术路线,延续其今年稍早DeepSeek-V3.2-Exp在效率上的突破路线。
业界反应与意义
数学证明能力被视为AI“深度推理”的重要试金石,因为它比一般问答更难靠大量数据记忆取巧。这则消息发布后,业界普遍将其解读为中国AI厂商在推理类模型(reasoning model)赛道上持续追赶甚至局部超车的又一例证,尤其是在数学与科学类的专精模型上,DeepSeek展现出与OpenAI、Google同台竞争的实力。
对管理者的意义
对管理者而言,这则新闻的重点不在于“AI会算数学”,而是AI在需要严谨多步骤逻辑推理的任务上正快速逼近甚至超越顶尖人类水平。这类能力未来可能被下放到供应链优化、财务模型验证、质量分析等需要严谨逻辑推导的管理决策场景,值得持续关注这类推理模型何时走出实验室、进入企业可用的工具形式。