DeepSeek發表DeepSeekMath-V2:數學推理模型拿下普特南競賽118/120分
DeepSeek於2025年11月27日發表專精數學推理的DeepSeekMath-V2,在威廉·羅威爾·普特南數學競賽(滿分120分)測驗中拿下118分,遠超官方比較數據中人類代表性高分基準90分,展現AI在高難度數學證明上的突破。
中國AI公司DeepSeek於2025年11月27日發表新模型DeepSeekMath-V2,這是一款專精數學推理與數學證明的模型。官方公布的測試數據顯示,DeepSeekMath-V2在被視為全球最難大學數學競賽之一的「威廉·羅威爾·普特南數學競賽」(William Lowell Putnam Mathematical Competition)滿分120分的測驗中,拿下118分的成績。官方比較數據以90分作為人類參賽者的代表性高分基準(並非普特南競賽有史以來的最高紀錄——該競賽歷史上曾有多次滿分紀錄),以此對照,DeepSeekMath-V2的118分仍明顯展現出遠超一般頂尖人類參賽者的推理表現。
為什麼普特南競賽是硬指標
普特南競賽並非一般計算測驗,而是要求嚴謹的數學證明——考生必須寫出完整、邏輯無漏洞的推導過程,而非只給出最終答案。這類題目長期被視為AI模型的弱項,因為證明需要多步驟的邏輯連貫性,任何一步出錯整題就不算數,無法靠「蒙對答案」矇混過關。DeepSeekMath-V2在這樣的測驗中拿到接近滿分的成績,代表其推理鏈已能維持長距離的邏輯一致性,而非僅止於模式匹配式的解題。
與先前數學模型的差異
過去一年,OpenAI、Google等公司也陸續展示旗下模型在數學競賽(如IMO國際數學奧林匹亞)中的優異表現,但多聚焦於「解題答對」而非「證明過程完整性」。DeepSeekMath-V2的公布數據若屬實,代表其在證明類任務上的訓練方法(可能涉及自我驗證、多步驟推理鏈的強化學習)取得了具體進展,這也呼應了DeepSeek一貫以較低成本追求高階推理能力的技術路線,延續其今年稍早DeepSeek-V3.2-Exp在效率上的突破路線。
業界反應與意義
數學證明能力被視為AI「深度推理」的重要試金石,因為它比一般問答更難靠大量資料記憶取巧。這則消息發布後,業界普遍將其解讀為中國AI廠商在推理類模型(reasoning model)賽道上持續追趕甚至局部超車的又一例證,尤其是在數學與科學類的專精模型上,DeepSeek展現出與OpenAI、Google同台競爭的實力。
對管理者的意義
對管理者而言,這則新聞的重點不在於「AI會算數學」,而是AI在需要嚴謹多步驟邏輯推理的任務上正快速逼近甚至超越頂尖人類水準。這類能力未來可能被下放到供應鏈優化、財務模型驗證、品質分析等需要嚴謹邏輯推導的管理決策場景,值得持續關注這類推理模型何時走出實驗室、進入企業可用的工具形式。