專欄 AI 管理編年史 第 145/217 講 查看課程目錄

DeepSeek發表DeepSeekMath-V2:數學推理模型拿下普特南競賽118/120分

27/11/2025 220
3:35
DeepSeek發表DeepSeekMath-V2:數學推理模型拿下普特南競賽118/120分

DeepSeek於2025年11月27日發表專精數學推理的DeepSeekMath-V2,在威廉·羅威爾·普特南數學競賽(滿分120分)測驗中拿下118分,遠超官方比較數據中人類代表性高分基準90分,展現AI在高難度數學證明上的突破。

中國AI公司DeepSeek於2025年11月27日發表新模型DeepSeekMath-V2,這是一款專精數學推理與數學證明的模型。官方公布的測試數據顯示,DeepSeekMath-V2在被視為全球最難大學數學競賽之一的「威廉·羅威爾·普特南數學競賽」(William Lowell Putnam Mathematical Competition)滿分120分的測驗中,拿下118分的成績。官方比較數據以90分作為人類參賽者的代表性高分基準(並非普特南競賽有史以來的最高紀錄——該競賽歷史上曾有多次滿分紀錄),以此對照,DeepSeekMath-V2的118分仍明顯展現出遠超一般頂尖人類參賽者的推理表現。

為什麼普特南競賽是硬指標

普特南競賽並非一般計算測驗,而是要求嚴謹的數學證明——考生必須寫出完整、邏輯無漏洞的推導過程,而非只給出最終答案。這類題目長期被視為AI模型的弱項,因為證明需要多步驟的邏輯連貫性,任何一步出錯整題就不算數,無法靠「蒙對答案」矇混過關。DeepSeekMath-V2在這樣的測驗中拿到接近滿分的成績,代表其推理鏈已能維持長距離的邏輯一致性,而非僅止於模式匹配式的解題。

與先前數學模型的差異

過去一年,OpenAI、Google等公司也陸續展示旗下模型在數學競賽(如IMO國際數學奧林匹亞)中的優異表現,但多聚焦於「解題答對」而非「證明過程完整性」。DeepSeekMath-V2的公布數據若屬實,代表其在證明類任務上的訓練方法(可能涉及自我驗證、多步驟推理鏈的強化學習)取得了具體進展,這也呼應了DeepSeek一貫以較低成本追求高階推理能力的技術路線,延續其今年稍早DeepSeek-V3.2-Exp在效率上的突破路線。

業界反應與意義

數學證明能力被視為AI「深度推理」的重要試金石,因為它比一般問答更難靠大量資料記憶取巧。這則消息發布後,業界普遍將其解讀為中國AI廠商在推理類模型(reasoning model)賽道上持續追趕甚至局部超車的又一例證,尤其是在數學與科學類的專精模型上,DeepSeek展現出與OpenAI、Google同台競爭的實力。

對管理者的意義

對管理者而言,這則新聞的重點不在於「AI會算數學」,而是AI在需要嚴謹多步驟邏輯推理的任務上正快速逼近甚至超越頂尖人類水準。這類能力未來可能被下放到供應鏈優化、財務模型驗證、品質分析等需要嚴謹邏輯推導的管理決策場景,值得持續關注這類推理模型何時走出實驗室、進入企業可用的工具形式。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 DeepSeek發表V3.2正式版與Speciale推理特化版:稀疏注意力機制成本效率再升級

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策