Anthropic 發表 Claude Sonnet 4.5:SWE-bench 77.2% 創新高,官方稱「全球最強程式模型」
Anthropic於2025年9月29日發表Claude Sonnet 4.5,官方稱其為全球最強程式模型,SWE-bench Verified達77.2%創新高,可維持專注30小時以上,定價維持不變。
2025年9月29日,Anthropic正式發表新一代模型Claude Sonnet 4.5,官方公告稱其為「全球最強的程式撰寫模型」(the best coding model in the world)。這是Claude Sonnet系列自今年5月推出4.0版本後的最新迭代,模型代號為claude-sonnet-4-5-20250929,已可透過Anthropic API直接呼叫使用。
根據官方公布的基準測試數據,Claude Sonnet 4.5在SWE-bench Verified(軟體工程任務測試集,用於評估模型解決真實GitHub程式碼問題的能力)中取得77.2%的成績,為目前公開紀錄中的新高分。在電腦操作能力測試OSWorld(評估模型操作電腦圖形介面、完成多步驟任務的能力)中,得分為61.4%。Anthropic特別強調,這款模型能在複雜、多步驟的任務中維持專注長達30小時以上,不中斷、不偏離目標。值得注意的是,儘管效能提升,此次定價並未調整——每百萬token輸入3美元、輸出15美元,與前代Claude Sonnet 4完全相同。
技術意義:從「回答問題」到「長時間自主執行」
過去一年AI模型的競爭焦點,逐漸從單次問答的準確度,轉向能否在無人監督下完成長時間、多步驟的任務。Claude Sonnet 4.5所強調的長時間專注能力,指向的正是這個方向:模型不只是回答一個程式問題,而是能像工程師一樣持續規劃、除錯、測試、修正,直到任務完成。這也是SWE-bench Verified這類「真實世界程式碼修復」測試分數持續攀升的原因——測的不是模型知不知道語法,而是能不能像人類工程師一樣拆解問題、動手解決。
定價策略:效能提升,價格不變
此次Claude Sonnet 4.5維持與前代Sonnet 4相同的每百萬token輸入3美元、輸出15美元定價,並未因效能提升而漲價。這種「同價格、更高效能」的策略,延續了近一年AI模型市場的常見走勢:各家廠商透過持續迭代,在既有定價結構下提供更高性價比,藉此鞏固企業客戶與開發者社群的黏著度。
業界反應:程式碼協作工具的潛在洗牌
Claude系列模型,尤其是Sonnet,長期是市場上多數AI輔助編程工具(如程式碼協作平台、IDE整合外掛)的底層引擎選項之一。SWE-bench Verified成績的持續刷新,往往直接影響開發者社群對「該用哪個模型接入工作流程」的選擇。隨著Claude Sonnet 4.5在自主除錯與長時間任務執行上的能力提升,倚賴AI模型完成程式碼撰寫、重構、測試自動化的產品與團隊,預期將重新評估現有的模型供應商配置。
對管理者的意義
Claude Sonnet 4.5展現的「長時間自主執行力」,代表AI工具正逐漸從「輔助員工完成單一小任務」,走向「能被交付一段完整專案、自行規劃執行」的階段。對非技術部門的管理者而言,這則新聞真正該留意的不是程式碼分數本身,而是「AI能不能被信任獨立完成一段完整工作」這個趨勢——未來評估團隊導入AI工具時,除了看模型答得準不準,也該開始關注它能不能自己把一件事從頭做到尾。