專欄 AI 管理編年史 第 108/217 講 查看課程目錄

Anthropic 發表 Claude Opus 4 與 Claude Sonnet 4:全球最佳程式撰寫模型登場

22/05/2025 144
4:13
Anthropic 發表 Claude Opus 4 與 Claude Sonnet 4:全球最佳程式撰寫模型登場

Anthropic正式發表混合推理模型Claude Opus 4與Sonnet 4,Opus 4號稱全球最佳程式撰寫模型,SWE-bench達72.5%;兩款模型即日起開放Pro、Max、Team、Enterprise與免費用戶,並上架API、Bedrock、Vertex AI。

2025年5月22日,Anthropic正式發表新一代模型Claude Opus 4與Claude Sonnet 4。兩款模型皆採「混合推理」架構,使用者可依任務需求,選擇近乎即時回應的一般模式,或啟動延伸思考模式進行更深入的推理,兼顧速度與深度。這是Anthropic繼2月推出Claude 3.7 Sonnet與Claude Code之後,時隔三個月的重大版本更新。

Claude Opus 4是Anthropic目前為止最強大的模型,官方將其定位為「全球最佳程式撰寫模型」。在衡量真實軟體工程任務解決能力的SWE-bench基準測試中,Opus 4達到72.5%的表現;在測量模型操作終端機、執行多步驟指令能力的Terminal-bench上,則達到43.2%。Claude Sonnet 4則是今年2月發表的Sonnet 3.7的重大升級版本,程式撰寫與推理能力皆有顯著提升,並且能更精準地依循使用者下達的指令,減少過去模型「自作主張」偏離原始要求的問題。

技術意義:從單一回應模式走向混合推理

過去的大型語言模型多半只有一種回應方式,使用者若想要更嚴謹的推理,往往得另外呼叫「思考版」模型。Claude Opus 4與Sonnet 4把兩種模式整合進同一個模型,讓使用者能依任務難度動態切換:簡單查詢用即時模式節省成本與等待時間,複雜的程式除錯或多步驟規劃則切換到延伸思考模式,換取更高的準確度。這種「一個模型、兩種速度」的設計,反映業界正從單純比拼模型規模,轉向比拼推理資源的彈性調度。

與前代比較:程式撰寫能力成為主戰場

Anthropic把這次發表的重心明確放在「程式撰寫」而非泛用對話能力,SWE-bench與Terminal-bench兩項基準都是專門用來評估模型能否像工程師一樣理解程式碼庫、修復真實錯誤、操作命令列。相較於3.7版本,Sonnet 4在依循指令的精準度上被特別強調,顯示Anthropic正在回應企業用戶「模型太自主、不聽話」的常見抱怨,把可控性列為與能力同等重要的產品指標。

開放範圍:從付費方案一路下放到免費用戶

兩款模型與延伸思考功能,即日起開放Pro、Max、Team與Enterprise方案用戶使用;值得注意的是,Sonnet 4也同步開放給免費用戶,讓一般使用者無需付費即可體驗新一代模型。此外,Opus 4與Sonnet 4也同步上架於Anthropic API、Amazon Bedrock與Google Cloud Vertex AI三大管道,方便企業將模型整合進既有雲端架構。定價維持過去水準未調漲:Opus 4為每百萬token輸入15美元、輸出75美元;Sonnet 4為每百萬token輸入3美元、輸出15美元,顯示Anthropic選擇以效能升級而非漲價作為此次發表的訴求。

對管理者的意義

對於管理者而言,這次發表最值得留意的不是技術參數本身,而是「免費用戶也能用到主力新模型」與「三大雲端平台同步上架」這兩個訊號——代表企業導入AI協作工具的門檻正持續降低,若團隊尚未評估將Claude用於程式碼審查、系統除錯或內部工具開發,這是重新盤點的好時機。

適用產業: 電商社群銷售
測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 DeepSeek 發表 R1-0528 更新版:推理準確率大躍進,開源商用免費用

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策