Anthropic發表Claude Opus 4.1:程式撰寫能力再提升
Anthropic於2025年8月5日推出Claude Opus 4.1,作為Opus 4的升級版,強化程式撰寫、深度研究與代理式搜尋能力,SWE-bench Verified分數提升至74.5%,定價與前代相同。
Anthropic於2025年8月5日發表新模型Claude Opus 4.1(模型代號claude-opus-4-1-20250805),定位為Claude Opus 4的升級版本,重點強化「代理任務」(agentic tasks)、真實世界程式撰寫,以及推理能力。官方公布的關鍵指標顯示,Opus 4.1在SWE-bench Verified這項衡量真實軟體工程任務解決能力的基準測試中,分數提升至74.5%,優於前代Opus 4;同時官方也表示,深度研究與資料分析能力有所改善,尤其是在細節追蹤與代理式搜尋(agentic search,即模型自主拆解問題、多步驟查找資料的能力)兩方面表現更穩定。
技術意義:不是全新世代,而是「同代精修」
Opus 4.1並非另起爐灶的新一代模型,而是在Opus 4既有架構基礎上做的強化版本,這種「點數升級」(x.1版)模式在近期主流模型廠商中愈來愈常見——先推出主版本,再透過微調與資料強化,在幾週到幾個月內釋出精修版,優先補強最容易被企業客戶檢驗的能力:程式撰寫正確率與長任務可靠度。對照Opus 4的定位,Opus 4.1延續其作為Anthropic「旗艦推理模型」的角色,主要服務需要高複雜度、多步驟任務的專業與企業用戶,而非日常對話這類輕量場景。
與前代比較:程式撰寫是本次升級的主戰場
SWE-bench Verified是目前業界公認較貼近真實工程情境的測試集,考核的是模型能否在既有程式碼庫中理解上下文、定位問題並產出可用修補,而非單純寫一段獨立程式。74.5%的分數提升,代表Opus 4.1在處理複雜、跨檔案的程式修改任務時,正確率與可靠度雙雙提高,這對已經在生產環境使用Claude Code(Anthropic的程式開發代理工具)的團隊而言,是直接可感受的體驗差異,而非僅止於評測數字的進步。
釋出管道與定價:無痛升級
Opus 4.1已開放給付費Claude訂閱用戶與Claude Code使用,同時可透過Anthropic API、Amazon Bedrock、Google Cloud Vertex AI等主流雲端管道存取,定價維持與Opus 4相同,代表企業客戶不需要重新評估預算即可直接切換,技術團隊也只需更新模型代號即可完成升級,不涉及額外的採購或合約調整。
對管理者而言,這則消息的重點不在於「又有新模型」,而在於:若團隊已在用AI輔助程式開發或資料研究,值得請技術負責人實測Opus 4.1在既有工作流中的表現差異,尤其是複雜除錯與跨系統資料查找任務,因為這正是本次升級著力最深的兩個場景。