專欄 AI 管理編年史 第 119/217 講 查看課程目錄

Anthropic發表Claude Opus 4.1:程式撰寫能力再提升

05/08/2025 99
3:27
Anthropic發表Claude Opus 4.1:程式撰寫能力再提升

Anthropic於2025年8月5日推出Claude Opus 4.1,作為Opus 4的升級版,強化程式撰寫、深度研究與代理式搜尋能力,SWE-bench Verified分數提升至74.5%,定價與前代相同。

Anthropic於2025年8月5日發表新模型Claude Opus 4.1(模型代號claude-opus-4-1-20250805),定位為Claude Opus 4的升級版本,重點強化「代理任務」(agentic tasks)、真實世界程式撰寫,以及推理能力。官方公布的關鍵指標顯示,Opus 4.1在SWE-bench Verified這項衡量真實軟體工程任務解決能力的基準測試中,分數提升至74.5%,優於前代Opus 4;同時官方也表示,深度研究與資料分析能力有所改善,尤其是在細節追蹤與代理式搜尋(agentic search,即模型自主拆解問題、多步驟查找資料的能力)兩方面表現更穩定。

技術意義:不是全新世代,而是「同代精修」

Opus 4.1並非另起爐灶的新一代模型,而是在Opus 4既有架構基礎上做的強化版本,這種「點數升級」(x.1版)模式在近期主流模型廠商中愈來愈常見——先推出主版本,再透過微調與資料強化,在幾週到幾個月內釋出精修版,優先補強最容易被企業客戶檢驗的能力:程式撰寫正確率與長任務可靠度。對照Opus 4的定位,Opus 4.1延續其作為Anthropic「旗艦推理模型」的角色,主要服務需要高複雜度、多步驟任務的專業與企業用戶,而非日常對話這類輕量場景。

與前代比較:程式撰寫是本次升級的主戰場

SWE-bench Verified是目前業界公認較貼近真實工程情境的測試集,考核的是模型能否在既有程式碼庫中理解上下文、定位問題並產出可用修補,而非單純寫一段獨立程式。74.5%的分數提升,代表Opus 4.1在處理複雜、跨檔案的程式修改任務時,正確率與可靠度雙雙提高,這對已經在生產環境使用Claude Code(Anthropic的程式開發代理工具)的團隊而言,是直接可感受的體驗差異,而非僅止於評測數字的進步。

釋出管道與定價:無痛升級

Opus 4.1已開放給付費Claude訂閱用戶與Claude Code使用,同時可透過Anthropic API、Amazon Bedrock、Google Cloud Vertex AI等主流雲端管道存取,定價維持與Opus 4相同,代表企業客戶不需要重新評估預算即可直接切換,技術團隊也只需更新模型代號即可完成升級,不涉及額外的採購或合約調整。

對管理者而言,這則消息的重點不在於「又有新模型」,而在於:若團隊已在用AI輔助程式開發或資料研究,值得請技術負責人實測Opus 4.1在既有工作流中的表現差異,尤其是複雜除錯與跨系統資料查找任務,因為這正是本次升級著力最深的兩個場景。

適用產業: 電商社群銷售
測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 OpenAI 正式發表 GPT-5:統一系統自動判斷「快答」或「深思」

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策