Anthropic 發表升級版 Claude 3.5 Sonnet,同步推出 Computer Use 公開測試版
Anthropic 於2024年10月22日發表升級版 Claude 3.5 Sonnet,宣稱多項基準測試全面優於前代且價格速度不變;同步推出「Computer Use」公開Beta,讓AI能像人一樣操作電腦畫面,是首個提供此能力的前沿模型。
2024年10月22日,Anthropic 發表升級版 Claude 3.5 Sonnet。官方宣稱這個新版本在多項業界標準基準測試上全面優於前一代模型,其中程式撰寫能力的進步最為明顯,同時維持與前代相同的價格與回應速度,使用者不需多花一毛錢就能享有更強的模型表現。與此同時,Anthropic 也正式推出「Computer Use」公開測試版功能,並預告即將登場的輕量模型 Claude 3.5 Haiku。
什麼是 Computer Use
Computer Use 讓 Claude 具備「看螢幕、動滑鼠、點按鈕、打字」的能力,能像人類使用者一樣直接操作電腦畫面完成任務,而不只是透過文字或既定 API 指令互動。開發者可透過 Anthropic 官方 API、Amazon Bedrock,以及 Google Cloud Vertex AI 三個管道使用這項功能。Anthropic 特別強調,這是第一個提供「操作電腦」公開 Beta 能力的前沿 AI 模型。
技術意義:從「回答問題」走向「代為操作」
過去多數大型語言模型的進步集中在文字理解、推理與程式碼生成,使用者仍需自己把模型輸出貼到對的地方、按下對的按鈕。Computer Use 的出現,代表模型開始具備跨越「螢幕」這一層抽象界線的能力——觀察畫面元素、判斷座標與內容,再做出滑鼠與鍵盤層級的實際操作,讓 AI 有機會直接在既有系統上完成多步驟流程,不需企業額外開發專屬 API 串接。
同期比較與業界反應
對照同年 9 月 OpenAI 的 o1 系列、Google 的 Gemini-1.5 更新、xAI 的 Colossus 上線,各家焦點多仍停留在「模型更聰明、更便宜」;Anthropic 這次同時交出模型升級與操作能力擴展,另闢了「AI 能不能真的動手做事」的賽道。不過 Anthropic 也提醒,Computer Use 目前操作速度較慢,複雜介面仍可能誤判或誤觸,建議先在受控環境測試,避免直接用於高風險正式系統。
對管理者的意義
這次升級的啟示,是留意「AI 從輔助建議走向直接操作」的方向:未來重複性的畫面操作型工作(如系統間資料轉貼、固定表單填寫),有機會逐步交由 AI 代理人執行,管理者現階段可先盤點團隊中高重複、低判斷難度的螢幕操作流程,作為日後導入的優先候選。