Google DeepMind發表Gemini 2.5 Computer Use模型,讓AI學會操作網頁與App介面
Google DeepMind於2025年10月8日發表Gemini 2.5 Computer Use模型,基於Gemini 2.5 Pro打造,可像人一樣點擊、填表、捲動操作網頁與App介面,透過API公開預覽,官方稱多項基準測試表現優於競品且延遲更低。
Google DeepMind於2025年10月8日在官方部落格宣布推出「Gemini 2.5 Computer Use」模型。這是一款基於Gemini 2.5 Pro打造的專用模型,鎖定「視覺理解+推理」能力,讓AI系統能像真人使用電腦一樣,直接在螢幕畫面上操作網頁或應用程式介面——包括點擊按鈕、填寫表單、捲動頁面等動作,而不需要仰賴傳統的API串接。官方定位此模型是給開發者打造「能實際操作軟體介面的AI代理」的基礎元件,目前已透過Gemini API在Google AI Studio與Vertex AI上以公開預覽形式釋出。官方公布的基準測試顯示,此模型在多項網頁與行動裝置操控評測上優於競爭對手,同時延遲更低——這對「電腦操作代理」是關鍵指標,因為每一步動作都需模型即時「看畫面、想動作、下指令」。
技術意義:從「呼叫API」到「看畫面操作」
過去AI完成線上任務多半依賴軟體公司開放的API,但大量企業內部系統、老舊網頁、沒有API的服務,AI過去完全無法碰觸。「電腦操作型」模型改由直接讀取螢幕畫面,判斷可互動元素,再模擬滑鼠鍵盤完成操作,理論上可操作「任何有畫面的軟體」,大幅擴張AI代理能觸及的工作範圍。
與前代及競品的比較
此能力並非Google首創,OpenAI與Anthropic此前也推出過類似方向的能力。Google這次的差異在於將能力獨立成「基於Gemini 2.5 Pro的專用模型」,同時針對網頁與App做基準測試與最佳化,官方強調的「多項測試優於對手、延遲更低」,顯示Google正嘗試在「代理型AI」戰場建立技術優勢,而非僅是跟進。
業界反應
由於模型以「公開預覽」形式先開放給開發者,討論多集中在其對「AI代理生態系」的基礎建設意義——開發者可用它打造自動完成網頁流程(填單、比價、批次輸入)的助理工具,不需為每個目標網站個別開發整合介面。同時,AI能自主操作介面完成點擊、送出、付款等動作,也引發資安與誤操作風險的討論,如何防止誤觸敏感操作是部署前必須正視的課題。
對管理者的意義
這類「AI能直接操作軟體介面」的能力,長期意味著企業內部大量仰賴人工重複點擊、填表、跨系統搬資料的作業流程,未來有機會被AI代理直接接管,不必等IT部門開發專屬串接。管理者現階段不需急著導入,但可以開始盤點團隊裡「純粹是滑鼠點擊、複製貼上」的重複性工作,這正是這類技術未來最先能替換的環節。