專欄 AI 管理編年史 第 133/217 講 查看課程目錄

Google DeepMind發表Gemini 2.5 Computer Use模型,讓AI學會操作網頁與App介面

08/10/2025 255
3:45
Google DeepMind發表Gemini 2.5 Computer Use模型,讓AI學會操作網頁與App介面

Google DeepMind於2025年10月8日發表Gemini 2.5 Computer Use模型,基於Gemini 2.5 Pro打造,可像人一樣點擊、填表、捲動操作網頁與App介面,透過API公開預覽,官方稱多項基準測試表現優於競品且延遲更低。

Google DeepMind於2025年10月8日在官方部落格宣布推出「Gemini 2.5 Computer Use」模型。這是一款基於Gemini 2.5 Pro打造的專用模型,鎖定「視覺理解+推理」能力,讓AI系統能像真人使用電腦一樣,直接在螢幕畫面上操作網頁或應用程式介面——包括點擊按鈕、填寫表單、捲動頁面等動作,而不需要仰賴傳統的API串接。官方定位此模型是給開發者打造「能實際操作軟體介面的AI代理」的基礎元件,目前已透過Gemini API在Google AI Studio與Vertex AI上以公開預覽形式釋出。官方公布的基準測試顯示,此模型在多項網頁與行動裝置操控評測上優於競爭對手,同時延遲更低——這對「電腦操作代理」是關鍵指標,因為每一步動作都需模型即時「看畫面、想動作、下指令」。

技術意義:從「呼叫API」到「看畫面操作」

過去AI完成線上任務多半依賴軟體公司開放的API,但大量企業內部系統、老舊網頁、沒有API的服務,AI過去完全無法碰觸。「電腦操作型」模型改由直接讀取螢幕畫面,判斷可互動元素,再模擬滑鼠鍵盤完成操作,理論上可操作「任何有畫面的軟體」,大幅擴張AI代理能觸及的工作範圍。

與前代及競品的比較

此能力並非Google首創,OpenAI與Anthropic此前也推出過類似方向的能力。Google這次的差異在於將能力獨立成「基於Gemini 2.5 Pro的專用模型」,同時針對網頁與App做基準測試與最佳化,官方強調的「多項測試優於對手、延遲更低」,顯示Google正嘗試在「代理型AI」戰場建立技術優勢,而非僅是跟進。

業界反應

由於模型以「公開預覽」形式先開放給開發者,討論多集中在其對「AI代理生態系」的基礎建設意義——開發者可用它打造自動完成網頁流程(填單、比價、批次輸入)的助理工具,不需為每個目標網站個別開發整合介面。同時,AI能自主操作介面完成點擊、送出、付款等動作,也引發資安與誤操作風險的討論,如何防止誤觸敏感操作是部署前必須正視的課題。

對管理者的意義

這類「AI能直接操作軟體介面」的能力,長期意味著企業內部大量仰賴人工重複點擊、填表、跨系統搬資料的作業流程,未來有機會被AI代理直接接管,不必等IT部門開發專屬串接。管理者現階段不需急著導入,但可以開始盤點團隊裡「純粹是滑鼠點擊、複製貼上」的重複性工作,這正是這類技術未來最先能替換的環節。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 Anthropic 發表 Claude Haiku 4.5:程式能力追平頂尖模型,價格僅三分之一

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策