專欄 AI 管理編年史 第 116/217 講 查看課程目錄

OpenAI 發表 ChatGPT Agent:把「操作瀏覽器」與「深度研究」合而為一

17/07/2025 111
3:33
OpenAI 發表 ChatGPT Agent:把「操作瀏覽器」與「深度研究」合而為一

OpenAI 於 2025 年 7 月 17 日發表 ChatGPT Agent,整合 Operator 的瀏覽器操作能力與 Deep Research 的網頁綜整能力,讓使用者一句指令就能完成查資料、填表、做簡報等多步驟任務,先開放 Pro/Plus/Team 訂閱用戶。

OpenAI 於 2025 年 7 月 17 日正式發表 ChatGPT Agent,這是一套「統一代理系統」,把兩項原本分開的能力合併進同一個 ChatGPT 對話視窗:一是先前的 Operator,能實際操作瀏覽器(點擊、輸入、捲動、填表);二是 Deep Research,能大量瀏覽網頁並綜整成報告。加上 ChatGPT 原本的對話理解能力,使用者現在可以用一句自然語言指令,交辦需要「查資料+做動作+產出成果」的多步驟任務。

官方公布的示範情境包括:查看使用者的行事曆,依據近期新聞自動整理出一份客戶會議簡報;規劃日式早餐菜單並直接在購物網站下單食材;分析三家競爭對手的公開資訊,產出一份簡報檔。這些任務過去需要使用者自己在多個分頁、多個工具之間手動切換,現在由代理一次串接完成。功能先開放給 Pro、Plus、Team 訂閱用戶,後續會擴及 Enterprise 與 Edu 方案。

技術意義:從「單次回答」走向「可執行的多步驟流程」

過去的 ChatGPT 本質上是問答式工具——使用者問、模型答,中間的查資料、操作系統、產出檔案都得靠人工完成。ChatGPT Agent 的關鍵變化,是把「理解任務」「規劃步驟」「在真實網頁與檔案間執行動作」三件事串成一條可自主運作的鏈路。它能在公開網站、使用者上傳的檔案,以及已連接的第三方來源(例如 email、文件庫)之間自主研究與整合,並實際執行填表、編輯試算表等操作,而不只是輸出一段建議文字。

安全機制與前代的差異

值得注意的是,OpenAI 並未把代理設計成「全自動黑箱」。系統在採取有實際影響性的動作(例如送出表單、完成付款)前,會先向使用者徵求許可;使用者也可以隨時中斷任務、接管瀏覽器操作,或直接停止代理運作。這種「人在迴路中」的設計,反映出業界對代理型 AI 的普遍疑慮——動作型 AI 一旦出錯,代價比純文字回答高得多,因此可控性與可中斷性成為這類產品能否被信任的關鍵指標。

對管理者的意義

這則發表代表「AI 助理」正從單純的對話工具,逐步演變成能實際執行辦公室例行任務(資料蒐集、初稿製作、跨系統操作)的工作夥伴。管理者不妨留意:哪些團隊裡「查資料+整理+產出文件」的重複性工作,未來可能先交給代理處理初稿,再由人力把關關鍵決策與最終確認。

測驗檢核:驗證你的理解
5 篇 · 答對 80% 通過,通過後計入學習履歷 登入後即可測驗
問 AI:這篇文章怎麼用在我的管理上?
內容由 AI 根據本文輔助生成,僅供參考,請自行判斷準確性。
下一講・AI 管理編年史 OpenAI實驗推理模型解出IMO六題中五題 達人類金牌水準

相關文章

我們使用必要 Cookie 維持登入與語言設定,並記錄使用行為以改善服務。你可以只保留必要項目。 隱私權政策