专栏 AI 管理编年史 第 116/217 讲 查看课程目录

OpenAI 发布 ChatGPT Agent:把「操作浏览器」与「深度研究」合二为一

17/07/2025 113
3:33
OpenAI 发布 ChatGPT Agent:把「操作浏览器」与「深度研究」合二为一

OpenAI 于2025年7月17日发布 ChatGPT Agent,整合 Operator 的浏览器操作能力与 Deep Research 的网页综合分析能力,用户一句指令即可完成查资料、填表、做演示文稿等多步骤任务,先开放 Pro/Plus/Team 订阅用户。

OpenAI 于2025年7月17日正式发布 ChatGPT Agent,这是一套「统一代理系统」,把两项原本分开的能力合并进同一个 ChatGPT 对话窗口:一是此前的 Operator,能实际操作浏览器(点击、输入、滚动、填表);二是 Deep Research,能大量浏览网页并综合整理成报告。加上 ChatGPT 原有的对话理解能力,用户现在可以用一句自然语言指令,交办需要「查资料+做动作+产出成果」的多步骤任务。

官方公布的演示场景包括:查看用户的日程安排,依据近期新闻自动整理出一份客户会议简报;规划日式早餐菜单并直接在购物网站下单食材;分析三家竞争对手的公开信息,产出一份演示文稿。这些任务过去需要用户在多个标签页、多个工具之间手动切换,现在由代理一次串联完成。功能先开放给 Pro、Plus、Team 订阅用户,后续会扩展到 Enterprise 与 Edu 方案。

技术意义:从「单次回答」走向「可执行的多步骤流程」

过去的 ChatGPT 本质上是问答式工具——用户问、模型答,中间的查资料、操作系统、产出文件都得靠人工完成。ChatGPT Agent 的关键变化,是把「理解任务」「规划步骤」「在真实网页与文件间执行动作」三件事串成一条可自主运作的链路。它能在公开网站、用户上传的文件,以及已连接的第三方来源(例如邮箱、文档库)之间自主研究与整合,并实际执行填表、编辑电子表格等操作,而不只是输出一段建议文字。

安全机制与前代的差异

值得注意的是,OpenAI 并未把代理设计成「全自动黑箱」。系统在采取有实际影响性的动作(例如提交表单、完成付款)前,会先向用户征求许可;用户也可以随时中断任务、接管浏览器操作,或直接停止代理运行。这种「人在回路中」的设计,反映出业界对代理型 AI 的普遍顾虑——动作型 AI 一旦出错,代价比纯文本回答高得多,因此可控性与可中断性成为这类产品能否被信任的关键指标。

对管理者的意义

这则发布代表「AI 助理」正从单纯的对话工具,逐步演变成能实际执行办公室例行任务(资料收集、初稿制作、跨系统操作)的工作伙伴。管理者不妨留意:哪些团队里「查资料+整理+产出文件」的重复性工作,未来可能先交给代理处理初稿,再由人力把关关键决策与最终确认。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 OpenAI实验推理模型解出IMO六题中五题 达人类金牌水准

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策