Google DeepMind发布Gemini 2.5 Computer Use模型,让AI学会操作网页与App界面
Google DeepMind于2025年10月8日发布Gemini 2.5 Computer Use模型,基于Gemini 2.5 Pro打造,可像人一样点击、填表、滚动操作网页与App界面,通过API公开预览,官方称多项基准测试表现优于竞品且延迟更低。
Google DeepMind于2025年10月8日在官方博客宣布推出“Gemini 2.5 Computer Use”模型。这是一款基于Gemini 2.5 Pro打造的专用模型,聚焦“视觉理解+推理”能力,让AI系统能像真人使用电脑一样,直接在屏幕画面上操作网页或应用程序界面——包括点击按钮、填写表单、滚动页面等动作,而不需要依赖传统的API对接。官方将该模型定位为供开发者打造“能实际操作软件界面的AI代理”的基础组件,目前已通过Gemini API在Google AI Studio与Vertex AI上以公开预览形式发布。官方公布的基准测试显示,该模型在多项网页与移动设备操控评测上优于竞争对手,同时延迟更低——这对“电脑操作代理”是关键指标,因为每一步动作都需模型实时“看画面、想动作、下指令”。
技术意义:从“调用API”到“看画面操作”
过去AI完成线上任务多半依赖软件公司开放的API,但大量企业内部系统、老旧网页、没有API的服务,AI过去完全无法触及。“电脑操作型”模型改为直接读取屏幕画面,判断可交互元素,再模拟鼠标键盘完成操作,理论上可操作“任何有画面的软件”,大幅扩展AI代理能触及的工作范围。
与前代及竞品的比较
这类能力并非Google首创,OpenAI与Anthropic此前也推出过类似方向的能力。Google这次的差异在于将该能力独立成“基于Gemini 2.5 Pro的专用模型”,同时针对网页与App做基准测试与优化,官方强调的“多项测试优于对手、延迟更低”,显示Google正尝试在“代理型AI”战场建立技术优势,而非只是跟进。
业界反应
由于模型以“公开预览”形式先开放给开发者,讨论多集中在其对“AI代理生态系统”的基础建设意义——开发者可用它打造自动完成网页流程(填单、比价、批量录入)的助理工具,不需为每个目标网站单独开发集成接口。同时,AI能自主操作界面完成点击、提交、付款等动作,也引发数据安全与误操作风险的讨论,如何防止误触敏感操作是部署前必须正视的课题。
对管理者的意义
这类“AI能直接操作软件界面”的能力,长期意味着企业内部大量依赖人工重复点击、填表、跨系统搬运数据的作业流程,未来有机会被AI代理直接接管,不必等IT部门开发专属对接。管理者现阶段不需急于导入,但可以开始盘点团队里“纯粹是鼠标点击、复制粘贴”的重复性工作,这正是这类技术未来最先能替代的环节。