Anthropic发布升级版Claude 3.5 Sonnet,同步推出Computer Use公开测试版
Anthropic于2024年10月22日发布升级版Claude 3.5 Sonnet,宣称多项基准测试全面优于前代且价格速度不变;同步推出「Computer Use」公开测试版,让AI能像人一样操作电脑画面,是首个提供此能力的前沿模型。
2024年10月22日,Anthropic发布升级版Claude 3.5 Sonnet。官方宣称这个新版本在多项行业标准基准测试上全面优于上一代模型,其中代码编写能力的进步最为明显,同时保持与上一代相同的价格与响应速度,用户不需多花一分钱就能享有更强的模型表现。与此同时,Anthropic也正式推出「Computer Use」公开测试版功能,并预告即将上线的轻量模型Claude 3.5 Haiku。
什么是Computer Use
Computer Use让Claude具备「看屏幕、移鼠标、点按钮、打字」的能力,能像人类用户一样直接操作电脑画面完成任务,而不只是通过文字或既定API指令交互。开发者可以通过Anthropic官方API、Amazon Bedrock,以及Google Cloud Vertex AI三个渠道使用这项功能。Anthropic特别强调,这是第一个提供「操作电脑」公开测试版能力的前沿AI模型。
技术意义:从「回答问题」走向「代为操作」
过去多数大语言模型的进步集中在文本理解、推理与代码生成上,用户仍需自己把模型输出粘贴到对应位置、点击对应按钮。Computer Use的出现,代表模型开始具备跨越「屏幕」这一层抽象界限的能力——观察画面元素、判断坐标与内容,再做出鼠标与键盘层级的实际操作,让AI有机会直接在现有系统上完成多步骤流程,不需企业额外开发专属API对接。
同期比较与业界反应
对照同年9月OpenAI的o1系列、Google的Gemini-1.5更新、xAI的Colossus上线,各家焦点多仍停留在「模型更聪明、更便宜」;Anthropic这次同时交出模型升级与操作能力扩展,另辟了「AI能不能真正动手做事」的赛道。不过Anthropic也提醒,Computer Use目前操作速度较慢,复杂界面仍可能误判或误触,建议先在受控环境测试,避免直接用于高风险正式系统。
对管理者的意义
这次升级的启示,是留意「AI从辅助建议走向直接操作」的方向:未来重复性的画面操作型工作(如系统间数据转贴、固定表单填写),有机会逐步交由AI代理执行,管理者现阶段可先盘点团队中高重复、低判断难度的屏幕操作流程,作为日后导入的优先候选。
大家怎么说 · 3 条留言