专栏 AI 管理编年史 第 108/217 讲 查看课程目录

Anthropic 发布 Claude Opus 4 与 Claude Sonnet 4:全球最佳编程模型登场

22/05/2025 145
4:13
Anthropic 发布 Claude Opus 4 与 Claude Sonnet 4:全球最佳编程模型登场

Anthropic正式发布混合推理模型Claude Opus 4与Sonnet 4,Opus 4号称全球最佳编程模型,SWE-bench达72.5%;两款模型即日起开放Pro、Max、Team、Enterprise与免费用户,并上架API、Bedrock、Vertex AI。

2025年5月22日,Anthropic正式发布新一代模型Claude Opus 4与Claude Sonnet 4。两款模型均采用“混合推理”架构,用户可根据任务需求,选择近乎即时响应的一般模式,或启用延伸思考模式进行更深入的推理,兼顾速度与深度。这是Anthropic继2月推出Claude 3.7 Sonnet与Claude Code之后,时隔三个月的重大版本更新。

Claude Opus 4是Anthropic目前为止最强大的模型,官方将其定位为“全球最佳编程模型”。在衡量真实软件工程任务解决能力的SWE-bench基准测试中,Opus 4达到72.5%的表现;在测量模型操作终端、执行多步骤指令能力的Terminal-bench上,则达到43.2%。Claude Sonnet 4则是今年2月发布的Sonnet 3.7的重大升级版本,编程与推理能力均有显著提升,并且能更精准地遵循用户下达的指令,减少以往模型“自作主张”偏离原始要求的问题。

技术意义:从单一响应模式走向混合推理

以往的大型语言模型大多只有一种响应方式,用户若想要更严谨的推理,往往得另外调用“思考版”模型。Claude Opus 4与Sonnet 4把两种模式整合进同一个模型,让用户能根据任务难度动态切换:简单查询用即时模式节省成本与等待时间,复杂的代码调试或多步骤规划则切换到延伸思考模式,换取更高的准确度。这种“一个模型、两种速度”的设计,反映行业正从单纯比拼模型规模,转向比拼推理资源的弹性调度。

与前代对比:编程能力成为主战场

Anthropic把此次发布的重心明确放在“编程”而非泛用对话能力,SWE-bench与Terminal-bench两项基准都是专门用来评估模型能否像工程师一样理解代码库、修复真实错误、操作命令行。相较于3.7版本,Sonnet 4在遵循指令的精准度上被特别强调,显示Anthropic正在回应企业用户“模型太自主、不听话”的常见抱怨,把可控性列为与能力同等重要的产品指标。

开放范围:从付费方案一路下放到免费用户

两款模型与延伸思考功能,即日起开放Pro、Max、Team与Enterprise方案用户使用;值得注意的是,Sonnet 4也同步开放给免费用户,让普通用户无需付费即可体验新一代模型。此外,Opus 4与Sonnet 4也同步上架于Anthropic API、Amazon Bedrock与Google Cloud Vertex AI三大渠道,方便企业将模型整合进现有云端架构。定价维持以往水平未上调:Opus 4为每百万token输入15美元、输出75美元;Sonnet 4为每百万token输入3美元、输出15美元,显示Anthropic选择以性能升级而非涨价作为此次发布的诉求。

对管理者的意义

对管理者而言,此次发布最值得留意的不是技术参数本身,而是“免费用户也能用到主力新模型”与“三大云平台同步上架”这两个信号——代表企业导入AI协作工具的门槛正持续降低,若团队尚未评估将Claude用于代码审查、系统调试或内部工具开发,这是重新盘点的好时机。

适用产业: 电商社群销售
测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 DeepSeek发布R1-0528更新版:推理准确率大跃进,开源商用免费用

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策