Anthropic 发布 Claude Opus 4 与 Claude Sonnet 4:全球最佳编程模型登场
Anthropic正式发布混合推理模型Claude Opus 4与Sonnet 4,Opus 4号称全球最佳编程模型,SWE-bench达72.5%;两款模型即日起开放Pro、Max、Team、Enterprise与免费用户,并上架API、Bedrock、Vertex AI。
2025年5月22日,Anthropic正式发布新一代模型Claude Opus 4与Claude Sonnet 4。两款模型均采用“混合推理”架构,用户可根据任务需求,选择近乎即时响应的一般模式,或启用延伸思考模式进行更深入的推理,兼顾速度与深度。这是Anthropic继2月推出Claude 3.7 Sonnet与Claude Code之后,时隔三个月的重大版本更新。
Claude Opus 4是Anthropic目前为止最强大的模型,官方将其定位为“全球最佳编程模型”。在衡量真实软件工程任务解决能力的SWE-bench基准测试中,Opus 4达到72.5%的表现;在测量模型操作终端、执行多步骤指令能力的Terminal-bench上,则达到43.2%。Claude Sonnet 4则是今年2月发布的Sonnet 3.7的重大升级版本,编程与推理能力均有显著提升,并且能更精准地遵循用户下达的指令,减少以往模型“自作主张”偏离原始要求的问题。
技术意义:从单一响应模式走向混合推理
以往的大型语言模型大多只有一种响应方式,用户若想要更严谨的推理,往往得另外调用“思考版”模型。Claude Opus 4与Sonnet 4把两种模式整合进同一个模型,让用户能根据任务难度动态切换:简单查询用即时模式节省成本与等待时间,复杂的代码调试或多步骤规划则切换到延伸思考模式,换取更高的准确度。这种“一个模型、两种速度”的设计,反映行业正从单纯比拼模型规模,转向比拼推理资源的弹性调度。
与前代对比:编程能力成为主战场
Anthropic把此次发布的重心明确放在“编程”而非泛用对话能力,SWE-bench与Terminal-bench两项基准都是专门用来评估模型能否像工程师一样理解代码库、修复真实错误、操作命令行。相较于3.7版本,Sonnet 4在遵循指令的精准度上被特别强调,显示Anthropic正在回应企业用户“模型太自主、不听话”的常见抱怨,把可控性列为与能力同等重要的产品指标。
开放范围:从付费方案一路下放到免费用户
两款模型与延伸思考功能,即日起开放Pro、Max、Team与Enterprise方案用户使用;值得注意的是,Sonnet 4也同步开放给免费用户,让普通用户无需付费即可体验新一代模型。此外,Opus 4与Sonnet 4也同步上架于Anthropic API、Amazon Bedrock与Google Cloud Vertex AI三大渠道,方便企业将模型整合进现有云端架构。定价维持以往水平未上调:Opus 4为每百万token输入15美元、输出75美元;Sonnet 4为每百万token输入3美元、输出15美元,显示Anthropic选择以性能升级而非涨价作为此次发布的诉求。
对管理者的意义
对管理者而言,此次发布最值得留意的不是技术参数本身,而是“免费用户也能用到主力新模型”与“三大云平台同步上架”这两个信号——代表企业导入AI协作工具的门槛正持续降低,若团队尚未评估将Claude用于代码审查、系统调试或内部工具开发,这是重新盘点的好时机。