专栏 AI 管理编年史 第 129/217 讲 查看课程目录

Anthropic发布Claude Sonnet 4.5:SWE-bench 77.2%创新高,官方称「全球最强编程模型」

29/09/2025 165
4:27
Anthropic发布Claude Sonnet 4.5:SWE-bench 77.2%创新高,官方称「全球最强编程模型」

Anthropic于2025年9月29日发布Claude Sonnet 4.5,官方称其为全球最强编程模型,SWE-bench Verified达77.2%创新高,能保持专注30小时以上,定价维持不变。

2025年9月29日,Anthropic正式发布新一代模型Claude Sonnet 4.5,官方公告称其为“全球最强的编程模型”(the best coding model in the world)。这是Claude Sonnet系列自今年5月推出4.0版本后的最新迭代,模型代号为claude-sonnet-4-5-20250929,已可通过Anthropic API直接调用使用。

根据官方公布的基准测试数据,Claude Sonnet 4.5在SWE-bench Verified(软件工程任务测试集,用于评估模型解决真实GitHub代码问题的能力)中取得77.2%的成绩,为目前公开纪录中的新高分。在电脑操作能力测试OSWorld(评估模型操作电脑图形界面、完成多步骤任务的能力)中,得分为61.4%。Anthropic特别强调,这款模型能在复杂、多步骤的任务中保持专注长达30小时以上,不中断、不偏离目标。值得注意的是,尽管性能提升,此次定价并未调整——每百万token输入3美元、输出15美元,与前代Claude Sonnet 4完全相同。

技术意义:从“回答问题”到“长时间自主执行”

过去一年AI模型的竞争焦点,逐渐从单次问答的准确度,转向能否在无人监督下完成长时间、多步骤的任务。Claude Sonnet 4.5所强调的长时间专注能力,指向的正是这个方向:模型不只是回答一个代码问题,而是能像工程师一样持续规划、调试、测试、修正,直到任务完成。这也是SWE-bench Verified这类“真实世界代码修复”测试分数持续攀升的原因——测的不是模型知不知道语法,而是能不能像人类工程师一样拆解问题、动手解决。

定价策略:性能提升,价格不变

此次Claude Sonnet 4.5维持与前代Sonnet 4相同的每百万token输入3美元、输出15美元定价,并未因性能提升而涨价。这种“同价格、更高性能”的策略,延续了近一年AI模型市场的常见走势:各家厂商通过持续迭代,在既有定价结构下提供更高性价比,借此巩固企业客户与开发者社群的黏着度。

业界反应:代码协作工具的潜在洗牌

Claude系列模型,尤其是Sonnet,长期是市场上多数AI辅助编程工具(如代码协作平台、IDE整合插件)的底层引擎选项之一。SWE-bench Verified成绩的持续刷新,往往直接影响开发者社群对“该用哪个模型接入工作流程”的选择。随着Claude Sonnet 4.5在自主调试与长时间任务执行上的能力提升,依赖AI模型完成代码撰写、重构、测试自动化的产品与团队,预期将重新评估现有的模型供应商配置。

对管理者的意义

Claude Sonnet 4.5展现的“长时间自主执行力”,代表AI工具正逐渐从“辅助员工完成单一小任务”,走向“能被交付一段完整项目、自行规划执行”的阶段。对非技术部门的管理者而言,这则新闻真正该留意的不是代码分数本身,而是“AI能不能被信任独立完成一段完整工作”这个趋势——未来评估团队导入AI工具时,除了看模型答得准不准,也该开始关注它能不能自己把一件事从头做到尾。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 DeepSeek发布V3.2-Exp实验版:稀疏注意力机制把运算成本砍半

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策