专栏 AI 管理编年史 第 283/303 讲 查看课程目录

xAI 正式发布 Grok 4.7:编程与知识工作旗舰,价格与 4.6 相同、API 与 App 即日可用

21/09/2026 204
4:05
xAI 正式发布 Grok 4.7:编程与知识工作旗舰,价格与 4.6 相同、API 与 App 即日可用
图/Photo by Fatemeh Rezvani on Unsplash

xAI 于 2026 年 9 月 21 日推出 Grok 4.7,官方称其为“最强的编程与知识工作模型”:500k 上下文、四档推理强度、知识截止 2026 年 5 月,价格与 Grok 4.6 完全相同,即日在 API、Cursor、App 与 X 平台开放。

2026 年 9 月 21 日(美国时间周一),xAI 在官方页面正式发布 Grok 4.7,官方称其为“最强的编程与知识工作模型”。自 9 月初起 Elon Musk 多次预告、又多次推迟,这款上一代 Grok 4.6(2026 年 8 月推出)的接班者终于上线,API model ID 为 grok-4.7。

规格方面,Grok 4.7 支持 500k tokens 上下文、文本与图片输入,提供 low/medium/high/xhigh 四档推理强度,知识截止日期为 2026 年 5 月。价格与 Grok 4.6 完全相同:提示少于 200k tokens 时,每百万 tokens 输入 2 美元、缓存输入 0.5 美元、输出 6 美元;提示达 200k tokens 以上,整笔改按 4/1/12 美元计费。即日可在 Grok API、Cursor、Grok Build、第三方编程工具、云平台、iOS/Android App 与 X 平台使用。另有 Grok 4.7 Fast 变体,速度两倍、价格也两倍,目前仅限 Cursor 与 Grok Build,尚无独立公开的 API model ID。

技术意义:更大的基座、更长的强化学习

xAI 说明本代改进来自两个方向:

  • 更大的基座模型(媒体报道参数约 2.1 万亿,但官方页面并未载明,只能视为外界推估)。
  • 针对更难的任务组合进行更长时间的强化学习,让模型在困难任务上能工作更久、更仔细地自我验证,并更擅长产出文档与演示文稿。

官方另提到融入 SpaceX 的工程数据做补充训练。

与上一代比较:官方自称基准的差距

以下均为官方自称、尚未经独立验证的数字,括号内为 Grok 4.6:

  • CursorBench 4.0:46.3%(40.4%)
  • DeepSWE v1.1:71.0%(65.2%)
  • Terminal-Bench 4.0:38.0%(20.3%)
  • SWE-Marathon v1.1:46.0%(31.9%)
  • EEBench 电气工程:64.0%;Harvey 法律工作:19.6%

Terminal-Bench 几乎翻倍、SWE-Marathon 大幅提升,指向的是“长时间、多步骤的智能体式工程任务”,而非单轮问答。法律工作只有 19.6%,也说明官方并未把它包装成全能模型。

安全护栏与值得观察的两点

xAI 称 Grok 4.7 采用全新安全护栏栈并强化抗越狱:LatchBio 生物安全基准 62.4%,HackerBench v0.3 仅 3.3% 的高风险两用提示通过。从这则发布,笔者认为有两点值得观察:

  1. “价格不变、能力提升”的定价方式,与本月稍早的 Gemini 3.8 Flash、GPT-6 Astra、DeepSeek V4.1-Flash 形成直接对照。
  2. Fast 变体暂不开放独立 API,速度优势目前只在 Cursor 与 Grok Build 内可用。

对管理者的意义

对在泰国管理团队的主管而言,重点不在参数,而在“同价升级”与“长任务”:既有 Grok 4.6 的用量预算可直接沿用,而模型更适合交付需要多步骤自我验证的工作,例如把工厂或门店的作业流程整理成文档与演示文稿。官方基准毕竟是自称数字,用自家任务实测才是唯一准绳。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 Claude Opus 5.5 正式发布:多数工作达 Fable 5.1 水平、成本比 Opus 5 低 40%

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策