xAI 正式发布 Grok 4.7:编程与知识工作旗舰,价格与 4.6 相同、API 与 App 即日可用
xAI 于 2026 年 9 月 21 日推出 Grok 4.7,官方称其为“最强的编程与知识工作模型”:500k 上下文、四档推理强度、知识截止 2026 年 5 月,价格与 Grok 4.6 完全相同,即日在 API、Cursor、App 与 X 平台开放。
2026 年 9 月 21 日(美国时间周一),xAI 在官方页面正式发布 Grok 4.7,官方称其为“最强的编程与知识工作模型”。自 9 月初起 Elon Musk 多次预告、又多次推迟,这款上一代 Grok 4.6(2026 年 8 月推出)的接班者终于上线,API model ID 为 grok-4.7。
规格方面,Grok 4.7 支持 500k tokens 上下文、文本与图片输入,提供 low/medium/high/xhigh 四档推理强度,知识截止日期为 2026 年 5 月。价格与 Grok 4.6 完全相同:提示少于 200k tokens 时,每百万 tokens 输入 2 美元、缓存输入 0.5 美元、输出 6 美元;提示达 200k tokens 以上,整笔改按 4/1/12 美元计费。即日可在 Grok API、Cursor、Grok Build、第三方编程工具、云平台、iOS/Android App 与 X 平台使用。另有 Grok 4.7 Fast 变体,速度两倍、价格也两倍,目前仅限 Cursor 与 Grok Build,尚无独立公开的 API model ID。
技术意义:更大的基座、更长的强化学习
xAI 说明本代改进来自两个方向:
- 更大的基座模型(媒体报道参数约 2.1 万亿,但官方页面并未载明,只能视为外界推估)。
- 针对更难的任务组合进行更长时间的强化学习,让模型在困难任务上能工作更久、更仔细地自我验证,并更擅长产出文档与演示文稿。
官方另提到融入 SpaceX 的工程数据做补充训练。
与上一代比较:官方自称基准的差距
以下均为官方自称、尚未经独立验证的数字,括号内为 Grok 4.6:
- CursorBench 4.0:46.3%(40.4%)
- DeepSWE v1.1:71.0%(65.2%)
- Terminal-Bench 4.0:38.0%(20.3%)
- SWE-Marathon v1.1:46.0%(31.9%)
- EEBench 电气工程:64.0%;Harvey 法律工作:19.6%
Terminal-Bench 几乎翻倍、SWE-Marathon 大幅提升,指向的是“长时间、多步骤的智能体式工程任务”,而非单轮问答。法律工作只有 19.6%,也说明官方并未把它包装成全能模型。
安全护栏与值得观察的两点
xAI 称 Grok 4.7 采用全新安全护栏栈并强化抗越狱:LatchBio 生物安全基准 62.4%,HackerBench v0.3 仅 3.3% 的高风险两用提示通过。从这则发布,笔者认为有两点值得观察:
- “价格不变、能力提升”的定价方式,与本月稍早的 Gemini 3.8 Flash、GPT-6 Astra、DeepSeek V4.1-Flash 形成直接对照。
- Fast 变体暂不开放独立 API,速度优势目前只在 Cursor 与 Grok Build 内可用。
对管理者的意义
对在泰国管理团队的主管而言,重点不在参数,而在“同价升级”与“长任务”:既有 Grok 4.6 的用量预算可直接沿用,而模型更适合交付需要多步骤自我验证的工作,例如把工厂或门店的作业流程整理成文档与演示文稿。官方基准毕竟是自称数字,用自家任务实测才是唯一准绳。