Google 发布 Gemini 4 Argon:输出上限冲上百万 token,限量首发先给网络安全防御者
2026 年 9 月 30 日,Google 发布新一代前沿模型 Gemini 4 Argon,单次输出上限由 64K 提升至 100 万 token,DeepSWE v1.1 达 77.9%、CWE-bench v1 达 68% 并列第一。目前仅限量开放给受信任的网络安全防御者,模型并同步参与美国政府自愿性上市前审查,普通用户尚不能使用;Bloomberg 同日报道内部对实战编程能力存疑。
2026 年 9 月 30 日,Google 在官方博客发布新一代前沿模型 Gemini 4 Argon。这次采取“限量首发”:第一批只通过 Fairwind Program 开放给经审核的受信任网络安全防御者,模型并同步参与美国政府的自愿性上市前审查。官方表示后续会先开放付费 API 与 Google AI Ultra 订阅,但没有给出确切日期。换句话说,目前普通企业和个人用户还不能使用这个模型,能看到的只有官方公布的规格与测试成绩。
规格要点:输出上限从 64K 拉到 100 万 token
最受关注的变化是单次输出上限,从上一代的 64K token 提升到 100 万 token,约为原来的十五倍以上。过去模型“读得多、写得少”,生成长篇报告或整套代码时,往往要分段生成再人工拼接;输出上限大幅放宽,意味着一次交出完整成品在技术上变得可行。官方公布的三项测试成绩如下:
- DeepSWE v1.1:77.9%
- CWE-bench v1:68%,与其他模型并列第一
- AutomationBench:51.3%
定价方面,API 推广期为每百万 token 输入 2 美元、输出 10 美元,推广期结束后调整为输入 4 美元、输出 20 美元,价格直接翻倍,测算长期成本应以后者为准。
为什么先给网络安全防御者?
CWE-bench 以软件漏洞为名,成绩并列第一,说明模型在这类任务上表现突出。这类能力是双刃剑:防守方可以用来提前修补漏洞,攻击方也可能用来寻找突破口。Google 先让受信任的防御者使用,再配合美国政府的上市前审查,可解读为“先观察风险、再扩大开放”的保守路线,也反映出前沿模型发布越来越重视安全把关。
业界反应:成绩亮眼,实战仍有疑问
发布当天,Bloomberg 报道 Google 内部对 Gemini 4 Argon 的实战编程能力仍有疑虑。这提醒外界:测试分数是在标准化题目上取得的,真实项目需求模糊、代码陈旧、系统相互牵连,表现未必能等比例转化。
对管理者的意义
这则新闻对管理者有两点直接启示:
- 百万 token 输出如果在实际应用中站得住,长篇文档、完整系统代码这类“整包交付”的工作可能交给 AI 一次完成,值得提前梳理哪些流程适合。
- 模型尚未开放、内部评价也有分歧,不必急着调整采购或流程;较务实的做法是跟踪正式开放时间与第三方实测,并把推广期后的价格纳入预算评估。
先看清楚,再决定要不要跟进。