专栏 AI 管理编年史 第 83/217 讲 查看课程目录

Google 更新 Gemini 2.0 Flash Thinking Experimental:上下文暴增至百万 token、新增自主写代码能力

21/01/2025 262
3:00
Google 更新 Gemini 2.0 Flash Thinking Experimental:上下文暴增至百万 token、新增自主写代码能力

Google 于2025年1月21日发布代号0121的Gemini 2.0 Flash Thinking Experimental更新版,上下文窗口从3.2万token暴增至100万token,并新增可自主编写并执行代码的能力,数学与科学推理测试分数同步提升,目前于AI Studio与API免费开放测试。

Google在2025年1月21日发布更新版的Gemini 2.0 Flash Thinking Experimental模型,内部代号“0121”,这是继2024年12月推出的实验版之后的第二次迭代更新。此次更新最引人注目的规格变化,是将模型的上下文窗口从原本的3.2万token,一口气扩增至100万token输入,最高可支持6.4万token输出。这意味着模型单次可处理的数据量从原本大约几十页文档,一举跃升到能一次读完数百页的长文档、整个代码库,或大量会议记录。

除了容量提升,这次更新也新增了“原生代码执行”(code execution)工具。与过去需要外部对接才能执行代码不同,新版模型能在回答问题的过程中,自主判断是否需要编写代码、直接执行并依据执行结果修正答案,形成一个“思考、写代码、验证、再回答”的闭环。这项能力在上一版本模型中尚未提供。

推理能力的实测提升

根据Google公布的基准测试数据,新版本在数学竞赛题库AIME 2024的准确率达到73.3%,在研究生等级科学问答基准GPQA Diamond上达到74.2%,相较前一版本均有明显进步。这类分数的提升说明模型在多步骤逻辑推理与科学知识应用上的稳定性增强,而非单纯的表面优化。

与前代版本的差异定位

此次更新延续Gemini 2.0 Flash Thinking系列“先思考再回答”的设计逻辑,模型会先生成一段内部推理过程(reasoning trace),再输出最终答案。新增的代码执行工具,让这个推理过程不再只停留在文字层面的逻辑演绎,而能通过实际运算验证假设,这被视为从“纯语言推理”迈向“可验证推理”的关键一步,也呼应了业界对于AI模型需要具备自我校验能力的讨论方向。

目前这个实验版本于Google AI Studio与API免费开放测试,尚未列为正式发布(GA)版本,供开发者与研究人员抢先试用并反馈意见。

对管理者的意义

百万级上下文窗口意味着未来可以把整份年度报告、完整合同文件或大量客服记录一次性交给AI分析,不必再拆段喂数据;而自主代码执行能力,则让AI在处理数据运算、报表核对这类需要精确计算的任务时更值得信赖,值得留意这类“会自己验算”的模型未来在运营分析上的应用潜力。

测验检核:验证你的理解
5 篇 · 答对 80% 通过,通过后计入学习履历 登录后即可测验
问 AI:这篇文章怎么用在我的管理上?
内容由 AI 根据本文辅助生成,仅供参考,请自行判断准确性。
下一讲・AI 管理编年史 OpenAI 发布 Operator:能自己动手操作浏览器的AI代理研究预览版

相关文章

我们使用必要 Cookie 维持登录与语言设置,并记录使用行为以改善服务。你可以只保留必要项目。 隐私权政策