谷歌发布Gemini 2.5 Flash与Flash-Lite更新版 效率大幅提升
谷歌于2025年9月25日在Google AI Studio与Vertex AI推出Gemini 2.5 Flash与Flash-Lite更新版,Flash-Lite输出token用量减少50%、Flash减少24%,代理式工具调用能力明显提升。
谷歌于2025年9月25日在Google Developers Blog发布Gemini 2.5 Flash与Flash-Lite更新版,已在Google AI Studio与Vertex AI上线。此次更新重点不是全新模型架构,而是“效率”:Flash-Lite输出token用量减少50%,相当于成本降低一半;Flash则减少24%。对长期依赖API调用量计费的企业与开发者而言,这是直接反映在账单上的改变。除了省token,新版Flash在“代理式工具调用”(agentic tool use)能力上也有明显进步:SWE-bench Verified分数由前代48.9%提升至54%,代表模型在需要连续调用外部工具、逐步解决复杂任务(如自动修复代码)时,准确率有实质提升。新版开启“思考模式”(thinking mode)时,也能以更少token达到更高质量输出,同时降低延迟与成本。
技术意义:省钱与变强同时发生
过去模型升级常见“更强但更贵”,这次更新则罕见地让效率与能力同时提升,反映Flash系列定位越来越清晰:不是拼跑分的旗舰模型,而是主打“大量调用、实时响应”场景(如客服机器人、自动化流程、实时摘要)的主力模型,token成本下降对高频使用场景影响尤为显著。
与前代及定位的对比
官方说明这次发布的是“预览版”(可用字符串gemini-2.5-flash-preview-09-2025测试),不会直接取代现有正式稳定版。谷歌把更新定位为“探路”——收集开发者实际使用反馈,再决定哪些改进正式纳入下一个稳定版,显示厂商推动更新时越来越谨慎,避免大改动造成既有应用行为不可预期的变化。
业界反应:持续的“降本增效”竞赛
此次更新紧接同月早些时候Gemini系列调整之后,显示谷歌正加速更新频率,而OpenAI、Anthropic、xAI等竞争对手近几个月也都推出强调成本效率或工具调用能力的模型版本。这场“同样质量、更低成本”的竞赛,正把AI从昂贵的实验性技术,推向可大规模嵌入日常系统的基础设施。
对管理者而言,这则新闻的意义不在于要不要换模型,而在于提醒:AI导入成本结构正持续下降,过去因token成本卡关、暂缓上线的自动化流程(如客服应答、库存查询代理、报表摘要),现在值得重新评估可行性。