Google 发布 Gemini 3.7 Flash,低价押注编码与 Agent 工作流
Google 于 2026-08-13 推出 Gemini 3.7 Flash,主打编码、知识工作与 Agent 工作流,并以更低的 token 定价吸引开发者和企业用户。官方基准显示多项性能提升,但实际生产可用性仍需通过延迟、工具调用稳定性和安全部署等要素检验。
Google 于 2026-08-13 推出 Gemini 3.7 Flash,主打编码、知识工作与 Agent 工作流,并以更低的 token 定价吸引开发者和企业用户。官方基准显示多项性能提升,但实际生产可用性仍需通过延迟、工具调用稳定性和安全部署等要素检验。
Google 于 2026 年 8 月 13 日发布 Gemini 3.7 Flash,将其定位为面向编码、知识工作和 Agent 工作流的“高性价比”模型。公司公布的测试数据显示,新模型在软件工程和业务自动化相关基准上明显高于三周前发布的 Gemini 3.6 Flash;同时,Google 以每百万输入 token 0.75 美元、每百万输出 token 3.75 美元的年内介绍价推动开发者采用。
这次发布的重点不只是模型能力提升,也包括 Google 对 Agent 产品形态的进一步推进:Gemini 3.7 Flash 已接入 Gemini API、Google AI Studio、Android Studio、Gemini Enterprise Agent Platform 等开发和企业渠道,并成为 Gemini Spark 面向 Google AI Pro 和 Ultra 用户提供服务时使用的模型之一。
编码基准提升,但结果仍是厂商披露
Google 在官方公告中称,Gemini 3.7 Flash 在 FrontierCode 1.1 Main 上的得分为 43.6%,高于 Gemini 3.6 Flash 的 34.4%;在 DeepSWE v1.1 上的得分为 65.3%,高于上一代的 49.0%。Google 将这些变化归因于模型在调试、问题解决、生产级代码生成、多步规划和工具调用方面的改进。
在网页开发方面,Google 表示,3.7 Flash 能够用更少的提示生成更完整的页面和应用,在 WebDev Arena 上的 Elo 分数为 1588,高于 3.6 Flash 的 1538。对于金融、法律和生物科学等知识密集型任务,公司还公布了 GDP.pdf 基准 34.0% 对 22.0%、AutomationBench 30.4% 对 17.0% 的对比结果。
不过,这些数字均来自 Google 的官方披露,不能直接等同于独立复测结论。不同基准的任务设置、提示方式、工具权限和评分方法,都可能影响最终结果。对于需要把模型用于生产环境的团队,实际延迟、失败率、工具调用稳定性以及人工复核成本,仍比单项基准分数更重要。
这一点也与 AIFlux 此前对 Gemini API Managed Agents 的更新的观察相呼应:Agent 系统的竞争不再只是模型回答得多好,还包括能否在沙箱、预算、权限和审计机制下持续完成任务。
低价策略瞄准生产级 Agent
Google 为 Gemini 3.7 Flash 提供的介绍价为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元,适用至 2026 年 12 月 31 日。Google AI for Developers 的价格页面显示,2027 年 1 月 1 日起,标准价格将分别调整为 1.50 美元和 7.50 美元。
同一价格页面还显示,Google 正以相同的介绍价向 Gemini 3.6 Flash 提供服务。这意味着,3.7 Flash 的价格优势并不是简单地把新模型放到上一代的原价位之下,而是 Google 同时下调了 3.6 Flash 的标准使用价格,试图扩大整个 Flash 产品线在高频调用场景中的吸引力。
对于 Agent 而言,token 价格只是总成本的一部分。模型在多步任务中需要调用搜索、代码执行、文件管理或外部工具时,中间推理和工具循环都会增加消耗。Google 的官方定价说明也指出,Gemini API 的 Agent 使用成本按照底层模型的 token 消耗和工具使用规则计算,不能只用一次普通问答的价格来估算完整任务成本。
Gemini Spark 继续从聊天走向执行
Gemini 3.7 Flash 发布当天也被用于 Gemini Spark。Google 表示,Spark 面向 Google AI Pro 和 Ultra 订阅用户,在 160 多个国家和地区提供服务,并将利用新模型改进 Google Workspace 工具的调用、知识工作和多技能任务处理。
Google 给出的例子包括整理文件、起草邮件和更新状态文档。与传统聊天助手相比,这类功能要求模型理解多个文件和应用之间的关系,规划连续操作,并在执行过程中处理权限和工具返回结果。模型是否能够稳定完成任务,取决于推理能力,也取决于产品是否提供清晰的确认、回滚和错误处理机制。
此前,Google 已经把 Spark 接入 Chrome,让它在用户授权后推进网页浏览、预订和安排等任务,并在支付等高风险节点保留用户确认。Gemini Spark 接入 Chrome 的更新显示,Google 正在把 Gemini 从回答问题的工具,逐步改造成嵌入浏览器和应用的半自动工作界面。3.7 Flash 则为这条路线提供了新的模型基础。
Google 仍需证明模型能在复杂环境中稳定工作
Gemini 3.7 Flash 的发布也发生在 Google 加快模型迭代、同时面对竞争压力的背景下。路透社报道指出,Google 在推出 3.7 Flash 时没有公布旗舰 Pro 模型的发布时间。市场一直在关注 Gemini 3.5 Pro 的进展,因为该模型被视为 Google DeepMind 与 Anthropic、OpenAI 等公司竞争的重要产品。
这使得 3.7 Flash 的定位更加清晰:它不是用来承担所有旗舰模型叙事的产品,而是优先服务编码、业务自动化和 Agent 执行等高频任务。Google 试图通过更低的调用成本和更快的产品迭代,把 Flash 系列放到开发者日常工作流的核心位置。
但 Agent 的真实价值不能仅靠发布会演示或基准成绩证明。一个能生成代码的模型,还需要能够理解现有代码库、遵守项目约束、避免扩大修改范围,并在测试失败后准确定位问题。一个能操作业务软件的模型,也需要在权限不足、页面变化、提示注入和高风险操作面前保持可控。
Google 在发布公告中表示,Gemini 3.7 Flash 更新了针对网络攻击以及化学、生物、放射性和核风险的安全防护,并建议用户结合模型卡和实际部署条件评估相关能力。这意味着安全措施虽然随模型更新,但具体风险仍取决于部署环境、工具权限和人类监督方式。
从模型竞争转向工作流竞争
Gemini 3.7 Flash 的核心卖点,可以概括为更强的编码能力、更低的 token 价格,以及更紧密地嵌入 Google 的 Agent 产品线。Google 同时发布模型、调整价格并把它接入 Spark,说明公司希望把模型能力直接转化为 API 调用、企业自动化和个人生产力场景。
对开发者来说,真正值得关注的不是 43.6% 或 65.3% 这些单独的数字,而是新模型在自己的代码库、工具链和业务流程中能否减少重复劳动,同时不把验证成本转移给人类。AI 编程工具的下一阶段,可能不再只是“谁写代码更快”,而是“谁能让代码更可靠地被规划、执行、测试和审查”。
来源
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

