谷歌推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,押注更快更便宜的 AI 智能体
谷歌发布 Gemini 3.6 Flash、3.5 Flash-Lite 与面向防守的 3.5 Flash Cyber,重点从单纯追求更大模型转向更低成本、更低延迟与更高效率的生产级智能体。3.6 Flash 主打多模态与编码效率,3.5 Flash-Lite 面向高并发低延迟场景,Flash Cyber 则限向可信伙伴用于漏洞发现与修补。
谷歌发布 Gemini 3.6 Flash、3.5 Flash-Lite 与面向防守的 3.5 Flash Cyber,重点从单纯追求更大模型转向更低成本、更低延迟与更高效率的生产级智能体。3.6 Flash 主打多模态与编码效率,3.5 Flash-Lite 面向高并发低延迟场景,Flash Cyber 则限向可信伙伴用于漏洞发现与修补。
谷歌周一(7 月 21 日)在官方博客 Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber 中发布三款新模型,试图把 Gemini 的重点从“更大”进一步转向“更省、更快、也更适合智能体”。谷歌说,这一组更新面向的是生产级 AI 智能体的实际需求:更低延迟、更高 token 效率,以及更稳定的任务执行能力。
这次发布的主角是 Gemini 3.6 Flash。谷歌称它是“workhorse model”,适合编码、知识工作和多模态任务;按照 Artificial Analysis Index 的数据,它相比 3.5 Flash 少用 17% 的输出 token,在部分基准上甚至可减少更多。谷歌还把它的定价压到每百万输入 token 1.5 美元、每百万输出 token 7.5 美元。公司在文中称,这一代 Flash 会“更少推理步骤、更多工具调用效率”,目标是把复杂工作流的总成本继续往下拉。
3.6 Flash:把效率当成卖点
在性能上,谷歌给出的对比主要围绕三个方向:代码、知识工作和电脑操作。官方说,3.6 Flash 在 DeepSWE 上的表现为 49%,高于 3.5 Flash 的 37%;在 MLE Bench 上是 63.9%,高于 49.7%;在 OSWorld-Verified 上则从 78.4% 提升到 83.0%。谷歌还强调,computer use 现在已经成为 Gemini API 和 Gemini Enterprise 的内建客户端工具,而不再只是旁路能力。
这意味着谷歌正在把“模型本身”与“模型怎么做事”绑得更紧。对企业客户来说,决定成本的不只是回答质量,还包括一次任务会调用多少次工具、要走多少轮推理、是否会在中途反复修改代码。谷歌希望 3.6 Flash 提供的,不只是更好的分数,还有更少的冗余动作。
这条产品线的走向,也能从谷歌更早的 Gemini 布局里看出来。AI Flux 先前报道过,谷歌已经把 Gemini 3.5 Flash 推到搜索核心,让 Gemini 3.5 Flash 深度整合进 Search 的 AI Mode,并且把 Gemini in Chrome 继续向英国扩展,让浏览器侧边栏逐步变成 AI 助手入口。谷歌还在 Search 里继续加应用连接能力,让 AI Mode 可以直接连 Instacart、Canva 和 YouTube Music,把搜索框往任务执行界面推。
3.5 Flash-Lite 与 3.5 Flash Cyber:一个面向规模,一个面向防守
如果说 3.6 Flash 是面向主流生产场景的“工作马”,那么 3.5 Flash-Lite 更像是为高吞吐业务准备的轻量版本。谷歌在 3.5 Flash-Lite model card 中写道,这个模型面向低延迟和高并发任务,价格为每百万输入 token 0.30 美元、每百万输出 token 2.50 美元;官方还称它是 3.5 系列里最快的模型,每秒可输出 350 个 token。谷歌表示,它在一些编码和智能体任务上甚至超过了更早的 3 Flash。
与此并行,谷歌还发布了 3.5 Flash Cyber。根据官方博客,这一版本专门针对“finding and fixing cybersecurity vulnerabilities”优化,并被设计成与 CodeMender 配合使用。谷歌说,Flash Cyber 将只向政府和“可信合作伙伴”开放,属于有限访问试点,目的是帮助防守方在漏洞被滥用前更快发现、验证和修补问题。
这也把谷歌的新发布放进了更大的安全叙事里。Flash Cyber 的限制开放,说明谷歌一边想证明自家模型在安全领域有竞争力,一边也在尽量避免把更强的漏洞发现能力直接放开。官方文中甚至强调,模型在 CBRN 和 cyber offense 风险上加入了更强的 Frontier Safety 防护,并尽量减少对良性请求的误拒。
3.5 Pro 仍在路上,谷歌想先改写市场印象
谷歌还在文末提到,Gemini 3.5 Pro 目前仍在与合作伙伴测试中,等准备好后才会广泛推出;同时,团队已经开始了 Gemini 4 的预训练。这个表述与 Reuters 7 月 16 日的报道 形成了鲜明对照:当时 Reuters 引述 Bloomberg News 指出,谷歌最强的旗舰模型 3.5 Pro 已比计划晚了数月,团队仍在改进其编码能力。Reuters 7 月 20 日又报道称 ,谷歌正在开发一款新服务器芯片,以更高效率运行 Gemini 模型,内部代号为 “Frozen v2”,显示公司也在从硬件层面压低服务成本。
在这个背景下,7 月 21 日的发布并不仅仅是一次常规迭代。它更像是谷歌对外展示的一种回答:即便旗舰节奏被拖慢,Gemini 的产品线仍在前进,而且前进的方式不一定只靠更大的模型,而是靠更便宜的推理、更成熟的工作流和更明确的安全边界。来自 9to5Google、CNBC 和 SiliconANGLE 的报道也都把这次发布解读为谷歌在“便宜、快速、安全”三个维度上的同步下注。
从用户角度看,谷歌这轮更新已经不只是开发者新闻。3.6 Flash 和 3.5 Flash-Lite 会进入 Gemini API、Google AI Studio、Android Studio、Gemini Enterprise Agent Platform、Gemini Enterprise 应用,3.5 Flash-Lite 也会进入 Search。也就是说,谷歌正在把模型发布、搜索体验、浏览器助手和企业代理平台逐步拼成同一条产品链。
对市场而言,真正值得关注的可能不是某一个单点基准,而是谷歌是否能用这一套组合拳,证明自己仍能在成本、速度与安全之间找到新的平衡点。
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

