应用与产品

谷歌八月 AI 发布回顾:Gemini 3.7 Flash、语音转写与 Pixel 11 共同推进“主动式”AI

谷歌在 2026 年 8 月推出 Gemini 3.7 Flash、Gemini 3.5 Transcribe 与 Pixel 11 系列,将模型能力通过 API 与设备端结合,推动从“会答问题”到“主动完成工作流”的转变,同时多项功能仍处于预览或分批推送阶段,实际价值需在真实环境中验证。

谷歌八月 AI 发布回顾:Gemini 3.7 Flash、语音转写与 Pixel 11 共同推进“主动式”AI

谷歌在 2026 年 8 月推出 Gemini 3.7 Flash、Gemini 3.5 Transcribe 与 Pixel 11 系列,将模型能力通过 API 与设备端结合,推动从“会答问题”到“主动完成工作流”的转变,同时多项功能仍处于预览或分批推送阶段,实际价值需在真实环境中验证。

谷歌在 2026 年 8 月的 AI 动作,呈现出一条相当清晰的产品路线:一端是面向开发者和企业的模型与接口,另一端是搭载这些能力的手机、手表和日常应用。公司先后推出 Gemini 3.7 Flash 和 Gemini 3.5 Transcribe,并在 Pixel 11 系列中把 Gemini Intelligence 更深地嵌入相机、翻译、语音输入和跨应用操作。

这意味着,谷歌正在把 AI 竞争从“模型能回答什么”推向“模型能否在具体工作流中持续完成什么”。但从公开信息看,许多功能仍处于公开预览、分批推送或地区限定阶段,实际价值还需要在真实使用环境中验证。

从 Gemini 3.7 Flash 开始,谷歌押注高频 Agent 工作流

8 月 13 日,谷歌发布 Gemini 3.7 Flash,将其定位为面向编码、知识工作和 Agent 工作流的“高性价比”模型。官方称,新模型在软件工程、网页开发和业务自动化方面较三周前推出的 Gemini 3.6 Flash 有明显提升。

谷歌公布的对比数据包括:

测试项目 Gemini 3.7 Flash Gemini 3.6 Flash
FrontierCode 1.1 Main 43.6% 34.4%
DeepSWE v1.1 65.3% 49.0%
WebDev Arena Elo 1588 1538
GDP.pdf 34.0% 22.0%
AutomationBench 30.4% 17.0%

这些数字来自谷歌的官方披露,不能直接视为独立评测结论。不同基准的提示方式、工具权限和评分方法,都可能影响结果。对生产环境而言,模型能否理解现有代码库、稳定调用工具、处理失败并减少人工复核,往往比单一基准分数更重要。AIFlux此前对 Gemini 3.7 Flash 低价押注编码与 Agent 工作流 的报道,也指出了验证成本与权限控制的重要性。

Gemini 3.7 Flash 的介绍价为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元,适用至 2026 年 12 月 31 日。模型可通过 Gemini API、Google AI Studio、Android Studio、Gemini Enterprise Agent Platform 和 Gemini Enterprise 使用,也被用于面向订阅用户的 Gemini Spark。

谷歌同时表示,3.7 Flash 更新了针对网络攻击以及化学、生物、放射性和核风险的安全防护。不过,模型安全措施并不能替代部署层面的权限隔离、审计、人工确认和回滚机制。

Gemini 3.5 Transcribe:语音识别开始承担“理解”和“执行”

8 月 26 日,谷歌推出 Gemini 3.5 Transcribe。它并非只把语音转换成文字,而是试图处理口语中的自我纠正、填充词、专业术语和格式化需求,输出更接近可直接使用的文本。

该模型被拆分为两条 API 路径:

  • 实时流式转写:通过 Live API 使用 gemini-3.5-transcribe-live,面向实时语音代理和交互式字幕,强调连续双向传输和低延迟。
  • 预录音频处理:通过 Interactions API 使用 gemini-3.5-transcribe,面向会议录音、客服通话和其他音频文件,可提供说话人归属与逐词时间戳。

谷歌引用 Artificial Analysis 的测量结果称,模型在流式场景的平均词错误率为 4.0%,非流式场景为 2.6%,最终转写时间较此前的 Chirp 3 缩短 70%。在 FLEURS 多语言测试中,流式和非流式 WER 分别为 5.50% 和 5.04%。模型可自动识别并转写 85 种以上语言。

这些数据需要结合测试条件理解。实时音频与预录音频并非同一任务,WER 也不能完整反映背景噪声、多人重叠、口音、数字和专有名词对实际部署的影响。相关功能目前主要面向开发者和企业公开预览,普通用户则通过 macOS 版 Gemini、Android 上部分地区开放的 Rambler 等产品功能接触到它。AIFlux对 Gemini 3.5 Transcribe 的发布 的梳理显示,转写、理解和后续执行仍是可以分别控制的不同环节。

Pixel 11 把模型能力带到设备端

谷歌在 8 月 12 日的 Made by Google 活动中发布 Pixel 11、Pixel 11 Pro 和 Pixel 11 Pro XL,并以 Tensor G6 芯片和 Gemini Intelligence 作为产品主线。Pixel 11 起售价为 899 美元,Pixel 11 Pro 和 Pro XL 分别为 1099 美元和 1299 美元;三款手机于 8 月 20 日上市。

新设备的 AI 功能包括:

  • Rambler:在 Gboard 中把自然口语整理成更简洁、格式更完整的文字,并支持通过语音修正内容。
  • 跨应用主动建议:根据对话、行程和其他上下文,提示用户把信息保存到日历、地图或 Wallet,或推进预订等操作。
  • Magic Capture:结合端侧智能和 Gemini 模型分析约 400 个画面,自动捕捉瞬间并生成 1200 万像素照片,同时提供裁剪和去模糊等处理。
  • Creator Suite:提供提词器、社交媒体构图辅助、项目文件夹和 Storyboard 等视频创作工具。
  • 实时翻译与 Circle to Search:在相机和媒体播放等场景中,提供识别、翻译和信息检索功能。

谷歌称,Tensor G6 配备更多 TPU 计算能力,端侧 AI 任务处理速度最高可达上一代的 3.5 倍,同时能耗最高降低至原来的约三分之一。Pixel 11 的主要差异因此不只在摄像头和屏幕规格,也在于更多 AI 任务是否能在设备本地完成。

AIFlux此前在 Pixel 11 手机与 Pixel Watch 5 正式开售 的报道中提到,主动式 AI 能否成为购买理由,取决于功能稳定性、数据授权意愿,以及有多少能力会下放到旧设备。

谷歌的共同主线:从聊天界面走向操作层

把这三项更新放在一起看,谷歌的策略并不是孤立地发布一个更强模型或一部新手机,而是试图建立一条从基础模型到产品入口的完整链路:Gemini 3.7 Flash 负责代码和多步任务,Gemini 3.5 Transcribe 负责把自然语音转化为结构化输入,Pixel 11 则把这些能力放进用户随时携带的设备。

这种路线的优势在于,模型能力可以通过 API、应用和硬件反复分发;风险则在于,主动式功能必须处理更多个人数据和现实世界操作。日历、邮件、位置、健康信息和跨应用权限,都会让“方便”与“可控”之间的边界变得更具体。

谷歌在 8 月的发布中展示了不少从语音输入到文件整理、从相机识别到预订建议的应用场景,但公开资料也表明,部分功能仍为预览、实验性或分地区推出。对开发者和消费者而言,接下来更值得观察的不是谷歌还能增加多少演示功能,而是这些系统能否在真实噪声、复杂权限和失败场景中保持稳定,并让用户清楚知道 AI 正在读取什么、决定什么,以及何时需要人来确认。

主要来源

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读