应用与产品

谷歌把语音带进 Gmail、Docs 和 Keep:Workspace 开始成为可以直接交谈的工作界面

谷歌将语音从单纯的输入方式升级为 Google Workspace 的操作入口,推出 Gmail Live、Docs Live 和 Keep Live 三项由 Gemini Audio 驱动的对话式功能,分阶段向不同订阅用户与企业开放;这些功能能通过自然语言检索邮件、口述生成与整理文档、将零散想法转为结构化笔记,但准确性与权限控制仍是关键问题。

谷歌把语音带进 Gmail、Docs 和 Keep:Workspace 开始成为可以直接交谈的工作界面

谷歌将语音从单纯的输入方式升级为 Google Workspace 的操作入口,推出 Gmail Live、Docs Live 和 Keep Live 三项由 Gemini Audio 驱动的对话式功能,分阶段向不同订阅用户与企业开放;这些功能能通过自然语言检索邮件、口述生成与整理文档、将零散想法转为结构化笔记,但准确性与权限控制仍是关键问题。

谷歌正在把语音从输入方式提升为 Google Workspace 的操作入口。公司 2026 年 9 月 3 日宣布,Gmail、Google Docs 和 Google Keep 将陆续加入三项由 Gemini Audio models 驱动的对话式功能:Gmail Live 用于通过自然语言查找收件箱信息,Docs Live 让用户口述并共同整理文档,Keep Live 则把零散的“脑内倾倒”转换成结构化笔记和清单。

这批功能目前已开始分阶段推出。谷歌表示,Gmail 和 Keep 面向 Google AI Plus、Pro 和 Ultra 订阅者开放,Docs 面向 Pro 和 Ultra 订阅者开放;Google Workspace 企业客户则将在之后获得相关功能。具体开放范围仍取决于账户类型、地区、订阅计划和组织设置。

Gmail Live:从搜索邮件到直接询问收件箱

Gmail Live 针对的是移动办公中一个常见场景:用户记得某项信息可能藏在邮箱里,却没有时间翻找多个邮件线程。

谷歌给出的例子包括询问“我的航班登机口是多少”,或“这周孩子的学校有什么安排”。Gmail Live 会通过对话式搜索扫描收件箱,提取相关信息并快速给出回答。用户不必先构造精确的关键词,也不必在不同邮件之间手动比对。

这使 Gmail 的 AI 能力从邮件界面内的单点辅助,转向一种连续的问答方式。用户可以先询问某个主题,再追问邮件中的具体细节。与传统搜索相比,变化不只是语音输入,而是系统需要理解自然语言中的意图,并从多封邮件中组织出一个可读的答案。

Docs Live:让口述的想法直接变成文档初稿

Docs Live 面向的是写作开始前最难处理的阶段:用户有想法,却还没有形成清晰的结构。

用户可以直接对 Docs Live 口述一段头脑风暴内容,让系统协助整理观点、搭建大纲、调整语气并形成初稿。谷歌称,在获得用户许可后,Docs Live 还可以从 Gmail、Drive、Chat 以及网络中提取相关信息,为文档补充上下文。

这类设计把 Google Docs 从一个等待用户输入的编辑器,变成了一个可以实时交谈的“思考伙伴”。用户不需要先把想法整理成完整提示词,也不必在语音备忘录、搜索页面和文档之间反复切换。口述、检索、结构化和修改被放进了同一个工作流。

不过,“协助形成初稿”与“自动完成一份可直接发布的文档”仍然是两回事。Docs Live 可以组织信息和改写表达,但事实准确性、引用范围以及最终文稿是否符合用户意图,仍需要人工检查。尤其当系统被允许同时读取个人工作区和网络内容时,来源边界也会变得更加重要。

Keep Live:把思绪、清单和提醒整理起来

Keep Live 针对的是更短、更零散的记录。用户可以把突然想到的事情、购物需求或待办事项连续说出来,系统会在后台将其转换成结构化笔记和列表。

谷歌将这一过程描述为把“脑内倾倒”整理成可执行的内容。例如,用户可以围绕一个食谱口述需要购买的物品,Keep 再将其整理成购物清单。过去,Keep 更像是一个快速保存文字的地方;加入语音理解之后,它开始承担初步分类、归纳和格式化的工作。

这种能力的实际价值,可能不在于生成复杂内容,而在于降低记录门槛。用户只要先把想法说出来,之后再决定是否需要修改、补充或转化为提醒。对手机操作不方便、正在移动中,或者不想被键盘打断的人来说,这种方式尤其直接。

谷歌押注“说出目标”,而不是记住工具入口

谷歌在 2026 年 5 月的 Google Workspace 更新公告 中首次集中预告了这些语音能力。当时,公司还同时公布了 Google Pics、AI Inbox 和 Gemini Spark,展示其把 Gemini 嵌入日常办公和个人信息管理的整体方向。

9 月的正式推出意味着,这条路线开始从产品预告进入更具体的应用阶段。用户不再需要首先判断应该打开 Gmail、Docs 还是 Keep,而可以先说出自己想完成的事情,再由相应的 Workspace 功能处理。

这与谷歌此前推动 Gemini Live 跨应用执行任务的方向相呼应。AIFlux此前在谷歌让 Gemini Live 从语音对话走向任务执行一文中提到,谷歌正在把语音对话与 Gmail、Calendar、Drive 等服务连接起来,并尝试让 Gemini Spark 处理更长期、更多步骤的任务。此次 Workspace 更新的范围更窄,但落点更明确:把语音直接放进用户已经使用的办公应用。

谷歌同时也在将更多生成式能力纳入 Workspace。比如,Google Pics 上线显示,谷歌希望用户在既有的文档、演示和云端文件流程中完成图像生成与编辑,而不是在独立工具之间来回导出素材。语音功能走的是同一条产品化路径,只是它处理的不是图像,而是信息、思路和日常任务。

便利性提高后,权限和准确性仍是核心问题

语音交互降低了操作成本,却也可能把更多判断交给模型。转录错误可能改变用户原本的意思;从收件箱、云端文件和聊天记录中提取内容,意味着系统需要处理更复杂的个人数据边界;而一旦未来功能从“查找和整理”扩展到发送、删除或修改,错误操作的后果也会更加直接。

目前,谷歌强调 Docs Live 访问相关资料需要用户许可,并将 Workspace 企业客户的开放安排放在后续阶段。这表明公司仍在通过分阶段发布和账户权限控制来测试产品边界。但对于企业用户来说,真正需要评估的不只是功能是否可用,还包括管理员能否控制数据访问、员工能否理解信息来源,以及语音生成的内容能否被审计和复核。

谷歌此次更新的意义,因而不只是“Workspace 加入了语音功能”。更大的变化在于,Gmail、Docs 和 Keep 正逐渐从被动等待输入的应用,变成可以直接理解用户目标的工作界面。若这些能力能够在保持准确、透明和可控的同时扩大覆盖范围,用户与办公软件的关系可能会从“操作工具”进一步转向“交谈并委托任务”。

但在功能全面开放之前,用户仍应把 Gmail Live、Docs Live 和 Keep Live 视为需要验证的辅助工具,而不是无需复核的自动化系统。谷歌能否把自然语音真正转化为可靠的办公生产力,最终仍要由真实工作场景中的准确率、权限控制和长期使用结果来回答。

来源:

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读