应用与产品

谷歌让 Gemini Live 从语音对话走向任务执行:Spark、Daily Brief 与免手操作收件箱加入工作流

谷歌为 Gemini Live 推出生产力功能,将语音对话从信息询问扩展为可跨应用执行任务:引入 Gemini Spark 处理持续多步骤任务、Daily Brief 提供可听取的日程与邮件摘要,并支持免手操作的 Gmail 收件箱管理。这些功能通过连接 Google 生态的服务在后台执行,但也带来权限与准确性等可控性挑战。

谷歌让 Gemini Live 从语音对话走向任务执行:Spark、Daily Brief 与免手操作收件箱加入工作流

谷歌为 Gemini Live 推出生产力功能,将语音对话从信息询问扩展为可跨应用执行任务:引入 Gemini Spark 处理持续多步骤任务、Daily Brief 提供可听取的日程与邮件摘要,并支持免手操作的 Gmail 收件箱管理。这些功能通过连接 Google 生态的服务在后台执行,但也带来权限与准确性等可控性挑战。

谷歌正在把 Gemini Live 从“可以自然交谈的语音助手”,进一步变成能够代用户推进事务的入口。8月26日,谷歌宣布为 Gemini Live 增加一组生产力功能:用户可以通过自然语音调用 Gemini Spark,创建跨应用、可持续运行的复杂任务;直接听取 Daily Brief;还可以在不打开键盘的情况下搜索、整理和处理 Gmail 收件箱。

谷歌在官方公告中说,63%的用户会用语音与 Gemini 交流。这次更新的重点,不是让语音回答更像人,而是让一次对话能够延伸到日程、邮件、文档和个人信息等具体工作流。

从“说给 AI 听”到“让 AI 去做事”

新功能首先连接了 Gemini Spark。用户可以在 Gemini Live 中直接口述一个多步骤任务,而不必先判断应该打开哪个工具。例如,用户可以把一段零散的头脑风暴想法说出来,让 Spark 整理主题并生成 Google Docs 大纲;也可以要求它制定每周家庭餐单,并根据保存在文档中的食谱生成购物清单。

这类任务的关键在于,它们并不要求 Gemini 在当前对话里立即给出一段答案。根据谷歌的描述,Spark 可以跨越 Google Docs、Sheets、Drive 以及网页工作,在数天或数周内执行定时或长期任务,即使用户没有持续打开 Gemini 也能继续运行。

Spark 的产品说明还显示,它可以连接 Gmail、Calendar、Drive、Docs、Sheets、Slides、YouTube 和 Google Maps 等服务。相关连接默认关闭,用户需要在设置中主动开启。对于涉及发送邮件、消费或其他高风险操作的行为,谷歌表示系统会在关键节点征求用户意见,而不是完全放弃控制权。

这条路线延续了谷歌此前把 Gemini 推向浏览器和桌面工作流的尝试。此前,Gemini Spark 已经被用于代办网页事务;谷歌还在 macOS 版 Gemini 中加入了能把自然口述内容整理后写回光标位置的功能。如今,语音输入、应用连接和后台执行被放进同一条产品链路中。

Daily Brief 把收件箱和日程变成语音摘要

第二项变化是 Gemini Live 可以直接调用 Daily Brief。用户只需说“我的每日简报是什么”,Gemini 就会把 Gmail 和 Google Calendar 中最重要的更新组织成一段可听取的摘要。

Daily Brief并不只是把邮件逐条朗读出来。谷歌的产品页面称,它会根据用户的目标筛选和排序信息,并给出下一步建议;用户还可以在简报中打开邮件、起草回复、设置提醒或安排日历事件。

不过,这项能力仍有明确的可用范围。谷歌帮助中心说明,Daily Brief目前面向美国、年满18岁的个人账号用户,并要求订阅 Google AI Plus、Pro 或 Ultra;用户还必须连接 Google Workspace,并开启 Memory。现阶段功能只支持英语,可通过 Gemini 手机应用和网页版使用。

这意味着,Daily Brief在产品定位上介于“个人信息摘要”和“日程代理”之间。它试图先替用户判断哪些事情值得注意,再把部分后续动作放回同一个界面,而不是让用户在 Gmail、Calendar 和 Gemini 之间反复切换。

Gmail 开始成为可以对话的工作对象

谷歌还推出了面向收件箱的免手操作功能。用户可以询问“有什么新邮件”,也可以进一步限定条件,例如询问当天是否有来自孩子学校的紧急邮件。Gemini Live能够搜索和总结相关邮件,并执行加星、归档或删除等操作。

这项变化建立在谷歌此前对 Gmail 的 AI 改造之上。谷歌在Gmail 进入 Gemini 时代的公告中介绍过 AI Overviews 和 AI Inbox:前者用自然语言回答关于历史邮件的问题,后者则尝试从收件箱中筛出待办事项和高优先级信息。

差别在于,过去的 Gmail AI 主要出现在邮件或收件箱界面里,而 Gemini Live把这些能力搬进了连续的语音对话。用户可以先询问当天安排,再追问某封邮件的细节,随后要求把邮件中的活动邀请加入家庭日历。谷歌给出的示例中,后续的跨应用执行会交给 Spark 在后台完成。

这也解释了谷歌为什么把这些更新放在 Gemini Live,而不是只作为 Gmail 的单点功能发布:语音成为了统一入口,Spark负责长期任务,Daily Brief负责主动整理,Personal Intelligence则负责把过去的对话和已连接的应用串起来。

便利性背后仍是权限和准确性问题

谷歌希望用户不必先理解产品结构。用户不需要知道一个请求应该由 Spark、Daily Brief还是 Gmail 功能处理,只要继续说下去,系统就会在后台选择相应的能力。

但这种体验也把更多判断交给了模型。语音理解可能出现转录错误,个人信息连接会扩大数据使用范围,而归档、删除、发送邮件等操作一旦执行,后果可能无法通过原对话完全撤回。谷歌目前采取的做法是让用户主动连接应用,并在高风险动作前保留确认环节。

因此,这次更新的真正变化并不是“Gemini学会了更多语音指令”,而是 Google 试图把语音对话变成一层可以调度个人数字生活的控制界面。对用户来说,未来的使用重点可能不再是向聊天机器人提问,而是用一句自然语言描述目标,再决定哪些权限可以交给它长期运行。

Gemini Live的官方产品说明显示,它目前已经可以在对话中连接 Gmail、Drive、Calendar、Tasks、Keep、Maps 和 YouTube 等服务。不过,具体的可用地区、账号类型、语言和订阅条件仍因功能而异。随着更多任务从“回答”转向“执行”,谷歌接下来需要证明的,也将是这些后台操作是否足够透明、可控和可靠。

相关报道

AIFlux此前曾报道Gemini Spark接入Chrome,以及谷歌为 macOS 版 Gemini 加入自然说话能力。这些更新共同指向同一趋势:Gemini正从独立聊天应用,逐步变成覆盖浏览器、桌面和个人应用的任务执行层。

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读