谷歌将 Lyria 3.5 带入 Gemini:音乐生成开始走向更完整的创作工作流
谷歌将音乐生成模型 Lyria 3.5 接入 Gemini 应用与 Gemini API,提升人声表现、编排和音频保真度,同时在应用端增加风格选择、创作模板与时长控制,推动从单次提示到完整创作工作流的转变。开发者可通过 API 嵌入更复杂的歌曲结构,产品间功能存在差异,版权与标识(如 SynthID 水印)问题仍需关注。
谷歌将音乐生成模型 Lyria 3.5 接入 Gemini 应用与 Gemini API,提升人声表现、编排和音频保真度,同时在应用端增加风格选择、创作模板与时长控制,推动从单次提示到完整创作工作流的转变。开发者可通过 API 嵌入更复杂的歌曲结构,产品间功能存在差异,版权与标识(如 SynthID 水印)问题仍需关注。
谷歌表示,旗下音乐生成模型 Lyria 3.5 已于 2026 年 9 月 4 日进入 Gemini 应用和 Gemini API。公司称,新模型重点改善了人声表现、音乐编排和整体音频保真度;与此同时,Gemini 应用新增了更明确的风格选择、创作模板以及短曲和长曲选项。
这次更新的重点并不只是模型名称变化。谷歌正试图把音乐生成从一次性的提示词实验,推进到覆盖灵感、制作和应用的创作流程中。
Gemini 应用增加风格、模板和时长控制
根据谷歌在 官方博客 发布的说明,用户可以直接选择或描述音乐类型,并在有人声和纯器乐之间进行选择。新模板则面向更具体的使用场景,例如背景音乐、生日歌曲和个性化铃声。
用户还可以选择生成较短或较长的音轨。谷歌没有在这篇公告中给出具体的时长范围,但其此前的 Lyria 产品资料显示,短片段和更完整的歌曲一直是该系列模型的两条产品路径。谷歌 DeepMind 的 Lyria 模型页面目前将 Lyria 3 描述为能够生成最长约三分钟的音乐,并强调其对人声、歌词、风格和结构的控制能力。
对于普通用户而言,这意味着音乐生成的入口更接近一个简化的创作工具,而不只是一个等待提示词的模型接口。用户可以从模板开始,也可以进一步指定流派、演唱方式和曲目长度,再根据用途调整结果。
从 Gemini 到 API,谷歌扩大模型的使用场景
Lyria 3.5 同时进入 Gemini API。谷歌的 开发者文档将其描述为面向完整歌曲创作的旗舰音乐生成模型,重点支持多段主歌、副歌和桥段等较复杂的结构。文档还称,该模型能够生成 44.1 kHz 的立体声音频,并返回音乐和歌词相关内容。
谷歌的音乐生成指南将 Lyria 3 系列与 Gemini 的 Interactions API 连接起来:开发者可以通过接口生成音频,并取得模型返回的歌词或歌曲结构。AIFlux 此前对 Interactions API 的介绍也提到,谷歌正把图像、音乐和多说话人语音等媒体生成能力纳入更统一的开发者接口。
这为音乐应用开发者留下了更大的空间。音乐生成可以被嵌入视频制作、品牌音效、游戏原型、社交内容或个人创作工具,而不必局限在 Gemini 的聊天界面中。不过,开发者仍需要根据具体接口文档确认模型版本、输入形式、输出格式和预览阶段的使用限制。
可用范围扩大,但产品定位仍有差异
谷歌称,Lyria 3.5 面向全球用户开放 Gemini 网页端和移动应用,也可用于 Google Flow Music,并通过 Google AI Studio 和 Google Vids 面向开发者及技术用户提供访问入口。不同产品中的功能并不完全相同:Gemini 更强调快速创作和模板化体验,API 更适合开发者构建自己的产品,Flow Music 和 Vids 则分别连接音乐创作与视频制作流程。
谷歌 DeepMind 的 Lyria 3.5 模型卡显示,该模型使用基于时间音频潜变量的潜扩散架构训练,并使用谷歌 TPU 完成训练。模型卡称,谷歌通过人工和自动化评测考察音乐质量、人声质量、音频保真度以及提示词遵循能力;与 Lyria 2 相比,Lyria 3.5 在音频保真度和歌词提示词遵循方面有所改善。
不过,这些信息主要反映谷歌自己的评测和产品说明,并不等同于独立音乐制作测试。开发者文档目前仍以预览模型的形式介绍部分 Lyria 3.5 能力,模型输入、接口命名和可用功能也可能随着版本更新而变化。用户在将其用于商业项目之前,还需要核对服务条款、授权范围和具体地区的开放状态。
人声质量提升也带来更直接的版权与标识问题
音乐生成模型的进步,尤其是人声和结构控制能力的提升,也会让版权、署名和内容识别问题更加突出。谷歌此前对 Lyria 系列的说明称,生成音频会加入不可感知的 SynthID 水印,用于识别由人工智能生成或编辑的音乐;相关模型也会受到安全过滤和使用政策约束。
这类水印可以帮助平台和用户识别内容来源,但不能单独解决训练数据授权、风格模仿或商业使用责任等问题。对于品牌歌曲、视频配乐和公开发行内容,生成工具的易用性越高,创作者越需要在发布前保留制作记录,并确认所使用的输入和输出符合相关规则。
音乐生成竞争转向“从模型到工作流”
Lyria 3.5 的发布显示,谷歌的竞争重点正在从单纯提高音频质量,转向把音乐生成嵌入更多产品。Gemini 提供面向大众的低门槛入口,API 面向开发者,Flow Music 和 Vids 则把生成音乐放进更完整的内容生产链条中。
这一策略与视频和图像生成领域的产品化趋势相似:模型本身仍然重要,但用户是否能快速选定风格、修改结构、控制时长,并把结果带入下一步制作流程,同样决定了工具能否被持续使用。
目前尚不清楚谷歌是否会进一步提供更细粒度的分段编辑、连续修改、独立音轨或更明确的商业授权选项。对专业音乐人和内容团队来说,Lyria 3.5 能否从“快速生成一首歌”继续走向可反复编辑、可追踪和可交付的制作工具,将是下一阶段更值得观察的问题。
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

