Lyria 3.5上线,Gemini一键做整首歌

Google于2026年9月5日将音乐生成模型Lyria 3.5接入Gemini应用与Gemini API,支持根据文字或最多10张图片生成包含主歌、副歌、桥段的数分钟完整歌曲,并通过SynthID嵌入隐形水印。
Lyria 3.5上线:Google终于把音乐生成从“片段玩具”推进到完整歌曲
Google今天(2026年9月5日)宣布,最新音乐生成模型 Lyria 3.5 正式接入 Gemini 应用和 Gemini API,用户可以通过一句文字描述或上传图片,生成包含多段主歌、副歌、桥段以及人声歌词的数分钟完整歌曲。
这次更新的关键,不是又多了一个“输入提示词、输出一段音乐”的模型,而是 Google 开始把 Lyria 从实验性音乐工具,推进到普通用户产品和开发者平台。对创作者来说,它降低了制作完整歌曲小样的门槛;对 Google 来说,则是在 Suno、Udio 等音乐生成产品已经教育市场之后,补上 Gemini 生态中的音乐能力。

Lyria 3.5是什么?它是Google面向完整歌曲生成的音乐模型
Lyria 3.5 是 Google DeepMind 开发的音乐生成模型,重点优化了包含多段主歌、副歌和桥段的结构化完整歌曲生成。 与主要生成短片段、循环音频的模型不同,Lyria 3.5试图理解一首歌的整体结构,而不是只把几秒钟的旋律延长。
从实际使用角度看,两者的差别类似于“生成一张海报”和“制作一支短片”:前者只要局部效果好,后者还要考虑开场、推进、高潮和收束。音乐生成尤其如此。一段30秒的副歌听起来抓耳,并不代表模型能把同一个主题自然发展到两三分钟,更不代表它能处理主歌到副歌之间的情绪过渡。
Google给Lyria 3.5设定的目标,是让模型能够生成更完整的歌曲结构,包括:
- 多段主歌(Verse);
- 具有重复性和记忆点的副歌(Chorus);
- 用来转折、扩展或抬高情绪的桥段(Bridge);
- 人声、歌词与伴奏的同步编排;
- 鼓组、贝斯、和弦、旋律等多个声部之间的整体协调。
这并不意味着Lyria 3.5已经替代制作人、编曲师或录音棚。更准确的定位是:它把“从零开始做一首歌”的第一版成本压到了几分钟以内。对于广告配乐、播客片头、短视频背景音乐、游戏原型音乐和歌曲小样,这个变化比单纯提高音质更有用。
Gemini应用:从“描述一个想法”到“一键生成歌曲”
Gemini应用中的Lyria 3.5面向普通用户,交互方式仍然是Gemini熟悉的自然语言输入。用户可以直接描述想要的风格、情绪、乐器、速度和演唱方式,也可以上传一张照片,让模型根据视觉内容生成配乐。
例如,用户可以输入:
“为一段关于深夜城市骑行的视频创作一首电子流行歌曲,速度中快,主歌克制,副歌具有宽阔的合成器音墙,加入女声演唱和容易记住的英文歌词。”
也可以上传一张雨夜街景照片,让模型围绕“潮湿、霓虹、孤独但有希望”的情绪完成音乐创作。这里的图片输入不是简单的“给照片配一段随机背景音”,而是让模型从画面中的色彩、场景和情绪线索中提取创作方向。
目前公开资料显示,Google在Gemini应用中提供音乐生成能力,并为生成内容配套封面图和SynthID标识。此次Lyria 3.5进一步把能力从30秒音乐片段推进到数分钟级完整歌曲。不过,Gemini应用的具体开放范围、地区、语言、账号等级和每日生成额度,仍可能因市场和订阅方案不同而变化。Google AI Plus、Pro和Ultra订阅用户通常会获得更高的使用上限,但截至目前,Google没有公布Lyria 3.5在Gemini应用中的统一生成次数和等待时长。
这意味着,Gemini更适合“快速创作”和“低门槛试用”,而不是马上成为专业音乐工作站。用户可以得到一首能听的完整歌曲,但如果要精确修改某一小节、单独替换贝斯轨、调整每句歌词的重音,现阶段仍需要把音频导出到传统编曲或音频编辑软件中继续处理。
Gemini API开放:开发者可以把音乐生成嵌入产品
Gemini API 是 Google 面向开发者提供的模型调用入口,Lyria 3.5通过新的 Interactions API 统一调度文本、图片和音频生成任务。 这让音乐能力不再局限于Gemini聊天窗口,而可以进入视频编辑器、游戏工具、教育应用、广告创意平台和内容生产流水线。
Google AI Studio、Vertex AI以及Gemini API均被列为Lyria系列的开发者接入渠道。开发者能够以文字提示作为创作约束,也可以同时提交图片,让模型根据视觉素材生成音乐。参考文档显示,单次请求最多支持10张图片输入,适合为分镜、产品图、角色设定或一组旅行照片生成统一风格的配乐。
对应用开发者而言,最值得关注的不是“能不能生成音乐”,而是生成任务如何嵌入现有工作流。几个相对明确的使用方向包括:
- 视频自动配乐:用户上传短视频或分镜,系统根据画面节奏和主题生成背景音乐。
- 游戏原型音乐:设计师为不同关卡输入世界观和情绪描述,快速得到可测试的环境音乐。
- 广告创意小样:营销团队在脚本阶段同时生成多种风格的音乐版本,减少等待作曲和编曲的时间。
- 播客与直播包装:自动制作片头、转场和片尾音乐,尤其适合需要大量短音频素材的内容团队。
- 教育与音乐启蒙:根据学生给出的故事、诗歌或图片生成歌曲,让音乐创作变成可交互的学习过程。
不过,Lyria 3.5的API能力目前仍有明显边界。公开模型说明中,音频生成虽然受到支持,但缓存、函数调用、代码执行、搜索 grounding、结构化输出、Live API和批量API等能力并没有被列为支持项。换句话说,它更像一个“接受创作指令、返回音频和歌词”的专用生成模型,而不是可以自主调用外部工具、持续修改工程文件的音乐智能体。
两款模型怎么选?Lyria 3.5负责整曲,Clip负责短片段
Google当前文档中至少可以看到两条Lyria模型路线:一条面向30秒短片段和循环素材,另一条面向数分钟完整歌曲。不同页面中出现了Lyria 3、Lyria 3 Pro Preview以及Lyria 3.5等命名,开发者需要以所在区域和实际控制台显示的模型ID为准。
| 模型 | 模型ID | 主要用途 | 生成时长 | 输入 | 输出 | 更适合谁 |
|---|---|---|---|---|---|---|
| Lyria 3 Clip | lyria-3-clip-preview | 短片段、循环、预览 | 30秒 | 文本、图片 | MP3音频,部分文档同时列出歌词文本 | 短视频、游戏循环、快速试听 |
| Lyria 3.5 | lyria-3.5 | 完整歌曲、音乐小样 | 数分钟,可通过提示控制 | 文本、图片,最多10张图片 | MP3;参考资料显示支持WAV | 创作者、广告团队、应用开发者 |
| Lyria 3 Pro Preview | lyria-3-pro-preview | 完整歌曲生成的预览型号 | 几分钟 | 文本、图片 | MP3音频与歌词文本 | 仍在使用旧版或预览文档的开发者 |
表格里的命名差异值得特别说明。Google开发者文档在不同更新时间和语言页面中,曾使用“Lyria 3 Pro Preview”描述完整歌曲模型,也出现过“Lyria 3.5 Clip Preview”等相关名称;而9月5日的产品公告将最新版本明确称为Lyria 3.5。由此看来,Google正在进行模型版本和产品命名迁移,开发者不能只根据博客标题判断可用模型ID,最好直接检查Google AI Studio或Vertex AI控制台中的当前模型列表。
Clip模型的价值并没有消失。30秒音频对于短视频循环、游戏菜单、播客片头和广告预览反而更高效,生成速度和内容筛选成本也可能更可控。Lyria 3.5则更适合需要完整听感的场景,但生成时间、文件体积和后期编辑成本都会增加。
音频规格:MP3是默认选项,Lyria 3.5支持WAV
从输出格式看,Lyria系列默认生成MP3音频,Lyria 3.5另外支持WAV输出。MP3适合网页预览、社交平台发布和低带宽传输;WAV则更适合进入后期制作流程,因为它通常保留更适合编辑和混音的未压缩音频数据。
官方不同页面对采样率出现了44.1 kHz和48 kHz两种表述。现有音乐生成指南主要将Lyria 3系列描述为44.1 kHz立体声音频,而旗舰完整歌曲模型页面则提到48 kHz立体声。由于版本、预览型号和产品页面之间存在差异,开发者在正式上线产品前应以实际返回音频的元数据和所在平台文档为准,不能直接把所有Lyria型号都宣传为同一采样率。
这件事对普通用户影响不大,但对视频和游戏开发者很重要。视频项目通常以48 kHz作为音频工作采样率,如果模型返回44.1 kHz素材,后期仍需要重采样;如果返回48 kHz,则可以减少一次格式转换。对于影视配乐、游戏音频和广告交付,采样率、声道、响度标准和编码格式都比“听起来很高级”更决定能否落地。
SynthID:每首歌都带水印,但不等于版权已经解决
SynthID 是 Google用于识别AI生成内容的隐形水印技术,可以把不可见标记嵌入音频等媒体内容中。 Google表示,Lyria生成的音乐会嵌入SynthID,水印能够抵抗压缩、重采样等常见音频处理,用于内容识别、版权追踪和来源验证。
这对音乐生成产品是一个必要配置。AI歌曲很容易被重新编码、剪辑、上传和二次传播,如果没有来源标记,平台很难判断一段音频是否由模型生成。Google还在Gemini中扩展了音频验证能力,用户可以上传音频并询问其是否包含Google AI生成标记。
但SynthID解决的是“来源识别”问题,不是完整的版权授权系统。它不能自动回答以下问题:
- 生成歌曲的商业使用权属于谁;
- 模型训练数据是否包含受版权保护的录音或作品;
- 生成结果是否与某位真实艺术家的风格过度相似;
- 用户输入的歌词、旋律或图片是否本身侵权;
- 不同国家和地区如何认定AI生成音乐的著作权。
Google云文档提到,Lyria会应用内容安全过滤、背诵检查和艺术家意图检查,试图降低不当内容、复现训练材料以及模仿特定艺术家的风险。这类机制有助于平台控制风险,但对企业用户来说,真正上线前仍然需要确认服务条款、商用授权范围、地区限制和内容审核责任。
没有公布价格,开发者暂时无法准确算账
截至9月5日,Lyria 3.5公开文档尚未列出明确价格。对于开发者而言,这是当前最现实的不确定性。
音乐生成的成本不能只按“调用一次”理解。一首数分钟完整歌曲的计算量、生成等待时间和存储成本,都会高于30秒循环片段。应用还需要承担失败重试、内容审核、音频转码、CDN分发和用户反复修改提示词带来的额外消耗。
在价格公布之前,开发者可以先按三种产品形态评估:
- 低频创作工具:用户偶尔生成一首歌,成本主要来自单次推理和文件存储;
- 批量内容生产:每天生成数千段背景音乐,需要关注并发、排队、失败率和音频分发;
- 交互式音乐应用:用户持续修改风格、歌词和段落,真正成本可能来自多次生成,而不是最后选中的那一版。
如果Google最终按照音频时长、模型版本或输出格式计费,Lyria 3.5与Clip之间的成本差异将直接影响产品设计。对于需要大量素材的场景,先用Clip做风格筛选,再把最终方案交给Lyria 3.5生成完整版本,可能比每次都生成整首歌曲更经济。
和Suno、Udio相比,Lyria 3.5的优势是什么?
Lyria 3.5的最大优势不是“音乐生成领域第一次出现完整歌曲”,而是它进入了Gemini和Google Cloud的现有生态。Suno、Udio已经在歌曲完整度、社区传播和音乐创作体验上建立了先发优势,Google需要用平台能力而不只是模型音质来竞争。
| 维度 | Google Lyria 3.5 | Suno | Udio | |---|---|---|---| | 产品入口 | Gemini应用、Google AI Studio、Vertex AI、Gemini API | 独立音乐生成产品及开发者生态 | 独立音乐生成产品 | | 生成形态 | 数分钟完整歌曲,支持主歌、副歌、桥段 | 以完整歌曲和歌曲扩展为核心 | 以歌曲生成、扩展和风格控制为核心 | | 多模态输入 | 文本和图片,参考资料显示最多10张图片 | 以文本为主,具体能力随版本变化 | 以文本和音乐创作为主 | | 输出格式 | MP3;Lyria 3.5参考资料显示支持WAV | 以平台提供格式为准 | 以平台提供格式为准 | | 开发者接入 | Gemini API、Vertex AI、Interactions API | 需以官方当前开放能力为准 | 需以官方当前开放能力为准 | | 来源标记 | 嵌入SynthID | 需以平台当前政策为准 | 需以平台当前政策为准 | | 公开价格 | Lyria 3.5文档暂未公布 | 随订阅和额度变化 | 随订阅和额度变化 |
如果你只是想“写一首歌并发布”,Suno和Udio目前仍然是更成熟的直接竞品;如果你要把音乐生成嵌入一个已经使用Gemini、Vertex AI或Google Cloud的产品,Lyria 3.5的接入路径更自然。特别是图像到音乐、内容溯源以及企业级云平台部署,可能成为Google追赶的切入口。
这次更新真正改变了什么?
Lyria 3.5真正改变的是音乐生成的产品边界:音乐不再只是聊天机器人返回的一段试听音频,而开始成为可嵌入内容工作流的结构化输出。
此前,AI音乐产品最容易展示的是“十几秒内听起来很惊艳”的副歌。现在,竞争焦点会逐渐转向更难的问题:歌曲能否保持主题一致,歌词是否自然,段落之间是否有发展,结尾是否像一首真正完成的作品,以及用户能否精准修改而不用反复抽卡。
从这个角度看,Lyria 3.5值得关注,但还不能把它等同于“AI自动完成专业音乐制作”。它更像一个能快速交付第一版的创作引擎:适合找灵感、做小样、配视频、搭建原型;不适合在没有人工审核的情况下直接承担品牌音乐、商业发行或复杂影视项目的最终交付。
Google选择在Gemini应用和API同时上线,也说明音乐生成正在从独立玩具变成基础能力。未来的内容工具可能不再把“写文案、做图片、剪视频、配音乐”拆成四个产品,而是由同一个多模态代理根据脚本、画面和受众一次性完成内容初稿。Lyria 3.5就是这个方向上的一个具体信号。
结论
截至2026年9月5日,Lyria 3.5是Google在音乐生成领域最值得关注的一次产品化升级:它支持文本和图片输入,可以生成包含多段主歌、副歌、桥段的数分钟完整歌曲,并通过Gemini应用和Gemini API进入用户与开发者生态。
它的优势在于Google平台、Gemini多模态能力和SynthID溯源体系;短板则是价格尚未公布、文档中的模型命名和采样率存在不一致,以及精细化编曲和商业版权边界仍不清晰。对普通用户来说,现在可以把它当作“几分钟做一首歌”的创作工具;对开发者来说,真正值得等待的是价格、配额、商用授权和更细粒度的歌曲编辑能力。



