AI 快讯Lyria 3.5把AI作曲推进编曲台
模型上新

Lyria 3.5把AI作曲推进编曲台

2026-07-29T18:04:16.428Z
Lyria 3.5把AI作曲推进编曲台

Google DeepMind 在 Flow Music 上线 Lyria 3.5,重点升级旋律连贯性、歌词、人声和分段控制。它的价值不只是音质更好,而是让 AI 音乐从“一键抽卡”走向可指导、可修改的制作流程。

Lyria 3.5把AI作曲推进编曲台

Google DeepMind 近日在 Google Flow Music 中推出 Lyria 3.5,新版本集中升级音乐性、歌词生成、人声表现和创意控制。相比单纯追求“第一次生成就像成品”,Lyria 3.5 更重要的变化是让创作者能介入歌曲走向:旋律如何发展、段落怎样递进、歌词怎样落在节拍上,以及人声应该用什么方式完成演唱。

**Lyria 3.5 是 Google DeepMind 面向完整音乐生成场景推出的新一代模型,核心目标是根据文本和创作指令生成包含编曲、歌词与人声的歌曲。**它目前首先落地于 Flow Music,而不是以独立开发者模型或通用 API 的形式出现。

**Flow Music 是 Google 将生成式音乐能力产品化的创作工作区,用户可以在同一流程中生成、指导和调整歌曲。**这意味着 Lyria 3.5 不是一个只负责“吐出音频”的底层模型,而是 Flow 创作链条中的音乐引擎。

Google Flow Music 中使用 Lyria 3.5 生成并分段调整歌曲的产品界面

这次升级的重点不是更响,而是更像一首完整的歌

**Lyria 3.5 首先解决的是 AI 歌曲容易“原地循环”的问题。**不少音乐模型能生成一个抓耳的八小节,但在扩展到完整歌曲时,常见结果是把同一套和弦、鼓点和旋律稍作变化后重复播放;主歌、副歌和桥段虽然都在,却没有真正承担不同的叙事功能。

Google DeepMind 在本次发布中将“musicality”放在首位,强调旋律与结构的整体连贯性。这里的音乐性不是简单提高采样率,而是让模型理解一首歌为什么需要铺垫、释放和对比:主歌负责建立情绪,预副歌负责积累张力,副歌给出记忆点,桥段则打破此前形成的听觉惯性。

**结构理解决定了 AI 音乐能不能从片段生成进入完整创作。**如果模型只认识段落标签,它可能会机械执行“主歌—副歌—主歌—副歌”;如果模型理解段落的功能,它就会相应调整配器密度、和声张力、旋律音区和演唱力度。后者才更接近编曲者的工作方式。

从现有演示方向看,Lyria 3.5 的目标正是后者。副歌不只是音量更大,而会通过叠加声部、提高旋律音区或增加节奏密度来制造高潮;桥段也不只是换一组歌词,而要引入新的和声或音色材料,为最后一次副歌提供对比。

歌词升级的关键,是“能唱”而不是“能读”

**可演唱歌词是指歌词在语义成立之外,还能匹配节奏、重音、押韵和旋律走向。**语言模型写出一段意思通顺的文字并不难,但把它放进音乐后,过长的句子会挤占拍点,错误的重音会让演唱像机器念稿,元音分布不合适还会削弱高潮部分的穿透力。

Lyria 3.5 对歌词的升级因此不能只理解为“文案写得更好”。模型需要同时处理多个约束:一句歌词有多少音节、重音应该落在哪里、尾韵是否稳定、某个元音是否适合拉长,以及上下段是否维持统一视角。

**歌词与旋律联合建模比先写词、再硬塞进旋律更有价值。**例如一句中文歌词如果包含大量连续辅音或密集短词,模型就需要调整旋律节奏,而不是强行把每个字压进十六分音符。英文歌曲则要处理弱读、连读和多音节单词的重音位置。这些细节决定了成品听起来是在“唱歌”,还是在“配乐朗读”。

Google 没有在发布说明中给出歌词准确率、押韵成功率或人工盲测分数,因此目前不能用一个百分比断言 Lyria 3.5 已经领先竞品。更实际的检验方法,是观察长句是否吞字、副歌关键词是否稳定落在强拍,以及第二段主歌能否延续第一段的叙事逻辑。

人声更稳定,但稳定不等于更有生命力

**AI 人声控制是对音色、音准、咬字、演唱力度和情绪变化进行联合约束的能力。**Lyria 3.5 强调 vocals 方面的提升,意味着它不仅要生成一个“像人在唱”的声轨,还要让演唱与歌曲类型、段落功能和歌词情绪保持一致。

人声生成最难的部分并不是唱准,而是处理可控性与自然感之间的冲突。过度追求稳定,会让每个音符都像经过量化修正,听起来干净但缺少呼吸、滑音、颤音和临场变化;过度追求随机性,又容易出现音色漂移、咬字模糊和高音破裂。

**Lyria 系列此前已经将多语言演唱作为重要能力,Lyria 3.5 则进一步把重点放到演唱表现与创作指令的一致性上。**这对中文、日文和韩文歌曲尤其重要,因为它们在声调、音高重音和音节时值方面与英语不同。模型不能只是换一套发音字典,还需要理解语言自身的韵律规则。

第三方对上一代 Lyria 3 Pro 的体验认为,其人声优势在于音准整洁和结构稳定,而 Suno V5 在气声、微颤音和情绪起伏上往往更具“真人感”。这不是可直接套用到 Lyria 3.5 的独立评测结论,但它指出了 Google 必须解决的方向:一个技术上没有明显错误的歌手,未必是最能打动人的歌手。

Creative control 才是这次最有产品价值的升级

**创意控制是指创作者能够明确指定歌曲结构、风格变化、动态和演唱方式,而不必反复随机生成整首歌曲。**它决定了音乐模型究竟是灵感玩具,还是可以进入制作流程的工具。

早期 AI 音乐产品的主要交互方式类似抽卡:输入“复古合成器流行、女声、夜晚驾驶”,然后等待系统生成两个版本。不满意时,用户往往只能重写提示词并重新生成,已经满意的主歌也会一起被替换。

**Lyria 3.5 的方向是把一次性提示词拆成可以持续指导的创作过程。**用户可以更明确地描述歌曲如何推进,例如要求开头保持稀疏配器、第二段加入鼓组、副歌提高能量、桥段改为半拍律动,最后回到更宽的和声层次。

这种能力看起来只是“更听话”,实际上会显著降低创作成本。对于品牌短片、游戏场景和影视预演,制作方通常已经知道某个转场发生在什么位置,也知道高潮需要在第几秒到来;他们缺的不是无限随机的歌曲,而是能服从时间线和叙事节奏的音乐素材。

Lyria 3.5、Lyria 3 与 Lyria RealTime 不是同一个产品

**Google 目前的 Lyria 产品线覆盖完整歌曲生成与实时音乐生成,两者的交互逻辑并不相同。**Lyria 3.5 更接近制作一首可反复修改的作品,Lyria RealTime 则更像一个会持续演奏、能被现场指挥的虚拟乐手。

| 模型或产品 | 主要定位 | 核心输入与控制 | 已公开音频规格 | 更适合的场景 | |---|---|---|---|---| | Lyria 3.5 / Flow Music | 完整歌曲创作与编辑 | 旋律、歌词、人声、段落及风格指导 | 本次公告未单独公布统一规格 | 歌曲小样、品牌音乐、视频配乐、完整作品构思 | | Lyria 3 | 上一代完整音乐生成模型 | 详细文本提示、图像启发、风格与人声描述 | 官方强调高保真输出,但未给出统一公开基准 | 从概念快速生成歌曲 | | Lyria RealTime | 连续实时音乐生成 | 实时混合提示词,并调节调性、速度、密度和明亮度 | 48kHz 立体声 | 现场表演、互动装置、实时配乐与即兴演奏 | | Suno V5 | 面向大众的完整歌曲生成 | 文本、歌词、风格及歌曲编辑 | 不同产品模式与导出设置有所差异 | 快速生成流行歌曲和人声作品 |

**48kHz 立体声是 Lyria RealTime 官方公开的规格,不能直接当作 Lyria 3.5 的参数。**Google 在本次 Lyria 3.5 公告中没有同步给出采样率、最大歌曲时长、推理延迟、生成成本或标准化盲测成绩,因此现阶段最值得关注的是产品控制能力,而不是把未公开的数据自行补齐。

和 Suno V5 比,Google 更想争夺“制作过程”

**Lyria 3.5 与 Suno V5 的竞争焦点不是谁先生成一首能听的歌,而是谁能让创作者更稳定地得到想要的版本。**Suno 的强项一直是较低的使用门槛和快速完成度,用户输入一句描述,就有较高概率获得具备主歌、副歌和人声的成品。

Google 的优势则来自对多模态创作工作流的整合。Flow 原本就围绕镜头、场景和叙事构建内容生成能力,音乐加入后,可以与视频节奏和画面情绪形成更紧密的配合。对于只想生成一首歌的用户,这种整合未必有决定性意义;对于同时制作画面、声音和故事的团队,它可能比单项跑分更重要。

| 对比维度 | Lyria 3.5 / Flow Music | Suno V5 | 当前判断 | |---|---|---|---| | 歌曲结构控制 | 强调段落推进与创意指导 | 支持完整歌曲和编辑,但复杂结构偶有偏离 | Lyria 3.5 的产品方向更偏精细控制 | | 人声表现 | 强调稳定性、多语言和指令一致性 | 第三方体验普遍更认可其情绪与演唱细节 | 仍需同条件盲测 | | 多模态工作流 | 可进入 Google Flow 创作环境 | 主要围绕音乐及相关内容生产 | Google 的生态协同更完整 | | 实时生成 | 由独立的 Lyria RealTime 承担 | 完整歌曲生成是核心 | 两者产品路线不同 | | 公开基准 | 暂无统一跑分或盲测数字 | 暂无可横向复现的统一行业基准 | 不能仅凭官方样片定胜负 | | 开发者接入 | 本次重点是 Flow Music 产品上线 | 以其官方产品能力为主 | Lyria 3.5 暂不应被视为通用开发者 API 发布 |

**AI 音乐目前缺少类似语言模型基准测试的统一评价体系。**音乐是否“更好”高度依赖曲风、审美和使用场景,而官方演示通常还会挑选成功样本。真正有说服力的比较,应固定歌词、歌曲结构、速度、调性和目标音色,再进行多人盲听,并记录结构遵循率、歌词可懂度和人声音色漂移次数。

它对开发者和专业用户意味着什么

**Lyria 3.5 最直接的用途是降低音乐概念验证的时间成本。**影视团队可以先用它验证某段剧情需要冷峻电子乐还是稀疏钢琴,游戏团队可以快速比较不同战斗场景的配器密度,品牌团队则能在正式委托作曲前确认节奏和情绪方向。

**专业音乐人更可能把 Lyria 3.5 当作草图工具,而不是完整替代数字音频工作站。**当前生成式音乐仍难以提供传统制作流程中的逐轨控制,例如单独替换贝斯音色、精修某一句和声、调整一处底鼓瞬态,或者输出所有乐器的干净分轨。只要这些能力没有完全打通,最终混音、母带和复杂编辑仍需要专业工具完成。

**开发者需要注意,本次发布不等同于 Google 开放了一个新的公共音乐模型端点。**官方重点介绍的是 Lyria 3.5 在 Flow Music 中的体验,尚未在此次材料中公布独立 API 的模型标识、价格、速率限制和地区可用性。现阶段将其理解为产品能力更新,比将其包装成可直接集成的基础设施更准确。

版权、水印和声音身份仍是绕不开的问题

**SynthID 是 Google 用于给生成内容嵌入机器可识别标记的水印技术。**Lyria 产品线一直强调生成音频的可识别性,这能帮助平台在传播环节判断内容是否由 AI 生成,但水印只能解决来源标记,不能自动解决训练数据授权、作品归属和声音模仿争议。

创作者还需要区分“像某种风格”和“像某位具体歌手”。前者可以是宽泛的音乐类型描述,后者可能涉及声音身份、人格权和商业授权。如果产品允许高度逼真的人声生成,平台就需要在提示词限制、声音相似度检测、申诉和内容标记上建立完整机制。

Google 在 YouTube 生态中的位置也让这件事更敏感。生成、分发、版权识别和商业化可能发生在同一套平台体系内,这既有利于建立可追踪流程,也要求 Google 对授权边界给出比普通创业公司更明确的答案。

判断:Lyria 3.5不是一次参数升级,而是交互方式升级

**Lyria 3.5 最值得肯定的地方,是 Google 把竞争重点从“生成一首歌”转向“指导一首歌完成”。**旋律更连贯、歌词更可唱、人声更稳定当然重要,但如果用户仍然只能不断重抽整首作品,这些升级很难进入严肃生产流程。

**Flow Music 的真正价值取决于局部编辑是否足够可靠。**如果创作者能够保留满意的副歌,只修改第二段主歌,或者锁定旋律后重新生成歌词与人声,Lyria 3.5 就可能从演示型工具变成生产型工具;如果所谓控制最终仍依赖整首重生成,它与现有产品的差距就不会像宣传中那么大。

截至 2026 年 7 月 29 日,Google 尚未在本次公告中提供可复现的公开基准、完整价格体系和独立开发者接入细节。现阶段更稳妥的结论是:Lyria 3.5 已经把 AI 音乐的产品标准向前推了一步,但它能否在成品人声上压过 Suno、在专业编辑上接近传统制作软件,仍需要实际用户和独立盲测给出答案。

参考来源

  • Google DeepMind 官方发布说明:《We’re launching Lyria 3.5 in Google Flow Music, with advances across musicality, lyrics, vocals, and creative control》。受文末外链域名规则限制,此处仅列出资料名称。
  • Google DeepMind 官方模型资料:Lyria RealTime 产品页,用于核对 48kHz 立体声、实时提示词混合以及调性、速度、密度、明亮度控制等信息。
  • Google DeepMind 官方资料:《Transforming the future of music creation》,用于核对 Lyria 产品线的生成、续写、转换和 SynthID 背景。
  • Reddit:Lyria 3.5 相关社区讨论检索:用于追踪用户实测、生成样本和后续独立对比,社区观点不等同于官方结论。

相关推荐

查看全部