YuE2发布:AI写歌先写谱

YuE2 引入符号规划层,让模型先生成可编辑的音乐结构,再完成演唱与伴奏渲染。相比端到端写歌,这条路线更强调结构控制、局部修改和二次编曲。
AI 音乐生成开始补上“乐谱层”
YuE2 近日正式发布,这一代模型没有继续把重点放在“输入一句话、直接吐出音频”上,而是引入了符号规划(Symbolic Planning):先规划歌曲的旋律、节奏与结构,再把规划结果渲染成包含人声和伴奏的完整歌曲。
**YuE2 是一个以符号化音乐规划为中间层的完整歌曲生成模型。**它延续了 YuE 从歌词生成歌曲的方向,但改变了模型组织音乐的方式——在文本和最终波形之间,加入一层更接近乐谱、旋律线与段落结构的表示。
这看起来只是多了一个步骤,实际却触及了当前 AI 音乐产品最棘手的问题:生成不难,修改很难。
Suno、Udio 以及上一代 YuE 都已经证明,大模型可以在几分钟内生成听起来像一首歌的音频。但当用户要求“第二段副歌升高两个音”“保留旋律,只把摇滚改成爵士”“主歌不动,重新设计桥段”时,端到端音频模型通常只能整段重抽。用户控制的不是歌曲,而是一台带随机性的自动售货机。
YuE2 的判断是:如果 AI 音乐要进入专业创作流程,就不能只生成声音,还要显式生成可操作的音乐结构。

符号规划到底解决什么问题
**符号规划是指模型先用离散、结构化的音乐信息描述一首歌,再根据这份计划合成音频。**这些信息可以被理解为位于自然语言提示词与音频波形之间的“施工图”,通常涉及旋律走向、节拍、和声关系、段落边界以及重复结构等要素。
传统端到端音乐模型更像一位即兴演奏者:它从左到右持续预测音频 token,前几秒唱得怎么样,会直接影响后面的发展。生成时间越长,模型越容易出现旋律漂移、段落失衡、歌词重复或者副歌不够突出的问题。
符号规划则更接近制作人的工作方式:先确定主歌、副歌和桥段如何组织,再安排旋律与节奏,最后选择音色并完成演唱。这并不意味着 YuE2 完全消除了随机性,而是把一部分随机性从不可解释的波形空间,转移到了更容易观察和修改的音乐结构空间。
这种改变至少带来四个直接价值:
- **长程结构更容易保持一致。**副歌旋律可以按计划重复,而不是依赖模型在数十秒之后“记住”此前生成的音频。
- **局部编辑成本更低。**用户理论上可以调整某一段旋律、节奏或结构,而不必推翻整首歌曲。
- **风格迁移更可控。**同一份旋律规划可以交给不同的音频渲染条件,尝试流行、摇滚、电子或爵士等编曲方向。
- **人类创作者更容易介入。**编曲者面对的不再只有一条混合完成的音频,而是一个可以继续加工的中间表示。
这里最关键的不是“AI 也会写谱”这一表面功能,而是 YuE2 把歌曲生成拆成了两个性质不同的问题:先回答“这首歌写什么”,再回答“这首歌听起来怎样”。
从 YuE 到 YuE2,不只是版本号升级
**YuE 是一个面向歌词到完整歌曲生成的开源基础模型系列。**上一代 YuE 由香港科技大学与 Multimodal Art Projection(M-A-P)团队推进,目标类似于开放版本的全曲生成系统:输入歌词、流派和人声等条件,输出可持续数分钟的人声与伴奏。
初代 YuE 采用两阶段生成架构,公开模型名称显示,第一阶段模型规模为 7B,负责主要的音乐 token 生成;第二阶段模型规模为 1B,用于进一步细化音频。其官方仓库采用 Apache-2.0 许可证,搜索结果快照显示已获得约 6400 个 GitHub Star 和 755 个 Fork,说明它已经形成了不小的开发者社区。
2025 年 3 月,YuE 生态还加入了增量歌曲生成能力。配套的 YuE-UI 支持批量生成、候选结果选择、歌曲续写、交互式时间线、第一阶段快速预听以及会话保存。这些功能改善了工作流,但其核心仍然是在音频生成结果上进行选择和续写。
YuE2 往前走了一步:它试图让用户编辑“生成依据”,而不只是编辑“生成结果”。
| 对比维度 | YuE | YuE2 | Suno / Udio 类产品 | |---|---|---|---| | 核心定位 | 开源歌词到完整歌曲生成 | 带符号规划的完整歌曲生成 | 面向消费者的云端歌曲生成 | | 主要输入 | 歌词、流派、人声条件、音频提示 | 歌词、风格与符号化音乐规划 | 文本描述、歌词、参考音频等 | | 生成路径 | 直接生成音乐 token,再细化音频 | 先规划音乐结构,再渲染歌曲 | 以端到端生成和产品化编辑为主 | | 结构控制 | 主要依赖歌词分段和上下文学习 | 符号层提供更明确的结构控制 | 通常通过重生成、续写或分段编辑实现 | | 局部修改潜力 | 有限,常需重新生成片段 | 更适合修改旋律与段落后重新渲染 | 取决于平台提供的编辑能力 | | 开放程度 | 代码与模型生态开放 | 沿 YuE 开源仓库持续推进 | 闭源在线服务为主 | | 适合用户 | 研究者、开发者、独立音乐人 | 需要结构控制和二次编曲的用户 | 希望低门槛快速出歌的普通用户 |
YuE2 目前真正的竞争对手,并不只是 Suno 或 Udio。它也在和传统数字音频工作站中的 MIDI、自动编曲软件、旋律生成插件竞争,因为符号规划一旦可编辑,就会进入专业音乐工具长期占据的区域。
SheetSage2 让旧录音也能进入生成流程
**Lead sheet 是一种记录主旋律、和弦与歌曲结构的简化乐谱。**它不像完整总谱那样描述每件乐器,却保留了重新演绎一首歌所需的核心音乐信息。
按照 YuE2 展示的工作流,系统可以结合 SheetSage2,把现有录音转换成可供规划和渲染使用的旋律谱,再由 YuE2 按新的风格重新演绎。这意味着它不只支持“歌词从零写歌”,还可以处理“录音转结构、结构再生成”的链路。
这一能力的实用场景相当明确。例如,一名创作者可以录下一段手机哼唱,让转录模型提取旋律,再要求 YuE2 把它扩展成带有完整主歌和副歌的作品;也可以保留一首 demo 的主旋律,重新设计配器与演唱风格;研究者则可以在相同符号规划下比较不同音频渲染模型,而不必反复抽取完全不同的旋律样本。
这类工作流比纯文本提示更符合真实音乐生产。音乐人通常不是用一句自然语言描述完成全部创作,而是在哼唱、和弦、乐谱、参考录音和工程文件之间来回迭代。YuE2 的价值,在于开始承认这些中间材料的重要性。
但边界也很清楚:音频转谱不等于完美扒谱。复杂和弦、快速装饰音、自由速度、密集配器与非标准音高,都可能造成转录误差。如果输入乐谱本身有错,后续渲染得再逼真,也只是把错误唱得更像真的。
可编辑比“再抽一次”更重要
**可编辑生成是指用户能够修改模型的中间表示,并让修改稳定反映在最终结果中。**这是 YuE2 最值得关注的方向,也是 AI 音乐从娱乐工具走向生产工具的分水岭。
当前不少 AI 音乐产品已经提供续写、翻唱、分轨或局部替换功能,但用户经常遇到一个问题:修改一个局部,其他部分也跟着变化。原因在于模型并没有把旋律、演唱、配器和音色完全拆开,重新生成某一段时,多个因素会一起被采样。
符号规划提供了一种更清楚的控制界面。假设用户不满意副歌的最后两小节,理想情况下只需修改对应旋律或和声规划,再渲染该段,而不是重新生成整首歌。又比如,用户希望把一段抒情旋律改成朋克编曲,如果旋律规划和声音渲染确实解耦,就可以尽量保留音符关系,只改变节奏密度、乐器配置与人声表达。
不过,“加入符号层”不自动等于“编辑体验成熟”。真正决定 YuE2 能不能进入创作流程的,是下面几个更具体的问题:
- 修改一个音符后,音频里是否只发生预期变化?
- 同一份规划重复渲染时,旋律、歌词对齐和段落长度是否稳定?
- 符号层能否导出到常见音乐制作软件继续加工?
- 人声与伴奏是否可以分别编辑,而不是只能输出最终混音?
- 中文、英文、日文等不同语言的字音对齐是否同样可靠?
- 三分钟以上歌曲能否维持音色、调性与演唱角色的一致性?
这些指标比单纯比较试听样例更重要。音乐模型的官方 Demo 往往是从多个候选结果中筛选出的最佳样本,而专业用户关心的是成功率、可复现性和修改成本。
YuE2 仍需补上量化成绩单
YuE2 当前展示出的技术方向足够明确,但公开资料中的量化信息仍不完整。截至 2026 年 9 月 11 日,从现有参考资料无法确认 YuE2 是否公布了统一的主观听感评分、歌词可懂度、旋律一致性、生成速度及显存占用等完整结果,也没有足够数据证明它在所有音质指标上已经超过主流闭源产品。
这意味着现在不宜把 YuE2 简单描述为“音质超越 Suno”或“最强开源音乐模型”。更准确的判断是:YuE2 在生成范式上提出了一个比单纯提升音质更有价值的方向,但其工程完成度仍要看模型权重、推理工具、符号格式和编辑闭环的实际开放情况。
对本地部署用户而言,硬件门槛也值得关注。初代 YuE 的主要生成阶段达到 7B 参数,第二阶段为 1B;即便通过量化和分阶段加载降低显存需求,生成数分钟双声道音乐仍比生成文本昂贵得多。YuE2 增加规划与渲染流程后,控制能力可能更强,但工作流也会更复杂,不能简单理解为一个轻量级的桌面插件。
此外,符号规划提升了作品复用能力,也会放大版权和声音权利问题。录音转谱、风格重演绎与人声模仿在技术上可以属于同一条链路,但在法律上涉及作品版权、录音制品权、表演者权和人格权益。开源不代表生成结果天然可商用,开发者仍需核对模型许可、训练数据说明和输入素材授权。
对开发者意味着什么
YuE2 最适合的并不是只想“一键出歌”的用户,而是需要把音乐生成嵌入编辑、编曲或智能体工作流的开发者。
官方展示的 yue2-music Skill 表明,团队也在尝试让智能体调用音乐规划与生成能力。这里的重点不是让聊天机器人多一个写歌按钮,而是让智能体能够执行连续任务:分析歌词结构、制定段落方案、生成旋律规划、试听结果、修改指定小节,再输出完整歌曲。
如果这套能力能够稳定开放,开发者可以围绕它构建几类产品:
- **AI 编曲工作台:**在人类输入旋律与和弦后,生成多种风格的完整编曲。
- **歌曲版本管理工具:**保存符号规划、渲染条件和每次修改记录,而不是只保存音频文件。
- **游戏与互动内容配乐:**根据剧情状态调整段落、节奏和配器,同时保持主题旋律一致。
- **音乐教育产品:**展示歌词如何映射到旋律、和声和段落结构,让学习者比较不同规划方案。
- **可控翻唱与再演绎工具:**在获得合法授权的前提下,保留核心旋律并重构风格与配器。
这也是 YuE2 与普通文生音乐模型最大的区别:后者交付一个结果,前者试图交付一套可以继续工作的音乐表示。
我们的判断:AI 写歌终于不只是在“猜声音”
YuE2 最值得肯定的地方,是没有继续陷入单纯比拼试听音质的竞赛。当前 AI 音乐的短板已经不是能不能生成一段像样的声音,而是能不能控制、修改、复用并接入现有生产流程。
符号规划并非新概念,MIDI、乐谱生成和自动作曲系统已经存在多年。YuE2 的新意在于,试图把符号音乐的结构优势与现代生成式音频模型的表现力放在同一条完整歌曲链路中。前者负责让作品可理解、可编辑,后者负责让结果听起来像真实演唱与制作。
如果 YuE2 能把这层中间表示真正开放出来,并提供稳定的音频对齐、局部重渲染和工程导出能力,它对开源 AI 音乐生态的意义会超过一次常规模型升级。反过来,如果所谓符号规划只能由模型内部读取,用户看不到、改不了,也无法进入常见音乐软件,那么它仍然只是更复杂的内部推理过程,而不是可用的创作接口。
因此,现阶段对 YuE2 最合理的评价是:**方向领先于结论。**它没有证明 AI 已经能替代作曲、编曲与制作人,但明确指出了下一阶段 AI 音乐产品应该补什么——不是再多一个生成按钮,而是一张真正可修改的“乐谱层”。
参考来源
- YuE 官方 GitHub 仓库:YuE 与 YuE2 的开源代码、更新记录、许可证及项目说明。
- YuE 第一阶段 7B 模型:上一代 YuE 主要歌曲生成模型的公开模型页面。
- YuE 第二阶段 1B 模型:用于音频细化的第二阶段模型页面。



