AI 快讯字节用一条指令生成整场声音
模型上新

字节用一条指令生成整场声音

2026-07-20T08:03:50.249Z
字节用一条指令生成整场声音

字节发布 Seed Audio 1.0,可统一生成人声、音效与环境声,并支持时间线控制、20 多种语言和长音频音色一致性。它瞄准的不是单一配音,而是完整声音场景。

字节把对白、音效和环境声塞进了一个模型

字节跳动 Seed 团队今天正式发布音频创作模型 Seed Audio 1.0,并已将其上线至火山方舟体验中心。Seed Audio 1.0 是一个面向完整声音场景的多模态音频生成模型,可在统一框架内联合生成人声、音效、环境声等元素。

这次发布的重点不是把文本转语音再做得自然一点,而是试图压缩传统音频制作中彼此分离的多个环节。用户可以在一条提示词里写入角色对白、说话情绪、声音出现时间、环境氛围和关键拟音,再由模型端到端生成一段具备叙事结构的音频。

举个典型场景:一段悬疑短剧需要先出现雨声,随后让脚步从远处靠近,女主角压低声音说出台词,最后在第 12 秒插入玻璃破碎声。传统工作流通常需要配音、音效素材检索、多轨剪辑和混音;Seed Audio 1.0 想做的是把这些要求直接写进提示词,让模型一次完成编排。

Seed Audio 1.0 根据时间线统一生成人声、脚步声、雨声和玻璃破碎声的产品演示界面

严格来说,Seed Audio 1.0 并非今天才第一次露面。该模型已在 2026 年 6 月 23 日举行的火山引擎 FORCE 原动力大会上公开展示,而 7 月 20 日的动作更接近 Seed 团队面向创作者的正式发布与能力说明,同时开放火山方舟体验入口。

它不是传统 TTS,也不是另一个音乐生成器

**完整声音场景生成是指模型一次生成包含对白、非语言表达、环境声和事件音效的连续音频,而不是只输出一条干净的人声轨。**这个定位决定了 Seed Audio 1.0 与常见文本转语音模型、音乐生成模型并不处在完全相同的赛道。

传统 TTS 的目标通常是把文字读得准确、自然,并尽量保持指定音色;音乐生成模型主要处理旋律、编曲、人声演唱与歌曲结构;音效模型则擅长生成爆炸、脚步、机械运转等孤立声音。Seed Audio 1.0 试图把这些能力放进同一条时间线,让模型理解声音之间的关系。

| 产品类型 | 主要输出 | 多角色对白 | 环境声与拟音 | 时间线编排 | 典型用途 | |---|---|---:|---:|---:|---| | Seed Audio 1.0 | 完整叙事音频 | 支持 | 支持 | 支持精细控制 | 短剧、影视预演、播客、动漫、广告 | | 传统 TTS | 干净语音 | 通常需分段生成 | 通常不支持 | 多依赖后期剪辑 | 配音、有声书、语音助手 | | 音乐生成模型 | 歌曲或配乐 | 通常不是重点 | 部分支持氛围塑造 | 主要控制歌曲结构 | 配乐、歌曲 Demo、音乐创作 | | 单项音效模型 | 单个或连续音效 | 不支持 | 支持 | 通常较弱 | 游戏素材、影视拟音、素材库 |

Seed Audio 1.0 真正值得关注的地方,是它把音频生成从“生成一种声音”推进到了“安排一场声音”。这和视频模型从生成单镜头走向角色、运镜、对白与音效联合控制,本质上是同一种演进路径:模型开始接管更多制作流程,而不只是提供单个素材。

时间控制是这次最实用的能力

**精细时间控制是指用户可以指定某种声音何时进入、持续多久,以及它与其他声音如何衔接。**对于影视、短剧和广告制作来说,这项能力的重要性甚至高于单纯提升音质,因为声音如果不能踩准画面节点,再真实也很难直接使用。

官方展示的思路是把时间信息和声音事件直接写入同一条指令。用户可以要求背景雨声从开头持续铺设,让角色在特定时间开口,并在某句台词之后安排关门、碰撞或脚步等事件。模型需要同时理解语义、节奏、时长以及多个声源之间的层次关系。

这类能力的技术难点不只是“在第几秒播放一个音效”。当模型需要把一句对白压进限定时长时,它还要调整语速、停顿和情绪;当脚步声逐渐接近时,它要同步改变响度、空间位置和混响;当环境声与人声重叠时,它还要避免背景把台词淹没。换句话说,时间控制背后其实包含了声音事件规划和自动混音。

Seed Audio 1.0 单次可支持约 2 分钟音频创作,并可通过参考输入继续延长音频。两分钟足以覆盖多数短视频、广告、短剧片段和播客切片,但距离整集广播剧或长篇有声内容的一次性生成仍有明显距离,因此延长后的角色一致性比单次生成长度更关键。

音色和表演风格开始解耦

**音色与风格解耦是指模型在保持角色声音身份不变的同时,可以改变其情绪、语气、节奏和语言。**过去不少语音生成系统会把音色和说话状态绑定在一起:参考音频平静,生成结果也容易偏平;一旦要求角色大喊、哭泣或耳语,声音身份就可能发生漂移。

Seed Audio 1.0 支持文本和参考音频输入,并强调在长音频及多次延长后维持角色一致性。同一个音色可以自然切换平静、兴奋、悲伤、愤怒等状态,也可以表现笑声、叹息、停顿和口音等非语言细节。

这项能力对系列化内容尤其重要。短剧团队可以让同一角色跨多个片段保持稳定声音,游戏团队可以基于一个角色音色批量生成战斗、对话和受伤状态,播客或有声内容也可以减少跨段落重新调音的成本。

不过,官方目前没有公布跨多少次延长、总时长达到多少分钟后仍能保持一致,也没有给出说话人相似度、字错率或音色漂移的公开数值。所谓“长时稳定”现阶段更多来自官方演示和内部评测,距离可重复验证的生产级结论仍差一组完整测试。

20 多种语言不是简单换一套发音

**多语种音频生成是指同一模型能够依据不同语言的音系、重音和节奏生成自然语音,而不是逐字替换读音。**Seed Audio 1.0 支持 20 多种语言,并允许同一角色在不同语言之间维持可辨认的声音身份。

官方披露,大部分受测语言的自然度 MOS 超过 4 分;在复杂音频生成的指令遵循测试中,除越南语外,其余语言的 MOS 均高于 3.5 分。这个结果说明模型在多数语言上已经越过“可以听”的门槛,但越南语的单独掉队也反映出多语言生成仍受到音系复杂度、训练数据覆盖和评测样本分布影响。

**MOS 是 Mean Opinion Score 的缩写,即由听众对音质、自然度或指令完成度进行主观打分的平均值,通常采用 1 至 5 分量表。**MOS 超过 4 分一般意味着听感达到较高水平,但不同测试的人员数量、播放设备、样本难度和评分问题会直接影响结果,因此不同厂商的 MOS 不能脱离测试设置横向比较。

Seed Audio 1.0 的多语种能力对跨境短视频、游戏本地化和多语言广告更有现实价值。过去,同一角色切换语言往往需要寻找多个配音演员,声音身份很难一致;现在模型可以保留角色声线,同时根据目标语言调整发音、重音和语速。

官方称多数场景可用率超过 90%,但还不能只看一个数字

**可用率是指生成结果中达到预设质量门槛、无需完全重做的样本比例。**字节在影视、电视节目、短剧、动漫、播客对话、直播带货、网络创作、话剧和语音合成等场景进行了内部评测,多数场景的音频可用率达到 90% 以上。

官方还对文本生成音色能力进行了 AB 主观评测,并称 Seed Audio 1.0 在偏好度、可用率和优良率上取得明显优势。AB 主观评测是让测试者在两个匿名结果中选择更优样本的方法,适合衡量真实听感偏好,但结果高度依赖对手模型、样本构成和评测人群。

| 官方披露指标 | Seed Audio 1.0 表现 | 应如何理解 | |---|---:|---| | 支持语言数量 | 20 多种 | 覆盖多语言内容生产,但各语言能力并不完全一致 | | 多数语言自然度 MOS | 超过 4.0 | 达到较优秀听感,仍需结合测试设置判断 | | 复杂指令遵循 MOS | 除越南语外均高于 3.5 | 多语言复杂场景已有可用性,越南语仍是短板 | | 多数应用场景可用率 | 超过 90% | 内部结果较高,但缺少公开样本数和判定标准 | | 单次生成时长 | 约 2 分钟 | 足够短内容,长节目仍需延长或分段制作 | | 输入形式 | 文本、参考音频 | 可用自然语言描述,也可用声音作为角色或风格参考 |

这些数字足以证明 Seed Audio 1.0 不是实验室里的单点 Demo,但还不足以证明它可以无条件替代专业声音制作。官方尚未完整公开评测集规模、置信区间、失败样本分布和外部基线,也没有说明“可用”是否包含人工微调、重新生成或后期混音。

真正影响生产采用的指标还包括生成延迟、重复生成稳定性、对白字错率、声画同步误差、音轨可编辑性和商用授权边界。尤其在影视工业中,一个混在单文件里的完整音频即便听起来不错,也未必比可单独调整对白、环境声和拟音的分轨结果更实用;目前公开信息没有明确说明模型是否提供可独立编辑的多轨或声部分离输出。

Seed Audio 1.0 的上限取决于能不能进入编辑链路

Seed Audio 1.0 最直接的用户不是只想生成一段好玩声音的普通消费者,而是短剧、广告、动漫、播客和游戏内容团队。这些团队真正关心的是模型能否缩短从脚本到样片的时间,以及生成结果能否继续进入剪辑、混音和审核流程。

对短视频创作者而言,一条指令直出对白、环境声和关键音效,可以迅速制作可发布的声音底稿;对影视团队而言,它更适合概念预演、分镜配音和低成本样片,而不是立刻替代录音棚;对游戏团队而言,批量生成同一角色的多情绪台词可能比生成一段完整混音更有价值。

Seed Audio 1.0 与字节现有内容产品之间也存在明显协同空间。Seed-Music 负责音乐生成,Seedance 系列负责视频生成,而新的音频模型补齐了对白、环境声和拟音这一层。如果后续在剪映、即梦或其他创作产品中形成音视频联合编辑,字节就能把模型能力从单次演示转化为完整工作流。

这种协同也是字节相较独立音频创业公司的优势。独立模型可能在某个语音指标上更强,但字节拥有视频生成、剪辑工具、内容平台和大规模创作者生态,能够直接观察哪些生成结果被保留、删除、重做或发布,从而持续优化模型的实际可用率。

最大风险仍是声音身份和版权

声音生成模型进入生产环境后,最敏感的问题不是音质,而是声音身份的合法使用。参考音频可以降低创建角色声音的门槛,也可能被用于未经授权的声音复刻、虚假代言和身份冒充。

平台需要在输入授权、敏感人物保护、生成内容标识、可追溯水印和滥用申诉方面建立完整机制。对于企业客户,授权证明、生成日志和内容审核能力甚至可能比 MOS 再提高 0.1 分更重要。

训练数据来源同样会影响商业落地。人声、影视音效、环境录音和音乐都可能带有版权或表演者权利,模型输出能否用于广告、影视发行和游戏商业化,需要明确的服务条款和资产授权边界。字节目前公布的重点仍是模型能力,定价、正式商用范围、服务稳定性承诺及更详细的版权政策仍有待进一步披露。

我们的判断:这是音频版的“一镜到底”,但后期还不会消失

Seed Audio 1.0 的价值不在于某个声音是否比现有 TTS 更像真人,而在于它首次把角色表演、声音事件和环境氛围放到同一个生成任务里。音频创作由单素材生成走向场景编排,是这次发布最值得关注的变化。

它也不会立刻让配音、拟音和混音岗位消失。生成模型擅长快速给出一个完整版本,但专业制作强调精确修改:导演可能只想把第 18 秒的关门声减弱 3 分贝,保留其他内容不变;如果模型无法稳定局部编辑或输出分轨,创作者仍要回到传统音频工作站处理。

Seed Audio 1.0 目前更像一台高效率的声音样片机。它可以把原本需要多个工种配合的草稿阶段压缩到一次生成,对短内容甚至可能直接交付;但在长篇叙事、精确声画同步、可重复编辑和版权治理上,产品仍需证明自己。

字节这次踩中了一个明确方向:下一阶段的生成式音频竞争,不再只是“谁说得更像真人”,而是“谁能让整场声音按照创作者的意图发生”。

参考来源

相关推荐

查看全部