Engram:让 AI 幻觉变成声音

音乐初创公司 Thoughtful Things 发布 Engram 众筹项目。这是一台离线运行本地 AI 的采样器和 groovebox,专门把破碎、不可预测的 AI 音频幻觉变成可演奏的实验声音。
Engram:让 AI 幻觉变成可演奏的声音
截至 2026 年 9 月 27 日,音乐初创公司 Thoughtful Things 已经在 Kickstarter 发起首款硬件乐器 Engram 的众筹。Engram 是一台内置本地 AI 的采样器和 groovebox,能够实时重塑输入音频,也能基于短促的声音片段生成完全不同的新声音。
它最值得注意的地方,不是“AI 能不能自动写歌”,而是把 AI 最常被批评的不可预测性,直接变成一种演奏方法。
Engram 是一台使用本地小型 AI 模型处理声音的硬件采样器,它不依赖互联网,也不把最终目标设定为生成一首可以直接发布的流行歌曲。用户输入人声、鼓点、环境声或乐器片段,Engram 会对这些声音进行切片、变形、重组和再生成,最后输出带有失真、断裂和陌生感的声音素材。
这和把 Suno、Udio 装进一个盒子里完全不是一回事。Suno 和 Udio 的核心体验是输入提示词,等待系统生成一首结构完整的歌曲;Engram 则更像一个会“误解”声音的乐手,用户需要不断输入、触发、采样和调整,结果往往不稳定,但也因此更适合现场演奏和实验音乐。

它到底在做什么
采样器是能够录入、切片、编辑并重新播放声音片段的电子乐器;groovebox 则是把采样器、鼓机、音序器和效果器整合在一起的独立音乐工作站。Engram 把这两类设备与一个本地 AI 音频模型结合起来,重点不在“生成成品”,而在“制造可继续加工的声音”。
从工作方式看,Engram 至少包含三层能力:
- 输入声音:用户可以把现实中的声音或已有音乐片段送进设备。
- AI 变形:本地模型分析并重构输入内容,生成与原始声音有关、但不完全受其约束的新结果。
- 采样与演奏:用户把结果重新切片、循环、叠加,再通过硬件控制器继续演奏。
传统采样器的变化通常来自确定性的参数,例如播放速度、起止点、音高、滤波器、包络和效果器。Engram 增加的变量是模型本身:它可能保留原始声音的节奏,也可能只留下某种质感;可能把一句人声变成颗粒化噪声,也可能生成一个原本不存在的打击乐片段。
这类体验的关键不是“模型理解了什么”,而是模型在哪些地方理解错了。对普通语音助手来说,声音被错误识别是问题;对实验音乐来说,错误识别可能正好是素材。
Engram 不追求“按一下出成品”
Engram 的产品定位是实验型乐器,而不是自动作曲机。它不试图替代音乐人的编曲、混音和审美判断,也没有把“几秒钟生成一首完整歌曲”作为卖点。
这个区别很重要。过去两年,AI 音乐产品大量围绕“降低创作门槛”展开:用户输入一段文字,模型输出主歌、副歌、伴奏和人声。这样的产品适合快速制作广告小样、社交媒体配乐或概念 Demo,但问题也很明显:结果容易趋同,用户对生成过程的控制有限,最终产物通常更像模型的平均审美,而不是用户自己的声音。
Engram 选择的是另一条路:让用户保留更多操作,但接受更高的不确定性。
它的使用场景可能包括:
- 现场电子音乐演出中,把观众声音、环境噪声和乐器输入实时变成新的声部;
- 电影、游戏和装置艺术中,制作不容易从传统音源库找到的异质声音;
- 实验音乐创作中,把一次无法复现的模型输出当作独特采样;
- 音乐制作人的声音设计阶段,用 AI 先生成方向,再由人工筛选和加工;
- 教学或工作坊中,让参与者直观看到输入声音如何被模型拆解和重组。
换句话说,Engram 不是让 AI 替你完成一首歌,而是让 AI 成为一个带有随机性的音色伙伴。它更接近一台可演奏的声音实验室,而不是一台自动点唱机。
“幻觉”为什么适合做音乐
AI 幻觉是模型在缺乏可靠依据时生成看似合理、实际并不对应事实的内容。放在语言模型里,幻觉通常意味着错误;放在音乐创作里,幻觉可以表现为不存在的音色、非现实的空间感或不符合常规声学逻辑的结构。
声音生成中的“幻觉”与文本模型的事实错误并不完全相同。音乐不一定需要对应一个可验证的现实答案。一个鼓声可以不像任何真实鼓组,一段人声也可以不再保留语言含义,只要它能在节奏、质感或情绪上服务于作品。
Engram 的价值正在这里:它把模型的不确定性从风险转化为控制变量。用户不需要每次都得到一致结果,而是通过重复触发、保存片段和现场筛选,从一批奇怪输出里挑出值得留下的部分。
这种方式有点像把即兴演奏加入了机器学习系统。传统软件乐器强调可复现:同样的音符、同样的参数,应该得到同样的声音。Engram 更像一个声音骰子,但这个骰子不是完全随机,它会受到输入音频和模型训练分布的影响,因此结果仍然与用户的动作存在联系。
这也解释了为什么 Engram 不适合所有人。需要稳定音高、明确和弦、可精确编辑的流行音乐制作人,可能更需要成熟的软音源和自动编曲工具;愿意接受失控、噪声和偶然性的声音设计师,则可能从中获得传统插件难以提供的素材。
本地运行,是产品的核心卖点
Engram 的 AI 模型在设备本地运行,这意味着它不需要连接互联网,也不需要把录入的音频上传到云端。对于一台现场使用的音乐设备来说,这不是简单的隐私选项,而是直接关系到可靠性和延迟的产品能力。
本地推理至少带来三项实际好处:
- 延迟更可控:声音输入和模型处理不需要经过网络往返,适合实时演奏;
- 隐私更明确:人声、未发布作品和现场录音不必离开设备;
- 离线可用:演出场地没有稳定网络时,设备仍能工作。
当然,本地运行也意味着模型规模受硬件算力、内存和功耗限制。Engram 使用的是 Thoughtful Things 自行设计并定制训练的“小型 AI”模型,而不是云端常见的超大规模生成模型。它在语言理解或复杂音乐结构方面不可能与云端系统进行同维度比较,但它也不需要完成长篇作曲任务。
对于 Engram 来说,关键指标不是参数量,而是从输入到可用声音的响应速度、生成结果的可控程度,以及硬件操作是否足够直接。一个模型即使规模很小,只要能够在数十毫秒到数百毫秒级的交互链路里稳定工作,就可能比更强但需要联网的模型更适合舞台。
目前公开资料并没有给出 Engram 的完整模型架构、参数规模、端侧芯片型号、推理延迟、采样率或频率响应等详细技术指标。因此,不能把它与通用音乐生成模型按照基准测试分数直接比较。它当前更像一个完整的硬件产品概念,而不是一份已经公开到工程细节层面的 AI 论文。
与主流 AI 音乐产品的区别
Engram、Suno、Udio 和传统硬件采样器解决的是不同问题,不能只用“谁生成得更像音乐”来判断优劣。
| 产品或类别 | 核心形态 | 是否依赖云端 | 主要输出 | 用户控制方式 | 更适合的场景 | |---|---|---:|---|---|---| | Engram | AI 采样器与 groovebox | 否,主打本地运行 | 实验音色、变形采样、可演奏片段 | 硬件操作、输入音频、实时筛选 | 现场演出、声音设计、实验音乐 | | Suno | 文本到歌曲生成平台 | 是 | 结构完整的歌曲 | 提示词、风格和歌词描述 | 快速小样、配乐、歌曲概念验证 | | Udio | 文本到歌曲生成平台 | 是 | 歌曲、段落和人声作品 | 提示词、段落延展和编辑 | 音乐草稿、风格探索、成品雏形 | | 传统采样器 | 确定性音频处理设备 | 否 | 可编辑采样与循环 | 起止点、音高、滤波、音序 | 精确编曲、现场采样、舞台演奏 | | AI 音色生成插件 | 软件音源或效果器 | 视产品而定 | 音色、纹理和效果 | 参数、提示词、MIDI 或音频输入 | 制作人工作站、后期声音设计 |
从创作效率看,Suno 和 Udio 更快;从可预测性看,传统采样器更强;从现场交互和偶然性看,Engram 的定位更鲜明。
这意味着 Engram 不太可能取代主流 AI 音乐平台,也不需要取代它们。它的潜在用户不是“想在一分钟内得到一首歌”的人,而是已经知道自己想寻找某种不寻常声音,却不想从数千个插件预设里逐一试听的人。
真正的挑战在硬件,不在 AI
Engram 能否成立,最终取决于硬件体验,而不是宣传中的“AI 幻觉”概念。
第一,生成结果必须足够快。声音设备一旦出现明显等待,现场演奏就会从互动变成排队。如果用户触发一次声音后需要等待几秒,模型再有创造力,也很难成为可演奏乐器。
第二,结果必须具备一定的可控性。完全随机的输出只适合展示,不适合创作。用户至少需要知道输入会影响结果,需要能够锁定节奏、音高、长度或某些声音特征,否则每一次操作都像重新抽签。
第三,设备必须让“筛选好结果”变得容易。AI 生成会带来大量废片,Engram 需要通过快速回听、保存、撤销、循环和分层操作,降低筛选成本。否则它只是一个会生成噪声的黑盒,而不是一件乐器。
第四,产品必须解决长期使用价值。实验性产品的新鲜感很容易在几次试玩后消失。用户最终会关心:模型是否能持续产生不同结果,输入范围是否足够宽,固件是否更新,能否导出标准音频,以及它是否能与现有音乐工作流连接。
目前公开信息主要集中在产品定位和众筹启动,关于售价、发货时间、具体硬件配置、音频接口、MIDI 或 USB 支持情况,以及模型后续更新机制,仍需要等待 Thoughtful Things 发布更多信息。众筹项目还存在量产、交付和软件成熟度风险,不能把宣传中的概念直接等同于最终零售版本。
另一个需要注意的“Engram”
“Engram”这个名字在 AI 开发者圈也并不陌生。DeepSeek 曾公开过同名的 Engram 架构项目,但它与 Thoughtful Things 的音乐硬件没有直接关系。
在大语言模型语境中,Engram 是一种条件记忆机制,核心思路是通过可扩展的 N-gram 查找,把部分高频模式从重复计算转化为静态记忆读取,再由上下文相关的门控机制决定是否使用这些记忆。简单说,它试图让模型把“经常出现的固定片段”放进更高效的记忆通道,从而探索注意力机制之外的稀疏化方向。
音乐硬件中的 Engram 则是品牌名称和产品概念,重点是利用本地模型制造声音变化。两者都与“记忆”和“生成”有关,但不是同一家公司、同一个模型,也不是同一项技术发布。开发者在搜索资料时需要注意区分,避免把 DeepSeek 的架构论文、GitHub 项目与这款音乐设备混为一谈。
OpenAI Hub 观点
Engram 的意义不在于它能否生成比云端模型更完整、更悦耳的歌曲,而在于它重新定义了 AI 音乐产品的交互方式。
过去的 AI 音乐产品努力把创作过程压缩成一句提示词;Engram 反过来把生成过程重新放回人的手里,让用户通过输入、触发、筛选和演奏,与模型共同制造声音。它接受不完美,也接受结果不稳定,甚至把“模型搞错了”当作创作素材。
这条路线的商业规模可能不会像文本到歌曲平台那样大,但产品辨识度更高。对音乐人和声音设计师来说,真正稀缺的从来不是又一个能生成标准钢琴、鼓组和弦乐的模型,而是能否快速找到一个没有现成名字、无法从素材库直接搜索到的声音。
我们的判断是:Engram 值得关注,但它更像一件面向声音创作者的实验型乐器,而不是大众 AI 音乐入口。它的创新点已经成立,产品价值则要等真实的端侧延迟、可控性、音频质量和长期更新能力来验证。若 Thoughtful Things 能把本地模型的不可预测性限制在“可探索”的范围内,Engram 可能成为 AI 音频硬件中少见的差异化产品;如果控制和导出能力不足,它也可能只停留在一次有趣的众筹概念上。
参考来源
- DeepSeek Engram GitHub:用于核对文中提到的同名大语言模型架构项目;该项目与 Thoughtful Things 的音乐硬件产品并非同一项目。
- 本文依据用户提供的 The Verge 关于 Thoughtful Things 发布 Engram Kickstarter 众筹项目的报道资料整理,重点核对产品定位、本地 AI 运行方式及其与 Suno 类产品的差异。由于参考链接域名不在本文允许的来源域名范围内,正文不附该站点链接。



