AI 快讯114B视频模型,推理只动6B
模型上新

114B视频模型,推理只动6B

2026-08-05T10:04:06.167Z
114B视频模型,推理只动6B

Sand.ai 今日开源 MAGI-2-preview,以 114B 总参数、约 6B 激活参数切入千亿级 MoE 视频生成。官方口径下,8 卡 H100 生成 10 秒 1080P 视频成本约 0.5 元。

Sand.ai 把视频模型带进千亿参数时代

Sand.ai 在 2026 年 8 月 5 日开源了视频生成模型 MAGI-2-preview,模型总参数达到 114B,但单次前向计算只激活约 6B 参数。

这组数字比演示视频更值得关注。114B 意味着 MAGI-2-preview 已进入千亿参数区间,而约 6B 的激活规模意味着,它没有照搬稠密视频模型“参数越多、每一步计算越贵”的扩展方式。按照团队披露的估算,在 8 张 NVIDIA H100 上生成一段 10 秒、1080P 视频,计算成本约为 0.5 元,约是行业主流模型成本的十分之一。

MAGI-2-preview 是 Sand.ai 推出的千亿级混合专家视频生成模型,也是 MAGI-1 路线的一次明显升级。这里的“preview”很重要:它代表当前版本主要用于展示架构方向、开放验证和收集反馈,并不等同于最终稳定版。

MAGI-2-preview生成的1080P视频画面与114B总参数、6B激活参数架构示意图

Sand.ai 将其称为全球首个开源的千亿参数 MoE 视频生成模型,但“全球首个”目前主要依据团队及公开报道口径。相比争夺一个容易过时的头衔,MAGI-2-preview 更实际的价值,是第一次把千亿参数、稀疏激活和开放权重同时放进视频生成模型,并给出了可供开发者验证的代码与模型权重。

MoE 解决的不是显存,而是每一步算多少

MoE,即混合专家模型,是一种把网络拆分为多个“专家”模块,并由路由器在每次计算时只选择其中少数专家参与推理的稀疏架构。

MAGI-2-preview 拥有 114B 总参数,却只在单次前向中激活约 6B,激活比例约为 5.26%。可以把它理解成一家拥有大量专业科室的医院:医院总体能力取决于所有科室,但一个具体病例不会同时叫来全部医生,而是由分诊系统选择最相关的专家。

“激活 6B”不等于模型文件只有 6B 参数。114B 权重通常仍需被加载或分布到多张加速卡上;如果采用 BF16 权重,仅参数本身的理论存储量就约为 228GB,尚未计算缓存、中间激活、通信缓冲区和运行时开销。8 张 80GB H100 合计提供 640GB 显存,真正解决的是千亿权重的驻留和跨卡执行问题。

“单次前向激活 6B”也不等于生成整段视频只运行一次 6B 模型。视频生成需要连续预测大量时空 token,并可能包含多轮迭代、分块生成和上下文读取;6B 描述的是每一步被选中的有效参数量,而不是整条生成任务的总计算量。

MoE 的核心收益是把“知识容量”和“单步计算量”部分解耦。模型可以保留 114B 参数,用不同专家学习人物运动、镜头语言、材质、光照、物理关系或音视频模式,同时避免每个 token 都经过全部 114B 参数。

MoE 的代价则是路由和通信变得更复杂。专家分布在不同 GPU 上时,token 需要被发送给对应专家,再把结果汇总回来;如果路由不均衡,少数专家可能过载,而其他 GPU 处于等待状态。语言模型里已经棘手的 All-to-All 通信,放到 token 数量更大的视频任务中只会更难。

为什么视频生成更需要稀疏架构

视频模型的扩展成本通常比语言模型更陡,因为它同时处理空间、时间和多模态信息。

文本可以被切分为离散 token,而视频首先要把每一帧压缩为空间 token,再沿时间轴建模连续帧之间的变化。分辨率越高、时长越长、帧率越高,token 数量就越大;人物动作、物体遮挡、镜头运动和场景一致性,又要求模型保留更长的上下文。

1080P 是分辨率为 1920×1080 的全高清视频规格,一帧包含约 207 万个像素。视频模型一般不会直接在全部像素上运行 Transformer,而是通过视频编码器或 VAE 将画面压缩成潜空间 token,但 10 秒视频压缩后的序列规模仍远高于一段普通文本。

稠密模型在这种任务上的问题很直接:所有 token 都要经过所有参数。假设把一个 6B 稠密模型直接扩到 114B,而不改变架构,每一步矩阵计算的理论规模可能接近原来的 19 倍;MAGI-2-preview 则试图用专家路由保留大模型容量,同时让每一步仍接近 6B 参数的计算规模。

这也是 MAGI-2-preview 比“又一个视频生成模型”更值得研究的原因。视频行业过去经常通过缩短时长、降低分辨率、减少采样步数或者加大集群投入来换取速度,现在 Sand.ai 给出的答案是:先从模型结构上改变成本曲线。

0.5 元的成本数字,应该怎样理解

“10 秒 1080P 约 0.5 元”是计算成本估算,不应直接理解成面向用户的固定售价。

根据目前公开口径,这一数字基于 8 卡 H100 的运行条件和当下算力行情计算,约为行业主流模型的十分之一。若按这一口径线性换算,生成 1 分钟视频的纯计算成本约为 3 元,生成 1 小时时长约为 180 元,但真实生产不会如此简单线性增长。

实际成本还会受到以下因素影响:

  • GPU 获取方式: 自建集群、长期租用和按需实例的单位价格不同。
  • H100 具体规格: 80GB SXM、PCIe 版本以及互联拓扑会影响吞吐和通信效率。
  • 并发与利用率: 单任务成本和持续满载服务的摊销成本不是一回事。
  • 生成参数: 帧率、采样策略、提示词长度、随机种子数量和失败重试都会增加计算量。
  • 工程开销: 内容审核、存储、带宽、任务排队和模型常驻显存均不包含在单纯的推理估算中。
  • 输出链路: 1080P 是否由模型原生生成,还是经过潜空间解码、超分和插帧处理,也会改变成本构成。

因此,0.5 元更适合被视为“架构效率指标”,而不是最终产品价格。它证明千亿参数视频模型不一定对应千亿参数的全量计算,却不能证明任何部署环境都能稳定复现同样的单位成本。

这个数字仍然具有现实冲击力。视频生成若只能服务少量高价宣传片,其市场边界非常有限;当 10 秒素材的基础计算成本进入人民币角级,电商批量素材、短剧分镜、游戏过场动画、广告 A/B 测试和视频智能体才可能真正按规模运行。

MAGI-2-preview 与上一代差在哪里

MAGI-1 是一种通过自回归预测视频块序列来生成内容的视频模型,其重要特征是分块生成、时间轴控制和视频续写。

自回归视频生成是按照时间或视频块顺序,基于已经生成的内容继续预测后续内容的方法。它与写文章时逐段续写类似,天然适合延长视频,但也容易积累误差:前面一帧出现的人脸、姿态或物体位置偏差,可能在后续片段中被不断放大。

MAGI-2-preview 延续了 Sand.ai 对基础视频模型和长时序建模的投入,同时把文本、视频和音频纳入统一 Transformer,并首次将模型规模推到 114B。统一建模的目标不是简单地把三种输入拼在一起,而是让模型在共享表示空间里理解“说了什么、画面发生什么、声音何时出现”之间的对应关系。

从已披露信息看,两代模型的定位差异如下:

| 维度 | MAGI-1 / MAGI-1.1 | MAGI-2-preview | |---|---|---| | 发布时间 | 2025 年起陆续发布 | 2026 年 8 月 5 日 | | 模型定位 | 开源自回归视频生成模型 | 千亿级 MoE 多模态视频生成模型 | | 参数规模 | 24B 完整版、4.5B 轻量及蒸馏版 | 114B 总参数 | | 单次激活参数 | 以具体版本为准 | 约 6B | | 核心架构 | 视频块自回归生成 | 稀疏 MoE Transformer | | 主要能力 | 1—10 秒生成、视频续写、秒级时间轴控制 | 1080P 生成、更大模型容量、文本/视频/音频统一建模 | | 部署门槛 | 轻量版更适合研究和本地实验 | 完整部署更依赖多卡高显存服务器 | | 开放状态 | 代码与多个版本权重已开放 | preview 版本代码与权重开放 |

MAGI-2-preview 的升级重点不是单纯增加参数,而是改变参数的使用方式。上一代通过不同尺寸覆盖研究与部署需求,新一代则用 114B 总容量和 6B 激活规模同时追求质量与效率。

画面进入第一梯队边缘,但还谈不上全面领先

MAGI-2-preview 在 AA 视频生成榜单中暂列第六,说明它已经接近当前视频生成模型的第一梯队。

榜单第六是一个不错的起点,但不能被包装成全面领先。视频评测高度依赖提示词集合、用户偏好、匿名投票规模和测试版本,同一模型在写实人物、复杂运动、文字渲染、动漫风格及物理一致性上的表现可能完全不同。

公开演示里更值得观察的维度包括运镜、对焦和人物连续性。视频模型容易生成一张漂亮的首帧,却在镜头推进、人物转身或多人互动时暴露问题;如果 MAGI-2-preview 能在连续 10 秒中保持主体身份、背景结构和运动方向,实际价值会高于静态画质上的轻微优势。

MAGI-2-preview 目前最大的竞争力是“质量、成本、开放性”三项同时成立。闭源产品通常具备更成熟的交互界面、审核体系和生成稳定性,但开发者无法查看权重,也难以针对行业素材进行深度修改;小型开源模型便于部署,却经常在复杂语义和动态质量上让步。MAGI-2-preview 试图填补两者之间的空档。

| 对比维度 | 千亿级稠密视频模型 | MAGI-2-preview 的 MoE 路线 | 中小型开源视频模型 | |---|---|---|---| | 总模型容量 | 高 | 114B | 通常较低 | | 单步计算量 | 接近全参数参与 | 约 6B 参数参与 | 相对较低 | | 权重存储压力 | 高 | 仍然很高 | 较低 | | 跨卡通信复杂度 | 高 | 很高,依赖专家路由 | 相对可控 | | 二次开发空间 | 取决于是否开放 | 权重与代码开放 | 通常开放 | | 适合场景 | 大型云端服务 | 研究机构、云端生成平台、行业微调 | 本地实验和成本敏感任务 |

开源很关键,但不代表普通显卡就能跑

开放权重是指开发者可以下载模型参数并自行部署、评测或修改,而不是只能通过封闭产品使用模型。

MAGI-2-preview 开放代码和权重,使研究者可以检查专家路由、并行策略和视频生成流程,也能验证 6B 激活参数是否真的转化成了吞吐优势。对于视频模型来说,这比只放一份技术报告更有价值,因为系统工程往往决定模型能否跑起来。

完整开源仍需区分不同层级。公开推理代码和权重,意味着模型可以被复现运行;公开训练代码、数据构成、过滤规则、训练超参数和集群配置,才更接近可从头复现。MAGI-2-preview 当前首先解决的是“能否检查与部署”,而不是让任何团队都能重新训练一个 114B 视频模型。

114B 权重也决定了它不会成为消费级单卡模型。即使每一步只激活 6B 参数,完整专家仍需要存储和调度;量化、CPU 卸载或专家按需加载可以降低显存要求,却可能增加延迟,并破坏官方成本估算所依赖的高吞吐条件。

对多数开发者来说,更现实的路径不是把模型塞进一张显卡,而是等待社区提供量化版本、专家裁剪、蒸馏模型和更成熟的多卡推理框架。Sand.ai 此前已经为 MAGI-1 提供 4.5B 轻量版和蒸馏版本,如果同样的产品层级延伸到 MAGI-2,实际生态影响会明显大于当前 8 卡 H100 的旗舰配置。

真正的考题是路由效率和长视频稳定性

MAGI-2-preview 接下来需要证明,MoE 的低激活比例不会以质量波动为代价。

专家路由器如果选择错误,模型可能在不同帧之间调用不一致的能力模块,表现为人物身份漂移、材质突变或运动逻辑中断。视频比文本更容易暴露这种不连续,因为观众会把相邻帧直接进行视觉比较。

长视频稳定性则是自回归路线的另一道难题。10 秒生成成本降低只是第一步,真正有商业价值的故事视频往往需要几十秒甚至数分钟;模型必须处理误差累积、跨镜头角色一致性、剧情记忆和声音同步,而不是无限复制一段看似流畅的局部运动。

音视频统一建模也需要更多公开测试。声音不是视频的附属品,口型、环境音、动作声效和音乐节奏都要求严格的时间对齐;如果统一 Transformer 只是共享输入接口,而没有提供稳定同步,它对生产工作流的帮助会有限。

正式版还应补齐更透明的评测信息,包括测试集规模、人工评估方法、原生输出规格、实际生成耗时、峰值显存、吞吐量以及不同 H100 拓扑下的成本。只有这些指标公开,0.5 元才能从一个醒目的发布数字变成可复核的工程结论。

这次发布的意义不只是一款模型

MAGI-2-preview 给视频生成行业提供了一条比“继续堆稠密参数”更可持续的扩展路线。

过去一年,MoE 已经在语言模型中证明可以用较低激活参数承载更大的知识容量,但视频模型的序列更长、通信更重、训练更不稳定。Sand.ai 把这套思路推到 114B,并直接开放代码与权重,等于把一个原本只能在闭源实验室内部讨论的系统问题交给了社区。

这款模型目前仍有明显限制:8 卡 H100 的硬件门槛不低,0.5 元属于特定条件下的计算估算,榜单第六也不意味着所有场景都达到闭源头部水平。MAGI-2-preview 更像是一个可运行的架构宣言,而不是已经完成商业化打磨的终局产品。

Sand.ai 这次真正证明的是,千亿参数视频模型不必在每一步都支付千亿参数的计算账单。如果正式版能保持画质、提高路由利用率,并推出更易部署的蒸馏或量化版本,MAGI-2-preview 可能会成为视频生成领域的一个分水岭:模型容量继续扩大,但单次生成成本不再同步失控。

参考来源

  • SandAI-org GitHub 组织主页:Sand.ai 官方开源代码入口,可用于查看 MAGI 系列仓库、推理实现和后续版本更新。
  • MAGI-1 官方 GitHub 仓库:上一代 MAGI-1 的代码、部署说明与模型架构资料,可用于理解 Sand.ai 的自回归视频生成路线。
  • Sand.ai Hugging Face 主页:Sand.ai 官方模型权重与模型卡发布入口,可关注 MAGI 系列开放权重及版本说明。

相关推荐

查看全部